ÚLTIMA HORA
En el Festival Cultura UNAM resonará el Jack Quartet EU hunde otra estación flotante en el Pacífico; la vinculan con el grupo de "Los Choneros" Zuckerberg se desmarca de propuestas para ralentizar desarrollo de la IA; defiende que cada empresa asuma seguridad de sus modelos Trump va por políticos mexicanos que ‘ayuden’ a cárteles: ‘Traicionan la soberanía de su propio país’ Van 7 millones de líneas suspendidas, reporta la comisión reguladora Van 7 millones de líneas suspendidas, reporta la comisión reguladora La crisis climática desde el arte crítico de Bagus Pandega Trump pide que las tasas de interés bajen "rápidamente"; Casa Blanca también reacciona a decisión ¿Quiénes son los nominados rumbo a la recta final de "La casa de los famosos México"?; así fue la octava gala de nominación El dólar toma vuelo por alza de tasa de interés en EU
2 min de lectura

Washington. OpenAI reveló este miércoles varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de "desalineamiento" de sus sistemas.

Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas.

En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.

La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.

Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.

OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025.

La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.

Medidas para detectar posibles incidentes

El nuevo marco permitirá a cualquier empleado de OpenAI señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.

Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia.

La compañía reconoció que hasta ahora sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada.

OpenAI afirmó que pretende publicar los incidentes con mayor regularidad y que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.

Te puede interesar

Fed sube las tasas de interés por primera vez desde 2023; quedan entre el 3.75% y 4%

Armani elige a Dario Vitale para liderar Emporio y accesorios; su llegada ocurre a un año de la muerte de Giorgio Armani

Barril de petróleo mexicano alcanza los 107.51 dólares

Únete a nuestro canal ¡EL UNIVERSAL ya está en Whatsapp!, desde tu dispositivo móvil entérate de las noticias más relevantes del día, artículos de opinión, entretenimiento, tendencias y más.

dmt/desa


Contenido sindicado vía RSS de El Universal Cartera. Nota original: https://www.eluniversal.com.mx/cartera/modelos-de-ia-ignoran-reglas-de-sus-creadores-y-ocultan-errores-openai-revela-6-casos/

Publicidad
Nota sindicada de El Universal Cartera · Leer la nota original ↗
Escrito por
El Universal Cartera
Fuente externa · Sindicación RSS · Carta de México

Contenido sindicado vía RSS desde El Universal Cartera. Los derechos pertenecen a su editor original.