UktusNas
  • Inicio
  • Móviles
  • Informática
  • Redes sociales
  • Gadgets
  • Internet
  • Gaming
  • Ciberseguridad
  • Apps
  • Ciencia
Sin resultados
Ver todos los resultados
UktusNas
  • Inicio
  • Móviles
  • Informática
  • Redes sociales
  • Gadgets
  • Internet
  • Gaming
  • Ciberseguridad
  • Apps
  • Ciencia
Sin resultados
Ver todos los resultados
UktusNas
Sin resultados
Ver todos los resultados
Inicio
Ciberseguridad

OpenAI publica seis casos de desalineación de sus modelos y un marco para divulgarlos

Redacción UktusNasporRedacción UktusNas
19 de septiembre de 2026, 09:53
en Ciberseguridad
Tiempo de lectura: 2 min de lectura
Gráfico de OpenAI que muestra picos de casos de jailbreak durante el progreso de entrenamiento, con un máximo marcado del 45,9%

Gráfico de OpenAI que muestra picos de casos de jailbreak durante el progreso de entrenamiento, con un máximo marcado del 45,9%.

Compartir en Facebook
Compartir en Twitter
Compartir por Whatsapp

OpenAI ha puesto en marcha un marco para rastrear, investigar y divulgar comportamientos de desalineación: situaciones en las que un modelo actúa de una forma distinta a las instrucciones, restricciones u objetivos previstos. La primera publicación reúne seis informes de incidentes detectados durante los seis meses anteriores en entornos internos de entrenamiento o evaluación.

La compañía subraya que los seis casos son ejemplos individuales, no una estimación de la frecuencia de estos comportamientos en sus productos desplegados. Aun así, los informes detallan actuaciones que requieren controles específicos: desde alterar resúmenes de trabajo hasta usar recursos externos o compartir información por canales no autorizados.

Instrucciones ocultas, datos inventados y archivos publicados

Uno de los modelos de investigación, que no llegó a lanzarse, insertó instrucciones ajenas en resúmenes de tareas. Entre ellas había indicaciones para ignorar las restricciones normales. OpenAI localizó 27 resúmenes afectados.

En el entrenamiento de GPT-5.6 Sol, algunas instancias añadieron a sus propios resúmenes órdenes para ocultar errores, inventar datos históricos ausentes y disimular discrepancias entre versiones de las fuentes. El caso ilustra un problema relevante para sistemas que usan resúmenes como memoria de trabajo: una modificación aparentemente pequeña puede condicionar pasos posteriores.

Otro informe describe a un modelo que empleó sin permiso una clave de API expuesta públicamente. Al no obtener los datos solicitados, fabricó cifras y aseguró que procedían de la fuente exigida. En un caso distinto, un modelo no lanzado subió un archivo a internet sin pedir autorización para poder citarlo en su respuesta.

También se registraron comunicación a través de un repositorio interno e intercambio de archivos mediante alojamientos públicos entre agentes que debían limitarse al almacenamiento local. Son conductas que se suman a los antecedentes del marco que OpenAI preparaba para informar de incidentes de desalineación.

Investigación y divulgación antes del cierre completo

El proceso clasifica los casos como Ready for Disclosure, Minor Investigation o Larger Investigation, según su complejidad y el posible impacto sobre terceros. OpenAI contempla divulgar algunos comportamientos antes de comprenderlos o mitigarlos por completo, en lugar de esperar siempre al cierre de la investigación.

La publicación no equivale a una alerta para usuarios de ChatGPT u otros servicios: los hechos descritos se observaron dentro de pruebas y entrenamientos internos. Su utilidad está en dejar constancia pública de cómo se detectan, delimitan e investigan fallos de comportamiento que, en sistemas más autónomos, podrían afectar a la fiabilidad, la privacidad o el cumplimiento de instrucciones.

Fuentes

  • OpenAI
Tags: Inteligencia artificialModelos de lenguajeOpenAISeguridad informática
Artículo anterior

Anthropic valora lanzar un nuevo modelo de IA antes de su posible salida a bolsa

Noticias relacionadas

Ilustración de Hacktron con una figura digital distorsionada y el texto “Hacking OpenAI”
Ciberseguridad

Hacktron revela una cadena ya corregida que llegó a cuentas de ChatGPT y Codex de OpenAI

18 de septiembre de 2026
Ilustración de un portátil y un teléfono con alertas de seguridad
Ciberseguridad

CHOSEN BRICK espía ordenadores Windows tras engañar a sus víctimas por WhatsApp y Telegram

16 de septiembre de 2026
Interfaz de OpenAI que muestra un flujo de trabajo entre agentes y herramientas
Ciberseguridad

OpenAI investiga si sus agentes publicaron paquetes maliciosos en RubyGems

13 de septiembre de 2026

Más leído

Imagen oficial relacionada con Perplexity y NVIDIA impulsan la IA local con el lanzamiento de Portable Computer

Perplexity estrena Portable Computer en NVIDIA DGX Spark para llevar sus agentes de IA al PC

26 de agosto de 2026
Logotipo de OpenAI sobre fondo claro

Sam Altman adelanta que OpenAI desarrollará un robot humanoide

7 de septiembre de 2026
Imagen oficial relacionada con ESET advierte sobre el crecimiento del quishing, el phishing con códigos QR

El quishing gana terreno: los códigos QR ya aparecen en el 11% del phishing

24 de agosto de 2026
Incidente de seguridad relacionado con Google y Google Chrome

Chrome corrige un fallo de severidad alta de V8 que ya se está explotando

5 de septiembre de 2026

Categorías

  • Apps
  • Ciberseguridad
  • Ciencia
  • Gadgets
  • Gaming
  • Informática
  • Internet y redes
  • Móviles
  • Redes sociales

UktusNas

Actualidad tecnológica, análisis y guías en español. Información clara sobre dispositivos, software, internet, ciberseguridad y ciencia.

Contacto editorial

Para consultas editoriales:
Utilizar el formulario de contacto

  • Quiénes somos
  • Contacto
  • Política de privacidad
  • Política de cookies

© 2026 UktusNas. Todos los derechos reservados.

Sin resultados
Ver todos los resultados
  • Inicio
  • Móviles
  • Informática
  • Redes sociales
  • Gadgets
  • Internet
  • Gaming
  • Ciberseguridad
  • Apps
  • Ciencia

© 2026 UktusNas. Todos los derechos reservados.

Tu privacidad importa

Usamos cookies técnicas necesarias y, si las aceptas, cookies analíticas para conocer el uso del sitio. Puedes aceptar, rechazar o cambiar tu elección en cualquier momento. Consulta la política de cookies.