Investigadores de seguridad de han revelado los detalles de “AgentForger”, una vulnerabilidad crítica (ya parcheada) en los agentes de ChatGPT Workspace de OpenAI. Este fallo permitía a un atacante utilizar un simple enlace de phishing para crear, configurar y ejecutar de forma encubierta un agente de IA autónomo y malicioso dentro de la cuenta de la víctima, convirtiendo la plataforma de OpenAI en un canal de Comando y Control (C2) para exfiltrar datos corporativos.
Veredicto Analítico
- Estado: Vulnerabilidad parcheada del lado del servidor. Zenity reportó el fallo a OpenAI el 4 de junio de 2026 y la solución fue implementada por completo el 8 de junio de 2026. No hay evidencia de explotación activa (in the wild) previa al parche.
- Confianza: Absoluta. Validado mediante el análisis técnico y la prueba de concepto (PoC).
- Riesgo para SOC, TDIR y Redes: Alto (A nivel de Modelado de Amenazas). Aunque el fallo técnico específico fue solucionado, este incidente demuestra un cambio de paradigma en la superficie de ataque. Los adversarios están apuntando a las integraciones de IA (LLMs) con acceso a datos privados para orquestar ataques automatizados y silenciosos, eludiendo los controles de red tradicionales.
- Urgencia Operativa: Baja (Fase Post-Incidente / Informativa). No se requiere aplicación de parches en los endpoints, pero se exige una revisión de las políticas de uso de conectores de IA empresariales.
- Base del Veredicto: Existencia de fallos arquitectónicos en la validación de parámetros URL y un control de seguridad en lenguaje natural excesivamente permisivo en el Generador de Agentes de ChatGPT.
Hallazgos Clave
- Vulnerabilidad Principal (AgentForger): Falsificación de Agente entre Sitios (Cross-Site Agent Forgery). Una evolución del tradicional CSRF, pero en lugar de forzar una única acción, instala un actor autónomo persistente.
- Conectores Afectados: El agente malicioso podía abusar de los servicios empresariales previamente autorizados por la víctima, incluyendo Outlook, Gmail, Slack, Google Drive, SharePoint y Microsoft Teams.
- La “Triple Combinación Letal”: El éxito del ataque dependía de tres factores presentes en la plataforma: ingreso de información no confiable (vía enlace de phishing), acceso irrestricto a datos privados (OAuth previo) y una vía de extracción sin supervisión (tareas automatizadas).
Análisis Técnico: La Cadena de Ataque de AgentForger
En lugar de robar contraseñas, el atacante abusaba de los flujos de aplicaciones de confianza para instalar un “empleado interno” virtual:
- Entrega (Phishing): El atacante enviaba un correo con un enlace hacia el Generador de Agentes de ChatGPT. Dicho enlace contenía parámetros URL manipulados (template_name e initial_assistant_prompt).
- Ejecución Automática: Por un fallo de diseño, ChatGPT no solo rellenaba los campos con los parámetros de la URL, sino que ejecutaba automáticamente el prompt inicial al cargar la página.
- Evasión de Privilegios y Consentimiento: Como la víctima ya tenía sus conectores de trabajo autorizados por usos legítimos anteriores, no se activaba ninguna pantalla nueva de consentimiento OAuth. Mediante instrucciones en lenguaje natural, el atacante ordenaba al agente cambiar las aprobaciones de acciones de escritura de “Preguntar siempre” a “Nunca preguntar”, desactivando la principal medida de seguridad.
- Persistencia y Canal C2: El agente falso se programaba para ejecutarse cada cinco minutos. Su directiva era escanear la bandeja de entrada del atacante buscando correos con el prefijo “TASK”, ejecutar esos comandos contra el entorno de la víctima (ej. buscar documentos confidenciales en SharePoint, mapear la estructura organizativa en Slack) y enviar los resultados de vuelta por correo electrónico.
Tácticas, Técnicas y Procedimientos (MITRE ATT&CK)
- Acceso Inicial: Spearphishing mediante Enlace (T1566.002).
- Ejecución: Automatización de Tareas (T1053) delegada a un modelo de IA.
- Evasión de Defensas: Modificación de Políticas de Seguridad (Modificación de aprobaciones a “Nunca preguntar” – T1562) y Abuso de Tokens de Acceso Web (T1550.004).
- Comando y Control (C2): Servicios Web / Aplicaciones de Terceros (T1102).
Recomendaciones Operativas
Para Administración de Identidades y Seguridad Cloud
- Auditoría de Integraciones OAuth: Implementar revisiones periódicas de los permisos de aplicaciones de terceros en Google Workspace y Microsoft 365. Revocar cualquier token de acceso (OAuth consent) otorgado a aplicaciones de IA o agentes que no tengan un caso de uso corporativo estrictamente justificado.
- Políticas de Aprobación Estrictas: Si se utilizan plataformas de creación de agentes a nivel corporativo, forzar a nivel de administrador del tenant que las acciones de escritura o exfiltración hacia el exterior requieran siempre aprobación explícita del usuario humano (Human-in-the-Loop), sin posibilidad de que el agente modifique dicha regla.
Para el Centro de Operaciones de Seguridad (SOC)
- Monitoreo de Comportamiento de IA (AI-SecOps): Incorporar patrones de actividad de Agentes de IA en el SIEM. Un volumen alto, automatizado y rítmico (ej. exactamente cada 5 minutos) de consultas a correos electrónicos o repositorios de archivos desde una aplicación de integración de IA legítima debe activar una alerta de posible extracción de datos o de compromiso de correo empresarial (BEC) automatizado.




