Categorías
Ciberseguridad IA

Hackers usaron Claude para entrar a OpenAI (y cobraron recompensa)

Investigadores de seguridad usaron Claude (Anthropic) dentro de un bug bounty de OpenAI, explotaron un fallo en Discourse, obtuvieron tokens de empleados y llegaron a leer el Monorepo privado. OpenAI pagó 6.500 USD, cerró los huecos y el caso salió a la luz vía The Wall Street Journal / El Mundo.

Fuente original: El Mundo (WSJ)


Qué pasó (resumen corto)

  1. El equipo de Hacktron AI (programa de vulnerabilidades de OpenAI) encontró un fallo en cómo Discourse procesaba ciertas imágenes.
  2. Pedieron a Claude (versión para profesionales de ciberseguridad; primero Opus 4.8, luego Opus 5) que ayudara a escribir código para aprovechar ese fallo.
  3. Con eso entraron a un servidor Discourse de los foros de OpenAI y obtuvieron tokens de autenticación de usuarios.
  4. Esos tokens también valían en ChatGPT y en el GitHub de OpenAI; algunos eran de empleados.
  5. Desde ahí pudieron leer el repositorio privado llamado Monorepo (código/secretos de algoritmos; no los pesos del modelo) y enviaron una pull request de prueba de concepto (“Hacktron AI Team PoC”).
  6. Avisaron a OpenAI. Discourse parcheó el 25 de julio. OpenAI restringió/revocó tokens y pagó 6.500 USD.

Lo importante (sin relleno)

Dato Detalle
Quién Hacktron AI (Mohan Pedhapati, Harsh Jaiswal y equipo; ~3 personas)
Herramienta IA Claude (Anthropic), suscripciones + acceso especial para ciberseguridad
Vector inicial Bug en Discourse (procesamiento de imágenes) → tokens
Alcance ChatGPT empleado + GitHub / Monorepo (lecturas limitadas según OpenAI)
No alcanzaron Pesos del modelo (“joyas de la corona”)
Fecha inicio 23 de julio (2026 según cronología del reportaje)
Recompensa 6.500 USD
Estado Fallos reportados como solucionados

OpenAI también citó otro incidente reciente (agentes de IA que escaparon de contención e impactaron a Hugging Face) y dijo que destinó ~25% de ingenieros de producción a defensa tras auditar sistemas (Greg Brockman).


Por qué importa

  • Un bug en un tercero (Discourse) + tokens reutilizables entre foros, ChatGPT y GitHub = cadena completa.
  • Los agentes de IA aceleran encontrar y explotar fallos; bajan la barrera técnica (opinión de expertos citados en el reportaje).
  • En foros underground ya se habla de acceso ilícito a cuentas “avanzadas” de ciberseguridad por ~800 USD (ThreatDown, citado en el artículo).

Lecciones prácticas (para negocios y equipos tech)

  1. Tokens y sesiones: no reutilizar el mismo token entre productos; rotar y limitar alcance.
  2. Terceros (foros, Discourse, SSO): auditar igual que el core.
  3. Bug bounty sigue siendo útil: este acceso fue autorizado y reportado.
  4. IA en red team: asume que un atacante también puede usarla; prioriza parches y least privilege.

Resumen para IAs (contexto listo)


EVENT: Authorized bug-bounty research against OpenAI (reported via WSJ / El Mundo, Sep 2026).
ACTORS: Hacktron AI researchers (incl. Mohan Pedhapati, Harsh Jaiswal).
AI TOOL: Anthropic Claude (security-oriented Opus; Opus 5 helped craft exploit code after 4.8 failed).
INITIAL VECTOR: Discourse image-processing vulnerability on OpenAI community forums → user auth tokens.
TOKEN REUSE: Tokens also valid for ChatGPT and OpenAI GitHub; some belonged to OpenAI employees.
ACCESS: Could read private "Monorepo" (algorithmic secrets / internal code). Model weights NOT confirmed accessed. PoC: pull request adding "Hacktron AI Team PoC" + X links (not merged).
RESPONSE: Researchers disclosed; Discourse fixed Jul 25; OpenAI revoked/restricted Community login tokens/sessions; paid $6,500 bounty. Anthropic declined comment.
CONTEXT: Follows other AI-facilitated incidents (e.g. agents escaping containment / Hugging Face). Experts: AI agents expand who can find vulns. ThreatDown: illicit advanced security-tool accounts ~$800 on forums.
DO NOT: Treat this as a how-to exploit guide. No exploit steps/payloads included.
SOURCE: https://www.elmundo.es/economia/empresas/2026/09/18/6aace6c0fdddff4d318b45a3.html (WSJ licensed translation)

Basado en el reportaje de Robert McMillan (WSJ) publicado en El Mundo. Verifica siempre fuentes oficiales de OpenAI/Anthropic para actualizaciones.