OpenAI jugó la “carta Skynet”, pero su IA no actuó sola para hackear a Hugging Face
Además: más "Bugpocalypse" con 400 parches en Linux, un bug crítico de la VPN de Palo Alto explotado por Qilin Ransomware y Anthropic pagará US$ 1.500 millones por piratear libros.
Dark News es un resumen semanal de noticias de ciberseguridad, privacidad y hacking. Los temas están producidos y seleccionados por Juan Brodersen según estos criterios de edición.
17~24
jul
⚡TL;DR
Está cada vez más complicado saber qué está pasando realmente con la inteligencia artificial en el mundo de la ciberseguridad. Esta semana se viralizó (ah shit, here we go again) una historia según la cual OpenAI hackeó a otra empresa, Hugging Face, “de manera autónoma”. Es el “momento Skynet” de la empresa que, vale decir, llega bastante tarde porque Anthropic puso al mundo en alerta con Mythos en abril de este año.
Pero esto no fue tan así. Muchos medios tomaron el comunicado de OpenAI como lo que sucedió y no como una versión de la compañía, en el contexto de una clara guerra con sus competidores por quedarse (también) con la corona de la ciberseguridad AI-driven. Los medios especializados dieron en la tecla: Cómo un error humano en OpenAI llevó a un hackeo potenciado con IA.
Por eso, hablé con especialistas que trabajan en la industria, para entender qué está pasando. ¿Realmente se “escapó” este modelo de un sandbox? ¿Qué instrucción le dieron? ¿Qué se sabe?
Valentina Palmiotti (Chompie, de Phrack), Nico Waisman (XBOW) y Ernesto Mislej (7Puentes) cuentan en esta entrega cómo entender lo que comunicó OpenAI. Hay mucho de marketing en esto de “se nos fue de las manos” y acá vamos a intentar separar señal de ruido. Todo ocurre en el contexto de la salida de un nuevo modelo que viene de oriente: Kimi, que se suma a la carrera por dominar el mercado (y, en este caso, como DeepSeek, con menos recursos).
En el mundo de las vulnerabilidades, sigue el “Bugpocalypse”, esta vez con más de 400 CVEs en Linux. En el terreno del cibercrimen, LAPSUS$ (que es más un branding que una referencia al grupo original) habría anunciado su retiro, y Qilin está explotando un bug crítico en la VPN de Palo Alto.
En cuanto a regulaciones, Anthropic acordó pagar por piratear libros para entrenar a sus modelos y Polymarket enfrenta una prohibición en Francia.
Cierro con agenda: estoy preproduciendo material para la cobertura de Black Hat y DEF CON, que estaré cubriendo en dos semanas desde Las Vegas. Si van, exponen, dan charlas o simplemente quieren contactarme, como siempre, pueden responder este correo.
En esta edición:
🤖 OpenAI jugó la “carta Skynet”, pero sus modelos no hackearon por su cuenta a Hugging Face
🐧 “Bugpocalypse”: Linux corrige más de 400 vulnerabilidades
🎭 Un sitio web anuncia lo que sería el fin de las operaciones de LAPSUS$
📚 Anthropic acuerda pagar 1.500 millones de dólares por usar libros con copyright
🎰 Francia prohíbe el acceso al sitio de apuestas Polymarket
🔐 Un bug crítico de la VPN de Palo Alto, explotado por el ransomware Qilin
⏰ Substack dice que leer este correo completo lleva 13 minutos
Dark News #212
OpenAI jugó la “carta Skynet”, pero sus modelos no hackearon por su cuenta a Hugging Face
GPT 5.6 Sol y otro modelo todavía no lanzado vulneraron sistemas de Hugging Face durante una evaluación interna. El episodio muestra el avance de los agentes ofensivos, pero también por qué “autónomo” no significa que hayan decidido atacar por cuenta propia.
Qué pasó. OpenAI probaba dentro de ExploitGym (un sandbox) si sus modelos podían convertir vulnerabilidades en ataques funcionales. En vez de limitarse a resolver los desafíos, encontraron una falla en una herramienta, llegaron a una computadora con acceso a internet y buscaron las respuestas en una base de datos externa.
Los modelos aprovecharon vulnerabilidades, robaron credenciales y consiguieron ejecutar instrucciones dentro de la infraestructura de Hugging Face. La plataforma ya había detectado miles de acciones realizadas desde entornos temporales y había atribuido la intrusión a un sistema autónomo. Sus investigadores creían que podía haber una IA detrás, debido a la velocidad del ataque.
No actuaron solos. Los modelos eligieron y ejecutaron por su cuenta los pasos del ataque, pero la meta había sido definida por humanos y los controles estaban deliberadamente reducidos. Nicolás Waisman, de XBOW, explicó a Dark News:
No se conocen exactamente las instrucciones, pero probablemente hayan sido algo así como: ‘Este es el objetivo y podés hacer lo que consideres necesario para alcanzarlo’. Era un desafío y probablemente no hubo suficientes controles para evitar que el modelo se saliera del alcance previsto.
“Creatividad ofensiva”. Para Waisman, estos comportamientos aparecen cuando un modelo recibe una meta, herramientas y libertad de acción:
Pueden ser muy buenos y pensar de manera creativa, fuera de lo esperado. A veces hacen cosas que uno no anticipa, incluso pueden hacer trampa para alcanzar el objetivo. Por eso es importante construir un harness alrededor del modelo, un sistema que lo guíe y lo mantenga dentro de la dirección deseada.
Sandbox y guardrails. Ernesto Mislej, cofundador y Chief Data Scientist de 7Puentes, resumió los mecanismos de contención:
Un sandbox es una especie de gimnasio donde los agentes exploran dentro de un entorno protegido, con máquinas virtuales y datos preparados para hacer pruebas sin exponer infraestructura real. Los guardrails son la arquitectura que procesa las respuestas del modelo y agrega reglas más duras para mitigar errores o malas prácticas. En este caso, esa estructura no logró contener completamente al agente.
Falla de alineación. Valentina Palmiotti, investigadora del X-Force Offensive Research de IBM, conocida como “Chompie” y miembro del comité editorial de Phrack, sostuvo que el sistema encontró un atajo para cumplir la meta, aunque se apartara de lo que esperaban sus operadores:
El modelo no tenía la intención de atacar sistemas ajenos. Analizó el ejercicio y determinó que buscar un atajo era más fácil que resolverlo, así que eso hizo. En el proceso encontró múltiples zero-days, los usó para escapar del entorno aislado y salió a internet. Un modelo correctamente alineado se habría concentrado en el ejercicio en sí.
La desventaja defensiva. Palmiotti destacó además que Hugging Face no pudo investigar el incidente con modelos comerciales de frontera porque sus guardrails no distinguen entre un analista defensivo y un atacante. Tuvo que recurrir a un modelo de pesos abiertos ejecutado localmente:
Los defensores quedaron limitados y en desventaja. Estos agentes pueden actuar como un humano competente y despiadado, con una diferencia: no se aburren, no duermen y siguen adelante. Gran parte del software sobre el que funciona el mundo nunca fue revisado seriamente. A muchas empresas les espera un despertar bastante brusco.
La carrera. El caso aparece en plena competencia entre OpenAI y Anthropic por liderar el desarrollo de modelos especializados en ciberseguridad. Anthropic había tomado la delantera pública con Project Glasswing y Claude Mythos Preview, promocionado como capaz de descubrir fallas desconocidas y construir ataques funcionales con mayor autonomía.
“Bugpocalypse”: Linux corrige más de 400 vulnerabilidades
Linux corrigió más de 400 vulnerabilidades del kernel en cerca de 24 horas. La ola de parches muestra cómo las herramientas automatizadas y asistidas por IA están acelerando la detección de fallas, pero también multiplican el trabajo de validación y actualización.
Qué pasó. El proyecto Linux publicó cientos de CVE entre el 19 y el 20 de julio. Los problemas afectan componentes centrales como redes, sistemas de archivos, Bluetooth, virtualización, almacenamiento, Wi-Fi, drivers y gestión de memoria.
El alcance. No todas las vulnerabilidades permiten ataques remotos ni tienen el mismo nivel de riesgo. Muchas requieren hardware específico, acceso local con privilegios, módulos cargados o funciones concretas habilitadas. La existencia de un CVE tampoco implica que la falla esté siendo explotada.
El procedimiento en Linux. La IA puede señalar un posible error, pero los maintainers todavía deben comprobarlo, determinar qué versiones están afectadas, preparar un parche seguro y trasladarlo a las ramas estables.
Linux recomienda instalar las últimas versiones disponibles y seguir los avisos de seguridad de cada distribución.
Por qué importa. El volumen refleja el impacto creciente del análisis asistido por IA en la seguridad del software. Estas herramientas pueden revisar grandes historiales de código, comparar ramas y detectar patrones inseguros difíciles de encontrar manualmente.
La semana pasada, Microsoft parcheó 620 bugs y Google, 433.
Un sitio web anuncia lo que sería el fin de las operaciones de LAPSUS$, prolífico grupo de ingeniería social
Un sitio web que se presenta como el canal oficial de LAPSUS$ anunció el “cese permanente” de todas sus operaciones. El mensaje está firmado con PGP, aunque no hay confirmación independiente de que la página o la clave pertenezcan a los mismos integrantes de la ola de ataques de 2022.
Qué pasó. Los autores dicen que no se trata de “una retirada” ni de “una rendición”: aseguran que cumplieron sus objetivos, superaron “con mínimo esfuerzo” sistemas de seguridad multimillonarios y obtuvieron, en varias ocasiones, ganancias con sumas de siete cifras. “Nuestros objetivos financieros se cumplieron por completo y elegimos retirarnos en nuestros propios términos”, sostienen.
También aseguran que no habrá nuevas comunicaciones, filtraciones ni accesos.
Por qué importa. LAPSUS$ se hizo conocido por vulnerar grandes compañías con ingeniería social más que con malware sofisticado: recurría al SIM swapping, el bombardeo de notificaciones MFA, llamados a mesas de ayuda y hasta pagos a empleados para conseguir accesos. Entre sus víctimas estuvieron Nvidia, Samsung, Microsoft y Globant.
El caso argentino. En marzo de 2022, Mercado Libre confirmó un acceso no autorizado a una parte de su código fuente y a datos de unos 300.000 usuarios. LAPSUS$ aseguró haber accedido a 24.000 repositorios de Mercado Libre y Mercado Pago. La empresa dijo que no había evidencia de robo de contraseñas, saldos, información financiera o tarjetas.
Salvedad. Los anuncios de retiro en el cibercrimen no siempre son definitivos: pueden servir para bajar la presión policial o volver con otro nombre.
En 2025, Scattered LAPSUS$ Hunters anunció su disolución y reapareció pocos días después.
Anthropic acuerda pagar 1.500 millones de dólares por usar libros con copyright
Un juez aprobó el acuerdo de US$ 1.500 millones con el que Anthropic busca cerrar una demanda colectiva de autores por el uso de libros pirateados para entrenar a Claude. Es el mayor pago conocido en un caso de copyright en Estados Unidos.
Qué pasó. Un juzgado federal aprobó el acuerdo y rechazó las objeciones de autores que consideraban insuficiente la compensación. Más del 91% de los escritores y editores alcanzados ya había reclamado su parte del pago.
La demanda había comenzado en 2024. Los autores acusaron a Anthropic de descargar y conservar más de siete millones de libros pirateados para construir una biblioteca interna utilizada en el desarrollo de sus modelos.
El matiz clave. La Justicia había determinado que usar libros para entrenar una IA podía considerarse fair use, es decir, un uso legítimo bajo la ley estadounidense. Pero distinguió esa práctica de la descarga y el almacenamiento de copias pirateadas, que sí podían constituir una infracción.
Ese punto dejó a Anthropic expuesta a un juicio por daños que, en el peor escenario, podía implicar cientos de miles de millones de dólares. El acuerdo evita ese riesgo, aunque la empresa no cierra todos sus frentes judiciales: algunos autores y editoriales decidieron excluirse y continúan con demandas separadas.
Por qué importa. Es el primer gran acuerdo dentro de la ola de litigios iniciados por escritores, medios y otros titulares de derechos contra las compañías de IA.
El precedente no prohíbe entrenar modelos con obras protegidas, pero envía una señal clara: que el entrenamiento pueda ser legítimo no convierte en legal la obtención de los materiales.
Francia prohíbe el acceso al sitio de apuestas Polymarket
Francia ordenó a los proveedores de internet bloquear Polymarket, una plataforma que permite apostar dinero sobre el resultado de elecciones, decisiones políticas y otros eventos futuros.
Qué pasó. La Autorité Nationale des Jeux, el regulador francés de juegos y apuestas, exigió a los proveedores de internet que impidan el acceso al sitio. El organismo considera que Polymarket opera como una plataforma ilegal de apuestas en el país.
El antecedente. Francia ya había bloqueado, en noviembre de 2024, las transacciones financieras de residentes franceses dentro de Polymarket. La medida no frenó su crecimiento: según el regulador, usuarios locales siguieron entrando mediante mecanismos para eludir la restricción.
Los números. Polymarket recibió en junio 578.751 visitas desde Francia, de las cuales 205.057 correspondieron a visitantes únicos. El volumen llevó a la autoridad a avanzar desde el bloqueo de pagos hacia la restricción directa del sitio.
El contexto. Francia no es el único país que endurece su postura frente a los mercados de predicción. España ordenó bloquear Polymarket y Kalshi mientras investiga si violan sus leyes de apuestas.
En Estados Unidos, Minnesota prohibió estas plataformas y otros estados iniciaron acciones judiciales.
Un bug crítico de la VPN de Palo Alto, explotado por el grupo de ransomware Qilin
La banda de ransomware Qilin está aprovechando una vulnerabilidad crítica en las VPN GlobalProtect de Palo Alto Networks para ingresar a redes corporativas y cifrar dominios completos.
Qué pasó. La falla, identificada como CVE-2026-0257, permite saltear la autenticación y establecer conexiones VPN no autorizadas en dispositivos PAN-OS vulnerables. Palo Alto publicó parches el 13 de mayo, pero Arctic Wolf investigó varios ataques ocurridos durante junio que terminaron con el despliegue de Qilin.
Los incidentes tuvieron comportamientos distintos: algunos atacantes pasaron rápidamente al cifrado, mientras que otros robaron información antes de bloquear los sistemas para aplicar una estrategia de doble extorsión. Esto sugiere que distintos afiliados de Qilin están utilizando el mismo exploit.
Por qué importa. Una VPN suele funcionar como puerta de entrada a la red interna de una organización. Explotar una falla de autenticación permite a los atacantes ingresar sin credenciales válidas y avanzar directamente sobre servidores, cuentas y controladores de dominio.
Qilin apareció en 2022 con el nombre Agenda y afirma haber comprometido a más de 2.000 organizaciones. Entre sus víctimas figuran Nissan, Asahi, Lee Enterprises y el proveedor británico de servicios de salud Synnovis.
🔓 Breaches y hacks
Estée Lauder da a conocer un data breach
Roban 23 millones en cripto de la plataforma Ostium
Chats de DeepSeek quedaron indexados y accesibles por Google
🔒 Ransomware
Arrestan a un miembro de REvil en Armenia
JadePuffer, ataque “agéntico”, ahora despliega ransomware
Anubis ransomware se adjudica el ataque contra Coca-Cola
💣 Exploits y malware
Nueva cepa de ransomware: Spirals
Cursor, Codex, Gemini CLI, Antigravity afectados por un sandbox escape
Monitores de LG instalan adware
🔍 Threat intel y vulnerabilidades
Estafas de “escasez”: cada vez se registran más en todo el mundo
Incautan más de mil sitios pirata de partidos de la Copa del Mundo
Reportes: Sophos, Thales, Acronis, WatchGuard, Emsisoft, ThreatDown
🛠️ Tools y updates
Un usuario lanza “AI Pentest Checker”: convierte a un modelo de frontera en una plataforma ofensiva
JadePuffer, un ransomware con IA, ahora apunta a LLMs
Ubuntu, Zimbra y Honeywell lanzan updates de seguridad; Oracle parchea 1.449 CVEs
📋 Privacidad y regulaciones
Investigan a TikTok por sus medidas para proteger menores
Rusia da de baja el App Store de Apple
Francia aprueba una ley para prohibir redes sociales a menores de 15 años
Este newsletter fue escrito por un humano. Se usó inteligencia artificial generativa para resumir textos, detectar errores de redacción, concordancia y typos. Aun así, puede contener imprecisiones.
Para cualquier comentario, corrección o sugerencia, podés responder este mail. Si tenés información sobre un hackeo, me podés contactar por acá o por mis redes.
Si te sirvió, compartilo: tu recomendación orgánica es mucho más valiosa que cualquier campaña publicitaria.










