El pensamiento dañino se puede trasplantar
S01:E24

El pensamiento dañino se puede trasplantar

Episode description

Un jailbreak no necesita romper un modelo nuevo desde cero: alcanza con robarle el razonamiento dañino a uno ya comprometido y trasplantarlo a otros 34 modelos distintos. En este episodio de Paperslab exploramos dos papers recientes sobre seguridad y contención de daño en modelos de lenguaje.

El primero, “Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior” (Ali Khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, et al.), muestra que las cadenas de razonamiento dañinas de un modelo comprometido se pueden trasplantar y destilar en ataques de jailbreak reutilizables — probado en 29 modelos open-source y 5 cerrados, elevando la tasa de respuestas dañinas por encima del 80% en los más vulnerables.

El segundo, “SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction” (Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng), ataca un problema distinto: los agentes que operan interfaces móviles no pueden seguir siendo reactivos, tienen que anticipar la consecuencia de una acción antes de ejecutarla.

Dos ángulos sobre la misma pregunta incómoda: ¿cómo se contiene el daño antes de que pase, cuando el daño mismo es transferible?

Papers de este episodio:

  • Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior — arxiv.org/abs/2607.15286
  • SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction — arxiv.org/abs/2607.15550

🎧 Paperslab — el podcast que convierte papers de investigación en IA en conversaciones claras, en español, para audiencia técnica. 🔗 Todos los episodios: podcast.paperslab.es