Un jailbreak no necesita romper un modelo nuevo desde cero: alcanza con robarle el razonamiento dañino a uno ya comprometido y trasplantarlo a otros 34 modelos distintos. En este episodio de Paperslab exploramos dos papers recientes sobre seguridad y contención de daño en modelos de lenguaje.
El primero, “Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior” (Ali Khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, et al.), muestra que las cadenas de razonamiento dañinas de un modelo comprometido se pueden trasplantar y destilar en ataques de jailbreak reutilizables — probado en 29 modelos open-source y 5 cerrados, elevando la tasa de respuestas dañinas por encima del 80% en los más vulnerables.
El segundo, “SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction” (Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng), ataca un problema distinto: los agentes que operan interfaces móviles no pueden seguir siendo reactivos, tienen que anticipar la consecuencia de una acción antes de ejecutarla.
Dos ángulos sobre la misma pregunta incómoda: ¿cómo se contiene el daño antes de que pase, cuando el daño mismo es transferible?
Papers de este episodio: