Un jailbreak no necesita romper un modelo nuevo desde cero: alcanza con robarle el razonamiento dañino a uno ya comprometido y trasplantarlo a otros 34 modelos distintos. En este episodio de Paperslab exploramos dos papers recientes sobre seguridad y contención de daño en modelos de lenguaje.