¿Se puede apagar solo lo peligroso?
S01:E19

¿Se puede apagar solo lo peligroso?

Episode description

Anthropic publicó casi en simultáneo cuatro piezas de seguridad: compartimentos removibles de conocimiento peligroso, una técnica para reducir la desalineación agéntica, un mapeo de los valores de Claude entre idiomas, y una medición de cuánto ayudan realmente los modelos de lenguaje a explotar vulnerabilidades de día N. Cuatro ángulos sobre la misma pregunta: ¿se puede aislar lo peligroso sin apagar todo lo demás?

No transcript available for this episode.