GPT-Red: cuando la IA aprende a hackear a otra IA
S01:E25

GPT-Red: cuando la IA aprende a hackear a otra IA

Episode description

En este episodio de Paperslab desmenuzamos GPT-Red: Automated Red Teaming via Self-Play at Scale, uno de los papers más comentados del momento, liderado por Eric Wallace y un equipo de 21 investigadores de OpenAI. La propuesta suena paradójica: entrenar un modelo de lenguaje específicamente diseñado para atacar a otros modelos de lenguaje, y usar esos ataques adversariales para robustecer los sistemas de IA en producción. Exploramos el problema del prompt injection, el talón de Aquiles de los asistentes modernos conectados a emails, navegadores web, bases de datos y ejecución de código. Analizamos por qué el red teaming humano no escala, cómo funciona el self-play aplicado a seguridad de LLMs, y qué implicancias tiene para empresas que despliegan GPT-4, Claude u otros modelos. Un episodio imprescindible sobre AI safety, adversarial machine learning y el futuro de la ciberseguridad en la era de los modelos generativos.

#AISafety #RedTeaming #PromptInjection #OpenAI #LLM

🎧 Paperslab — el podcast que convierte papers de investigación en IA en conversaciones claras, en español, para audiencia técnica. 🔗 Todos los episodios: podcast.paperslab.es