En este episodio de Paperslab desmenuzamos GPT-Red: Automated Red Teaming via Self-Play at Scale, uno de los papers más comentados del momento, liderado por Eric Wallace y un equipo de 21 investigadores de OpenAI. La propuesta suena paradójica: entrenar un modelo de lenguaje específicamente diseñado para atacar a otros modelos de lenguaje, y usar esos ataques adversariales para robustecer los sistemas de IA en producción. Exploramos el problema del prompt injection, el talón de Aquiles de los asistentes modernos conectados a emails, navegadores web, bases de datos y ejecución de código. Analizamos por qué el red teaming humano no escala, cómo funciona el self-play aplicado a seguridad de LLMs, y qué implicancias tiene para empresas que despliegan GPT-4, Claude u otros modelos. Un episodio imprescindible sobre AI safety, adversarial machine learning y el futuro de la ciberseguridad en la era de los modelos generativos.
#AISafety #RedTeaming #PromptInjection #OpenAI #LLM