El reinforcement learning mejora el razonamiento de los modelos, pero sale caro. Tres papers buscan la misma economía por caminos distintos: destilación auto-evolutiva, agentes que aprenden a preguntar mejor jugando al hundir la flota, y generadores de velocidad promedio que aceleran el proceso sin perder calidad.