El bucle que por fin le gana a escalar
S01:E22

El bucle que por fin le gana a escalar

Episode description

Repetir el mismo bloque de un Transformer en loop promete ahorrar parámetros sin perder capacidad, pero durante años perdió contra la alternativa obvia: si tenés más cómputo, casi siempre conviene multiplicar los parámetros en vez de loopear un modelo. En este episodio de Paperslab exploramos dos papers que atacan ese problema desde ángulos distintos.

El primero, “Loop the Loopies!” (Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai), presenta Loopie, el looped Transformer más potente hasta la fecha — dos modelos Mixture-of-Experts que por primera vez logran que loopear le gane a escalar.

El segundo, “Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers” (James O’Neill, Fergal Reid), resuelve el costo oculto que ese loop arrastraba: guardar una caché de memoria separada por cada vuelta del bucle, un gasto que nadie había cuestionado hasta ahora.

Papers de este episodio:

  • Loop the Loopies! — arxiv.org/abs/2607.16051
  • Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers — arxiv.org/abs/2607.15456

🎧 Paperslab — el podcast que convierte papers de investigación en IA en conversaciones claras, en español, para audiencia técnica. 🔗 Todos los episodios: podcast.paperslab.es

No transcript available for this episode.