Lo que la física le enseña a un Transformer
S01:E21

Lo que la física le enseña a un Transformer

Episode description

El deep learning avanzó durante años a pura prueba y error. En este episodio de Paperslab exploramos dos papers que, desde direcciones completamente opuestas, empiezan a poner el andamiaje matemático debajo.

El primero, “Relevant and Irrelevant: A Renormalization Group Analysis of Transformer Attention” (Parviz Haggi-Mani, Irina Rish), trata el mecanismo de atención de un Transformer como un operador de un grupo de renormalización — el mismo lenguaje que usa la física para describir transiciones de fase — y deriva predicciones verificables sobre su geometría interna.

El segundo, “Diffusion models recover accurate mixture weights despite score function insensitivity” (Andrew Dennehy, Ramchandran Muthukumar, Rebecca Willett, Nisha Chandramoorthy), resuelve una paradoja que llevaba años sin explicación: por qué los modelos de difusión aprenden bien los pesos relativos de una distribución con múltiples modos, incluso cuando la señal que deberían usar para eso es insensible a esos pesos.

Papers de este episodio:

  • Relevant and Irrelevant: A Renormalization Group Analysis of Transformer Attention — arxiv.org/abs/2607.15449
  • Diffusion models recover accurate mixture weights despite score function insensitivity — arxiv.org/abs/2607.15485

🎧 Paperslab — el podcast que convierte papers de investigación en IA en conversaciones claras, en español, para audiencia técnica. 🔗 Todos los episodios: podcast.paperslab.es

No chapters are available for this episode.