Cómo se llega a un modelo de 2.8 billones de parámetros
S01:E25

Cómo se llega a un modelo de 2.8 billones de parámetros

Episode description

De Mamba2 a los 2.8 billones de parámetros de Kimi K3: la genealogía completa de tres papers que redefinieron la atención lineal en menos de dos años.

Trazamos el camino técnico entero: Gated DeltaNet (Songlin Yang, Jan Kautz, Ali Hatamizadeh — la regla delta que mejora Mamba2), Kimi Linear (el salto a Kimi Delta Attention, la arquitectura híbrida que hace viable un contexto de un millón de tokens) y el Technical Report de Kimi K3 (Moonshot AI: 2.8 billones de parámetros totales, apenas 104.000 millones activos por token).

No es solo una carrera de benchmarks: es la historia de cómo un mecanismo pensado para modelos de espacio de estados terminó sosteniendo uno de los modelos de pesos abiertos más grandes jamás publicados.

🎧 Paperslab — el podcast que convierte papers de investigación en IA en conversaciones claras, en español, para audiencia técnica. 🔗 Todos los episodios: podcast.paperslab.es

No chapters are available for this episode.