De Mamba2 a los 2.8 billones de parámetros de Kimi K3: la genealogía completa de tres papers que redefinieron la atención lineal en menos de dos años.
Trazamos el camino técnico entero: Gated DeltaNet (Songlin Yang, Jan Kautz, Ali Hatamizadeh — la regla delta que mejora Mamba2), Kimi Linear (el salto a Kimi Delta Attention, la arquitectura híbrida que hace viable un contexto de un millón de tokens) y el Technical Report de Kimi K3 (Moonshot AI: 2.8 billones de parámetros totales, apenas 104.000 millones activos por token).
No es solo una carrera de benchmarks: es la historia de cómo un mecanismo pensado para modelos de espacio de estados terminó sosteniendo uno de los modelos de pesos abiertos más grandes jamás publicados.