Ocho años atrás, un paper llamado Attention Is All You Need aseguró que la atención, sola, alcanzaba para construir el mejor modelo del mundo. Hoy tres papers —incluido uno de NVIDIA— proponen arquitecturas híbridas que combinan difusión, autoregresión y atención jerárquica con contexto infinito. ¿Estamos viendo los primeros intentos serios de destronar al Transformer, o solo mejoras dentro de la misma familia?