Cada sentido tuvo históricamente su propio modelo. La tendencia ahora es unificar visión, audio y razonamiento en un solo marco: de un modelo de visión auto-supervisado a escala sin precedentes, a un sistema que entiende audio, pasando por arquitecturas que generan y comprenden imágenes al mismo tiempo.