Artikel:Opher Lieber, Barak Lenz, Hofit Bata et al.
Jamba: Hybrides Sprachmodell aus Transformer, Mamba und Mixture-of-Experts
Ein Forschungsteam stellt Jamba vor, ein großes Basis-Sprachmodell mit einer neuartigen Hybrid-Architektur. Das Modell verzahnt Transformer- und Mamba-Schichten und ergänzt diese teilweise durch Mixture-of-Experts (MoE). Die vorgestellte Konfiguration passt auf eine einzelne 80-GB-GPU und unterstützt Kontextlängen von bis zu 256.000 Token.