Gemma 3: Architektur, Multimodalität und Neuerungen im Detail

ArtikelJu-yeong Ji, Ravin KumarSammlung

Google erklärt die Neuerungen in Gemma 3. Die Modellreihe bringt Vision-Language-Funktionen, längere Kontextfenster, einen überarbeiteten Tokenizer sowie architektonische Anpassungen für effizientere KV-Cache-Nutzung.

Das Wichtigste

  1. Multimodale Unterstützung: Die Modelle mit 4B, 12B und 27B Parametern nutzen einen angepassten SigLIP-Vision-Encoder für Bilder mit 896x896 Pixeln sowie Pan&Scan für unterschiedliche Bildformate.
  2. Kompakte Bild-Tokens: Ein MultiModalProjector bündelt Bilddaten in 256 Vektoren, während Bild-Tokens über bidirektionale Attention und Text-Tokens autoregressiv verarbeitet werden.
  3. Interleaved Attention: Eine Abfolge von fünf lokalen Attention-Layern (Sliding Window 1024) auf einen globalen Layer reduziert den Speicherbedarf des KV-Caches.
  4. Verzicht auf Softcapping: Gemma 3 ersetzt das Softcapping aus Gemma 2 durch QK-Norm, was die Rechengeschwindigkeit und Genauigkeit steigert.
  5. Längere Kontextfenster: Das 1B-Modell unterstützt 32k Tokens, während die größeren Varianten bis zu 128k Tokens verarbeiten können.
  6. Neuer Tokenizer: Ein Vokabular von 262k Tokens (identisch mit Gemini) verbessert die multilinguale Verarbeitung nicht-englischer Sprachen.

Warum das relevant ist

Lokale und offene Modelle erhalten mit Gemma 3 native Bildverarbeitung und Kontextfenster von bis zu 128k Tokens bei gleichzeitig optimiertem Speicherverbrauch. Die Umstellung auf QK-Norm und Interleaved Attention macht den Betrieb auf eigener Hardware ressourcenschonender.

Einordnung

Ju-yeong Ji und Ravin Kumar grenzen Gemma 3 explizit von PaliGemma 2 ab: Während PaliGemma 2 für spezialisierte Aufgaben wie Objekterkennung und Bildsegmentierung gedacht bleibt, zielt Gemma 3 auf dialogorientierte Vision-Aufgaben mit Zero-Shot-Fähigkeiten ab. Technisch sticht die Kombination aus bidirektionaler Bild-Attention und komprimierten Soft-Tokens hervor, die trotz hoher Auflösung die Inferenzlast begrenzen soll.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

  • Link:Z.ai

    Z.ai veröffentlicht GLM-5.3-Flash als multimodales Open-Source-Modell

    Z.ai hat mit GLM-5.3-Flash das erste nativ multimodale Modell der GLM-5-Reihe unter MIT-Lizenz auf Hugging Face bereitgestellt. Mit 320 Milliarden Gesamtparametern und 18 Milliarden aktiven Parametern zielt das Modell auf hohe Effizienz bei Programmier- und Agenten-Workloads ab.

    KI & AI· Tool

  • Artikel:Kimi Team (Yu Zhang et al.)

    Kimi Linear: Hybride lineare Attention-Architektur übertrifft Full Attention

    Das Kimi-Team stellt Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in Tests über kurze und lange Kontexte sowie im RL-Scaling übertrifft. Sie senkt den KV-Cache-Bedarf um bis zu 75 Prozent und steigert den Decoding-Durchsatz bei Kontexten von 1 Million Token um das bis zu Sechsfache.

    KI & AI· Forschung

  • Artikel:Opher Lieber, Barak Lenz, Hofit Bata et al.

    Jamba: Hybrides Sprachmodell aus Transformer, Mamba und Mixture-of-Experts

    Ein Forschungsteam stellt Jamba vor, ein großes Basis-Sprachmodell mit einer neuartigen Hybrid-Architektur. Das Modell verzahnt Transformer- und Mamba-Schichten und ergänzt diese teilweise durch Mixture-of-Experts (MoE). Die vorgestellte Konfiguration passt auf eine einzelne 80-GB-GPU und unterstützt Kontextlängen von bis zu 256.000 Token.

    KI & AI· Forschung

  • Link:Unsloth AI

    Unsloth veröffentlicht Qwen3.6-27B-MTP im GGUF-Format

    Unsloth AI stellt mit Qwen3.6-27B-MTP-GGUF quantisierte Versionen des ersten Open-Weight-Modells aus der Qwen3.6-Reihe bereit. Das multimodale 27-Milliarden-Parameter-Modell nutzt Multi-Token Prediction (MTP) für schnellere Inferenz und bringt Verbesserungen bei Agentic Coding sowie Tool Calling mit.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.