Z.ai veröffentlicht GLM-5.3-Flash mit nativer Multimodalität und 1M Kontext

LinkZ.aiSammlung

Z.ai hat GLM-5.3-Flash vorgestellt, das über Ollama Cloud verfügbar ist. Das Modell besitzt insgesamt 320B Parameter bei nur 18B aktiven Parametern und liefert hohe Leistung bei Programmier- sowie Agenten-Aufgaben zu deutlich geringeren Kosten.

Das Wichtigste

  1. Architektur mit 320 Milliarden Gesamtwerten und 18 Milliarden aktiven Parametern (45 Layer) reduziert Attention-Berechnungen um das Dreifache und den KV-Cache um das 4,4-fache gegenüber GLM-5.3.
  2. Unterstützt ein Kontextfenster von 1 Million Tokens und verarbeitet neben Text auch Bilder und Videos.
  3. Kombiniert lineare Attention für lokale Abhängigkeiten mit spärlicher Attention via IndexPool-Kompression zur Reduzierung von Latenz und Speicherbedarf.
  4. Erhältlich über die Ollama Cloud für 0,15 US-Dollar pro 1M Input-Tokens, 0,03 US-Dollar für Cached Tokens und 0,50 US-Dollar pro 1M Output-Tokens unter MIT-Lizenz.
  5. Optimiert für Agentic Coding und Computer-Use; vor der Veröffentlichung anonym als ox-alpha getestet.

Warum das relevant ist

Für Entwickler und Unternehmen senkt das Modell die Betriebskosten für KI-gestützte Entwickler-Workflows und Coding-Agenten erheblich, ohne nennenswerte Abstriche bei der Modellintelligenz oder dem Kontextfenster machen zu müssen.

Einordnung

Z.ai positioniert GLM-5.3-Flash gezielt an der Schnittstelle zwischen High-End-Coding-Leistung und extrem niedrigen Betriebskosten. Die Architektur kombiniert lineare und spärliche Attention, um das 1M-Token-Fenster rechen- und speichereffizient zu halten. Benchmark-Ergebnisse zeigen, dass das Modell Vorgänger wie GLM-5.2 deutlich hinter sich lässt und bei Aufgaben wie DeepSWE v1.1 oder Z.ai Code Bench nahe an Flaggschiffmodelle wie Claude Opus 4.8 heranreicht. Durch das native Training auf visuellen Trajektorien eignet sich GLM-5.3-Flash besonders für iterative Frontend- und UI-Feedbackschleifen in Coding-Agenten.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:docs.z.ai

    Z.AI veroeffentlicht GLM-5.3-Flash mit nativer Multimodalitaet

    Z.AI hat GLM-5.3-Flash vorgestellt, das erste nativ multimodale Modell der GLM-5-Reihe. Mit 320 Milliarden Parametern (18 Milliarden aktiviert) kombiniert das Modell Sparse- und Linear-Attention, um Rechenaufwand und KV-Cache massiv zu senken.

    KI & AI· Ankündigung

  • Link:Z.ai

    Z.ai veröffentlicht GLM-5.3-Flash als multimodales Open-Source-Modell

    Z.ai hat mit GLM-5.3-Flash das erste nativ multimodale Modell der GLM-5-Reihe unter MIT-Lizenz auf Hugging Face bereitgestellt. Mit 320 Milliarden Gesamtparametern und 18 Milliarden aktiven Parametern zielt das Modell auf hohe Effizienz bei Programmier- und Agenten-Workloads ab.

    KI & AI· Tool

  • Link:Z.ai

    Z.ai veröffentlicht GLM-5.2 mit 1M-Kontext und MIT-Lizenz

    Z.ai hat das Flaggschiff-Modell GLM-5.2 auf Hugging Face unter der freien MIT-Lizenz bereitgestellt. Das Modell zielt auf komplexe Coding- und Agentic-Workflows ab und bietet ein stabiles Kontextfenster von einer Million Tokens. Durch Architekturverbesserungen wie IndexShare und einen optimierten MTP-Layer wurden Rechenaufwand gesenkt und Inferenzzeiten verkürzt.

    KI & AI· Sammlung

  • Link:Z.ai

    Z.ai veröffentlicht GLM-5.1 mit Fokus auf Agentic Engineering

    Z.ai hat auf Hugging Face das Modell GLM-5.1 unter MIT-Lizenz bereitgestellt. Das MoE-Modell mit 754 Milliarden Parametern zielt auf anspruchsvolle Programmier- und Agenten-Workflows ab und soll über lange Sessions hinweg stabil arbeiten.

    KI & AI· Sammlung

  • Artikel:Jonas Reeve

    Z.ai stellt GLM-5.3 vor: Leistungszuwächse beim Coden und ungeplante Exploit-Fähigkeiten

    Z.ai hat GLM-5.3 veröffentlicht. Das Modell nutzt dieselbe Basis wie GLM-5.2 und bezieht alle Leistungssteigerungen aus skaliertem Post-Training in realistischen Arbeitsumgebungen. Neben Fortschritten beim Coden zeigte das Modell unerwartet starke Fähigkeiten bei der Verkettung mehrstufiger Exploits in der Cybersicherheit.

    KI & AI· News

  • Artikel:Z.AI

    Z.AI Quick Start: Entwicklerdokumentation für GLM-5.3 und SDK-Integration

    Die Quick-Start-Dokumentation von Z.AI beschreibt die ersten Schritte zur Einbindung der Plattform über APIs und SDKs. Neben dem Flaggschiffmodell GLM-5.3 und weiteren Bild- und Videomodellen wird die direkte Kompatibilität mit bestehenden OpenAI-SDKs erläutert.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.