NVIDIA Nemotron 3.5 Lightning: Kompaktes MoE-Modell für Agenten-Workflows

ArtikelChris Alexiuk and Chintan PatelAnkündigung

NVIDIA hat Nemotron 3.5 Lightning vorgestellt, ein offenes Mixture-of-Experts-Modell (MoE) mit 30 Milliarden Gesamt- und 3 Milliarden aktiven Parametern. Es wurde speziell für die Ausführungsebene langlebiger KI-Agenten optimiert, um Routineaufgaben wie Tool-Aufrufe und Ergebnisvalidierung schnell und kostengünstig zu bewältigen.

Das Wichtigste

  1. MoE-Architektur mit 30B Gesamtparametern und 3B aktiven Parametern pro Token für geringen Rechenaufwand.
  2. Unterstützt spekulatives Decoding mittels vorab trainierter Multi-Token-Vorhersage (MTP) sowie Draft-Modelle (DSpark und DFlash).
  3. Erscheint unter der OpenMDW-1.1-Lizenz mit offenen Gewichten, Trainingsdaten und Rezepten im BF16- und quantisierten NVFP4-Format.
  4. Optimiert für Hardware von lokalen Systemen (RTX 5090, DGX Spark) bis hin zu Rechenzentren (Hopper, Blackwell).
  5. Erreicht auf PinchBench 86 % Genauigkeit und schließt 10.000 Aufgaben 30 % schneller ab als Qwen3.6 35B.
  6. NeMo Switchyard übernimmt intelligentes Task-Routing zwischen Planungsmodellen (Frontier LLMs) und Ausführungsmodellen wie Nemotron 3.5 Lightning.

Warum das relevant ist

Autonome Agenten verbringen den Großteil ihrer Rechenzeit mit wiederkehrenden Standardaufrufen statt mit komplexer Planung. Teure Frontier-Modelle für jede Tool-Interaktion einzusetzen, treibt Latenz und Kosten unnötig in die Höhe. Nemotron 3.5 Lightning bietet Entwicklern eine offene, hochperformante Ausführungsebene, die sich lokal oder im Rechenzentrum effizient betreiben lässt.

Einordnung

Mit Nemotron 3.5 Lightning und NeMo Switchyard forciert NVIDIA eine klare Aufgabenteilung in agentischen Architekturen: Große Frontier-Modelle planen, spezialisierte kleine MoE-Modelle führen aus. Die Integration von NVFP4-Quantisierung und spekulativem Decoding zeigt den Fokus auf Durchsatz und Kostenreduktion. Durch die permissive Lizenzierung und native Unterstützung für Frameworks wie Ollama, vLLM und LM Studio positioniert NVIDIA das Modell direkt gegen Open-Source-Konkurrenten wie Qwen im Bereich langlebiger Agenten.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:NVIDIA

    NVIDIA DGX Spark: Desktop-KI-Supercomputer mit Grace-Blackwell-Chip

    NVIDIA stellt mit dem DGX Spark einen kompakten Desktop-Supercomputer vor, der speziell auf lokale autonome Agenten und generative KI-Workloads ausgelegt ist. Das System basiert auf dem GB10 Grace Blackwell Superchip und bietet 128 GB kohärenten Unified Memory.

    KI & AI· Tool

  • Artikel:Zhidx

    Ant Group veröffentlicht kompaktes MoE-Modell Ling-3.0-tiny

    Ant Groups Bailian hat das Open-Source-Modell Ling-3.0-tiny vorgestellt. Die Architektur kombiniert DeepSeeks MLA mit Kimis KDA in einem Mixture-of-Experts-Design mit 7,9 Milliarden Gesamtparametern, von denen pro Token nur 1,3 Milliarden aktiviert werden. Das Modell zielt auf den effizienten lokalen Einsatz auf Rechnern wie Apple-Silicon-Macs und DGX-Workstations ab.

    KI & AI· Ankündigung

  • Link:inclusionAI

    Ling-3.0-tiny: Leichtes hybrides Reasoning-MoE-Modell von inclusionAI

    inclusionAI hat Ling-3.0-tiny veröffentlicht, ein leichtgewichtiges MoE-Modell mit 7,9 Milliarden Gesamtparametern, das pro Token nur 1,3 Milliarden Parameter aktiviert. Das Modell setzt auf eine hybride Architektur aus linearen Aufmerksamkeits- und Latent-Attention-Schichten und zielt auf recheneffizientes Reasoning sowie Agenten-Aufgaben auf lokaler Hardware ab.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.