Liquid AI veröffentlicht LFM2.5-2.6B: Lokales Agentenmodell für Edge-Geräte

ArtikelLiquid AIAnkündigung

Liquid AI hat das Open-Weight-Modell LFM2.5-2.6B vorgestellt. Mit 2,6 Milliarden Parametern wurde es speziell für Agenten-Workflows optimiert und läuft vollständig lokal auf Smartphones, CPUs oder Rechenzentrums-GPUs.

Das Wichtigste

  1. 2,6 Milliarden Parameter, vortrainiert auf etwa 34 Billionen Token mit 128K Token Kontextfenster und erweitertem Vokabular für nicht-lateinische Schriften.
  2. Vierstufige Post-Training-Pipeline: Zweistufiges SFT, Domain-Spezialisierung von Lehrer-Modellen, Multi-Domain On-Policy Distillation (MOPD) und Agentic Reinforcement Learning via GRPO in echten Sandbox-Umgebungen.
  3. In Benchmarks für Instruction Following und Tool-Nutzung übertrifft das Modell teils deutlich größere Modelle wie Gemma-4 und konkurriert mit Qwen3.5-4B und 9B, während größere Modelle beim Coden im Vorteil bleiben.
  4. Hohe Inferenzleistung: 30 Token/s auf Mobiltelefonen, 220 Token/s auf Apple M5 Max, 113 Token/s auf Ryzen AI Max+ 395 bei unter 2,5 GB Speicherbedarf sowie knapp 15.000 Token/s auf einer H100 GPU.
  5. Sofortige Integration in Frameworks wie llama.cpp (GGUF), MLX, vLLM, SGLang und ONNX; kompatibel mit Agenten-Umgebungen wie OpenClaw und Hermes Agent.

Warum das relevant ist

Lokale Agentenmodelle beseitigen laufende API-Kosten pro Token und ermöglichen datenschutzkonforme, latenzarme Hintergrundaufgaben direkt auf Endgeräten. Entwickler können rechenintensive Multi-Step-Workflows und Werkzeugaufrufe parallelisieren, ohne von Cloud-Diensten abhängig zu sein.

Einordnung

Liquid AI demonstriert mit LFM2.5-2.6B den Trend zu hochspezialisierten, kompakten Modellen für Agentenaufgaben. Durch den Fokus auf On-Policy-Destillation und RL-Training in realen Agenten-Harnesses erreicht das Modell trotz geringer Parameterzahl starke Ergebnisse bei strukturierter Befolgung von Anweisungen und Funktionsaufrufen. Für ressourcenbeschränkte Anwendungen oder datensensible Umgebungen bietet das Modell eine praktische Alternative zu proprietären Cloud-APIs, auch wenn komplexe Programmieraufgaben weiterhin größere Architekturen erfordern.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Chris Alexiuk and Chintan Patel

    NVIDIA Nemotron 3.5 Lightning: Kompaktes MoE-Modell für Agenten-Workflows

    NVIDIA hat Nemotron 3.5 Lightning vorgestellt, ein offenes Mixture-of-Experts-Modell (MoE) mit 30 Milliarden Gesamt- und 3 Milliarden aktiven Parametern. Es wurde speziell für die Ausführungsebene langlebiger KI-Agenten optimiert, um Routineaufgaben wie Tool-Aufrufe und Ergebnisvalidierung schnell und kostengünstig zu bewältigen.

    KI & AI· Ankündigung

  • Artikel:Zhidx

    Ant Group veröffentlicht kompaktes MoE-Modell Ling-3.0-tiny

    Ant Groups Bailian hat das Open-Source-Modell Ling-3.0-tiny vorgestellt. Die Architektur kombiniert DeepSeeks MLA mit Kimis KDA in einem Mixture-of-Experts-Design mit 7,9 Milliarden Gesamtparametern, von denen pro Token nur 1,3 Milliarden aktiviert werden. Das Modell zielt auf den effizienten lokalen Einsatz auf Rechnern wie Apple-Silicon-Macs und DGX-Workstations ab.

    KI & AI· Ankündigung

  • Link:inclusionAI

    Ling-3.0-tiny: Leichtes hybrides Reasoning-MoE-Modell von inclusionAI

    inclusionAI hat Ling-3.0-tiny veröffentlicht, ein leichtgewichtiges MoE-Modell mit 7,9 Milliarden Gesamtparametern, das pro Token nur 1,3 Milliarden Parameter aktiviert. Das Modell setzt auf eine hybride Architektur aus linearen Aufmerksamkeits- und Latent-Attention-Schichten und zielt auf recheneffizientes Reasoning sowie Agenten-Aufgaben auf lokaler Hardware ab.

    KI & AI· Tool

  • Repository:google-ai-edge/LiteRT-LM

    LiteRT-LM: Googles Open-Source-Inferenz-Framework für On-Device-LLMs

    LiteRT-LM ist ein Open-Source-Framework von Google zur plattformübergreifenden Ausführung großer Sprachmodelle direkt auf Edge-Geräten. Die Software nutzt Hardwarebeschleunigung über GPU und NPU und treibt On-Device-KI-Funktionen in Chrome, Pixel Watch und Chromebook Plus an.

    6375SterneC++

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.