LiteRT-LM: Googles Open-Source-Inferenz-Framework für On-Device-LLMs

Repositorygoogle-ai-edge/LiteRT-LMTool

LiteRT-LM ist ein Open-Source-Framework von Google zur plattformübergreifenden Ausführung großer Sprachmodelle direkt auf Edge-Geräten. Die Software nutzt Hardwarebeschleunigung über GPU und NPU und treibt On-Device-KI-Funktionen in Chrome, Pixel Watch und Chromebook Plus an.

Das Wichtigste

  1. Plattformübergreifende Unterstützung für Android, iOS, Web, Desktop und IoT-Geräte wie Raspberry Pi.
  2. Hardwarebeschleunigung über GPU und NPU sowie Unterstützung für spekulative Dekodierung.
  3. Breite Modellkompatibilität inklusive Gemma (u. a. Gemma4-E4B), Llama, Phi-4 und Qwen.
  4. Unterstützung für multimodale Eingaben (Audio und Vision) sowie Tool Use und Function Calling für Agent-Workflows.
  5. Neuerungen in Version 0.16.0 bringen vorkompilierte C-API-Bibliotheken für einfachere native Einbindung und einen experimentellen YNNPACK-Delegaten für Linux ARM64.

Warum das relevant ist

On-Device-Inferenz minimiert Latenz, spart Serverkosten und schützt die Privatsphäre, da Daten das Endgerät nicht verlassen müssen. Durch vorkompilierte APIs und plattformübergreifende Werkzeuge vereinfacht LiteRT-LM die Integration lokaler Sprachmodelle in Desktop-, Mobile- und Embedded-Software.

Einordnung

LiteRT-LM löst das Problem, dass LLMs auf ressourcenbeschränkter Edge-Hardware oft nur mit hohem manuellem Optimierungsaufwand lauffähig sind. Es dient als Orchestrierungsschicht auf Basis von C++, LiteRT und XNNPACK/YNNPACK und bietet Schnittstellen für CLI, Python, JavaScript und native C-Bibliotheken. Das Projekt richtet sich an Entwickler von Mobil-, Web- und IoT-Anwendungen, die KI lokal einbinden wollen. Hinsichtlich der Reife befindet sich das Framework mit Version v0.16.0 formell noch in einer frühen Versionsphase, ist laut Google aber bereits produktionsreif und in eigenen Endgeräten wie Pixel Watch und Chromebook Plus im Feldeinsatz erprobt.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:ggml-org/llama.cpp

    llama.cpp: LLM-Inferenz in C/C++

    llama.cpp ist ein quelloffenes C/C++-Projekt der Organisation ggml-org, das auf LLM-Inferenz spezialisiert ist. Mit über 127.000 Sternen auf GitHub bietet es vorkompilierte Binärdateien, Docker-Container, REST-APIs und C-Bibliotheksanbindungen für den Betrieb von Sprachmodellen.

    127.115SterneC++

    KI & AI· Tool

  • Repository:drumih/turbo-fieldfare

    TurboFieldfare: Gemma 4 26B-A4B mit 2 GB RAM auf Apple Silicon

    TurboFieldfare ist eine spezialisierte Swift- und Metal-Laufzeitumgebung, die das Sprachmodell Gemma 4 26B-A4B auf Apple-Silicon-Macs mit nur etwa 2 GB RAM ausführt. Statt das gesamte 14,3 GB große Modell im Arbeitsspeicher zu halten, verbleiben nur der 1,35 GB große Kern sowie der KV-Cache im RAM, während benötigte Experten-Layer dynamisch per SSD-Streaming nachgeladen werden.

    6609SterneSwift

    KI & AI· Tool

  • Repository:ollama/ollama

    Ollama: Lokale Ausführung und Integration offener Sprachmodelle

    Ollama ist ein Open-Source-Framework in Go, mit dem Open-Weight-Modelle lokal ausgeführt, über APIs angesprochen und an Entwicklungswerkzeuge sowie Chat-Assistenten angebunden werden können.

    180.203SterneGo

    KI & AI· Tool

  • Repository:JustVugg/colibri

    Colibrì: Frontier-MoE-Modelle lokal mit Streaming ausführen

    Colibrì ist eine leichtgewichtige Open-Source-Inferenz-Engine in reinem C ohne externe Abhängigkeiten, die riesige Mixture-of-Experts-Modelle (MoE) von 744 Milliarden bis 2,8 Billionen Parametern auf gewöhnlicher Consumer- und heterogener Hardware ausführt. Durch mehrstufiges Speichermanagement (AI Memory Multitiering) werden Experten dynamisch von der Festplatte gestreamt.

    37.671SterneC

    KI & AI· Tool

  • Link:drumih

    TurboFieldfare: Gemma 4 26B mit nur 2 GB RAM auf Apple Silicon betreiben

    TurboFieldfare ist eine in Swift und Metal geschriebene Open-Source-Inference-Engine, die das 4-Bit-quantisierte Modell Gemma 4 26B-A4B-IT auf Apple M-Series Macs mit rund 2 GB Arbeitsspeicher ausführt. Da die Gewichte etwa 14 GB SSD-Speicher belegen, werden nur der gemeinsame Modellkern und der KV-Cache im RAM gehalten, während benötigte Experten pro Token direkt per Streaming von der SSD nachgeladen werden.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.