Colibrì: Frontier-MoE-Modelle lokal mit Streaming ausführen

RepositoryJustVugg/colibriTool

Colibrì ist eine leichtgewichtige Open-Source-Inferenz-Engine in reinem C ohne externe Abhängigkeiten, die riesige Mixture-of-Experts-Modelle (MoE) von 744 Milliarden bis 2,8 Billionen Parametern auf gewöhnlicher Consumer- und heterogener Hardware ausführt. Durch mehrstufiges Speichermanagement (AI Memory Multitiering) werden Experten dynamisch von der Festplatte gestreamt.

Das Wichtigste

  1. Führt gigantische MoE-Modelle (unter anderem GLM-5.2/5.3, Kimi K3, DeepSeek V4/V4.1 Flash, Qwen3.8) auf lokaler Hardware aus.
  2. Entwickelt in reinem C ohne externe Abhängigkeiten ('zero deps'); jede Modellfamilie ist in einer einzigen C-Datei implementiert.
  3. Mehrstufige Speicherhierarchie: VRAM, RAM und Massenspeicher werden vereint, um Experten zur Laufzeit von Festplatte zu streamen.
  4. Strikte semantische Garantien: Verändert niemals eigenmächtig Präzision oder Routing-Logik zugunsten von Durchsatz.
  5. Bietet CLI-Interface (`coli chat`), Server-Modus (`coli serve`) und ein integriertes Web-Dashboard (`coli web`).

Warum das relevant ist

Riesige MoE-Modelle erfordern üblicherweise teure Rechenzentrums-GPUs mit enormen VRAM-Kapazitäten. Colibrì senkt diese Einstiegshürde dramatisch, indem es Inferenz auch mit geringem Arbeitsspeicher ermöglicht – relevant für lokale Forschung, Datenschutz und kostensensible Deployments.

Einordnung

Colibrì löst das Speicherproblem riesiger Frontier-Modelle durch Multitiering: Das System lagert ungenutzte Experten auf SSDs aus und lädt sie bedarfsgerecht nach. Technisch besticht das Projekt durch Minimalismus (reines C, zero dependencies, modulare Einzeldateien). Mit über 37.000 GitHub-Stars und Release v1.12.1 besitzt das Tool eine beachtliche Reife für ein Forschungsprojekt, wenngleich das Design explizit auf semantische Korrektheit statt fester Latenz-SLAs optimiert ist. Es richtet sich vor allem an Forschende und Entwickler, die extreme Modellgrößen ohne teure Cloud-GPU-Infrastruktur evaluieren wollen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:FlashML-org/FreeToken

    FreeToken: Lokales Serving von 290B+ MoE-Modellen auf Consumer-Hardware

    FreeToken ist eine quelloffene Inference-Engine, die große Mixture-of-Experts-Modelle (MoE) auf herkömmlichen Gaming-PCs und Laptops nutzbar macht. Durch kooperative CPU-GPU-Ausführung, semantisches Caching und dynamisches VRAM-Management lassen sich Modelle wie DeepSeek-V4-Flash oder GLM-5.2 ohne Rechenzentrumsinfrastruktur lokal betreiben.

    11.702SternePython

    KI & AI· Tool

  • Link:drumih

    TurboFieldfare: Gemma 4 26B mit nur 2 GB RAM auf Apple Silicon betreiben

    TurboFieldfare ist eine in Swift und Metal geschriebene Open-Source-Inference-Engine, die das 4-Bit-quantisierte Modell Gemma 4 26B-A4B-IT auf Apple M-Series Macs mit rund 2 GB Arbeitsspeicher ausführt. Da die Gewichte etwa 14 GB SSD-Speicher belegen, werden nur der gemeinsame Modellkern und der KV-Cache im RAM gehalten, während benötigte Experten pro Token direkt per Streaming von der SSD nachgeladen werden.

    KI & AI· Tool

  • Repository:drumih/turbo-fieldfare

    TurboFieldfare: Lokale Gemma 4 26B Inferenz auf Apple Silicon

    TurboFieldfare ist eine spezialisierte Swift- und Metal-Laufzeitumgebung, die es ermöglicht, das 26-Milliarden-Parameter-Modell Gemma 4 26B-A4B mit einem minimalen Speicherbedarf von nur etwa 2 GB auf Apple Silicon Macs auszuführen. Durch ein intelligentes Streaming-Verfahren werden nur die benötigten Experten-Parameter von der SSD geladen, anstatt das gesamte Modell im Arbeitsspeicher zu halten.

    6609SterneSwift

    KI & AI

  • Link:inclusionAI

    Ling-3.0-tiny: Leichtes hybrides Reasoning-MoE-Modell von inclusionAI

    inclusionAI hat Ling-3.0-tiny veröffentlicht, ein leichtgewichtiges MoE-Modell mit 7,9 Milliarden Gesamtparametern, das pro Token nur 1,3 Milliarden Parameter aktiviert. Das Modell setzt auf eine hybride Architektur aus linearen Aufmerksamkeits- und Latent-Attention-Schichten und zielt auf recheneffizientes Reasoning sowie Agenten-Aufgaben auf lokaler Hardware ab.

    KI & AI· Tool

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

  • Repository:google-ai-edge/LiteRT-LM

    LiteRT-LM: Googles Open-Source-Inferenz-Framework für On-Device-LLMs

    LiteRT-LM ist ein Open-Source-Framework von Google zur plattformübergreifenden Ausführung großer Sprachmodelle direkt auf Edge-Geräten. Die Software nutzt Hardwarebeschleunigung über GPU und NPU und treibt On-Device-KI-Funktionen in Chrome, Pixel Watch und Chromebook Plus an.

    6375SterneC++

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.