TurboFieldfare: Gemma 4 26B mit nur 2 GB RAM auf Apple Silicon betreiben

LinkdrumihTool

TurboFieldfare ist eine in Swift und Metal geschriebene Open-Source-Inference-Engine, die das 4-Bit-quantisierte Modell Gemma 4 26B-A4B-IT auf Apple M-Series Macs mit rund 2 GB Arbeitsspeicher ausführt. Da die Gewichte etwa 14 GB SSD-Speicher belegen, werden nur der gemeinsame Modellkern und der KV-Cache im RAM gehalten, während benötigte Experten pro Token direkt per Streaming von der SSD nachgeladen werden.

Das Wichtigste

  1. TurboFieldfare läuft auf M-Series Macs in Swift und Metal und benötigt rund 2 GB Arbeitsspeicher.
  2. Das 4-Bit-Modell Gemma 4 26B-A4B-IT belegt rund 14 GB Speicherplatz.
  3. Geteilte Modellschichten und der KV-Cache verbleiben im RAM; Experten-Layer werden pro Token per parallelem pread von der SSD gestreamt.
  4. Während Lesezugriffe auf die SSD laufen, führt die GPU die Berechnungen der geteilten Schichten aus.
  5. Erreichte Geschwindigkeiten liegen bei 5–6 Token/s auf einem 8-GB-M2-MacBook-Air und 31–35 Token/s auf einem M5 MacBook Pro.
  6. Enthält einen lokalen, OpenAI-kompatiblen Server mit Unterstützung für Streaming, Tool Calls und Prefix-Caching.

Warum das relevant ist

Lokale LLM-Inferenz scheitert auf Standard-Laptops häufig an zu geringem Unified Memory. Durch die gezielte Entkopplung von geteilten Gewichten und on-demand gestreamten MoE-Experten von schnellen NVMe-SSDs lassen sich größere Sprachmodelle selbst auf Einsteiger-Hardware mit 8 GB RAM sinnvoll nutzen.

Einordnung

Das Mixture-of-Experts-Prinzip (MoE) aktiviert pro Token nur eine Teilmenge aller Parameter. Entwickler drumih nutzt dies gezielt aus: Da SSD-Zugriffe langsamer sind als Arbeitsspeicher, überlappt TurboFieldfare asynchrone pread-Operationen mit GPU-Berechnungen der Basisschichten und nutzt einen kleinen Cache. Der Durchsatz auf Basismodellen wie dem M2 Air ist mit 5–6 Token/s alltagstauglich, während neuere M5-Chips über 30 Token/s erzielen. Die Architektur zeigt eine gangbare Alternative zum klassischen Voll-Laden von Modellen in den Hauptspeicher.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:drumih/turbo-fieldfare

    TurboFieldfare: Gemma 4 26B-A4B mit 2 GB RAM auf Apple Silicon

    TurboFieldfare ist eine spezialisierte Swift- und Metal-Laufzeitumgebung, die das Sprachmodell Gemma 4 26B-A4B auf Apple-Silicon-Macs mit nur etwa 2 GB RAM ausführt. Statt das gesamte 14,3 GB große Modell im Arbeitsspeicher zu halten, verbleiben nur der 1,35 GB große Kern sowie der KV-Cache im RAM, während benötigte Experten-Layer dynamisch per SSD-Streaming nachgeladen werden.

    6609SterneSwift

    KI & AI· Tool

  • Repository:JustVugg/colibri

    Colibrì: Frontier-MoE-Modelle lokal mit Streaming ausführen

    Colibrì ist eine leichtgewichtige Open-Source-Inferenz-Engine in reinem C ohne externe Abhängigkeiten, die riesige Mixture-of-Experts-Modelle (MoE) von 744 Milliarden bis 2,8 Billionen Parametern auf gewöhnlicher Consumer- und heterogener Hardware ausführt. Durch mehrstufiges Speichermanagement (AI Memory Multitiering) werden Experten dynamisch von der Festplatte gestreamt.

    37.671SterneC

    KI & AI· Tool

  • Repository:FlashML-org/FreeToken

    FreeToken: Lokales Serving von 290B+ MoE-Modellen auf Consumer-Hardware

    FreeToken ist eine quelloffene Inference-Engine, die große Mixture-of-Experts-Modelle (MoE) auf herkömmlichen Gaming-PCs und Laptops nutzbar macht. Durch kooperative CPU-GPU-Ausführung, semantisches Caching und dynamisches VRAM-Management lassen sich Modelle wie DeepSeek-V4-Flash oder GLM-5.2 ohne Rechenzentrumsinfrastruktur lokal betreiben.

    11.702SternePython

    KI & AI· Tool

  • Link:inclusionAI

    Ling-3.0-tiny: Leichtes hybrides Reasoning-MoE-Modell von inclusionAI

    inclusionAI hat Ling-3.0-tiny veröffentlicht, ein leichtgewichtiges MoE-Modell mit 7,9 Milliarden Gesamtparametern, das pro Token nur 1,3 Milliarden Parameter aktiviert. Das Modell setzt auf eine hybride Architektur aus linearen Aufmerksamkeits- und Latent-Attention-Schichten und zielt auf recheneffizientes Reasoning sowie Agenten-Aufgaben auf lokaler Hardware ab.

    KI & AI· Tool

  • Repository:PipeNetwork/kimi-k3-mlx

    kimi-k3-mlx: Portierung des 2,78-Billionen-Parameter-MoE-Modells für Apple Silicon

    kimi-k3-mlx portiert Moonshots multimodales Kimi-K3-MoE-Modell (2,78 Billionen Parameter) auf Apples MLX-Framework. Da das Modell selbst im komprimierten Zustand zu groß für handelsübliche Apple-Silicon-Rechner ist, liefert das Projekt neben den Modell- und Vision-Wrappern einen Streaming-Konverter sowie Werkzeuge zum Pruning von Experten.

    337SternePython

    KI & AI· Tool

  • Repository:google-ai-edge/LiteRT-LM

    LiteRT-LM: Googles Open-Source-Inferenz-Framework für On-Device-LLMs

    LiteRT-LM ist ein Open-Source-Framework von Google zur plattformübergreifenden Ausführung großer Sprachmodelle direkt auf Edge-Geräten. Die Software nutzt Hardwarebeschleunigung über GPU und NPU und treibt On-Device-KI-Funktionen in Chrome, Pixel Watch und Chromebook Plus an.

    6375SterneC++

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.