TurboFieldfare: Gemma 4 26B-A4B mit 2 GB RAM auf Apple Silicon

Repositorydrumih/turbo-fieldfareTool

TurboFieldfare ist eine spezialisierte Swift- und Metal-Laufzeitumgebung, die das Sprachmodell Gemma 4 26B-A4B auf Apple-Silicon-Macs mit nur etwa 2 GB RAM ausführt. Statt das gesamte 14,3 GB große Modell im Arbeitsspeicher zu halten, verbleiben nur der 1,35 GB große Kern sowie der KV-Cache im RAM, während benötigte Experten-Layer dynamisch per SSD-Streaming nachgeladen werden.

Das Wichtigste

  1. Ermöglicht lokale Ausführung des 26-Milliarden-Parameter-Modells Gemma 4 26B-A4B auf Macs mit lediglich 8 GB RAM.
  2. Benötigt nur ca. 2 GB Arbeitsspeicher durch selektives SSD-Streaming der aktiven Experten pro Token.
  3. Verbleibender Speicherbedarf im RAM: 1,35 GB für den gemeinsamen Modellkern plus FP16-KV-Cache.
  4. Eigene native Implementierung in Swift 6.2 und Metal 4 ohne Abhängigkeit von Frameworks wie MLX oder llama.cpp.
  5. Umfasst eine native macOS-App, CLI-Tools, einen Hintergrund-Decode-Dienst und Vorbereitung für lokale OpenAI-kompatible Server.

Warum das relevant ist

Lokale LLM-Inferenz scheitert auf Standard-Hardware oft an zu geringem RAM, insbesondere bei Einsteiger-Macs mit 8 GB Speicher. Durch intelligentes Streaming von Mixture-of-Experts-Layern direkt von der SSD können auch größere Modelle ohne Cloud-Abhängigkeit und teure Hardware-Upgrades lokal betrieben werden.

Einordnung

Das Open-Source-Projekt von drumih zielt auf Nutzer ab, die moderne Open-Weights-Modelle lokal auf MacBooks mit minimaler Speicherausstattung betreiben wollen. Mit über 6.600 Stars, detaillierten Benchmarks und einer dedizierten Mac-App wirkt das Projekt bereits beachtlich ausgereift, erfordert durch den Fokus auf macOS 26 und Swift 6.2 jedoch eine sehr aktuelle Systemumgebung.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:drumih

    TurboFieldfare: Gemma 4 26B mit nur 2 GB RAM auf Apple Silicon betreiben

    TurboFieldfare ist eine in Swift und Metal geschriebene Open-Source-Inference-Engine, die das 4-Bit-quantisierte Modell Gemma 4 26B-A4B-IT auf Apple M-Series Macs mit rund 2 GB Arbeitsspeicher ausführt. Da die Gewichte etwa 14 GB SSD-Speicher belegen, werden nur der gemeinsame Modellkern und der KV-Cache im RAM gehalten, während benötigte Experten pro Token direkt per Streaming von der SSD nachgeladen werden.

    KI & AI· Tool

  • Repository:JustVugg/colibri

    Colibrì: Frontier-MoE-Modelle lokal mit Streaming ausführen

    Colibrì ist eine leichtgewichtige Open-Source-Inferenz-Engine in reinem C ohne externe Abhängigkeiten, die riesige Mixture-of-Experts-Modelle (MoE) von 744 Milliarden bis 2,8 Billionen Parametern auf gewöhnlicher Consumer- und heterogener Hardware ausführt. Durch mehrstufiges Speichermanagement (AI Memory Multitiering) werden Experten dynamisch von der Festplatte gestreamt.

    37.671SterneC

    KI & AI· Tool

  • Repository:google-ai-edge/LiteRT-LM

    LiteRT-LM: Googles Open-Source-Inferenz-Framework für On-Device-LLMs

    LiteRT-LM ist ein Open-Source-Framework von Google zur plattformübergreifenden Ausführung großer Sprachmodelle direkt auf Edge-Geräten. Die Software nutzt Hardwarebeschleunigung über GPU und NPU und treibt On-Device-KI-Funktionen in Chrome, Pixel Watch und Chromebook Plus an.

    6375SterneC++

    KI & AI· Tool

  • Repository:PipeNetwork/kimi-k3-mlx

    kimi-k3-mlx: Portierung des 2,78-Billionen-Parameter-MoE-Modells für Apple Silicon

    kimi-k3-mlx portiert Moonshots multimodales Kimi-K3-MoE-Modell (2,78 Billionen Parameter) auf Apples MLX-Framework. Da das Modell selbst im komprimierten Zustand zu groß für handelsübliche Apple-Silicon-Rechner ist, liefert das Projekt neben den Modell- und Vision-Wrappern einen Streaming-Konverter sowie Werkzeuge zum Pruning von Experten.

    337SternePython

    KI & AI· Tool

  • Repository:FlashML-org/FreeToken

    FreeToken: Lokales Serving von 290B+ MoE-Modellen auf Consumer-Hardware

    FreeToken ist eine quelloffene Inference-Engine, die große Mixture-of-Experts-Modelle (MoE) auf herkömmlichen Gaming-PCs und Laptops nutzbar macht. Durch kooperative CPU-GPU-Ausführung, semantisches Caching und dynamisches VRAM-Management lassen sich Modelle wie DeepSeek-V4-Flash oder GLM-5.2 ohne Rechenzentrumsinfrastruktur lokal betreiben.

    11.702SternePython

    KI & AI· Tool

  • Link:inclusionAI

    Ling-3.0-tiny: Leichtes hybrides Reasoning-MoE-Modell von inclusionAI

    inclusionAI hat Ling-3.0-tiny veröffentlicht, ein leichtgewichtiges MoE-Modell mit 7,9 Milliarden Gesamtparametern, das pro Token nur 1,3 Milliarden Parameter aktiviert. Das Modell setzt auf eine hybride Architektur aus linearen Aufmerksamkeits- und Latent-Attention-Schichten und zielt auf recheneffizientes Reasoning sowie Agenten-Aufgaben auf lokaler Hardware ab.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.