FreeToken: Lokales Serving von 290B+ MoE-Modellen auf Consumer-Hardware

RepositoryFlashML-org/FreeTokenTool

FreeToken ist eine quelloffene Inference-Engine, die große Mixture-of-Experts-Modelle (MoE) auf herkömmlichen Gaming-PCs und Laptops nutzbar macht. Durch kooperative CPU-GPU-Ausführung, semantisches Caching und dynamisches VRAM-Management lassen sich Modelle wie DeepSeek-V4-Flash oder GLM-5.2 ohne Rechenzentrumsinfrastruktur lokal betreiben.

Das Wichtigste

  1. Bandbreiten-adaptive CPU-GPU-Koausführung mit q*-Policy, globalem LRU-Expert-Caching und dem FTW-Gewichtsformat.
  2. Semantisches KV- und State-Caching verhindert wiederholte Berechnungen bei Agenten-Workflows, Tool Calls und Denkblöcken.
  3. Dynamische VRAM-Umlagerung zwischen KV-Cache und Experten-Gewichten im laufenden Betrieb ohne Neustart.
  4. Breite Quantisierungsunterstützung inklusive MXFP4, NVFP4, FP8 und BF16 auf NVIDIA RTX 30-, 40- und 50-Grafikkarten.
  5. OpenAI- und Anthropic-kompatible APIs zur Einbindung in Coding-Agenten wie Claude Code, Codex oder OpenClaw.

Warum das relevant ist

Die Ausführung modernster Open-Weight-MoE-Modelle mit hunderten Milliarden Parametern war bisher fast ausschließlich Multi-GPU-Servern in Rechenzentren vorbehalten. FreeToken senkt die Einstiegshürde dramatisch, indem es GPU-, CPU- und Systemspeicher auf Endgeräten nahtlos bündelt. Das ermöglicht kostengünstige, datenschutzkonforme KI-Entwicklung und Agenten-Workflows direkt am lokalen Arbeitsplatz.

Einordnung

FreeToken adressiert das Hauptproblem von MoE-Architekturen: Zwar ist die Rechenlast pro Token dank spärlicher Aktivierung gering, der Speicherbedarf für sämtliche Experten-Gewichte übersteigt jedoch das VRAM gängiger Desktop-Karten bei weitem. Die Lösung kombiniert Prefill-Streaming, Expert-Offloading und elastische Speicherverwaltung, um interaktive Geschwindigkeiten trotz PCI-Express- und RAM-Flaschenhälsen zu erzielen. Mit über 11.000 Sternen, einer wissenschaftlichen Publikation (arXiv 2608.16157) und Desktop-Installern für Windows und Linux zeigt das Projekt bereits einen beachtlichen Reifegrad für Entwickler und Power-User.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:JustVugg/colibri

    Colibrì: Frontier-MoE-Modelle lokal mit Streaming ausführen

    Colibrì ist eine leichtgewichtige Open-Source-Inferenz-Engine in reinem C ohne externe Abhängigkeiten, die riesige Mixture-of-Experts-Modelle (MoE) von 744 Milliarden bis 2,8 Billionen Parametern auf gewöhnlicher Consumer- und heterogener Hardware ausführt. Durch mehrstufiges Speichermanagement (AI Memory Multitiering) werden Experten dynamisch von der Festplatte gestreamt.

    37.671SterneC

    KI & AI· Tool

  • Repository:MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

    GLM-5.3 Flash EXL3 auf 2x NVIDIA DGX Spark Kits

    Das GitHub-Repository von Mia's AI Lab bietet eine optimierte vLLM-Serving-Konfiguration für GLM-5.3-Flash mit 4-bpw-EXL3-Quantisierung auf zwei NVIDIA GB10 Systemen.

    431SternePython

    KI & AI· Tool

  • Repository:drumih/turbo-fieldfare

    TurboFieldfare: Gemma 4 26B-A4B mit 2 GB RAM auf Apple Silicon

    TurboFieldfare ist eine spezialisierte Swift- und Metal-Laufzeitumgebung, die das Sprachmodell Gemma 4 26B-A4B auf Apple-Silicon-Macs mit nur etwa 2 GB RAM ausführt. Statt das gesamte 14,3 GB große Modell im Arbeitsspeicher zu halten, verbleiben nur der 1,35 GB große Kern sowie der KV-Cache im RAM, während benötigte Experten-Layer dynamisch per SSD-Streaming nachgeladen werden.

    6609SterneSwift

    KI & AI· Tool

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Link:drumih

    TurboFieldfare: Gemma 4 26B mit nur 2 GB RAM auf Apple Silicon betreiben

    TurboFieldfare ist eine in Swift und Metal geschriebene Open-Source-Inference-Engine, die das 4-Bit-quantisierte Modell Gemma 4 26B-A4B-IT auf Apple M-Series Macs mit rund 2 GB Arbeitsspeicher ausführt. Da die Gewichte etwa 14 GB SSD-Speicher belegen, werden nur der gemeinsame Modellkern und der KV-Cache im RAM gehalten, während benötigte Experten pro Token direkt per Streaming von der SSD nachgeladen werden.

    KI & AI· Tool

  • Repository:syv-ai/qwen38-27b-rtx3090

    Qwen3.8-27B auf einer RTX 3090: Hochleistungs-Serving mit vLLM

    Das Repository bietet eine optimierte Serving-Lösung, um das Modell Qwen3.8-27B auf einer einzigen Consumer-Grafikkarte (RTX 3090 mit 24 GB VRAM) mit vLLM 0.28.0 und bis zu 150k–262k Kontextlänge zu betreiben.

    1142SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.