kimi-k3-mlx: Portierung des 2,78-Billionen-Parameter-MoE-Modells für Apple Silicon

RepositoryPipeNetwork/kimi-k3-mlxTool

kimi-k3-mlx portiert Moonshots multimodales Kimi-K3-MoE-Modell (2,78 Billionen Parameter) auf Apples MLX-Framework. Da das Modell selbst im komprimierten Zustand zu groß für handelsübliche Apple-Silicon-Rechner ist, liefert das Projekt neben den Modell- und Vision-Wrappern einen Streaming-Konverter sowie Werkzeuge zum Pruning von Experten.

Das Wichtigste

  1. 2,78 Billionen Parameter (104 Milliarden aktiv) mit 896 gerouteten Experten (Top-16), 2 geteilten Experten und 1 Million Token Kontextfenster.
  2. Architektur kombiniert KDA (Kimi Delta Attention), MLA (Multi-Head Latent Attention), Attention Residuals (AttnRes) und SiTU-GLU-Aktivierungen.
  3. Benutzerdefinierter Streaming-Konverter umgeht Speicherengpässe des Standard-mlx_lm-Tools, da K3 in bf16 5,6 TB umfasst.
  4. Enthält Implementierungen für REAP-Experten-Pruning sowie Analysen zu sprachspezifischen Experten-Überschneidungen.
  5. Läuft laut Dokumentation auf keinem einzelnen Mac, da selbst die kleinste Variante rund 870 GB Speicher benötigt und das Apple-Silicon-Limit bei 512 GB liegt.

Warum das relevant ist

Kimi-K3 demonstriert die Grenzen lokaler LLM-Inferenz auf Apple Silicon. Das Repository zeigt, wie neue Modellarchitekturen (wie LatentMoE und KDA) für MLX implementiert und Multiterabyte-Gewichte via Streaming verarbeitet werden können, selbst wenn die Ausführung verteilte Cluster oder extremes Pruning voraussetzt.

Einordnung

Das Projekt richtet sich an ML-Entwickler und Forschende, die neuartige MoE- und Aufmerksamkeitsmechanismen unter MLX untersuchen wollen. Es löst das Skalierungsproblem bei der Konvertierung riesiger Modelle durch Streaming direkt von Hugging Face. Der Reifegrad der mathematischen Portierung (etwa die fp32-Berechnung von SiTU-GLU gegen bf16-Rundungsfehler) ist hoch, die praktische Nutzbarkeit im Alltag bleibt jedoch durch die 512-GB-Speicherbegrenzung von Einzel-Macs stark eingeschränkt.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:drumih/turbo-fieldfare

    TurboFieldfare: Gemma 4 26B-A4B mit 2 GB RAM auf Apple Silicon

    TurboFieldfare ist eine spezialisierte Swift- und Metal-Laufzeitumgebung, die das Sprachmodell Gemma 4 26B-A4B auf Apple-Silicon-Macs mit nur etwa 2 GB RAM ausführt. Statt das gesamte 14,3 GB große Modell im Arbeitsspeicher zu halten, verbleiben nur der 1,35 GB große Kern sowie der KV-Cache im RAM, während benötigte Experten-Layer dynamisch per SSD-Streaming nachgeladen werden.

    6609SterneSwift

    KI & AI· Tool

  • Repository:studio-dots-ai/dots3-note-prev

    dots3-note preview: Open-Weight MoE-Modell mit 280B Parametern und 512K Kontext

    Dots Studio hat mit dots3-note preview das erste Open-Weight-Modell der dots3-Reihe veröffentlicht. Die Mixture-of-Experts-Architektur kombiniert 280 Milliarden Gesamtparameter mit 16 Milliarden aktivierten Parametern und unterstützt multimodale Eingaben sowie bis zu 512.000 Kontext-Token.

    123Sterne

    KI & AI· Ankündigung

  • Link:drumih

    TurboFieldfare: Gemma 4 26B mit nur 2 GB RAM auf Apple Silicon betreiben

    TurboFieldfare ist eine in Swift und Metal geschriebene Open-Source-Inference-Engine, die das 4-Bit-quantisierte Modell Gemma 4 26B-A4B-IT auf Apple M-Series Macs mit rund 2 GB Arbeitsspeicher ausführt. Da die Gewichte etwa 14 GB SSD-Speicher belegen, werden nur der gemeinsame Modellkern und der KV-Cache im RAM gehalten, während benötigte Experten pro Token direkt per Streaming von der SSD nachgeladen werden.

    KI & AI· Tool

  • Repository:JustVugg/colibri

    Colibrì: Frontier-MoE-Modelle lokal mit Streaming ausführen

    Colibrì ist eine leichtgewichtige Open-Source-Inferenz-Engine in reinem C ohne externe Abhängigkeiten, die riesige Mixture-of-Experts-Modelle (MoE) von 744 Milliarden bis 2,8 Billionen Parametern auf gewöhnlicher Consumer- und heterogener Hardware ausführt. Durch mehrstufiges Speichermanagement (AI Memory Multitiering) werden Experten dynamisch von der Festplatte gestreamt.

    37.671SterneC

    KI & AI· Tool

  • X-Post:Trevor Wood

    Qwen3.8-27B Abliterated für Apple Silicon via MLX veröffentlicht

    Trevor Wood und das PocketAI Model Lab haben optimierte MLX-Versionen des Modells Qwen3.8-27B für Apple Silicon veröffentlicht. Bei diesen Varianten wurden die antrainierten Verweigerungsmechanismen („Abliteration“) entfernt, und sie stehen in Quantisierungen von 2-Bit bis BF16 zur Verfügung.

    3198Lesezeichen199.030Aufrufe

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.