Modular MAX: Open-Source-Framework für AI-Serving und Modellierung über heterogene Hardware

LinkModularTool

Modular stellt MAX (Version 26.5) vor, ein Open-Source-Framework für AI-Serving und Modellentwicklung über CPUs, GPUs und ASICs hinweg. Es verzichtet auf CUDA- oder PyTorch-Abhängigkeiten und nutzt die Programmiersprache Mojo für portable GPU-Kernel.

Das Wichtigste

  1. Plattformübergreifende Ausführung auf NVIDIA, AMD und Apple Silicon ohne separate CUDA- oder ROCm-Toolchains.
  2. OpenAI-kompatible Inferenz-Schnittstelle mit nativer Unterstützung für Modelle wie DeepSeek, Gemma und Qwen.
  3. PyTorch-ähnliche Python-API zur Modellerstellung und Modellintegration sowie Kernel-Entwicklung mittels Mojo.
  4. Laut Modular 171 % des Durchsatzes von vLLM (getestet mit Gemma3-27B auf AMD-MI355x: 15,557 QPS gegenüber 9,091 QPS bei vLLM 0.10.1).
  5. Kompaktere Container und beschleunigte Kaltstarts durch Wegfall externer Framework-Laufzeiten; Installation via uv, pixi oder Docker möglich.

Warum das relevant ist

Die Entkopplung von proprietären Stacks wie NVIDIAs CUDA oder AMDs ROCm reduziert Vendor-Lock-in. Entwickler und Unternehmen können dieselben Modelle ohne Neuimplementierung auf alternativen Hardware-Architekturen betreiben.

Einordnung

MAX setzt an der Fragmentierung moderner Beschleuniger-Hardware an. Indem Modular eigene Graph-Compiler und in Mojo geschriebene Kernel nutzt, umgeht das System klassische Toolchain-Konflikte und vereinfacht die Bereitstellung im Datacenter. Der hervorgehobene Benchmark auf AMDs MI355x zeigt den strategischen Fokus, Inferenz jenseits dominanter NVIDIA-Infrastrukturen konkurrenzfähig zu machen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Modular

    Modular: Einheitlicher KI-Inferenz-Stack von GPU-Kernels bis zur Cloud

    Modular stellt seine Inferenzplattform vor, die KI-Workloads herstellerunabhängig über unterschiedliche Architekturen wie NVIDIA, AMD, TPU, Trainium und Apple Silicon ausführt. Der Stack umfasst das Serving-Framework MAX und die Programmiersprache Mojo.

    KI & AI· Tool

  • Link:mojolang.org

    Mojo erreicht Version 1.0.0 und wird vollständig Open Source

    Die Programmiersprache Mojo wurde in Version 1.0.0 veröffentlicht und unter der Apache-2.0-Lizenz als Open Source auf GitHub bereitgestellt. Mojo positioniert sich als Systemsprache für heterogene Hardware im KI-Bereich, die hohe Performance mit Python-Interoperabilität kombiniert.

    KI & AI· Sammlung

  • Link:lmcache.ai

    LMCache: Modularer KV-Cache für skalierbare LLM-Inferenz

    LMCache ist eine modulare Open-Source-Infrastruktur für den Key-Value-Cache (KV-Cache) bei LLM-Inferenzen. Das System speichert, komprimiert, durchsucht und teilt vorberechnete KV-Caches über GPU-, CPU- und externe Speicher hinweg, um redundante Prefill-Berechnungen zu minimieren.

    KI & AI· Tool

  • Repository:LMCache/LMCache

    LMCache: Skalierbare KV-Cache-Verwaltung für LLM-Inferenz

    LMCache ist ein Open-Source-Projekt unter Apache-2.0-Lizenz, das als spezialisierter Management-Layer für den KV-Cache bei LLM-Inferenz dient. Es optimiert Latenz und Kosten beim Serving von Sprachmodellen auf GPUs von Nvidia und AMD.

    11.660SternePython

    KI & AI· Tool

  • Link:Donato Capitella

    Strix Halo AI Toolboxes: Container-Umgebungen und Host-Tuning für AMD Ryzen AI MAX+

    Donato Capitella stellt mit den Strix Halo AI Toolboxes eine Sammlung containerisierter Laufzeitumgebungen und Systemkonfigurationen für AMDs Mobilplattform Ryzen AI MAX+ bereit. Die Plattform erlaubt dank Unified Memory bis zu 128 GB gemeinsamen Arbeitsspeicher für lokale KI-Workloads wie LLM-Inferenz, Bildgenerierung und Fine-Tuning.

    KI & AI· Sammlung

  • Repository:FlashML-org/FreeToken

    FreeToken: Lokales Serving von 290B+ MoE-Modellen auf Consumer-Hardware

    FreeToken ist eine quelloffene Inference-Engine, die große Mixture-of-Experts-Modelle (MoE) auf herkömmlichen Gaming-PCs und Laptops nutzbar macht. Durch kooperative CPU-GPU-Ausführung, semantisches Caching und dynamisches VRAM-Management lassen sich Modelle wie DeepSeek-V4-Flash oder GLM-5.2 ohne Rechenzentrumsinfrastruktur lokal betreiben.

    11.702SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.