Modular: Einheitlicher KI-Inferenz-Stack von GPU-Kernels bis zur Cloud

LinkModularTool

Modular stellt seine Inferenzplattform vor, die KI-Workloads herstellerunabhängig über unterschiedliche Architekturen wie NVIDIA, AMD, TPU, Trainium und Apple Silicon ausführt. Der Stack umfasst das Serving-Framework MAX und die Programmiersprache Mojo.

Das Wichtigste

  1. Hardware-Portabilität: Gleicher Code läuft auf GPUs, CPUs und ASICs von NVIDIA, AMD, Google TPU, AWS Trainium, Qualcomm, Intel, ARM und Apple Silicon.
  2. MAX Serving: Hardware-agnostisches Framework mit OpenAI-kompatibler API, das laut Anbieter eine doppelte Performance im Vergleich zu vLLM erzielt.
  3. Mojo: Eigene Systemprogrammiersprache zur Entwicklung und Anpassung von GPU-Kernels ohne typische C- oder CUDA-Komplexität.
  4. Flexible Bereitstellung: Verfügbar als gemanagte Modular-Cloud (Shared oder Dedicated Endpoints), im eigenen VPC oder als selbst gehosteter Container.
  5. Modellunterstützung: Vorkonfigurierte Unterstützung für über 1000 Modelle, darunter DeepSeek R1/V3, MiniMax M3 und Kimi K2.7, sowie eigene Modelle.

Warum das relevant ist

Die Abhängigkeit von NVIDIA-Hardware und fragmentierte Software-Stacks verteuern und verkomplizieren den Betrieb großer Sprachmodelle. Ein einheitlicher Compiler- und Serving-Ansatz vereinfacht den Hardwarewechsel und senkt Inferenzkosten.

Einordnung

Modular adressiert zwei zentrale Engpässe moderner KI-Infrastruktur: das Fehlen einer einheitlichen Toolchain zwischen Low-Level-Kerneln und Cloud-APIs sowie das Vendor-Lock-in im GPU-Markt. Durch die Kombination aus Mojo und der MAX-Engine sollen Entwickler Performance-Optimierungen hardwareübergreifend nutzen können, ohne Code für spezifische Beschleuniger umschreiben zu müssen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:mojolang.org

    Mojo erreicht Version 1.0.0 und wird vollständig Open Source

    Die Programmiersprache Mojo wurde in Version 1.0.0 veröffentlicht und unter der Apache-2.0-Lizenz als Open Source auf GitHub bereitgestellt. Mojo positioniert sich als Systemsprache für heterogene Hardware im KI-Bereich, die hohe Performance mit Python-Interoperabilität kombiniert.

    KI & AI· Sammlung

  • Link:lmcache.ai

    LMCache: Modularer KV-Cache für skalierbare LLM-Inferenz

    LMCache ist eine modulare Open-Source-Infrastruktur für den Key-Value-Cache (KV-Cache) bei LLM-Inferenzen. Das System speichert, komprimiert, durchsucht und teilt vorberechnete KV-Caches über GPU-, CPU- und externe Speicher hinweg, um redundante Prefill-Berechnungen zu minimieren.

    KI & AI· Tool

  • Link:baseten.co

    Baseten: Plattform für KI-Inferenz und Modellbereitstellung

    Baseten stellt eine spezialisierte Infrastruktur bereit, um Open-Source-, angepasste und feinabgestimmte KI-Modelle in Produktivumgebungen auszuführen. Die Plattform bietet verwaltete Cloud-Lösungen sowie selbst gehostete Bereitstellungen in eigenen VPCs.

    KI & AI· Tool

  • Repository:LMCache/LMCache

    LMCache: Skalierbare KV-Cache-Verwaltung für LLM-Inferenz

    LMCache ist ein Open-Source-Projekt unter Apache-2.0-Lizenz, das als spezialisierter Management-Layer für den KV-Cache bei LLM-Inferenz dient. Es optimiert Latenz und Kosten beim Serving von Sprachmodellen auf GPUs von Nvidia und AMD.

    11.660SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.