LMCache: Modularer KV-Cache für skalierbare LLM-Inferenz

LinkTool

LMCache ist eine modulare Open-Source-Infrastruktur für den Key-Value-Cache (KV-Cache) bei LLM-Inferenzen. Das System speichert, komprimiert, durchsucht und teilt vorberechnete KV-Caches über GPU-, CPU- und externe Speicher hinweg, um redundante Prefill-Berechnungen zu minimieren.

Das Wichtigste

  1. Persistiert KV-Caches über den GPU-Speicher hinaus im CPU-Arbeitsspeicher, auf lokalen Datenträgern oder in externen Speicher-Backends.
  2. Reduziert doppelte Prefill-Berechnungen durch das Wiederverwenden von KV-Caches über Anfragen hinweg.
  3. Ermöglicht mit CacheBlend das Wiederfinden und Zusammenführen relevanter Cache-Segmente jenseits exakter Prefix-Übereinstimmungen.
  4. Bietet zwei Betriebsmodi: In-Process innerhalb der Serving-Engine sowie Multiprocess als isolierter Standalone-Server.
  5. Unterstützt Integrationen mit vLLM, AMD Instinct MI300X, Google Cloud, CoreWeave, Redis und Nvidia Dynamo.

Warum das relevant ist

Bei langen System-Prompts, RAG-Pipelines und fortlaufenden Dialogen bindet die Prefill-Phase viele Rechenressourcen und belegt wertvollen GPU-VRAM. Eine clusterweite KV-Cache-Infrastruktur verringert Rechenzeiten und senkt Hardwarekosten im Produktivbetrieb.

Einordnung

Das Projekt entstammt der Systemforschung an der University of Chicago (unter anderem Publikationen zu CacheGen und CacheBlend). LMCache entkoppelt den KV-Cache von der reinen Modellausführung. Besonders der empfohlene Multiprocess-Modus erhöht die Robustheit, da der Cache auch bei Worker-Restarts erhalten bleibt. Nachgewiesene Durchsatzgewinne (etwa 3- bis 10-fache Steigerungen auf AMD Instinct MI300X) und Partnerschaften mit Anbietern wie Redis oder CoreWeave zeigen den klaren Fokus auf verteilte Rechenzentren und Enterprise-Skalierung.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:LMCache/LMCache

    LMCache: Skalierbare KV-Cache-Verwaltung für LLM-Inferenz

    LMCache ist ein Open-Source-Projekt unter Apache-2.0-Lizenz, das als spezialisierter Management-Layer für den KV-Cache bei LLM-Inferenz dient. Es optimiert Latenz und Kosten beim Serving von Sprachmodellen auf GPUs von Nvidia und AMD.

    11.660SternePython

    KI & AI· Tool

  • X-Post:0xSero

    Funktionsweise und Trade-offs von KV-Caching bei LLM-Inferenz

    Ein technischer Leitfaden von Avi Chawla, geteilt von 0xSero, erklärt die Mechanismen des Key-Value-Cachings (KV-Caching) in Transformern. Das Verfahren verhindert redundante Berechnungen bei der autoregressiven Generierung von Tokens und beschleunigt die Inferenz in der Praxis um etwa das Fünffache, verlagert den Engpass jedoch auf den GPU-Speicher.

    343Lesezeichen36.448Aufrufe

    KI & AI· Anleitung

  • Repository:hhhuang/CAG

    Cache-Augmented Generation (CAG): Alternative zu RAG über KV-Caching

    Das Open-Source-Repository CAG stellt Cache-Augmented Generation als schlanke Alternative zu Retrieval-Augmented Generation (RAG) vor. Statt Dokumente zur Laufzeit über Vektordatenbanken abzurufen, wird der gesamte Wissensbestand vorab in das Kontextfenster geladen und als KV-Cache vorgehalten.

    1540SternePython

    KI & AI· Sammlung

  • Link:Modular

    Modular: Einheitlicher KI-Inferenz-Stack von GPU-Kernels bis zur Cloud

    Modular stellt seine Inferenzplattform vor, die KI-Workloads herstellerunabhängig über unterschiedliche Architekturen wie NVIDIA, AMD, TPU, Trainium und Apple Silicon ausführt. Der Stack umfasst das Serving-Framework MAX und die Programmiersprache Mojo.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.