Repository:LMCache/LMCache
LMCache: Skalierbare KV-Cache-Verwaltung für LLM-Inferenz
LMCache ist ein Open-Source-Projekt unter Apache-2.0-Lizenz, das als spezialisierter Management-Layer für den KV-Cache bei LLM-Inferenz dient. Es optimiert Latenz und Kosten beim Serving von Sprachmodellen auf GPUs von Nvidia und AMD.
11.660SternePython
Aus Video: Weekly AI Updates: Local Models, GPT-6 Astra, and Agent Architectures