llama.cpp: LLM-Inferenz in C/C++

Repositoryggml-org/llama.cppTool

llama.cpp ist ein quelloffenes C/C++-Projekt der Organisation ggml-org, das auf LLM-Inferenz spezialisiert ist. Mit über 127.000 Sternen auf GitHub bietet es vorkompilierte Binärdateien, Docker-Container, REST-APIs und C-Bibliotheksanbindungen für den Betrieb von Sprachmodellen.

Das Wichtigste

  1. Fokussiert auf LLM-Inferenz, entwickelt in C/C++ auf Basis von GGML.
  2. Bereitstellung über vorkompilierte Binärdateien, Docker, Winget oder via Build aus dem Quellcode.
  3. Umfasst sowohl eine C-Bibliothek (lib llama API) als auch einen Server mit REST-Schnittstelle (llama-server REST API).
  4. Erscheint unter freier MIT-Lizenz und verfügt über mehr als 127.000 GitHub-Sterne und 22.000 Forks.

Warum das relevant ist

Das Projekt bietet Entwicklern und Teams eine schlanke Möglichkeit, LLM-Inferenz nativ in C/C++ ohne Python-Laufzeitumgebungen umzusetzen. Dank REST-Server und Docker-Unterstützung lässt sich die Inferenz direkt in bestehende Infrastrukturen integrieren.

Einordnung

Das Projekt löst das Problem, LLM-Inferenz performant und portabel in C/C++ bereitzustellen. Es basiert technisch auf C++ und dem GGML-Ökosystem und richtet sich an Entwickler sowie Betreiber, die Sprachmodelle lokal oder serverbasiert betreiben wollen. Angesichts von über 127.000 Sternen, mehr als 22.000 Forks, einer aktiven Maintainer-Basis, automatisierten Nightly- und Release-Builds sowie dokumentierten APIs (lib llama, llama-server REST API) weist das Projekt einen sehr hohen Reifegrad auf.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:google-ai-edge/LiteRT-LM

    LiteRT-LM: Googles Open-Source-Inferenz-Framework für On-Device-LLMs

    LiteRT-LM ist ein Open-Source-Framework von Google zur plattformübergreifenden Ausführung großer Sprachmodelle direkt auf Edge-Geräten. Die Software nutzt Hardwarebeschleunigung über GPU und NPU und treibt On-Device-KI-Funktionen in Chrome, Pixel Watch und Chromebook Plus an.

    6375SterneC++

    KI & AI· Tool

  • Repository:ollama/ollama

    Ollama: Lokale Ausführung und Integration offener Sprachmodelle

    Ollama ist ein Open-Source-Framework in Go, mit dem Open-Weight-Modelle lokal ausgeführt, über APIs angesprochen und an Entwicklungswerkzeuge sowie Chat-Assistenten angebunden werden können.

    180.203SterneGo

    KI & AI· Tool

  • Link:Samarveer Singh

    llama.cpp WebUI vs. Ollama: Mehr Geschwindigkeit und Kontrolle statt Klickkomfort

    Samarveer Singh vergleicht die integrierte WebUI von llama.cpp mit Ollama für das lokale Hosting von Sprachmodellen. Während Ollama bei der Modellverwaltung und einfachen Installation überlegen bleibt, bietet llama.cpp spürbar schnellere Inferenz und tiefere Konfigurationsmöglichkeiten.

    KI & AI· Meinung

  • Repository:drumih/turbo-fieldfare

    TurboFieldfare: Gemma 4 26B-A4B mit 2 GB RAM auf Apple Silicon

    TurboFieldfare ist eine spezialisierte Swift- und Metal-Laufzeitumgebung, die das Sprachmodell Gemma 4 26B-A4B auf Apple-Silicon-Macs mit nur etwa 2 GB RAM ausführt. Statt das gesamte 14,3 GB große Modell im Arbeitsspeicher zu halten, verbleiben nur der 1,35 GB große Kern sowie der KV-Cache im RAM, während benötigte Experten-Layer dynamisch per SSD-Streaming nachgeladen werden.

    6609SterneSwift

    KI & AI· Tool

  • Repository:eugr/spark-vllm-docker

    spark-vllm-docker: Optimierte vLLM-Docker-Setups für DGX Spark

    spark-vllm-docker ist ein Open-Source-Projekt, das Docker-Konfigurationen und Startskripte bereitstellt, um das LLM-Inferenz-Framework vLLM auf NVIDIA DGX Spark-Systemen auszuführen. Es unterstützt Einzelknoten sowie Multi-Node-Cluster über Ray oder vLLMs nativen PyTorch-Distributed-Modus.

    2222SterneShell

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.