Open WebUI mit lokalem Llama.cpp-Server verbinden

ArtikelAnleitung

Eine Anleitung von Open WebUI beschreibt die lokale Bereitstellung von quantisierten Sprachmodellen im GGUF-Format über den llama-server und deren Einbindung in die Web-Oberfläche.

Das Wichtigste

  1. Llama.cpp kann über vorkompilierte Binärdateien bezogen oder aus dem Quellcode gebaut werden.
  2. Als Beispiel für ein GGUF-Modell wird die auf 1,58 Bit quantisierte Variante von DeepSeek-R1 (ca. 131 GB) via Hugging Face angeführt.
  3. Der Befehl llama-server startet eine OpenAI-kompatible Schnittstelle mit anpassbaren Parametern wie Kontextlänge und GPU-Offloading.
  4. In Open WebUI wird die Verbindung unter Admin-Einstellungen über den Connection-Typ OpenAI mit der Server-URL konfiguriert.
  5. Wird der Provider explizit auf llama.cpp gesetzt, schaltet Open WebUI Zusatzfunktionen frei, darunter eine Statusanzeige für geladene Modelle und einen Eject-Button zum Entladen aus dem Speicher.

Warum das relevant ist

Die Kombination aus Llama.cpp und Open WebUI erlaubt den vollständig lokalen Betrieb großer quantisierter Sprachmodelle ohne Cloud-Abhängigkeiten oder API-Kosten bei gleichzeitiger Nutzung einer komfortablen Benutzeroberfläche.

Einordnung

Open WebUI nutzt die OpenAI-kompatible Schnittstelle von llama-server, erweitert diese aber durch native llama.cpp-Provider-Optionen. Dadurch lassen sich Modelle direkt über die Web-Oberfläche ohne Neustart des Daemons entladen oder verwalten. Voraussetzung dafür ist die korrekte Provider-Auswahl in den erweiterten Verbindungseinstellungen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Samarveer Singh

    llama.cpp WebUI vs. Ollama: Mehr Geschwindigkeit und Kontrolle statt Klickkomfort

    Samarveer Singh vergleicht die integrierte WebUI von llama.cpp mit Ollama für das lokale Hosting von Sprachmodellen. Während Ollama bei der Modellverwaltung und einfachen Installation überlegen bleibt, bietet llama.cpp spürbar schnellere Inferenz und tiefere Konfigurationsmöglichkeiten.

    KI & AI· Meinung

  • Repository:ggml-org/llama.cpp

    llama.cpp: LLM-Inferenz in C/C++

    llama.cpp ist ein quelloffenes C/C++-Projekt der Organisation ggml-org, das auf LLM-Inferenz spezialisiert ist. Mit über 127.000 Sternen auf GitHub bietet es vorkompilierte Binärdateien, Docker-Container, REST-APIs und C-Bibliotheksanbindungen für den Betrieb von Sprachmodellen.

    127.115SterneC++

    KI & AI· Tool

  • Repository:ollama/ollama

    Ollama: Lokale Ausführung und Integration offener Sprachmodelle

    Ollama ist ein Open-Source-Framework in Go, mit dem Open-Weight-Modelle lokal ausgeführt, über APIs angesprochen und an Entwicklungswerkzeuge sowie Chat-Assistenten angebunden werden können.

    180.203SterneGo

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.