Qwen3.8-27B auf einer RTX 3090: Hochleistungs-Serving mit vLLM

Repositorysyv-ai/qwen38-27b-rtx3090Tool

Das Repository bietet eine optimierte Serving-Lösung, um das Modell Qwen3.8-27B auf einer einzigen Consumer-Grafikkarte (RTX 3090 mit 24 GB VRAM) mit vLLM 0.28.0 und bis zu 150k–262k Kontextlänge zu betreiben.

Das Wichtigste

  1. Ermöglicht den Betrieb des 27B-Modells auf einer einzelnen 24-GB-GPU durch gezielte Quantisierung (Int8-GEMMs, kalibrierter Int4-lm_head).
  2. Bietet zwei vorkonfigurierte Modi via Docker Compose: Batch-Modus für API-Backends und Single-User-Modus für interaktive Nutzung.
  3. Erreicht im Batch-Modus bei 64 parallelen Anfragen über 1.000 Tokens/s und im Single-Stream-Betrieb ca. 120 Tokens/s durch spekulatives Decoding (MTP oder DFlash2).
  4. Unterstützt eine OpenAI-kompatible Schnittstelle inklusive Schlüssel-Authentifizierung.

Warum das relevant ist

Große Sprachmodelle mit 27 Milliarden Parametern und langen Kontextfenstern erfordern normalerweise teure Datacenter-GPUs oder Multi-GPU-Setups. Diese Implementierung zeigt, wie aggressive Quantisierung und spekulative Decodierung produktive Durchsätze auf günstiger Consumer-Hardware realisierbar machen.

Einordnung

Das Projekt richtet sich an Entwickler und Teams, die leistungsfähige Modelle lokal oder kostengünstig self-hosted betreiben möchten, ohne auf Cloud-APIs angewiesen zu sein. Durch Automatisierung via Docker, automatisches Re-Quantisieren beim ersten Start und Benchmark-Skripte wirkt das Repository trotz des experimentellen Charakters der individuellen Kernel-Patches bereits durchdacht und praxistauglich.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:MiaAI-Lab/Qwen3.8-27B-16gb-NVIDIA-GPUs-one-click-install

    One-Click-Installer für Qwen3.8-27B auf 16-GB-Nvidia-GPUs

    Ein Serving-Kit für Windows und Linux ermöglicht die lokale Ausführung des Sprachmodells Qwen3.8-27B auf einzelnen Nvidia-Grafikkarten ab 12 bis 16 GB VRAM mittels EXL3-Quantisierungen.

    529SternePython

    KI & AI· Tool

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Repository:eugr/spark-vllm-docker

    spark-vllm-docker: Optimierte vLLM-Docker-Setups für DGX Spark

    spark-vllm-docker ist ein Open-Source-Projekt, das Docker-Konfigurationen und Startskripte bereitstellt, um das LLM-Inferenz-Framework vLLM auf NVIDIA DGX Spark-Systemen auszuführen. Es unterstützt Einzelknoten sowie Multi-Node-Cluster über Ray oder vLLMs nativen PyTorch-Distributed-Modus.

    2222SterneShell

    KI & AI· Tool

  • Link:Unsloth AI

    Unsloth veröffentlicht Dynamic-V3.0-GGUF-Quantisierungen für Qwen3.8-27B

    Unsloth AI hat quantisierte GGUF-Versionen des neuen Modells Qwen3.8-27B unter der Apache-2.0-Lizenz bereitgestellt. Die Quantisierungen nutzen das neue Verfahren Dynamic V3.0, das gegenüber anderen Anbietern eine höhere Genauigkeit bei gleicher Dateigröße erzielen soll. Qwen3.8-27B ist ein 27 Milliarden Parameter starkes Vision-Language-Modell mit nativer Bild- und Videoverarbeitung, hybridem DeltaNet- und Attention-Aufbau sowie flexibler Steuerung von Denkprozessen.

    KI & AI· Tool

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.