One-Click-Installer bringt Qwen3.8-27B auf Nvidia-GPUs ab 16 GB VRAM

X-PostMiaTool

Mia (@MiaAI_lab) hat einen experimentellen One-Click-Installer für Windows und Linux veröffentlicht, mit dem das Sprachmodell Qwen3.8-27B auf Nvidia-Grafikkarten ab 16 GB VRAM betrieben werden kann. Das Setup unterstützt Kontexte bis zu 253k Tokens und enthält ein vorkonfiguriertes Harness.

Das Wichtigste

  1. Unterstützt Windows und Linux mit Nvidia-Grafikkarten zwischen 16 GB und 32 GB VRAM.
  2. Ermöglicht laut Entwicklerin Kontextlängen von bis zu 253k Tokens auf lokaler Hardware.
  3. Enthält ein vorinstalliertes und vorkonfiguriertes DeepSeek-Harness.
  4. Automatische Auswahl der passenden Qualitätsstufe je nach verfügbarem Videospeicher.
  5. Das Projekt befindet sich im experimentellen Status mit eingeschränkter Hardware-Testabdeckung.

Warum das relevant ist

Der Betrieb von 27B-Parametermodellen mit extrem langen Kontexten war bisher meist teurer Server-Hardware oder Multi-GPU-Systemen vorbehalten. Vorkonfigurierte Ein-Klick-Lösungen senken die Hürde für Entwickler und Power-User deutlich, rechenintensive Modelle lokal auf Consumer-Grafikkarten mit 16 GB VRAM auszuführen.

Einordnung

Das Tool zielt darauf ab, den Speicherbedarf von Qwen3.8-27B so zu optimieren, dass neben den Gewichten auch der bei 253k Tokens massive KV-Cache auf 16 GB VRAM Platz findet. Durch die automatische Konfiguration und das integrierte DeepSeek-Harness erspart das Paket das manuelle Abstimmen von Quantisierungsstufen und Runtime-Flags.

Original-Post

Mia

@MiaAI_lab · 10. September 2026

Rejoice Nvidia 16 GB VRAM GPU owners 💫 I've built a custom installer for Windows and Linux to make the best of your GPU and run Qwen3.8-27B with great quality AND long context with ease! - Up to 253k context - Easy one-click installer - Built-in preconfigured Harness - t.co/zr649OzH4z

1432 Likes134 Antworten1551 Lesezeichen95.301 Aufrufe

Auf X ansehen
Weitere Posts im Thread (7)
  1. @SGallius For now yes
  2. @FDreams69 Working on it
  3. @Ready2ESC Yes it works 16-32 GB of VRAM, picks the best quality automatically.
  4. @seker11235 Comes pre-installed and pre-configured with DeepSeek Harness
  5. @P6UFWsl981BbKpY Glad to hear!
  6. @AnnimoBrasilei3 Yes
  7. @panaiq_ai @jauneclaude @Italianclownz @ghazni1010 is there?
Ausgewählte Antworten (5)
  • @jauneclaude @MiaAI_lab @panaiq_ai @Italianclownz @ghazni1010 Any llama + GGUF that will run on a 32 GB Nvidia card will run on a 9700. The most obvious choice is llama.cpp + Unsloth's Q6 K_M Right now I'm working on a tool that will choose exactly the right model and llama fork for the user t.co/nSVNL69yOr
  • @Draly24 @DurnovSergey @MiaAI_lab @NullContex1s I'm kinda beginner regarding llm but it seems we have similar setup as I run llama-swap on my main computer (with the rtx 5060) and it points to ik_llama.ccp with custom configs, and all is accessible from a homelab with docker, may I ask how to compare efficiently models ?
  • @fatsjwshitlib @KSlgm0nx @MiaAI_lab 37 tok/s on my 4070 ti super
  • @jauneclaude @panaiq_ai @MiaAI_lab @Italianclownz @ghazni1010 Are you using MTP? what command and flags are you using to run llama?
  • @panaiq_ai @jauneclaude @MiaAI_lab @Italianclownz @ghazni1010 here it is t.co/W1FCARKH6y

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:MiaAI-Lab/Qwen3.8-27B-16gb-NVIDIA-GPUs-one-click-install

    One-Click-Installer für Qwen3.8-27B auf 16-GB-Nvidia-GPUs

    Ein Serving-Kit für Windows und Linux ermöglicht die lokale Ausführung des Sprachmodells Qwen3.8-27B auf einzelnen Nvidia-Grafikkarten ab 12 bis 16 GB VRAM mittels EXL3-Quantisierungen.

    529SternePython

    KI & AI· Tool

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

  • Link:Unsloth AI

    Unsloth veröffentlicht Dynamic-V3.0-GGUF-Quantisierungen für Qwen3.8-27B

    Unsloth AI hat quantisierte GGUF-Versionen des neuen Modells Qwen3.8-27B unter der Apache-2.0-Lizenz bereitgestellt. Die Quantisierungen nutzen das neue Verfahren Dynamic V3.0, das gegenüber anderen Anbietern eine höhere Genauigkeit bei gleicher Dateigröße erzielen soll. Qwen3.8-27B ist ein 27 Milliarden Parameter starkes Vision-Language-Modell mit nativer Bild- und Videoverarbeitung, hybridem DeltaNet- und Attention-Aufbau sowie flexibler Steuerung von Denkprozessen.

    KI & AI· Tool

  • Link:Unsloth AI

    Unsloth veröffentlicht Qwen3.6-27B-MTP im GGUF-Format

    Unsloth AI stellt mit Qwen3.6-27B-MTP-GGUF quantisierte Versionen des ersten Open-Weight-Modells aus der Qwen3.6-Reihe bereit. Das multimodale 27-Milliarden-Parameter-Modell nutzt Multi-Token Prediction (MTP) für schnellere Inferenz und bringt Verbesserungen bei Agentic Coding sowie Tool Calling mit.

    KI & AI· Sammlung

  • Repository:MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

    DeepSeek-v4-Flash auf einer einzelnen DGX Spark betreiben

    Ein Open-Source-Launcher und Docker-Setup, mit dem DeepSeek V4 Flash 0731 (EXL3) auf einer einzelnen NVIDIA DGX Spark mit 128 GiB Unified Memory ausgeführt werden kann.

    328SternePython

    KI & AI· Tool

  • Artikel:Nemo, DGX Spark & Local Inference Engineer

    Qwen3.8-Flash-Next erreicht 87,3 % auf einer einzelnen DGX Spark

    Ein lokaler Test von Qwen3.8-Flash-Next NVFP4 auf einem einzelnen NVIDIA DGX Spark (GB10) erzielt im smf-bench Official A 87,3 % und übertrifft damit frühere Ergebnisse eines Dual-Spark-Setups mit DeepSeek V4.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.