Hypothese zum Training von Qwen 3.8 27B: GRPO statt klassischem SFT

X-PostAstraiaMeinung

Laut einer Analyse des X-Accounts Astraia basiert die Leistungsfähigkeit von Qwen 3.8 27B nicht auf klassischem Supervised Fine-Tuning (SFT). Stattdessen sei Group Relative Policy Optimization (GRPO) mit großzügigeren Reasoning-Kontextlängen und den Ausgaben von Qwen 3.8 Max als Zielvorgabe genutzt worden.

Das Wichtigste

  1. Astraia vermutet, dass für Qwen 3.8 27B kaum oder gar kein SFT eingesetzt wurde.
  2. Das Modell nutzte GRPO mit deutlich längeren bzw. permissiveren Reasoning-Kontextlängen während des Trainings.
  3. Die Ausgaben des größeren Modells Qwen 3.8 Max dienten nicht als Trainingsdaten, sondern als Zielvorgabe (RL-Objective) für das Reinforcement Learning.
  4. Astraia stuft die Destillation via GRPO in diesem Nutzungsszenario als deutlich überlegen gegenüber Destillation via KL-Divergenz ein.

Warum das relevant ist

Sollte sich die Hypothese bestätigen, zeigt sie einen effizienten Weg auf, wie kleinere Open-Weights-Modelle die Fähigkeiten von Frontier-Modellen adaptieren können. Indem Ausgaben großer Modelle als RL-Belohnungsziel und nicht als statische Trainingsdaten genutzt werden, erlernen kleinere Modelle eigenständige Problemlösungsschritte statt reiner Musterimitation.

Einordnung

Die Beobachtung stützt sich auf Verhaltensmuster beim Reasoning während praktischer Tests. Die Theorie argumentiert, dass Intelligenz ein Lösungsweg und keine reine Kompression sei: Das kleinere 27B-Modell erhält den Freiraum, so ausführlich nachzudenken wie nötig, um ein Ergebnis zu erreichen, das dem Flaggschiffmodell entspricht. Einige Reaktionen aus der Community weisen darauf hin, dass diese langen Reasoning-Ketten erhebliche Anforderungen an Prefill-Geschwindigkeit und Hardware-Bandbreite im Test-Time-Compute stellen.

Original-Post

Astraia

@AstraiaAI · 15. August 2026

Okay, I am fairly confident in my hypothesis now. The secret sauce behind Qwen 3.8 27B becomes almost immediately evident during testing. It is not the training data. In fact, I doubt any SFT was involved at all. The model was simply allowed GRPO with a more liberal reasoning t.co/mPKeIMLp0q

1503 Likes39 Antworten995 Lesezeichen121.991 Aufrufe

Auf X ansehen
Weitere Posts im Thread (1)
  1. TL;DR, in as simple terms as I can possibly coin up: They used the outputs of Qwen 3.8 Max NOT AS TRAINING DATA, but as a reinforcement learning objective for Qwen 3.8 27B to pursue. The difference with Qwen 3.6 27B is that training this time was much more permissive in
Ausgewählte Antworten (5)
  • @Neuille1 @AstraiaAI This is why i'm happy to have bought a rtx 5090 rather then the spark, long thinking need fast prefill hardware and high bandwith.
  • @JTBeers @AstraiaAI Im an amateur when it comes ro model training but I see where you are going with this. I think you explained it well. How far could this be applied? Can we take a 9B, 27B 1.5bit architecture or MoE and do the same thing?
  • @grassmunkie @AstraiaAI So the similar approach as the improved DS V4 0731? Like Qwen, much longer reasoning, but better quality ouput on the same weights. Some people seem to suggest thinking adds little value, but from what I see, it is much better at internally validating edge cases.
  • @minkrov @AstraiaAI Qwen is a giant game changer for anyone paying for AI. Instead of paying for the absolute frontiers you can set up a personal assistant that runs 24/7 for free!! Who wouldn't want this setup??
  • @doyc_1 @AstraiaAI So scaling test-time-compute was all we need?

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

  • Link:Unsloth AI

    Unsloth veröffentlicht Dynamic-V3.0-GGUF-Quantisierungen für Qwen3.8-27B

    Unsloth AI hat quantisierte GGUF-Versionen des neuen Modells Qwen3.8-27B unter der Apache-2.0-Lizenz bereitgestellt. Die Quantisierungen nutzen das neue Verfahren Dynamic V3.0, das gegenüber anderen Anbietern eine höhere Genauigkeit bei gleicher Dateigröße erzielen soll. Qwen3.8-27B ist ein 27 Milliarden Parameter starkes Vision-Language-Modell mit nativer Bild- und Videoverarbeitung, hybridem DeltaNet- und Attention-Aufbau sowie flexibler Steuerung von Denkprozessen.

    KI & AI· Tool

  • X-Post:Trevor Wood

    Qwen3.8-27B Abliterated für Apple Silicon via MLX veröffentlicht

    Trevor Wood und das PocketAI Model Lab haben optimierte MLX-Versionen des Modells Qwen3.8-27B für Apple Silicon veröffentlicht. Bei diesen Varianten wurden die antrainierten Verweigerungsmechanismen („Abliteration“) entfernt, und sie stehen in Quantisierungen von 2-Bit bis BF16 zur Verfügung.

    3198Lesezeichen199.030Aufrufe

    KI & AI· Ankündigung

  • Link:OrcaRouter

    OrcaRouter veröffentlicht abliterierte FP8-Version von Qwen3.8-27B

    OrcaRouter hat eine modifizierte FP8-Version des multimodalen Modells Qwen3.8-27B auf Hugging Face bereitgestellt. Durch gezielte Abliteration wurde die interne Verweigerungsrichtung entfernt, um das Modell für Red-Teaming und Sicherheitsforschung ohne Schutzfilter nutzbar zu machen.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.