X-Post:Astraia
Hypothese zum Training von Qwen 3.8 27B: GRPO statt klassischem SFT
Laut einer Analyse des X-Accounts Astraia basiert die Leistungsfähigkeit von Qwen 3.8 27B nicht auf klassischem Supervised Fine-Tuning (SFT). Stattdessen sei Group Relative Policy Optimization (GRPO) mit großzügigeren Reasoning-Kontextlängen und den Ausgaben von Qwen 3.8 Max als Zielvorgabe genutzt worden.
995Lesezeichen121.991Aufrufe