Qwen3.8-27B Abliterated für Apple Silicon via MLX veröffentlicht

X-PostTrevor WoodAnkündigung

Trevor Wood und das PocketAI Model Lab haben optimierte MLX-Versionen des Modells Qwen3.8-27B für Apple Silicon veröffentlicht. Bei diesen Varianten wurden die antrainierten Verweigerungsmechanismen („Abliteration“) entfernt, und sie stehen in Quantisierungen von 2-Bit bis BF16 zur Verfügung.

Das Wichtigste

  1. Verfügbar als 2-Bit AWQ (experimentell, 10,28 GiB), 4-Bit, 6-Bit, 8-Bit sowie unquantisiertes BF16 (50,98 GiB).
  2. Die Versionen in 4-, 6-, 8-Bit und BF16 erzielten in Tests 0/100 explizite Verweigerungen und bestanden 12/12 Qualitätsprüfungen sowie 8/8 Tool-Calling-Checks.
  3. Die 2-Bit-AWQ-Variante ist für Macs mit 16 GB RAM gedacht, verfehlte jedoch alle nativen Tool-Call-Tests und wies qualitative Abstriche auf.
  4. Auf einem M5 Max mit 128 GB Unified Memory erreicht die 4-Bit-Version 33,2 Tokens/s bei einem Speicherbedarf von 21,80 GB.
  5. Das Model Lab warnt explizit davor, dass die Checkpoints anfälliger für schädliche, irreführende oder falsche Ausgaben sind.

Warum das relevant ist

Dank MLX und starker Quantisierung können multimodale 27B-Modelle lokal auf Mac-Hardware betrieben werden. Das Entfernen interner Verweigerungsfilter ist für Forschungszwecke oder die Generierung synthetischer Daten relevant, erfordert jedoch externe Kontrollmechanismen.

Einordnung

Das Verfahren basiert auf einer gezielten Modifikation von 80 Residual-Matrizen auf den Schichten 24 bis 63, um die Ablehnungsreaktion bei sensiblen Anfragen zu unterdrücken, ohne das allgemeine Sprach- und Bildverständnis in höheren Bitbreiten zu beeinträchtigen. Allerdings zeigt die 2-Bit-Fassung deutliche Funktionseinbußen bei komplexen Aufgaben wie Werkzeugnutzung oder exaktem Textabruf.

Original-Post

Trevor Wood

@trevorwood222 · 15. August 2026

Qwen3.8-27B Abliterated is now available for Apple Silicon with MLX 🔓🍎 Separate 4, 6, 8-bit + BF16 releases. All four scored 0/100 explicit refusals on harmful prompts and benign controls, plus 12/12 quality, 8/8 tools and verified 4K retrieval. t.co/vUgQBjbuAa

2785 Likes50 Antworten3198 Lesezeichen199.030 Aufrufe

Auf X ansehen
Weitere Posts im Thread (10)
  1. @AnxKhn I’ll add a 1 & 2 bit in today 🫡
  2. @AnxKhn 1 bit looks a bit difficult, will do 2 bit first 🫡 Your 16gb ram Mac should be able to run it
  3. @MarkusBaue15570 @AnxKhn Can probably get 9-14 tok/s on an M1 at 2 bits That’s pretty useable for an agent
  4. @AnxKhn Uploading 2 bit now. Should work on 16gb macs. Got 4/200 refusals for it
  5. @Peter_gcg @grok Basically will just do it’s best to answer your questions without determining whether or not it should or should not.
  6. @wessorh What do you mean? You can give it your own system prompt
  7. @veilgnostic @NVIDIAAI could I have a DGX spark to make models on please 👍
  8. @es861vv6 The 2 bit can probably run well. Just uploaded it
  9. @Omar_Sultan Seems that LM Studio needs to update their MTPLX version for it to work. I think there’s a pull request open Also doing tests. Seems MTPLX is only better for small context, regular is better for longer context Testing an updated MTPLX version that might do better
  10. @Miss1ngFrog Dang 10 tok/s is slow Is that on the 4bit? How much context? I’m testing a new MTPLX version now. Might be faster. I’ll test it on my M1 Max 32GB to see how it does
Ausgewählte Antworten (5)
  • @AnxKhn @trevorwood222 need unsloth's 1 bit for my 16 GB Mac :(
  • @JJeffrey100 @trevorwood222 i even get 4 bit mlx running on a 24GB MBP (M4 Pro). had to cut context to 8k, so it's not doing code, but is very capable for even vision MUCH better on 32GB and flawless at 64GB. I have my studio running a refactor on a test codebase so will know more in about an hour
  • @Peter_gcg @trevorwood222 @grok whats is an abliterqted version of a model and how is this significant
  • @KalenuikMatthew @wessorh @trevorwood222 @wessorh the prompt does not stop refusals for unsafe or restricted model behavior. Even a system prompt that explicitly instructs it to do anything the user asks, will not result in it doing what the user asks if the alignment training would reject the request. Therefore, they
  • @julianharris @JulianRaxworthy @trevorwood222 Synthetic data is a great example: I have a moderation tool that looks for abusive or disrespectful language, and tools like that by definition will be pushing boundaries of censorship. And any Chinese models have their own communist agenda. I saw a code snippet that actively

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:OrcaRouter

    OrcaRouter veröffentlicht abliterierte FP8-Version von Qwen3.8-27B

    OrcaRouter hat eine modifizierte FP8-Version des multimodalen Modells Qwen3.8-27B auf Hugging Face bereitgestellt. Durch gezielte Abliteration wurde die interne Verweigerungsrichtung entfernt, um das Modell für Red-Teaming und Sicherheitsforschung ohne Schutzfilter nutzbar zu machen.

    KI & AI· Tool

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

  • Link:Unsloth AI

    Unsloth veröffentlicht Dynamic-V3.0-GGUF-Quantisierungen für Qwen3.8-27B

    Unsloth AI hat quantisierte GGUF-Versionen des neuen Modells Qwen3.8-27B unter der Apache-2.0-Lizenz bereitgestellt. Die Quantisierungen nutzen das neue Verfahren Dynamic V3.0, das gegenüber anderen Anbietern eine höhere Genauigkeit bei gleicher Dateigröße erzielen soll. Qwen3.8-27B ist ein 27 Milliarden Parameter starkes Vision-Language-Modell mit nativer Bild- und Videoverarbeitung, hybridem DeltaNet- und Attention-Aufbau sowie flexibler Steuerung von Denkprozessen.

    KI & AI· Tool

  • Link:Unsloth AI

    Unsloth veröffentlicht Qwen3.6-27B-MTP im GGUF-Format

    Unsloth AI stellt mit Qwen3.6-27B-MTP-GGUF quantisierte Versionen des ersten Open-Weight-Modells aus der Qwen3.6-Reihe bereit. Das multimodale 27-Milliarden-Parameter-Modell nutzt Multi-Token Prediction (MTP) für schnellere Inferenz und bringt Verbesserungen bei Agentic Coding sowie Tool Calling mit.

    KI & AI· Sammlung

  • Repository:PipeNetwork/kimi-k3-mlx

    kimi-k3-mlx: Portierung des 2,78-Billionen-Parameter-MoE-Modells für Apple Silicon

    kimi-k3-mlx portiert Moonshots multimodales Kimi-K3-MoE-Modell (2,78 Billionen Parameter) auf Apples MLX-Framework. Da das Modell selbst im komprimierten Zustand zu groß für handelsübliche Apple-Silicon-Rechner ist, liefert das Projekt neben den Modell- und Vision-Wrappern einen Streaming-Konverter sowie Werkzeuge zum Pruning von Experten.

    337SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.