PrismML kündigt Ternary Bonsai 2 27B an: 6 GB großes quantisiertes Modell

X-PostUdi WertheimerMeinung

Udi Wertheimer hebt die Ankündigung von PrismMLs Ternary Bonsai 2 27B hervor. Das Modell basiert auf Qwen3.8 27B, benötigt lediglich 5,9 GB Speicher und soll laut Hersteller 98,2 % der Benchmark-Leistung des Vollpräzisionsmodells erreichen.

Das Wichtigste

  1. PrismML stellt Ternary Bonsai 2 27B unter der Apache 2.0-Lizenz vor.
  2. Das Modell basiert auf Qwen3.8 27B und ist mit 5,9 GB rund neunmal kleiner als die Vollpräzisionsversion.
  3. PrismML gibt an, dass 98,2 % der Benchmark-Performance erhalten bleiben, insbesondere bei Agent-Coding, multimodalem Reasoning und Tool-Nutzung.
  4. Udi Wertheimer vergleicht die Leistung mit Opus 4.5 und merkt an, dass das Modell auf Geräten wie iPads mit mindestens 16 GB RAM lauffähig sein sollte.
  5. In den Diskussionen weisen Tester auf praktische Hürden wie langsamere Inferenzgeschwindigkeiten und Schwächen bei praktischen Programmieraufgaben hin.

Warum das relevant ist

Extreme Quantisierung wie ternäre Modelle reduziert den Speicherbedarf drastisch. Dadurch werden leistungsfähige LLMs potenziell lokal auf Consumer-Hardware und Mobilgeräten betreibbar, ohne teure Cloud-Infrastruktur vorauszusetzen.

Einordnung

Wertheimers Enthusiasmus steht im Kontrast zu den Reaktionen einiger Anwender, die vor überschätzten Benchmarks und unzureichender Praxisleistung warnen. Dennoch demonstriert der Schritt von PrismML, wie schnell Fortschritte in der Gewichtsreduktion und Ternärisierung voranschreiten, um 27B-Modelle auf unter 6 GB zu komprimieren.

Original-Post

Udi Wertheimer

@udiWertheimer · 18. September 2026

this is crazy. 6gb model and it’s almost as powerful as opus 4.5 you should be able to run this on a high-end ipad t.co/dOhiTXSfDz

2550 Likes37 Antworten1468 Lesezeichen260.139 Aufrufe

Auf X ansehen
Weitere Posts im Thread (4)
  1. @TheDesertLynx what's your hardware?
  2. @TheDesertLynx kimi k3 on 128gb??
  3. @KryptoKenCPU if it’s like 16gb or more, yeah…
  4. @bensig i tried the previous version. i don’t remember the numbers but it didn’t feel exceptionally slow
Ausgewählte Antworten (5)
  • @TheDesertLynx @udiWertheimer Get a mini PC before they get too expensive. I've gone fully-local and it's great.
  • @TheDesertLynx @udiWertheimer Yep. Not going to be fast, but there are inference engines that let you do it on as low as 64gb
  • @TheDesertLynx @udiWertheimer Strix Halo 128GB. Running DeepSeek V4 Flash mainly. Giving Kimi K3 another go tonight.
  • @xolandar @udiWertheimer Used the abliterated model and it's awful Just asked for a story of Batman consuming meth it went into an infinite loop Also ggufs only 23tok/s on a M3 Max 36gb so poor performance
  • @dev_in_tech @udiWertheimer Maybe I am missing it, where is the comparison with opus4.5 ?

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Hamid Maei

    Ternary Bonsai 2 27B: Stark komprimiertes Qwen3.8-Modell mit 5,9 GB

    PrismML hat Ternary Bonsai 2 27B vorgestellt, eine stark komprimierte Version von Qwen3.8 27B. Das Modell ist neunmal kleiner als das Original, belegt nur 5,9 GB Speicher und erreicht laut Anbieter 98,2 Prozent der Benchmark-Leistung.

    97Lesezeichen20.996Aufrufe

    KI & AI· Ankündigung

  • X-Post:Trevor Wood

    Qwen3.8-27B Abliterated für Apple Silicon via MLX veröffentlicht

    Trevor Wood und das PocketAI Model Lab haben optimierte MLX-Versionen des Modells Qwen3.8-27B für Apple Silicon veröffentlicht. Bei diesen Varianten wurden die antrainierten Verweigerungsmechanismen („Abliteration“) entfernt, und sie stehen in Quantisierungen von 2-Bit bis BF16 zur Verfügung.

    3198Lesezeichen199.030Aufrufe

    KI & AI· Ankündigung

  • Link:Unsloth AI

    Unsloth veröffentlicht Dynamic-V3.0-GGUF-Quantisierungen für Qwen3.8-27B

    Unsloth AI hat quantisierte GGUF-Versionen des neuen Modells Qwen3.8-27B unter der Apache-2.0-Lizenz bereitgestellt. Die Quantisierungen nutzen das neue Verfahren Dynamic V3.0, das gegenüber anderen Anbietern eine höhere Genauigkeit bei gleicher Dateigröße erzielen soll. Qwen3.8-27B ist ein 27 Milliarden Parameter starkes Vision-Language-Modell mit nativer Bild- und Videoverarbeitung, hybridem DeltaNet- und Attention-Aufbau sowie flexibler Steuerung von Denkprozessen.

    KI & AI· Tool

  • Artikel:trendforce.com

    PrismML komprimiert Qwen 3.6 für das iPhone 17 Pro und weckt Apples Interesse

    Das Caltech-Spinout PrismML hat Alibabas Open-Source-Modell Qwen 3.6 von etwa 54 GB auf unter 4 GB komprimiert, um es direkt auf dem iPhone 17 Pro auszuführen. Laut Medienberichten prüft Apple die Technologie, um mehr On-Device-KI-Funktionen ohne Cloud-Anbindung anzubieten.

    KI & AI· News

  • X-Post:0xSero

    LLM-Benchmark-Ergebnisse bei 3-Bit-Quantisierung

    Ein Beitrag auf X diskutiert unerwartet hohe Leistungswerte eines Sprachmodells bei 3-Bit-Quantisierung (exl-3bits). Bei einem Benchmark-Score von 78,6 % wurden Durchsätze von 100 Token pro Sekunde bei einer Spitzenleistungsaufnahme von 1400 Watt erzielt.

    36Lesezeichen11.045Aufrufe

    KI & AI· Diskussion

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.