pi-bench: Benchmarks lokaler Coding-LLMs auf AMD-Hardware

LinkDonato CapitellaSammlung

Das Projekt pi-bench testet den pi-coding-agent auf lokaler AMD-Hardware wie Strix Halo und Radeon 9700 GPUs. Ziel ist es, die Leistungsfähigkeit aktueller Modelle und Quantisierungen ohne Cloud-Abhängigkeit anhand von SWE-bench-Aufgaben zu ermitteln.

Das Wichtigste

  1. Fokus auf AMD-Hardware: Untersucht werden insbesondere AMD Strix Halo und Radeon 9700 Grafikkarten.
  2. Datensatz SWEBench-verified-mini: Getestet wird mit einer kuratierten Teilmenge von 50 statt 500 Aufgaben, die die Schwierigkeit und Verteilung des Originals abbildet.
  3. Hybrides Testverfahren: Neuere Benchmarks kombinieren automatisierte Testausführungen in SWE-bench-Containern mit Gemini 3.1 Pro als LLM-Judge.
  4. Standard-Setup: Der pi-coding-agent läuft ohne Modifikationen, eigene Prompts oder zusätzliche Wrappers.
  5. Laufzeit: Die Auswertung einzelner Modelle kann pro Durchlauf mehr als 24 Stunden in Anspruch nehmen.

Warum das relevant ist

Für Entwickler, die Coding-Agenten datenschutzkonform und unabhängig von Cloud-Providern betreiben wollen, liefert das Projekt verlässliche Vergleichswerte für AMD-basierte Consumer- und Workstation-Hardware.

Einordnung

Mit der Evaluierung lokaler Quantisierungen auf AMD-Chips schließt das Projekt eine Lücke gegenüber klassischen Nvidia-Benchmarks. Durch die Beschränkung auf den Bare-Default-Agenten bleiben die Ergebnisse reproduzierbar und fokussieren auf die Kernfähigkeiten der Modelle.

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Donato Capitella

    Strix Halo AI Toolboxes: Container-Umgebungen und Host-Tuning für AMD Ryzen AI MAX+

    Donato Capitella stellt mit den Strix Halo AI Toolboxes eine Sammlung containerisierter Laufzeitumgebungen und Systemkonfigurationen für AMDs Mobilplattform Ryzen AI MAX+ bereit. Die Plattform erlaubt dank Unified Memory bis zu 128 GB gemeinsamen Arbeitsspeicher für lokale KI-Workloads wie LLM-Inferenz, Bildgenerierung und Fine-Tuning.

    KI & AI· Sammlung

  • Link:aicodingdaily.com

    AI Coding Daily: Benchmarks, Workflows und Tools für KI-Entwickler

    Die Website AI Coding Daily veröffentlicht laufend Tests, Benchmarks und Video-Tutorials zum praktischen Einsatz von Sprachmodellen in der Softwareentwicklung. Im Fokus stehen Vergleiche von Spitzenmodellen, lokale LLMs und Sicherheitswerkzeuge für Entwickler.

    KI & AI· Sammlung

  • Repository:magnitudedev/magnitude

    Magnitude: Lokaler Open-Source-Inferenzserver für Coding-Agents

    Magnitude ist ein quelloffener, in TypeScript entwickelter Inferenzserver, der lokale Sprachmodelle auf die eigene Hardware abstimmt und mit Coding-Agents wie Claude Code, Cline oder OpenCode verbindet. Das Tool profiliert die vorhandene Hardware, schlägt passende Modelle vor und übernimmt Download, Feineinstellung sowie Ausführung.

    2809SterneTypeScript

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.