DeepsecBench: GPT-6 Astra führt Vercels IT-Sicherheits-Benchmark an

X-PostGuillermo RauchNews

Laut Vercel-CEO Guillermo Rauch belegt OpenAI GPT-6 Astra den ersten Platz auf dem DeepsecBench für IT-Sicherheit. Das Modell löst Testaufgaben in knapp 50 Minuten, wofür der Vorgänger fast vier Stunden benötigte.

Das Wichtigste

  1. Vercels DeepsecBench bewertet die Erkennung von Sicherheitslücken in Applikationscode anhand von Recall und Precision unter Nutzung des Deepsec Cyber Harness.
  2. GPT-6 Astra xhigh erzielt mit einem Score von 37,79 (32,8 % Recall, 97,9 % Precision) den Spitzenplatz vor GPT-5.6 Sol xhigh (Score 35,44) und Claude Opus 5 max (Score 32,44).
  3. Mit einer Laufzeit von 49 Minuten und 47 Sekunden ist GPT-6 Astra xhigh deutlich schneller als GPT-5.6 Sol (rund 3 Stunden 39 Minuten) und kostet mit 63,70 US-Dollar etwa halb so viel wie Claude Opus 5 max (127,93 US-Dollar).
  4. Auf die Frage nach Tests mit dem Modell Fable gab Rauch an, dass dieses bereits getestet wurde, die Ausführung der Aufgaben jedoch verweigert.

Warum das relevant ist

Die Verringerung der Laufzeit von mehreren Stunden auf unter 50 Minuten bei hoher Treffergenauigkeit und niedrigen Kosten verändert die Effizienz automatisierter Schwachstellenanalysen im Code erheblich.

Einordnung

Der DeepsecBench verdeutlicht die Dynamik bei codebasierten Sicherheitsprüfungen. GPT-6 Astra zeigt vor allem bei der Ausführungszeit einen markanten Sprung gegenüber Modellen wie GPT-5.6 Sol oder Claude Opus 5. Gleichzeitig veranschaulicht Rauchs Hinweis auf Fable, dass strenge Modell-Guardrails die praktische Eignung von KI-Systemen bei Sicherheitsüberprüfungen einschränken können.

Original-Post

Guillermo Rauch

@rauchg · 5. September 2026

Astra is now the best cybersecurity model in the world on @vercel DeepsecBench. It pulls off in 49 minutes what took Sol ~4 hours, with a better score, at nearly the same cost. It's more effective and 50% cheaper than Claude Opus 5 max. t.co/14WK4F7Qhs t.co/zRyGqlZYFo

1050 Likes70 Antworten180 Lesezeichen81.077 Aufrufe

Auf X ansehen
Weitere Posts im Thread (1)
  1. @vidigoat2011 @vercel We have. Fable refuses
Ausgewählte Antworten (5)
  • @SlimAssiliX @rauchg @vercel best cybersecurity model at 49 minutes per task, running unsupervised. the timer matters more than the score here
  • @cramforce @oxfrancesco_ @rauchg @vercel Yes
  • @das_sma @rauchg @vercel Goodbye Fable
  • @vidigoat2011 @rauchg @vercel why havent u tested fable
  • @oxfrancesco_ @rauchg @vercel Can I use this with my codex sub by any chance?

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:OpenAI

    OpenAI veröffentlicht System Card für GPT-6 Astra

    OpenAI hat die System Card für GPT-6 Astra vorgestellt. Das Modell erreicht als erstes System des Herstellers die Einstufung „Critical“ im Bereich Cybersicherheit, zeigt Fortschritte bei Robustheit und Alignment gegenüber GPT-5.6 Sol, weist jedoch eine verringerte Überwachbarkeit seiner Chain of Thought auf.

    KI & AI· Sammlung

  • Link:Anthropic

    Anthropic stellt Claude Fable 5.1 und Claude Mythos 5.1 vor

    Anthropic kündigt die Frontier-Modelle Claude Fable 5.1 und Claude Mythos 5.1 an. Beide basieren auf demselben Modell, unterscheiden sich jedoch bei Sicherheitsbarrieren. Fable 5.1 bietet höhere Leistung beim Coding, wissenschaftlicher Forschung und Knowledge Work bei gleichzeitig reduzierten Kosten.

    KI & AI· Ankündigung

  • Link:StackAI

    StackAI LLM Leaderboard: Vergleich von Modellen nach Benchmarks und Kosten

    StackAI bietet ein interaktives Dashboard, das Sprachmodelle anhand von Benchmarks, Durchsatz, Kontextfenstern und Kosten vergleicht. Das Tool fasst Leistungskennzahlen wie MMLU, HumanEval+, GPQA, SWE-Bench und GSM8K zusammen und ermöglicht den direkten Modellvergleich.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.