DeepsecBench: Vercel veröffentlicht AI-Leaderboard zur Erkennung von Sicherheitslücken

LinkVercelSammlung

Auf dem Vercel AI Gateway vergleicht das Leaderboard DeepsecBench verschiedene KI-Modelle hinsichtlich ihrer Fähigkeit, Sicherheitslücken in Anwendungscode aufzuspüren. Die Auswertung basiert auf dem Deepsec-Cyber-Harness und kombiniert Recall sowie Precision zu einem Gesamtwert.

Das Wichtigste

  1. DeepsecBench bewertet KI-Modelle beim Auffinden von Sicherheitslücken im Code anhand von Score, Recall, Precision, False Positives, Kosten, Laufzeit und Tokenverbrauch.
  2. GPT-6 Astra xhigh führt das Ranking mit einem Score von 37,79, 32,8 % Recall, 97,9 % Precision und 2 False Positives an (Codex-Harness, 63,70 USD).
  3. Auf Platz zwei folgt GPT-5.6 Sol xhigh (Score 35,44, Precision 96,3 %), gefolgt von Claude Opus 5 max auf Platz drei (Score 32,44, Precision 88,0 %, Kosten 127,93 USD mit Claude Code).
  4. Grok 4.6 xhigh erzielt als einziges gelistetes Modell eine Precision von 100,0 % ohne False Positives, erreicht aber wegen eines Recalls von 13,4 % nur Score 16,16.
  5. Modelle wie Deepseek V4 Flash xhigh oder Qwen3.8 Max xhigh erreichen Scores um 16,47 bei deutlich geringeren Kosten unter 7 USD.

Warum das relevant ist

Für Entwicklerteams und Sicherheitsverantwortliche liefert der Benchmark konkrete Leistungsdaten dazu, welche Modelle verlässlich Code-Schwachstellen erkennen, wie hoch die Fehlalarm-Quote ist und welche Rechenkosten pro Prüflauf anfallen.

Einordnung

Die Daten zeigen erhebliche Unterschiede zwischen Trefferquote (Recall) und Genauigkeit (Precision). Selbst das führende Modell GPT-6 Astra xhigh deckt nur 32,8 % der Schwachstellen ab, glänzt aber mit sehr geringen Fehlalarmen (97,9 % Precision). Spitzenmodelle wie Claude Opus 5 verursachen im Claude-Code-Harness mit über 127 USD signifikante Kosten, während Modelle wie Deepseek V4 Flash für rund 6 USD vergleichbare Scores zu Mittelklasse-Setups erreichen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Guillermo Rauch

    DeepsecBench: GPT-6 Astra führt Vercels IT-Sicherheits-Benchmark an

    Laut Vercel-CEO Guillermo Rauch belegt OpenAI GPT-6 Astra den ersten Platz auf dem DeepsecBench für IT-Sicherheit. Das Modell löst Testaufgaben in knapp 50 Minuten, wofür der Vorgänger fast vier Stunden benötigte.

    180Lesezeichen81.077Aufrufe

    KI & AI· News

  • Link:StackAI

    StackAI LLM Leaderboard: Vergleich von Modellen nach Benchmarks und Kosten

    StackAI bietet ein interaktives Dashboard, das Sprachmodelle anhand von Benchmarks, Durchsatz, Kontextfenstern und Kosten vergleicht. Das Tool fasst Leistungskennzahlen wie MMLU, HumanEval+, GPQA, SWE-Bench und GSM8K zusammen und ermöglicht den direkten Modellvergleich.

    KI & AI· Tool

  • Link:clickrank.ai

    LLM Leaderboards 2026: Benchmarks, Methoden und Modelle im Vergleich

    Ein Leitfaden von ClickRank AI analysiert den Stand der LLM-Ranglisten im Jahr 2026. Da traditionelle Tests wie MMLU und HumanEval übersättigt sind, stützen sich Vergleiche heute auf anspruchsvollere Benchmarks, menschliche Blindvergleiche und kombinierte Metriken aus Leistung, Geschwindigkeit und Token-Preisen.

    KI & AI· Sammlung

  • Link:The Cognition Team

    FrontierCode: Neuer Benchmark für Merge-Fähigkeit von KI-Code

    Cognition hat mit FrontierCode einen Benchmark und ein Leaderboard veröffentlicht, das bewertet, ob von KI-Modellen erstellte Pull Requests von Open-Source-Maintainern tatsächlich gemergt werden würden. Die Bewertung stützt sich auf Unit-Tests, Verifizierer und praxisnahe Rubriken von Maintainern.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.