DeepSeek Vision-API: Bildverarbeitung mit deepseek-v4-flash-vision-exp

ArtikelSammlung

DeepSeek dokumentiert die Bildverarbeitung für das Modell deepseek-v4-flash-vision-exp. Entwickler können Bilder via Base64, Web-URL oder Files-API über OpenAI- und Anthropic-kompatible Schnittstellen übergeben.

Das Wichtigste

  1. Unterstützt werden JPEG, PNG, GIF und WebP, wobei das Format über den Dateiinhalt und nicht über den Dateinamen ermittelt wird.
  2. Bilder können als Inline-Base64, externe URL (bis 32 MiB, Download-Timeout 60 Sekunden) oder per Files-API (bis 64 MiB) übergeben werden.
  3. Das Modell skaliert Bilder intern auf maximal etwa 800×800 Pixel; die Token-Kosten sind dadurch auf 384 Tokens pro Bild gedeckelt.
  4. Pro Request sind maximal 600 Bilder und eine Gesamtbildgröße von 64 MiB (bzw. 200 MiB bei Nutzung der Files-API) erlaubt.
  5. Neben dem OpenAI-kompatiblen Chat-Completions-Format und der Responses-API wird auch der Anthropic-kompatible /messages-Endpunkt unterstützt.
  6. Bilder dürfen ausschließlich in User-Messages übermittelt werden; Anfragen in System- oder Assistant-Nachrichten werden mit einem 400-Fehler abgewiesen.

Warum das relevant ist

Für Entwickler, die bereits bestehende OpenAI- oder Anthropic-SDKs einsetzen, ermöglicht DeepSeek eine direkte Einbindung von Bildanalysen ohne Wechsel der Client-Bibliotheken. Die Obergrenze von 384 Tokens pro Bild bietet zudem gut kalkulierbare Kosten bei der Verarbeitung hochauflösender Bilder.

Einordnung

Die API-Gestaltung zeigt einen starken Fokus auf Kompatibilität mit etablierten Ökosystemen. Indem DeepSeek sowohl die OpenAI-Struktur als auch das Anthropic-Nachrichtenformat bedient, sinkt die Hürde für Multi-Provider-Setups erheblich. Technisch setzt die Begrenzung auf maximal 384 Tokens pro Bild klare Rahmenbedingungen für Bildauflösung und Detailtreue: Große Dateien werden vor der Inferenz komprimiert, was für Standardanalysen wie OCR oder Diagrammauswertungen ausreicht, aber bei feinsten visuellen Details an Grenzen stoßen könnte.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:api-docs.deepseek.com

    DeepSeek API: Kompatibilität mit OpenAI und Anthropic sowie neue Modelle

    Die Quick-Start-Dokumentation der DeepSeek-API beschreibt den Einstieg über OpenAI- und Anthropic-kompatible Schnittstellen. Neben aktualisierten V4-Modellen und einer experimentellen Vision-Variante wird die Integration in gängige Entwicklerwerkzeuge und Coding-Assistenten vorgestellt.

    KI & AI· Sammlung

  • Artikel:DeepSeek

    DeepSeek veröffentlicht experimentelles Modell DeepSeek-V4-Flash-Vision-Exp

    DeepSeek hat das multimodale Modell DeepSeek-V4-Flash-Vision-Exp über seine API freigegeben. Es behält die Text- und Reasoning-Fähigkeiten von DeepSeek-V4-Flash bei, erweitert diese jedoch um Bildverarbeitung. Gleichzeitig startet eine kostenlose Files API für wiederverwendbare Uploads.

    KI & AI· Ankündigung

  • Artikel:DeepSeek

    DeepSeek API Changelog: Release von V4-Flash-Vision-Exp und GA von V4-Pro

    Das Änderungsprotokoll der DeepSeek-API dokumentiert den Release des multimodalen Modells DeepSeek-V4-Flash-Vision-Exp sowie das GA-Update von DeepSeek-V4-Pro. Die V4-Modellfamilie bringt native Unterstützung für das OpenAI-Responses-API-Format, konfigurierbare Denkmodi und ein Peak-/Off-Peak-Preismodell.

    KI & AI· Ankündigung

  • Artikel:DeepSeek AI

    DeepSeek veröffentlicht DeepSeek-V4 Preview als Open Source mit 1M Kontext

    DeepSeek hat die Preview-Version von DeepSeek-V4 als Open Source freigegeben. Die Modellreihe umfasst die Varianten DeepSeek-V4-Pro und DeepSeek-V4-Flash, bietet standardmäßig ein Kontextfenster von einer Million Tokens und bringt neue Architekturen zur Rechenzeit- und Speicheroptimierung mit.

    KI & AI· Ankündigung

  • Artikel:Google AI for Developers

    Videogenerierung und -bearbeitung mit Gemini Omni Flash

    Google dokumentiert die Integration von Gemini Omni Flash (gemini-omni-1.1-flash) in die Gemini API. Das multimodale Modell verarbeitet Text, Bild, Audio sowie Video und erlaubt Text-to-Video- sowie Image-to-Video-Generierung inklusive Ton.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.