pdf-inspector: Schnelle PDF-Klassifizierung und Textextraktion in Rust

Repositoryfirecrawl/pdf-inspectorTool

pdf-inspector von Firecrawl ist eine performante Rust-Bibliothek, die PDFs analysiert, zwischen gescannten und textbasierten Dokumenten unterscheidet und Inhalte direkt in Markdown konvertiert.

Das Wichtigste

  1. Erkennt in 10 bis 50 ms, ob Dokumente textbasiert, gescannt, bildbasiert oder gemischt sind, inklusive Konfidenzwert und Seiten-Routing.
  2. Extrahiert Text positionsgenau mit Koordinaten, Schriftinformationen, Rotationswinkeln und automatischer Erkennung von Mehrspalten-Layouts.
  3. Konvertiert Inhalte ohne OCR direkt in sauberes Markdown, inklusive Tabellenerkennung (rechteckbasiert und heuristisch), Codeblöcken und Überschriften.
  4. Ermöglicht selektive lokale OCR mittels PP-OCRv6 Small über PDFium und ONNX Runtime nur für Seiten, die tatsächlich OCR erfordern.
  5. Stellt Schnittstellen für Rust, die Kommandozeile (CLI), Python, Node.js sowie WebAssembly für die clientseitige Ausführung im Browser bereit.

Warum das relevant ist

Viele Datenpipelines schicken standardmäßig alle PDF-Dokumente durch teure und langsame OCR-Dienste. Da laut Firecrawl rund 54 Prozent aller PDFs bereits digitalen Text enthalten, reduziert eine vorgeschaltete Klassifizierung die Verarbeitungsdauer auf unter 200 ms und spart erhebliche Infrastrukturkosten.

Einordnung

Das Tool löst ein zentrales Effizienzproblem moderner Dokumenten- und LLM-Pipelines: die Unterscheidung zwischen echtem Text und reinen Scans. Durch die Implementierung in Rust und die Vermeidung doppelter Ladevorgänge arbeitet die Engine sehr ressourcenschonend. Bemerkenswert ist die Architektur mit rein extrahierenden Standard-Builds und optional nachgelagertem, selektivem OCR-Einsatz. Mit fast 19.000 Sternen auf GitHub, multi-platform SDKs und WebAssembly-Unterstützung wirkt das unter MIT-Lizenz stehende Projekt produktionsreif und technisch sehr ausgereift.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Nicolas Camara

    Firecrawl veröffentlicht pdf-inspector: Schnelle PDF-Klassifizierung und Markdown-Extraktion in Rust

    Firecrawl hat pdf-inspector vorgestellt, eine quelloffene Rust-Bibliothek zur raschen Erkennung von PDF-Typen und direkten Markdown-Konvertierung ohne zwingendes OCR. Das Tool zielt darauf ab, KI-Agenten und Parsing-Pipelines zu beschleunigen, indem rein textbasierte Dokumente innerhalb von Millisekunden lokal extrahiert werden.

    20.611Lesezeichen2,7 Mio.Aufrufe

    KI & AI· Tool

  • Link:docling.ai

    Docling: Open-Source-Dokumentenverarbeitung für KI und RAG

    Docling ist ein quelloffenes Werkzeug der LF AI & Data Foundation, das komplexe Dokumente wie PDFs, Office-Dateien und Bilder in strukturierte Daten für Sprachmodelle umwandelt. Es arbeitet lokal und offline, erkennt Layouts sowie Tabellenstrukturen und stellt Schnittstellen für Python, CLI, REST-APIs und MCP bereit.

    KI & AI· Tool

  • Repository:docling-project/docling

    Docling: Dokumenten-Parsing für Generative AI

    Docling ist ein Open-Source-Python-Werkzeug, das Dokumente aus zahlreichen Formaten wie PDF, Office-Dateien, Audio und HTML für den Einsatz in Generative-AI-Pipelines aufbereitet.

    66.025SternePython

    KI & AI· Tool

  • Repository:Stirling-Tools/Stirling-PDF

    Stirling PDF: Selbst gehostete Plattform für PDF-Bearbeitung und Workflows

    Stirling PDF ist eine quelloffene Plattform zur PDF-Verarbeitung, die lokal als Desktop-App, im Browser oder als selbst gehosteter Server betrieben werden kann. Sie bietet über 50 Werkzeuge sowie REST-APIs und No-Code-Workflows, ohne dass vertrauliche Dokumente an Drittanbieter gesendet werden müssen.

    91.324SterneJava

    Automatisierung· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.