Content Extraction Prompt

PromptadminSammlung

Ein detaillierter System-Prompt steuert die automatisierte Extraktion und Strukturierung von Inhalten aus mehrseitigen Dokumenten (wie PDFs) in ein TYPO3-kompatibles JSON-Format.

Das Wichtigste

  1. Aggregiert Inhalte aus zweigeteilten Vorlagen (Grundlagen und Übungen) in ein einzelnes Seitenobjekt und kehrt dabei die Reihenfolge um.
  2. Segmentiert Fließtext anhand von Überschriften in einzelne tt_content-Blöcke und bereinigt Spaltenumbrüche sowie Rechtschreibfehler.
  3. Mappt spezielle Layoutelemente wie Callout-Boxen, DropCaps, Listen und Hinweiskästen direkt auf spezifische TYPO3-Elementtypen (z. B. mask_text_icon mit lightbulb-Icon und div-Trenner).
  4. Gibt valide JSON-Daten mit standardisierten Feldern (CType, header, bodytext mit definiertem HTML-Subset, tags) aus.

Warum das relevant ist

Die manuelle Übertragung komplexer Print- oder PDF-Inhalte in CMS-Datenstrukturen ist zeitaufwendig und fehleranfällig. Ein präzise definierter Prompt ermöglicht eine weitgehend automatisierte Migration von Legacy-Dokumenten direkt in strukturierte TYPO3-Content-Elemente.

Einordnung

Der Prompt setzt auf eine strikte, hierarchische Strukturierung (Input-Beschreibung, Verarbeitungsregeln, Output-Spezifikation) und klare Constraint-Vorgaben anstelle von freiem Text. Technisch nutzt er Schema-Demonstration (ein JSON-Template mit Beispielen für das Zielformat), Negativ- und Positivregeln (etwa die Beschränkung auf erlaubte HTML-Tags wie <p>, <strong> oder <ul>) sowie explizite Fallunterscheidungen für visuelle Sonderfälle (DropCaps, Tipp-Rahmen). Die Verarbeitungslogik kombiniert syntaktische Transformation (Entfernung von Pfeilen und Hashtags) mit CMS-spezifischer Geschäftslogik (Reihenfolge der tt_content-Elemente, Setzen von header_layout=1). Von dieser Vorlage profitieren vor allem TYPO3-Integratoren und Redaktionsteams, die Content-Migrations-Pipelines über LLM-APIs aufbauen.

Prompt

# Content Extraction Prompt

## Input Description
- Source Format: Mehrseitiges Dokument (z.B. PDF)
- Layout:
  - Columns: Mehrspaltig. Textfluss kann über Spalten hinweg gehen.
  - Structure: Inhalte sind logisch in "Grundlagen" (Seite 1) und "Übung" (Seite 2) getrennt.
  - Typography: Verwendet verschiedene Überschriftengrößen, Fettdruck und potenziell Hashtags.
  - Special Elements:
    - DropCap: Textblöcke, die mit einem großen Initialbuchstaben beginnen.
    - CalloutBox: Textblasen oder Kästen mit Zusatzinformationen.
    - GoalList: Ein als "Ziele" markierter Abschnitt mit einer Aufzählung.
    - Hint: Wenn "Hinweis" oder "Tipp" im Text vorkommt oder visuell ein Rahmen beim Inhaltselement vorhanden ist (in der Vorlage), dann automatisch ein Inhaltselement mit `ctype="mask_text_icon"` (Text & Icon) anlegen. Das Feld `tx_mask_icon` soll "lightbulb" auswählen. Header und Text sollen wie die anderen Content-Elemente befüllt werden.

## Processing Rules
- PageAggregation
  - Fasse den Inhalt der "Grundlagen"-Seite und der zugehörigen "Übungs"-Seite in einem einzigen `page`-Objekt in der JSON-Ausgabe zusammen.
  - Die Reihenfolge der Elemente soll sein: die anzulegenden Inhalte TYPO3 sollen zuerst die Bereiche Übungen enthalten und dann die Grundlagen.
  - Die erste Überschrift der angelegten Content-Elemente von Grundlagen (quasi Seite 1) soll `header_layout=1` bekommen.
  - Vor diesem Element lege ein Divider-Content-Element (`ctype:"div"`) an.
- ContentChunking
  - Segmentiere den Inhalt in `tt_content`-Einträge. Eine neue `tt_content`-Instanz beginnt immer mit einer neuen Überschrift. Jeder `tt_content`-Eintrag soll genau eine Überschrift und den dazugehörigen Textabsatz enthalten.
- ShortContentHandlinga
  - Sehr kurze `tt_content`-Einträge, die nur aus wenigen Worten bestehen, sollen entweder weggelassen oder in den vorherigen bzw. nachfolgenden `tt_content`-Eintrag integriert werden.
- SpellingCorrection
  - Überprüfe und korrigiere alle Texte und Überschriften auf Rechtschreibfehler.
- SpecialElementHandling
  - DropCap: Erstelle für einen Textblock, der mit einem großen, abgesetzen Buchstaben beginnt, ein eigenes `tt_content`-Element. Inkludiere den ersten Buchstaben im ersten Wort.
  - CalloutBox: Lege für Textinhalte in einer Textblase eine passende, neue Überschrift an (z.B. "Zusatzinformation") und erstelle ein eigenes `tt_content`-Element dafür.
  - GoalList: Der als "Ziele" markierte Abschnitt soll ein eigener `tt_content`-Block werden. Entferne Pfeil-Symbole aus der Aufzählung. Die Aufzählungen sollen schlussendlich als `<ul>`-Liste generiert werden.
- TextFlow
  - Erkenne Textflüsse über Spaltengrenzen hinweg. Ein Absatz endet erst dort, wo die nächste logische Überschrift beginnt.

## Output Specification
- Format: JSON
- Structure:
  - Description: Die JSON-Struktur muss dem folgenden Aufbau folgen. Die Wurzel ist ein Objekt mit einem `pages`-Array.
  - Schema:
    ```json
    {
      "pages": [
        {
          "title": "Seitentitel (z.B. aus dem Thema der Grundlage)",
          "tt_content": [
            {
              "CType": "header",
              "header": "Titel des ersten Inhaltsblocks",
              "bodytext": "<p>Formatierter HTML-Text...</p>",
              "tags": ["tag1", "tag2"]
            },
            {
              "CType": "text",
              "header": "Titel des zweiten Inhaltsblocks",
              "bodytext": "<p>Weiterer formatierter Text mit <strong>Hervorhebungen</strong> und <a href='...'>Links</a>.</p>",
              "tags": []
            }
          ]
        }
      ]
    }
    ```
- Field Rules:
  - Field `CType`:
    - Der erste `tt_content`-Eintrag einer Seite sollte den CType `header` haben. Alle folgenden können `text` oder `textmedia` sein. Zusätzlich kann noch ein `div` bzw. ein `mask_text_icon` verwendet werden. 
  - Field `bodytext`:
    - Der Text soll als simples HTML formatiert sein. Erlaubte Tags sind: `<p>`, `<br>`, `<h2>`, `<h3>`, `<ul>`, `<li>`, `<strong>`. Im Dokument fett formatierter Text muss in `<strong>`-Tags eingeschlossen werden. Hyperlinks müssen als `<a>`-Tags erhalten bleiben.
  - Field `tags`:
    - Falls Hashtags im Quelldokument vorhanden sind (z.B. `#Thema`), extrahiere diese. Die extrahierten Tags sollen im JSON-Array als Strings ohne das `#`-Symbol gespeichert werden. Wenn keine Hashtags vorhanden sind, soll das Array leer sein.

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:docling.ai

    Docling: Open-Source-Dokumentenverarbeitung für KI und RAG

    Docling ist ein quelloffenes Werkzeug der LF AI & Data Foundation, das komplexe Dokumente wie PDFs, Office-Dateien und Bilder in strukturierte Daten für Sprachmodelle umwandelt. Es arbeitet lokal und offline, erkennt Layouts sowie Tabellenstrukturen und stellt Schnittstellen für Python, CLI, REST-APIs und MCP bereit.

    KI & AI· Tool

  • Repository:Barty-Bart/gpt-6-astra-10k-websites

    GPT-6 Astra und Higgsfield MCP: Prompts für Marken-Websites

    Das Repository bündelt strukturierte Prompts, um mithilfe von GPT-6 Astra und dem Higgsfield MCP interaktive Marken-Websites mit Scroll-Animationen und KI-generierten Medien zu erstellen.

    97Sterne

    KI & AI· Sammlung

  • Repository:freestylefly/awesome-gpt-image-2

    awesome-gpt-image-2: Prompt-as-Code-Bibliothek für KI-Bildgenerierung

    awesome-gpt-image-2 ist ein Open-Source-Repository und Prompt-Engine für GPT-Image2. Es bietet über 540 per Reverse Engineering analysierte Bild-Prompts und mehr als 20 strukturierte Vorlagen nach dem Ansatz Prompt as Code.

    27.724SterneJavaScript

    KI & AI· Sammlung

  • Repository:docling-project/docling

    Docling: Dokumenten-Parsing für Generative AI

    Docling ist ein Open-Source-Python-Werkzeug, das Dokumente aus zahlreichen Formaten wie PDF, Office-Dateien, Audio und HTML für den Einsatz in Generative-AI-Pipelines aufbereitet.

    66.025SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.