Seit über 20 JahrenServer in DeutschlandDACH-weit
Zum Inhalt springen
KI Use Cases #1

PDFs für KI aufbereiten: weniger Tokens, bessere Antworten

Fast jeder Unternehmer zieht seine PDFs direkt in ChatGPT. Damit verschenkt man Rechenleistung, Geld und Genauigkeit. Hier erfährst du, warum das passiert und wie du es mit einem kostenlosen Werkzeug in wenigen Minuten löst.

Kurz erklärt

Lade PDFs nicht direkt in die KI, sondern wandle sie vorher in sauberen Text um, zum Beispiel lokal mit dem kostenlosen Microsoft-Tool MarkItDown. So verarbeitet die KI weniger Ballast, verbraucht weniger Tokens und antwortet schneller und präziser.

Zeitaufwand
ca. 15 Minuten
Schwierigkeit
Mittel
Geeignet für
Selbstständige, Büro und Verwaltung, Teams, die regelmäßig mit Berichten, Angeboten und anderen Dokumenten arbeiten
Bereich
Daten & Dokumente
KI-Aufgabe
Dokumente aufbereiten

Was passiert, wenn du ein PDF in die KI lädst?

Du lädst ein PDF in eine KI und glaubst, sie liest einfach deinen Inhalt. Tatsächlich bekommt das Modell viel mehr als nur deinen Text. Es schluckt den ganzen unsichtbaren Ballast mit: Formatierungs-Codes, Layout-Informationen, eingebettete Schriften und Bilder ohne ein einziges nützliches Wort.

Dazu kommt ein Kostentreiber, den kaum jemand auf dem Schirm hat: Viele KI-Tools verarbeiten jede PDF-Seite zusätzlich als Bild. Dieser Vision-Overhead kostet spürbar Tokens, und genau hier entsteht bei bildlastigen PDFs die größte Ersparnis, sobald du vorher in reinen Text umwandelst.

Ein großer Teil der verarbeiteten Tokens entfällt so auf Ballast statt auf deinen eigentlichen Inhalt. Tokens sind die Einheit, in der KI-Modelle Text verarbeiten und abrechnen. Je mehr Ballast, desto teurer und desto unschärfer das Ergebnis.

Beispielhafte Darstellung: ein erheblicher Teil der Tokens entfällt auf Formatierung, nicht auf den Inhalt.

Wie viele Tokens sparst du mit sauberem Text?

Nimm denselben Geschäftsbericht einmal als rohes PDF und einmal als aufgeräumten Text. Der Inhalt ist identisch, der Aufwand für die KI ist es nicht. Sauberer Text braucht spürbar weniger Tokens für genau dieselbe Aussage. Unabhängige Tests aus dem Jahr 2026 nennen grob ein Drittel bis die Hälfte weniger Tokens, je nach Dokument.

Veranschaulichung mit Beispielwerten. Die konkreten Zahlen hängen vom Dokument ab.

Weniger Tokens bedeuten dreierlei: Es kostet weniger, die Antwort kommt schneller, und sie wird präziser, weil das Modell nicht durch Formatierungs-Rauschen abgelenkt wird.

Was ist MarkItDown?

Die Lösung heißt MarkItDown. Das ist ein kostenloses, quelloffenes Werkzeug von Microsoft. Es wandelt PDFs, Word, Excel und weitere Formate in sauberes, reines Markdown um. Also genau in die strukturierte Textform, die KI-Modelle am besten verstehen, ganz ohne Formatierungs-Wust und versteckte Daten.

Wichtig für deinen DatenschutzEs kursieren viele Web-Seiten, auf denen man ein PDF einfach hochlädt. Das sind inoffizielle Dritt-Angebote. Wer dort ein Dokument hochlädt, schickt seine Daten auf einen fremden Server. Für alles mit Kundendaten ist das keine Option. Die saubere Lösung läuft lokal auf deinem eigenen Rechner.

Wie wandelst du ein PDF in sauberen Text um?

Je nachdem, wie technisch du arbeitest und wie sensibel deine Dokumente sind, gibt es drei Wege.

Nur unkritischWeg 1: schnell, ohne Installation

1

Web-Konverter nutzen

Es gibt browserbasierte Konverter, in die du das Dokument lädst und sofort sauberen Text zurückbekommst. Der wichtige Unterschied liegt darin, wo die Datei verarbeitet wird:

pdfmarkdown.app verarbeitet die Datei nach Anbieterangabe direkt im Browser, sie bleibt also auf deinem Gerät. Das ist die datenschutzfreundlichste der Web-Optionen. markitdown.online und markitdown.tech dagegen laden die Datei auf einen Server hoch.

Für alle Web-Konverter gilt: nur für Dokumente ohne sensible Inhalte, etwa öffentliche Texte oder eigene Notizen. Niemals für Kundendaten, Verträge oder Personaldaten. Wer auf Nummer sicher gehen will, nimmt Weg 2.

EmpfohlenWeg 2: lokal und datenschutzkonform

Einmal eingerichtet, läuft die Umwandlung komplett auf deinem eigenen Rechner. Das ist der richtige Weg für alles Geschäftliche.

1

Python installieren

Falls noch nicht vorhanden, lade Python von der offiziellen Seite python.org und installiere es.

2

MarkItDown installieren

Öffne die Kommandozeile und gib ein:

pip install 'markitdown[all]'

Die Anführungszeichen verhindern einen Fehler unter macOS (zsh). Das offizielle Tool von Microsoft findest du auf github.com/microsoft/markitdown.

3

Dokument umwandeln

Wandle dein PDF in eine saubere Textdatei um:

markitdown bericht.pdf -o bericht.md
4

In die KI laden

Gib der KI die erzeugte bericht.md statt des PDFs. Du wirst den Unterschied in Geschwindigkeit und Genauigkeit sofort merken.

Für ProfisWeg 3: direkt in Claude Desktop oder VS Code

1

Als MCP-Server anbinden

MarkItDown lässt sich als sogenannter MCP-Server direkt mit Claude Desktop verbinden. Dann wandelt die KI das Dokument bei Bedarf selbst um, ohne dass du einen Zwischenschritt machst. Der eleganteste Weg, wenn du ohnehin täglich mit KI arbeitest.

2

Oder per Klick in VS Code

Wer mit VS Code arbeitet, installiert die MarkItDown-Erweiterung und wandelt Dateien mit einem Klick um. Läuft lokal, ohne Kommandozeile.

Wo liegen die Grenzen?

MarkItDown ist stark bei Text, stößt aber bei stark verschachtelten Tabellen an Grenzen, dafür gibt es ausgefeiltere Werkzeuge. Zwei Dinge solltest du außerdem wissen: Im rein lokalen Standardbetrieb verarbeitet MarkItDown keine Bilder und macht kein OCR. Ein gescanntes oder reines Bild-PDF ohne echte Textebene liefert also nichts. Bildinhalte kann MarkItDown nur mit angebundenem KI-Modell auslesen oder beschreiben, dann verlassen diese Daten aber den Rechner und es entstehen Kosten.

Und ein Punkt, der leicht untergeht: Selbst wenn die Umwandlung lokal bleibt, geht der saubere Text zur Nutzung weiter an ein KI-Modell. Genau diese zweite Hälfte, die Verarbeitung in der EU mit Transparenz darüber, welches Modell wo läuft, deckt ConRat-AI ab.

Für den Alltag mit Berichten, Angeboten und textbasierten Dokumenten bleibt MarkItDown genau richtig, und die Aufbereitung selbst vollständig lokal.

Warum funktioniert das?

Die Logik dahinter ist einfach. Weniger Ballast lässt die KI fokussierter arbeiten, und fokussierte Arbeit führt zu einem besseren Ergebnis.

Diesen Use Case mit ConRat AI ausprobieren

Den aufbereiteten Text kannst du direkt im KI-Chat von ConRat AI verwenden. Die Verarbeitung läuft dort auf EU-Servern, so bleibt auch der zweite Schritt nach der lokalen Umwandlung datenschutzkonform.

ConRat-AI 30 Tage kostenlos testen

Häufige Fragen

Warum verbraucht ein PDF in ChatGPT so viele Tokens?

Ein PDF enthält neben deinem Text viel unsichtbaren Ballast: Formatierungs-Codes, Layout-Informationen, eingebettete Schriften und Bilder. Viele KI-Tools verarbeiten jede Seite zusätzlich als Bild. All das zählt beim Token-Verbrauch mit, obwohl es keine nützliche Information enthält.

Wie wandle ich ein PDF in Markdown um?

Am datenschutzfreundlichsten geht das lokal mit MarkItDown von Microsoft: Python installieren, das Tool mit pip install 'markitdown[all]' einrichten und dann markitdown bericht.pdf -o bericht.md ausführen. Ohne Kommandozeile klappt es mit der MarkItDown-Erweiterung für VS Code, für Profis auch als MCP-Server in Claude Desktop.

Ist es sicher, PDFs bei Online-Konvertern hochzuladen?

Nur bei Dokumenten ohne sensible Inhalte, etwa öffentlichen Texten oder eigenen Notizen. Viele Web-Konverter laden die Datei auf einen fremden Server hoch. pdfmarkdown.app verarbeitet sie nach Anbieterangabe im Browser. Für Kundendaten, Verträge oder Personaldaten ist die lokale Umwandlung der richtige Weg.

Funktioniert MarkItDown auch mit gescannten PDFs?

Im rein lokalen Standardbetrieb nicht, denn MarkItDown verarbeitet dann keine Bilder und macht kein OCR. Ein gescanntes PDF ohne echte Textebene liefert also keinen Text. Bildinhalte lassen sich nur mit angebundenem KI-Modell auslesen, dann verlassen die Daten aber den Rechner und es entstehen Kosten.

WordPress Cookie Hinweis von Real Cookie Banner