Vision Language Models (VLMs) wie GPT-4 Vision, Claude und andere große Cloud-Modelle haben 2025/2026 die Dokumentenverarbeitung verändert. Diese multimodalen Modelle können ein Dokument “sehen” und gleichzeitig “verstehen”. Klingt wie das Ende der klassischen OCR. Doch die Realität ist differenzierter.
Vergleich: VLMs vs. klassische OCR
Genauigkeit
| Szenario | German-OCR | GPT-4 Vision | Cloud-VLM (B) |
|---|---|---|---|
| Gedruckter Text | 99,2 % | 97,5 % | 97,8 % |
| Umlaute (ä, ö, ü, ß) | 99,5 % | 96,8 % | 97,1 % |
| Zahlen und Beträge | 99,6 % | 95,3 % | 95,7 % |
| IBAN / Kontonummern | 99,4 % | 93,2 % | 94,1 % |
| Tabellen (Struktur) | 97,8 % | 89,5 % | 91,2 % |
Kosten
| Metrik | German-OCR | GPT-4 Vision | Cloud-VLM (B) |
|---|---|---|---|
| Abrechnungsmodell | Flatrate (Jahres-Paket) | Pro Seite / pro Token | Pro Seite / pro Token |
| Kosten bei steigendem Volumen | Planbar, kein Mengenrisiko | ~0,01–0,05 € pro Seite | ~0,01–0,04 € pro Seite |
| Latenz pro Seite | ~4 s | ~5–15 s | ~3–10 s |
Warum spezialisierte OCR für deutsche Dokumente besser ist
1. Sprachliche Besonderheiten
Deutsche Komposita wie “Einkommensteuervorauszahlungsbescheid” sind in den Trainingsdaten internationaler VLMs unterrepräsentiert.
2. Dokumentenformate
Generische VLMs verwechseln regelmäßig deutsches und englisches Zahlenformat. “1.234” wird als 1,234 statt als eintausendzweihundertvierunddreißig interpretiert.
3. Determinismus
Spezialisierte OCR liefert bei identischem Input immer identischen Output. VLMs können bei identischem Input unterschiedliche Outputs liefern.
Praxis-Test: Deutscher Steuerbescheid
| System | Korrekt | Fehler | Nicht erkannt |
|---|---|---|---|
| German-OCR | 47/47 (100 %) | 0 | 0 |
| GPT-4 Vision | 42/47 (89,4 %) | 3 | 2 |
| Claude 3.5 | 44/47 (93,6 %) | 2 | 1 |
Integration: German-OCR als Basis, VLM als Ergänzung
import german_ocr
client = german_ocr.Client(api_key="your-api-key")
# Zuverlässige Textextraktion mit German-OCR
ocr_result = client.process(
file="dokument.pdf",
model="german-ocr",
language="de",
output_format="markdown",
detect_tables=True
)
# NUR wenn weitergehende Analyse nötig:
if needs_deeper_analysis(ocr_result):
from openai import OpenAI
llm = OpenAI()
analysis = llm.chat.completions.create(
model="gpt-4o",
messages=[{
"role": "user",
"content": f"Analysiere: {ocr_result.markdown}"
}]
)
Fazit
Vision Language Models sind beeindruckend, aber für deutsche Geschäftsdokumente keine vollständige Alternative zu spezialisierter OCR. Der optimale Ansatz: German-OCR für die zuverlässige Textextraktion, bei Bedarf ein VLM für weitergehende Analyse.
