OCR Language Pack: Welche Sprachen erkennt die Texterkennung?

Ihr Vorteil


Mit dem richtigen Sprachpaket erhalten Sie deutlich bessere Erkennungsergebnisse bei nicht-lateinischen Schriften — etwa bei Verträgen in Russisch, Arabisch, Hindi oder Chinesisch. Falsche Sprachwahl führt zu unleserlichem OCR-Output und damit zu fehlerhaften KI-Analyse-Ergebnissen. Ein Klick im Upload-Dialog spart Ihnen später viel manuelle Nachbesserung.


So funktioniert's


1. Sprachpaket beim Upload auswählen


Beim Hochladen eines Vertrags öffnet sich der Dialog „Verträge hinzufügen". Ganz oben sehen Sie das Dropdown „Sprache der Texterkennung" mit dem Default „Lateinische Schrift" und dem Hinweis:


„Das Sprachpaket bestimmt, welches Schriftsystem für die Texterkennung verwendet wird."


Klicken Sie auf das Dropdown und wählen Sie das Schriftsystem aus, in dem Ihr Vertrag verfasst ist.


2. PDF auswählen oder per Drag-and-Drop hochladen


Nach der Sprachauswahl ziehen Sie Ihr PDF in den blauen Upload-Bereich („Verträge im PDF-Format auswählen oder hier reinziehen") oder klicken hinein, um eine Datei auszuwählen. Die OCR-Engine verarbeitet den Vertrag anschließend mit dem gewählten Sprachpaket.


3. Verfügbare Sprachpakete im Überblick


ContractHero bietet aktuell acht Sprachpakete an. Jedes Paket deckt mehrere Sprachen ab, die das gleiche Schriftsystem nutzen:


Sprachpaket

Abgedeckte Sprachen

Lateinische Schrift (Default)

Englisch, Deutsch, Französisch, Spanisch, Portugiesisch, Italienisch, Niederländisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Schwedisch, Dänisch, Norwegisch, Finnisch, Kroatisch, Slowakisch, Slowenisch, Litauisch, Lettisch, Estnisch, Indonesisch, Vietnamesisch, Türkisch, Malaiisch, Tagalog, Swahili, Afrikaans, Aserbaidschanisch, Bosnisch, Katalanisch, Walisisch, Galicisch, Isländisch, Irisch, Albanisch, Maltesisch, Usbekisch, Sundanesisch, Javanisch

Chinesisch & Japanisch

Chinesisch (vereinfacht & traditionell), Japanisch

Kyrillisch

Russisch, Ukrainisch, Bulgarisch, Serbisch

Arabisch

Arabisch, Persisch (Farsi), Urdu

Devanagari (Hindi)

Hindi, Marathi, Nepali

Koreanisch

Koreanisch

Griechisch

Griechisch

Thai

Thai


Häufige Fragen


Was ist der Unterschied zwischen OCR und KI-Vertragsanalyse?


OCR wandelt das gescannte PDF oder Bild in maschinenlesbaren Text um — das ist die Voraussetzung dafür, dass die KI-Vertragsanalyse anschließend Felder wie Vertragsbeginn, Vertragspartner oder Kündigungsfrist erkennen kann. Ohne sauberes OCR keine saubere KI-Analyse.


Muss ich das Sprachpaket immer manuell wählen?


Nein — bei Verträgen in lateinischer Schrift (alle westeuropäischen Sprachen, Türkisch, Vietnamesisch etc.) ist der Default bereits richtig. Sie müssen das Dropdown nur ändern, wenn Ihr Vertrag in einer anderen Schrift verfasst ist (z. B. Russisch in Kyrillisch oder Arabisch).


Was passiert, wenn ich das falsche Sprachpaket wähle?


Die OCR-Erkennung liefert dann nahezu unbrauchbaren Text — etwa wenn Sie ein arabisches Dokument mit „Lateinische Schrift" verarbeiten. Sie können den Vertrag nach dem Upload löschen und erneut mit der korrekten Sprache hochladen.


Kann ein Vertrag mehrere Sprachpakete gleichzeitig nutzen?


Pro Upload wird ein Sprachpaket angewendet. Bei zweisprachigen Verträgen (z. B. Deutsch + Englisch) reicht „Lateinische Schrift" — beide Sprachen sind enthalten. Bei gemischten Schriften (z. B. Deutsch + Chinesisch im selben Dokument) wählen Sie das Paket, das für den vertragsrelevanten Teil zuständig ist.


Funktioniert die KI-Analyse in allen diesen Sprachen?


Die OCR-Texterkennung deckt alle aufgeführten Sprachen ab. Die KI-Vertragsanalyse (Befüllung der Felder per Prompt) arbeitet primär auf Deutsch und Englisch zuverlässig — bei anderen Sprachen hängt das Ergebnis stark von der Formulierung Ihres Prompts und der Vertragssprache ab. Sprechen Sie uns an, wenn Sie systematisch Verträge in weiteren Sprachen analysieren möchten.


Wo finde ich das Sprachpaket bei E-Mail-Import oder XLS-Import?


Bei automatischen Imports (E-Mail, XLS) wird immer „Lateinische Schrift" verwendet. Wenn Sie regelmäßig nicht-lateinische Verträge bekommen, ist der manuelle Upload mit Sprachauswahl der zuverlässigere Weg.


Erkennt ContractHero handschriftliche Notizen oder Unterschriften?


Die OCR-Engine ist auf gedruckten Text optimiert. Handschrift wird teils erkannt, ist aber nicht zuverlässig. Unterschriftenblöcke verarbeiten wir gesondert über die Signatur-Funktion (siehe Verwandte Artikel).


Gut zu wissen


  • Default reicht für 95 % der Use-Cases. Wenn Sie hauptsächlich europäische Verträge verarbeiten, müssen Sie nie etwas am Dropdown ändern.
  • Bei Bulk-Upload alle Sprachen gleich. Wenn Sie mehrere PDFs gleichzeitig in den Dialog ziehen, wird das gewählte Sprachpaket auf alle angewendet. Sprachlich gemischte Stapel: separat hochladen.
  • Sprachpaket ≠ Übersetzung. Das Dropdown wählt das Schriftsystem für die Texterkennung — der Vertrag wird nicht in eine andere Sprache übersetzt.
  • Scan-Qualität ist wichtiger als das Paket. Ein schlechter Scan in der richtigen Sprache liefert schlechtere Ergebnisse als ein sauberer Scan im falschen Paket. Achten Sie auf 300 dpi und kontrastreiche Vorlagen.
  • Wir unterstützen beim Setup. Wenn Sie regelmäßig Verträge in nicht-lateinischen Schriften verarbeiten, gehen wir das Setup im Onboarding gemeinsam durch.


Verwandte Artikel


Aktualisiert am: 31/08/2026

War dieser Beitrag hilfreich?

Teilen Sie Ihr Feedback mit

Stornieren

Danke!