Das Seminar verbindet die technische Dokumentenerkennung mit den Anforderungen eines verlässlichen Fachprozesses. Gescannte Seiten, digitale PDF-Dateien und mehrspaltige Dokumente werden zunächst hinsichtlich ihrer Eigenschaften untersucht. Anschließend entsteht eine Verarbeitungskette von der OCR-Ausgabe bis zu fachlich geprüften Daten.
Ein Schwerpunkt liegt auf dem Umgang mit Unsicherheit. Eine gut lesbare Texterkennung garantiert weder eine korrekte Tabellenzuordnung noch sachlich richtige Beträge, Datumswerte oder Zuordnungen. Deshalb werden technische Formatprüfung, fachliche Regeln und manuelle Nachbearbeitung bewusst als eigene Verarbeitungsschritte eingerichtet.
Inhaltsübersicht
- Dokumente vorbereiten
- OCR-Ausgabe verstehen
- Strukturierte Felder extrahieren
- Qualität und fachliche Regeln
- Verarbeitungskette integrieren
- Praxistest und Nachbearbeitung
Seminarinhalte
Dokumente vorbereiten
- Digitale PDFs, Scans, Bilder und mehrsprachige Dokumente nach Verarbeitungsbedarf unterscheiden.
- Seitenrotation, Scanqualität, Dateigröße und doppelte Dokumente vor der Verarbeitung prüfen.
- Ein Testkorpus mit erwarteten Feldwerten und bewusst schwierigen Beispielen aufbauen.
OCR-Ausgabe verstehen
- Dokumente über den vorgesehenen Dateizugang verarbeiten und Seitenresultate auswerten.
- Text, Lesereihenfolge, Tabellen und Bildbereiche entsprechend der gewählten Modellversion untersuchen.
- Abgeschnittene Inhalte und unvollständig erkannte Seiten anhand des Originaldokuments kontrollieren.
Strukturierte Felder extrahieren
- Ein Schema mit Datentypen, Pflichtfeldern, Listen und fehlenden Werten definieren.
- Beleg- oder Formularinformationen durch dokumentbezogene Extraktion in strukturierte Datensätze überführen.
- Seitennachweise und Zuordnungen zu Textstellen für die fachliche Kontrolle mitführen.
Qualität und fachliche Regeln
- Datumswerte, Beträge, Einheiten und Summen unabhängig von der Modellantwort validieren.
- Fehlende Werte von tatsächlich erkannten Nullwerten unterscheiden.
- Feldgenauigkeit, Vollständigkeit und Nachbearbeitungsquote am Testkorpus messen.
Verarbeitungskette integrieren
- Dokumentkennung, Verarbeitungsstatus und erneute Verarbeitung nachvollziehbar verwalten.
- Fehlerfälle in eine Prüfwarteschlange übergeben und Wiederholungen begrenzen.
- Geprüfte Daten in ein neutrales Austauschformat für nachgelagerte Systeme überführen.
Praxistest und Nachbearbeitung
- Mehrere Dokumentvarianten mit identischem Schema verarbeiten und Abweichungen vergleichen.
- Einen unvollständigen Datensatz manuell berichtigen und die Bearbeitung dokumentieren.
- Grenzen der Automatisierung und Regeln für die fachliche Freigabe festlegen.
Praktische Übungen
- Ein kleines Dokumentkorpus kennzeichnen und erwartete Daten für die spätere Prüfung erfassen.
- Eine OCR-Verarbeitung ausführen und Text- sowie Tabellenresultate mit den Seitenbildern vergleichen.
- Ein Extraktionsschema definieren und die erzeugten Datensätze technisch validieren.
- Prüfregeln für Summen, Datumswerte und Pflichtfelder ergänzen und fehlerhafte Belege aussortieren.
- Die geprüften Datensätze exportieren und für problematische Dokumente eine nachvollziehbare Nachbearbeitung durchführen.
Schulungsumgebung
Der Kunde stellt die Schulungsumgebung einschließlich der benötigten Zugänge, Nutzungsrechte und vereinbarten Ressourcen bereit. Erforderlich sind ein freigeschalteter OCR-/Document-AI-Zugang, Python, freigegebene Musterdateien und ein festgelegtes Seitenbudget. Die Übungen verwenden anonymisierte oder synthetische Dokumente. Ein vollständiges DMS und eine eigene GPU sind nicht erforderlich.
Passende Vertiefungen
Die Auswahl richtet sich nach den jeweiligen Voraussetzungen der Folgeseminare.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
|---|---|
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Entwickler, DMS-Verantwortliche, Integrationsspezialisten und technische Mitarbeiter aus Dokumentenprozessen |
| Voraussetzungen: | Grundkenntnisse in Python, HTTP und JSON; erste API-Erfahrung sowie Verständnis des zu verarbeitenden Dokumententyps. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
