eScriptorium ist der Ausgangspunkt für die meiste Quellenarbeit im Projekt: Handschriftliche und gedruckte historische Dokumente werden hier automatisch segmentiert und per Handwritten Text Recognition (HTR) transkribiert – trainiert auf historischen Schriften, die generische OCR-Werkzeuge kaum zuverlässig lesen können.
Wofür wir es hier einsetzen
- Transkription von Handschriften, etwa Schuldbüchern und Registern
- Layouterkennung komplexer, mehrspaltiger oder stark strukturierter Dokumente
- Training eigener OCR/HTR-Modelle auf projektspezifisches Schriftmaterial
- Export nach TEI-XML und ALTO-XML zur Weiterverarbeitung in TEI Publisher
Gerade bei größeren Beständen zahlt sich das Batch-Processing aus: Ganze Aktenkonvolute lassen sich mit einem trainierten Modell in einem Durchgang transkribieren, statt Seite für Seite von Hand.