OCR 4: Mistrals neues Zeichenerkennungstool im AI Studio testen
Freie Nutzung von Text & Abbildungen mit einem Unidigital-Zugang
Mistral hat mit OCR 4 ein neues Zeichenerkennungstool veröffentlicht, das man im AI Studio kostenlos testen kann. Über die Technologie „Optical Character Recognition“ wird aus einem Bild unter anderem der angezeigte Text extrahiert und lässt sich so gezielt anpassen. Im Beispiel habe ich den Blogbeitrag des Hochschulforums Digitalisierung (HFD) „Warum KI-Agenten das Ende klassischer Onlinetests einleiten“ mit der Lizenz CC BY-SA 4.0 über die Drucken-Funktion in ein PDF umgewandelt und anschließend in das AI Studio hochgeladen.

Um in den OCR-Playground zu gelangen, wird links in der Navigation auf das Feld „Document AI“ geklickt und eine Datei hochgeladen. Dieser Vorgang ist sehr einfach. Nach wenigen Sekunden ist der PDF-Upload beendet. Das ursprüngliche Dokument wird nun auf der linken Seite angezeigt und lässt sich von Anfang bis Ende durchscrollen.

Ich könnte rechts oben über den Button „Ausführen“ das PDF auslesen, nehme aber vorab noch eine Einstellung vor, um über die Annotation-Funktion zu jedem enthaltenen Bild eine kurze Beschreibung darunter ausgeben zu lassen. Auf der rechten Seite klickt man neben der Bezeichnung „Bilder annotieren“ auf „Hinzufügen“ und erstellt ein neues Feld.

Das Feld nenne ich „Annotation“ und wähl Output „Text“ aus. Dieser wird im Anschluss im JSON-Format angezeigt. Es ließen sich auch mehrere Felder erstellen, um unterschiedliche Annotationen vornehmen zu lassen. Hier kann man gerne etwas durchtesten. Rechts unten über „Feld hinzufügen“ wird die Auswahl bestätigt. Jetzt habe ich alle Settings gesetzt. Über den Button „Ausführen“ wird das Tool OCR 4 aktiv und analysiert die Oberfläche des PDFs, um dieses im Anschluss übersichtlich in einem Editor bearbeiten zu können.

Der untere Screenshot aus dem AI Studio zeigt auf der rechten Seite die Übertragung des PDF-Inhalts, der sich im Editor individuell bearbeiten lässt. Hier kann ich den Text anpassen, um zum Beispiel eine Passage zu löschen oder hinzuzufügen. Auch eine Änderung der Formatierung wie H1/H2‑Überschriften ist möglich. Auf der linken Seite sind alle Elemente markiert, sodass direkt erkennbar ist, ob es sich um einen Text oder ein Bild handelt. Klicke ich auf der rechten Seite auf ein Element, so werde ich auf der linken Seite direkt zu dieser Stelle im Dokument geführt. Sehr praktisch!

Anmerkung (Bild) in JSON-Format:
{
"Annotation": "The image depicts a blog post titled 'Warum KI-Agenten das Ende klassischer Onlinetests einleiten' (Why AI Agents Spell the End of Classic Online Tests) authored by Prof. Dr. Doris Weßels and Dr. Miriam Maibaum. The post is part of a blog, as indicated by the 'BLOG' label at the top. The background features a person interacting with a digital interface displaying AI agents, suggesting a focus on artificial intelligence and its applications in testing or assessment. The logo of the 'Hochschulforum Digitalisierung' (Higher Education Forum for Digitalization) is visible, indicating the source or publisher of the content."
}
Die Annotation wird direkt unter dem Bild mit einem kurzen beschreibenden Text angezeigt. Über eine Copy-Funktion im Code-Block kann ich den Inhalt schnell kopieren und in einem anderen Dokument wieder einfügen. Der Code-Block hebt sich mit dem schwarzen Hintergrund gut vom restlichen Inhalt ab und ist direkt erkennbar.

Wenn ich oben im Menü von „Visuell“ auf „Markdown“ wechsle, so lässt sich der PDF-Inhalt im Markdown-Format einsehen. Ganz unten wird eine Navigation mit Seitenzahlen dargestellt, um die einzelnen PDF-Seiten durchzugehen. Der Download der bearbeiteten Datei erfolgt als Zip-Datei mit den einzelnen Seiten inklusive Bildern, Text und Annotationen.

Möchte ich eine weitere Datei in den OCR-Playground von Mistral hochladen, so lässt sich dies über einen Klick oben in der Navigation auf das Feld „Neu starten“ und „Zurücksetzen“ vornehmen. Viel Erfolg bei der Übertragung eurer Dokumente!
Autor



