Bildinhalte mit OCR 4 strukturiert annotieren

✅ Freie Nutzung von Text & Abbildungen mit einem Unidigital-Zugang

Annotationen ermöglichen es, ganze Bilder oder einzelne Bildelemente strukturiert zu beschreiben. Diese Beschreibungen werden häufig im JSON-Format gespeichert, damit sie maschinenlesbar weiterverarbeitet und unter anderem für das Training von Bild-KI-Systeme genutzt werden können. Hierfür kommen Tools wie OCR 4 von Mistral zum Einsatz.

Matthias KindtUnidigitalProfil bearbeiten

Im Beispiel habe ich das Beitragsbild der 151. Auflage von KI & Bildung in den Playground von Mistral hochgeladen, um es dort strukturiert mithilfe von Annotationen beschreiben zu lassen. Nach dem Upload wird auf der linken Seite das Bild dargestellt und auf der rechten Seite kann ich gezielt Einstellungen vornehmen.

Auf der rechten Seite lässt sich rechts oben zwischen dem aktuellen Modell Mistral OCR 4 und der älteren Version Mistral OCR 3 auswählen. Ich bleibe beim neuesten Modell OCR 4. Dies ist vorab so eingestellt Für die Bildbeschreibungen klickt man rechts neben dem Feld „Bilder annotieren“ auf „Hinzufügen“.

Wenn ich die Annotation auf Deutsch ausgeben möchte, so muss der Titel auch auf Deutsch formuliert werden. Das ist wichtig! Ich hatte in einem Versuch das Feld mit „Anno 1″ ausgefüllt und es kamen ausschließlich italienische Bildbeschreibungen heraus, bis mir ChatGPT die Thematik genauer erläutert hat.  Daher habe ich den sehr präzisen Titel „Beschreibung (Deutsch)“ verwendet.

Annotation im JSON-Format (Einzelnes Bild: 

{
  "Beschreibung (Deutsch): "Das Bild zeigt eine Glühbirne, die als Symbol für eine Idee oder Inspiration steht. Die Glühbirne ist in einem leuchtend gelben Farbton dargestellt und hat einen klassischen, birnenförmigen Aufbau mit einem Schraubsockel unten. Sie ist auf einem weißen Hintergrund platziert und wirkt hell erleuchtet, was ihre symbolische Bedeutung als Lichtquelle oder geistige Erleuchtung unterstreicht."
}

Die obere Abbildung zeigt, wie OCR 4 die Glühbirne als einzelnes Bildelement genauer beschreibt und zusätzlich den im Bild enthaltenen Text „Erprobte Use-Cases zu KI in der Lehre“ erkennt. Auch die weiteren Bestandteile des Bildes werden auf diese Weise ausgegeben. Die im Code-Block dargestellten Annotationen können anschließend per Copy-and-paste in die Zwischenablage kopiert werden.

Gesamte Annotation im Markdown-Format

# KI & Bildung #151

![img-0.jpeg](img-0.jpeg)

Erprobte Use-Cases
zu KI in der Lehre

![img-1.jpeg](img-1.jpeg)

Neue Online-Kurse
für Lehre & Unterricht

![img-2.jpeg](img-2.jpeg)

Forschende können
nicht auf KI verzichten

![img-3.jpeg](img-3.jpeg)

KI kann nachhaltig und
verantwortungsvoll sein

In der Nahaufnahme wird deutlich, wie das OCR-Tool arbeitet und das Bild strukturiert nach Titel, Text und Bild aufteilt. Der Fokus liegt hierbei auf Bild + Text. Die beiden dargestellten Figuren bzw. die Malerin und der Roboter im Künstler-Stil werden hingegen nicht erfasst. Der Download der gesamten Analyse wird als Zip-Datei bereitgestellt.


Autor

matthias kindt

Matthias Kindt auf Linkedin