LayoutLM: Ein leistungsstarkes Modell zum Verstehen von...

LayoutLM: Ein leistungsstarkes Modell zum Verstehen von...

1. Kurze EinfĂŒhrung

Im digitalen Zeitalter begegnen wir tĂ€glich unzĂ€hligen Dokumenten – Scans, Formulare, Quittungen und mehr. Computer beizubringen, diese Dokumente mit Text und Layoutinformationen zu verstehen, ist ein wichtiger Forschungsschwerpunkt in der KI. Traditionelle NLP-Modelle konzentrieren sich hauptsĂ€chlich auf Textinhalte und ignorieren Dokumentlayout und visuelle Informationen, was beim Verarbeiten von Dokumentenbildern EngpĂ€sse verursacht. Um dies zu lösen, brachte Microsoft im Juni 2020 das LayoutLM-Modell heraus.

  • Hintergrund:
    • Vor LayoutLM fokussierten NLP-Modelle hauptsĂ€chlich auf Texteingaben, wĂ€hrend Computer-Vision-Modelle auf Bildeingaben setzten.
    • LayoutLM war das erste Modell, das Bilder, Text und 2D-Positions-informationen als Eingabe nutzt und damit multimodale Verarbeitung ermöglicht.
  • Entwicklungsteam: LayoutLM wurde gemeinsam von Yiheng Xu, Minghao Li, Lei Cui, Shaohan Huang, Furu Wei und Ming Zhou entwickelt.
  • FunktionalitĂ€t:
    • LayoutLM ist zum Verstehen von Dokumentenbildern konzipiert und ermöglicht Aufgaben wie Informationsextraktion, FormularverstĂ€ndnis, QuittungsverstĂ€ndnis und Dokumentklassifizierung.
    • Es verbessert signifikant die Verarbeitungsleistung durch gleichzeitige Modellierung der Interaktion zwischen Text und Layoutinformationen.

2. Architektur

LayoutLMs Architektur basiert auf BERT (Bidirectional Encoder Representations from Transformers) und fĂŒgt BERT zwei neue Eingabe-Embeddings hinzu:

  • 2D-Positions-Embeddings: ReprĂ€sentieren die rĂ€umliche Position von Text in Dokumenten. Statt nur die Wortreihenfolge zu berĂŒcksichtigen, werden Bounding-Box-Koordinaten (x0, y0, x1, y1) fĂŒr jedes Wort verwendet. Die Koordinaten werden auf den Bereich 0–1000 normalisiert.
  • Bild-Embeddings: Integrieren visuelle Informationen. LayoutLM segmentiert Bilder in Regionen, die OCR-Text entsprechen, und erzeugt daraus Bild-Embeddings.

Vortraining:

  • LayoutLM verwendet Masked Visual-Language Model (MVLM) fĂŒr das Vortraining, das sowohl Text- als auch 2D-Positions-Embeddings berĂŒcksichtigt.
  • Das Vortraining nutzte den IIT-CDIP Test Collection 1.0-Datensatz mit ĂŒber 6 Millionen Dokumenten und 11 Millionen gescannten Bildern.

3. UnterstĂŒtzte Dokumenttypen

LayoutLM eignet sich hervorragend fĂŒr Dokumente, bei denen Layout und visuelle Informationen fĂŒr das VerstĂ€ndnis entscheidend sind:

  • Formulare: Exzellente Ergebnisse im FormularverstĂ€ndnis mit dem FUNSD-Datensatz.
  • Quittungen: Gute Ergebnisse bei Quittungsdaten mit dem SROIE-Datensatz.
  • Gescannte Dokumente: Effektive Verarbeitung durch gleichzeitige Modellierung von Text und Layout.
  • GeschĂ€ftsdokumente: Bestellungen, Finanzberichte, Rechnungen, VertrĂ€ge, LebenslĂ€ufe und mehr.

4. Nutzungstipps

  • OCR-Engine: Nutze eine OCR-Engine (z. B. Tesseract), um Text und Bounding Boxes aus Dokumentenbildern zu extrahieren.
  • Bounding-Box-Normalisierung: Normalisiere die Koordinaten auf den Bereich 0–1000.
  • Spezielle Token: LayoutLM verwendet [CLS], [SEP], [PAD], [MASK] und [UNK].
  • Richtigen Tokenizer wĂ€hlen: Verwende LayoutLMTokenizer oder LayoutLMTokenizerFast.

5. Umgebungsanforderungen

  • Programmiersprache und Framework: LayoutLM kann mit PyTorch oder TensorFlow implementiert werden.
  • Hugging Face Transformers: Die Kernbibliothek fĂŒr die Nutzung von LayoutLM. VerfĂŒgbare Modellvarianten: LayoutLMModel, LayoutLMForMaskedLM, LayoutLMForSequenceClassification, LayoutLMForTokenClassification und LayoutLMForQuestionAnswering.