Was ist Multimodal?
Zuletzt aktualisiert am · Aidan Faes
Kurz gesagt
Multimodal heißt ein Modell, das mehr als eine Art von Eingabe verarbeitet, etwa Text und Bild oder Text und gesprochene Sprache. Ein solches Modell kann ein abfotografiertes Formular deuten, ohne dass der Text vorher separat erkannt werden muss. Für Unternehmen ist das vor allem bei Dokumenten und im Kundenkontakt relevant.
Bisher liefen solche Aufgaben in getrennten Schritten: erst OCR für die Texterkennung, dann eine Zuordnung, dann die Auswertung. Ein multimodales Sprachmodell sieht stattdessen die Seite und beantwortet Fragen dazu, samt Aufbau, Tabellen und handschriftlichen Vermerken. Das verkürzt die Kette und hilft besonders bei schlecht strukturierten Vorlagen, etwa Lieferscheinen mit Stempeln und Notizen.
Im Kundenservice zeigt sich der Nutzen anders. Ein Kunde schickt ein Foto des defekten Bauteils samt kurzer Beschreibung, und das System ordnet Modell und Fehlerbild zu, bevor jemand zurückruft. In Verbindung mit Spracherkennung entstehen daraus Telefonassistenten, die zuhören, verstehen und den Vorgang vorbereiten. Beides sind Aufgaben, an denen textbasierte Systeme bisher scheiterten.
Der typische Fehler ist, deshalb spezialisierte Werkzeuge abzuschreiben. Für die Massenverarbeitung gleichartiger Belege sind die auf Dokumente ausgelegten Lösungen weiterhin präziser, günstiger je Seite und mit Prüfoberfläche, Konfidenzwerten und Übergabe an das Zielsystem ausgestattet. Multimodale Modelle spielen ihre Stärke bei Vielfalt aus, nicht bei Menge.
Vor dem Kauf lohnt ein Test mit Ihren schlechtesten Vorlagen: dem grauen Fax, dem schiefen Scan, dem Formular mit Durchschlag. Fragen Sie außerdem, wo Bilder verarbeitet werden und wie lange sie gespeichert bleiben. Bilder enthalten oft mehr personenbezogene Daten als der Text, den sie zeigen, etwa Unterschriften und Gesichter im Hintergrund.
Welche Begriffe hängen damit zusammen?
- Sprachmodell: Ein Modell, das Sprache verarbeitet und fortsetzt, indem es das jeweils wahrscheinlichste nächste Stück Text bestimmt.
- Spracherkennung: Die Umwandlung gesprochener Sprache in Text, Grundlage für Telefonassistenten und Diktat.
- OCR: Umwandlung von Bild in Text: der erste Schritt jeder Belegverarbeitung, aber noch keine Zuordnung.
Wo wird Multimodal in der Auswahl konkret?
Begriffe helfen erst, wenn sie an einer Entscheidung hängen. Multimodal spielt vor allem in Dokumente & Verwaltung und Kundenservice & Voice eine Rolle. Dort sehen Sie, wie die geprüften Lösungen mit dem Punkt umgehen, jeweils mit Quelle und Stand-Datum.
Weiter im Glossar
Häufige Fragen
Brauchen wir dann noch klassische Texterkennung?
In den meisten Dokumentenprozessen ja, weil sie schnell, preiswert und wiederholbar ist. Multimodale Modelle ergänzen sie bei schwierigen oder wechselnden Vorlagen, ersetzen sie aber selten vollständig.
Kann so ein System auch Handschrift lesen?
Häufig ja, mit deutlich schwankender Trefferquote je nach Schriftbild. Für handschriftliche Felder gehört deshalb immer eine Prüfstufe dazu, besonders bei Zahlen und Mengenangaben.