Zum Inhalt springen
Softwarelotsen
Glossar

Was ist Embedding?

Zuletzt aktualisiert am · Aidan Faes

Kurz gesagt

Ein Embedding ist die Darstellung eines Textabschnitts als lange Zahlenreihe, mit der sich inhaltliche Ähnlichkeit berechnen lässt. Texte mit ähnlicher Bedeutung erhalten ähnliche Zahlenreihen, auch wenn sie kein einziges Wort teilen. Embeddings sind die Grundlage der semantischen Suche und damit jeder RAG-Anbindung.

Der praktische Effekt lässt sich an einem Beispiel zeigen: Die Anfrage „Was tun, wenn die Maschine nicht anläuft?“ findet den Abschnitt „Fehlerbehebung bei ausbleibendem Anlaufvorgang“, obwohl beide Formulierungen kaum Wörter gemeinsam haben. Eine Stichwortsuche würde hier nichts liefern. Für Betriebe mit gewachsenem Sprachgebrauch, in denen jede Abteilung eigene Bezeichnungen verwendet, ist genau das der entscheidende Vorteil.

Erzeugt werden Embeddings von einem eigenen Modell, das getrennt vom Sprachmodell arbeitet und meist deutlich weniger kostet. Die Ergebnisse landen in einer Vektordatenbank. Wichtig zu wissen: Alle Abschnitte müssen mit demselben Modell verarbeitet werden, sonst sind die Zahlenreihen nicht vergleichbar. Ein Wechsel des Embedding-Modells bedeutet deshalb, den gesamten Bestand neu einzulesen.

Der typische Fehler steckt in der Zerlegung. Wird ein Dokument stur nach Zeichenzahl geschnitten, zerreißt es Tabellen und trennt Überschriften vom Inhalt, und die Suche findet Bruchstücke ohne Zusammenhang. Gute Systeme schneiden entlang der Struktur und geben jedem Abschnitt Kontext mit, etwa Dokumenttitel und Kapitel. Fragen Sie im Auswahlgespräch danach, denn dieser Punkt entscheidet über die Antwortqualität mehr als das Sprachmodell.

Datenschutzrechtlich sind Embeddings kein harmloser Zwischenschritt. Sie werden aus Ihren Texten erzeugt, lassen sich in Teilen zurückrechnen und enthalten damit denselben Personenbezug wie das Ausgangsmaterial. Klären Sie deshalb, wo sie gespeichert werden, wer darauf zugreift und ob sie bei einer Löschanfrage mit entfernt werden.

Welche Begriffe hängen damit zusammen?

  • Vektordatenbank: Eine Datenbank, die Embeddings speichert und nach Ähnlichkeit statt nach exakter Übereinstimmung sucht.
  • Retrieval Augmented Generation: Verfahren, bei dem passende Firmendokumente gesucht und dem Modell mitgegeben werden, damit die Antwort auf Belegen beruht.
  • Semantische Suche: Suche nach Bedeutung statt nach Stichwort: Sie findet auch Treffer, die anders formuliert sind.

Wo wird Embedding in der Auswahl konkret?

Begriffe helfen erst, wenn sie an einer Entscheidung hängen. Embedding spielt vor allem in Wissen & Suche eine Rolle. Dort sehen Sie, wie die geprüften Lösungen mit dem Punkt umgehen, jeweils mit Quelle und Stand-Datum.

Weiter im Glossar

Häufige Fragen

Sind Embeddings anonym?

Nein. Sie sind eine andere Darstellung desselben Inhalts und teilen dessen datenschutzrechtliche Einordnung. Behandeln Sie den Speicherort wie die Dokumente selbst und lassen Sie Löschkonzepte darauf mit anwenden.

Müssen wir das selbst betreiben?

In der Regel nicht, denn bei fertigen Plattformen läuft dieser Schritt im Hintergrund. Relevant wird die Frage nur, wenn Sie eine eigene Lösung bauen lassen oder besondere Anforderungen an den Verarbeitungsort haben.

Quellen

  • Anbieterangaben laut Anbieter-Websites (abgerufen am 20.08.2026)