// Blog
Produktdaten übersetzen: Delta, TM, Terminologie und KI
Warum Katalogübersetzung mehr kostet als nötig — und die vier Mechanismen dagegen: Segment-Hashes, Deduplizierung, Translation Memory, Terminologie.
8 Min. LesezeitPIM Gate teamMarketing & Lokalisierung
Sie haben an achthundert Produkten ein Attribut geändert und ein Übersetzungsangebot über vierzigtausend Wörter erhalten. Irgendwo zwischen PIM und Agentur hat ein Mechanismus, der einen geänderten Satz hätte erkennen müssen, daraus einen Auftrag in Dateigrösse gemacht — und niemand in der Kette kann sagen, wo.
Der Grund ist fast immer derselbe: Die Strecke übersetzt Dateien, wo sie Segmente übersetzen müsste. Alles Weitere folgt aus dieser einen Unterscheidung.
Die Arbeitseinheit ist das Segment, nicht die Datei
Ein dateibasierter Ablauf exportiert ein Produkt, eine Sprache oder einen Katalog, gibt ihn weiter und bekommt ihn zurück. Er kann nicht wissen, dass von den 40'000 Wörtern im Export 39'300 mit dem Vormonat identisch sind und 600 des Rests derselbe Satz sind, der sich über eine Produktfamilie wiederholt.
Ein segmentbasierter Ablauf behandelt jeden Attributwert und jeden Satz als Einheit mit Identität. Geben Sie jeder einen Hash über den normalisierten Quelltext plus Kontext — Attributname, Produkttyp, Locale — und drei nützliche Dinge werden gleichzeitig möglich:
- Änderungserkennung. Kommt ein Datensatz herein, gelangen nur Segmente mit neuem Hash in die Strecke. Die Bearbeitung eines Produkts löst nie die Neuübersetzung eines anderen aus.
- Deduplizierung. «Messing, vernickelt» auf 812 Produkten ist ein Segment. Einmal übersetzt, einmal geprüft, 812-mal angewendet.
- Nachvollziehbarkeit. Zu jedem Segment lässt sich sagen, wo es verwendet wird, wann sich seine Quelle zuletzt geändert hat und welchen Status es pro Zielsprache hat.
Die Grössenordnung zählt mehr als die exakten Zahlen. Ein Katalog mit 12'000 SKU und 14 übersetzbaren Attributen hat rund 168'000 Feldwerte; nach Deduplizierung sind das typischerweise einige Zehntausend eindeutige Segmente; ein Wochenlauf ändert vielleicht tausend davon; nach Abgleich mit dem Translation Memory müssen einige Hundert wirklich neu übersetzt werden. Das ist der Unterschied zwischen einer fünfstelligen Wortzahl und einem Nachmittag Review — und er stammt aus Buchführung, nicht aus KI.
Eine Feinheit, die konfiguriert gehört: ob eine Quelländerung, die nur Satzzeichen oder Leerraum betrifft, als Änderung zählt. Ohne diese Einstellung kann ein Aufräumdurchgang im Produktmanagement einen Monat Übersetzungsarbeit entwerten.
Translation Memory: das Gut, das Ihre Agenturen längst aufgebaut haben
In den meisten Häusern liegen Jahre von TMX-Beständen bei der Agentur — ohne Möglichkeit, sie gegen den eigenen Katalog zu nutzen. Der Import verändert die Rechnung sofort, weil Katalogsprache über Produkte und über Jahre hinweg stark repetitiv ist.
Worauf es mechanisch ankommt:
- Exakte und Fuzzy-Treffer mit eigenen Schwellwerten. Exakte Treffer werden direkt wiederverwendet. Fuzzy-Treffer — etwa 87 % — gehen als Ausgangspunkt an Engine oder Übersetzerin, nicht als fertige Antwort.
- Kontextsensitiver Abgleich. Dieselbe deutsche Wendung braucht in der Kurzbeschreibung eine andere englische Entsprechung als im technischen Attribut. Ein Memory ohne Kontext liefert selbstbewusst falsche Treffer, und die sind schlimmer als gar keine.
- Wachstum. Jede freigegebene Übersetzung fliesst zurück ins Memory. Das Gut verzinst sich; Lauf 20 ist günstiger als Lauf 2.
- Portabilität. Bestehen Sie auf TMX-Export. Ein Memory, das Sie nicht mitnehmen können, ist Lock-in — und es ist Ihr sprachliches Kapital, nicht das Ihres Dienstleisters.
Terminologie: durchgesetzt, nicht empfohlen
Ein Glossar in einem geteilten Dokument ist ein Ratschlag. Eine Terminologiedatenbank in der Strecke ist eine Kontrolle.
Importieren Sie Ihre freigegebenen Begriffe als TBX, mit drei Zuständen pro Begriff und Sprache: freigegeben, bevorzugt, verboten. Dann passiert an zwei Stellen etwas, und beide sind nötig:
- Vor der Übersetzung. Freigegebene Begriffe gehen als Glossar an die Engine, sofern diese es unterstützt.
- Nach der Übersetzung. Jeder Vorschlag wird gegen die Terminologiedatenbank geprüft, unabhängig davon, welche Engine ihn erzeugt hat — denn ein Glossar ist für ein Modell ein Hinweis, keine Garantie.
Ein Verstoss blockiert dann die Freigabe oder erzeugt eine Warnung, pro Sprache nach Ihrer Wahl. «Manometer» dort, wo Ihre Terminologie «pressure gauge» verlangt, erreicht keine Prüferin ungekennzeichnet — und keinen Kanal überhaupt.
Zwei Dinge lohnen den Einrichtungsaufwand: locale-spezifische Einträge, die die Basissprache übersteuern, und ein Weg für Prüfende, aus der Review-Queue heraus neue Begriffe vorzuschlagen, damit die Terminologie aus echter Arbeit wächst und nicht aus einem einmaligen Workshop.
Wo KI tatsächlich hingehört
KI übersetzt. Sie entscheidet nicht. Diese Trennung macht ihren Einsatz am Katalog vertretbar.
Praktisch heisst das: Maschinelle Übersetzung erzeugt einen Vorschlag, und der Vorschlag durchläuft die Prüfregel, die Sie für diese Sprache konfiguriert haben. Verschiedene Sprachen verdienen verschiedene Regeln, und die Konfiguration sollte das abbilden können: Eine volumenstarke Sprache mit reifem Memory kommt mit MT-Vorschlag plus einfachem Review aus; ein rechtlich heikler Markt bleibt rein menschlich, wobei die Strecke Pakete statt Vorschläge liefert; eine Locale-Variante wie de-CH oder en-US wird besser per Regel aus der Basissprache abgeleitet — Eszett zu ss, Schweizer Begriffe, Zahlenformat — als von Grund auf neu übersetzt.
Die Engine-Wahl gehört pro Sprache, nicht pro Unternehmen. Qualität schwankt nach Sprachpaar und Textsorte, und Sie sollten DeepL, OpenAI, Anthropic, Azure OpenAI oder ein EU-gehostetes beziehungsweise lokales Modell anbinden und eines austauschen können, ohne den Workflow drumherum anzufassen. Das hält auch die Frage nach dem Datenstandort beantwortbar: Verlangt ein Markt es, routen Sie diese Sprache auf ein Modell, das dort gehostet ist, wo Sie es brauchen.
Eine Prüferin öffnet ein Segment und sieht die Quelle, den Vorschlag, den 87-%-Memory-Treffer, aus dem er stammt, die darin enthaltenen Terminologietreffer und das Zeichenlimit des Kanals — auf einem Bildschirm, vor der Entscheidung.
Dieser Bildschirm ist das eigentliche Produkt der Strecke. Alles davor existiert, um die Entscheidung klein und gut informiert zu machen.
Die Vorgaben, an die niemand denkt, bis ein Kanal ablehnt
Eine Übersetzung ist nicht fertig, wenn sie sich gut liest, sondern wenn jeder Kanal sie annimmt. Vier Prüfungen gehören in die Strecke statt ins Fehlerprotokoll des Empfängers:
- Längenbegrenzungen pro Attribut und Kanal — ein Marktplatztitel bei 80 Zeichen, ein Etikettenfeld, eine Tabellenzelle im PDF. Französische und deutsche Textausdehnung sprengt diese regelmässig; zu lange Vorschläge gehören vor dem Review markiert, nicht nach der Veröffentlichung.
- Platzhalter und Markup — Variablen wie
{size}, Zeilenumbrüche, Inline-Tags — während der Übersetzung geschützt und beim Rücklauf geprüft. - Einheiten, Normen und Artikelnummern — «G 1/4», «DN 15», «EN 837-1» — gesperrt, damit keine Engine sie hilfsbereit lokalisiert.
- Unzulässige Inhalte pro Kanal, am Gate abgefangen statt vom Kanal.
Lassen Sie Ihre Übersetzer, wo sie sind
Der häufigste Einwand gegen jedes Übersetzungswerkzeug lautet, die Agentur werde nicht darin arbeiten. Muss sie nicht. Ein Ablauf, der ein Paket exportieren kann — nur neue und Fuzzy-Segmente einer Sprache, dedupliziert, mit Kontext, Memory-Treffern und Terminologie, als XLIFF oder XLSX —, lässt die Agentur in ihrem gewohnten CAT-Tool arbeiten, ganz ohne Zugang zu Ihrem System. Das Paket kommt zurück, wird beim Import validiert (Segment-IDs, Platzhalter, Längen, Terminologie und ob sich die Quelle seit dem Export geändert hat) und läuft in dieselbe Review-Queue wie jeder andere Vorschlag.
Die kaufmännische Wirkung darf man der Agentur offen sagen: Sie kalkuliert echte Arbeit statt Wiederholungen. Dieses Gespräch läuft besser, wenn Sie ein Paket mit Dublettenzahl null vorlegen können.
Womit anfangen
Beginnen Sie mit einer Inventur, nicht mit einer Werkzeugentscheidung. Zählen Sie Ihre übersetzbaren Attribute und multiplizieren Sie mit den SKU, um die Zahl der Feldwerte zu erhalten. Fordern Sie die TMX-Dateien bei Ihrer Agentur an. Schreiben Sie auf, über welche Ihrer Begriffe schon einmal gestritten wurde — das ist Ihre erste Terminologieliste. Nehmen Sie dann eine Zielsprache und führen Sie sie durchgehend durch, bevor Sie die übrigen anfassen.
Sehen Sie sich die Strecke im Detail an — Memory, Terminologie, Engine-Routing und Review-Queues. Die Übersetzung von Produktdaten ist ein Modul auf demselben Qualitätsgate wie alles andere; Connectors für Content-Übersetzung in Ibexa DXP und Drupal sind geplant und derzeit im Early Access — planen Sie deshalb zuerst mit dem Produktdaten-Workflow.
Wichtigste Punkte
- Segmente mit Hashes übersetzen statt Dateien: Änderungserkennung, Deduplizierung und Nachvollziehbarkeit folgen aus dieser einen Umstellung.
- Die TMX-Bestände Ihrer Agenturen importieren; kontextsensitiven Abgleich und TMX-Export verlangen, damit das Memory Ihnen gehört.
- Terminologie muss zweimal greifen — als Glossar an die Engine und als Prüfung am Ergebnis, unabhängig von der Engine.
- KI erzeugt Vorschläge; die Prüfregel pro Sprache entscheidet über die Veröffentlichung. Locale-Varianten per Regel ableiten statt neu übersetzen.
- Engine pro Sprache wählen und austauschbar halten, damit Anforderungen an den Datenstandort beantwortbar bleiben.
- Länge, Platzhalter, gesperrte Einheiten und unzulässige Inhalte in der Strecke prüfen, nicht im Fehlerprotokoll des Kanals.
- Deduplizierte Delta-Pakete exportieren, damit Agenturen im CAT-Tool bleiben und echte Arbeit kalkulieren.
// Verwandte Artikel
8 Min. LesezeitIT & Architektur
Ihre Portale sollten Ihren PIM-Vertrag überleben
PIM-eigene Portale sterben mit dem PIM. Kanonische Ebene und Migrationsbruecke lassen Sie das System darunter wechseln, ohne einen Kanal anzufassen.
architecturemigrationitportals
6 Min. LesezeitProduktdaten
Warum ein Kundenportal, wenn das PIM doch exportiert?
Ein Export ist ein Lieferweg, kein Zugriffsmodell. Was ein Kundenportal ergaenzt: Berechtigungen, aktuelle Daten, Selbstbedienung und Nachvollziehbarkeit.
portalsentitlementsproduct-data