Zum Hauptinhalt springen

Raw & Roasted (Event & Webinar) | 17.09.2026 | Kontext für KI-Agenten: Wie aus Unternehmensdaten belastbare Antworten werden | Jetzt Platz sichern. >

Die unverzichtbare Grundlage für KI im Marketing

Data Quality & Governance


Tobias Lanzl 406e3053
Tobias Lanzl, 25.08.2026

Die Hopmann AI Foundation, Teil 3

Kurz zusammengefasst: Datenqualität ist die zweite Ebene der Hopmann AI Foundation und die einzige, die wir ausdrücklich als unverzichtbar bezeichnen würden. Eine KI kann nur mit den Daten arbeiten, die sie bekommt. Sind diese Daten unvollständig oder falsch, zieht das Modell möglicherweise den falschen Schluss oder liefert überzeugt eine plausible Erklärung, die einfach nicht stimmt. Dieser Beitrag beschreibt die sechs Dimensionen der Datenqualität und warum ihre Pflege eine dauerhafte Aufgabe ist und kein einmaliges Projekt.

Im ersten Beitrag dieser Serie haben wir die fünf Ebenen der Hopmann AI Foundation vorgestellt: Measurement Strategy, Data Quality & Governance, Semantic Layer, Context Layer und Agentic Marketing Intelligence. Der vorige Beitrag hat sich auf die Measurement Strategy konzentriert, also auf die Frage, was überhaupt gemessen werden soll. Dieses Mal gehen wir eine Ebene höher und stellen eine andere Frage: Kann man den Daten trauen, mit denen gemessen wird?

Es ist die Ebene, über die am wenigsten gesprochen wird. Datenqualität hat keine Demo, und niemand bekommt Applaus dafür, dass ein Sync-Fehler aufgefallen ist, bevor er in ein Board-Deck gewandert ist. Trotzdem ist es die Ebene, an der die meisten KI-Projekte im Marketing tatsächlich scheitern.

Warum schlechte Daten in KI-Projekten unsichtbar bleiben

Ein klassischer Report verhält sich bei fehlenden Daten relativ freundlich. Eine Zeile bleibt leer, eine Summe wirkt zu niedrig, irgendwer im Team stolpert darüber und fragt nach.

KI-Systeme verhalten sich anders. Ein Sprachmodell behandelt die Daten, die es bekommt, grundsätzlich als vertrauenswürdig. Solange das System um das Modell herum die Eingaben nicht prüft, erklärt es, was es sieht, statt zu hinterfragen, ob die Datenbasis lückenhaft oder falsch ist. Im besten Fall weist es darauf hin, dass die Daten unvollständig sein könnten oder dass es sich seiner Antwort nicht sicher ist. Im schlechtesten Fall füllt es die Lücke mit einer plausiblen Erklärung und präsentiert sie als Tatsache.

Fehlen drei Tage Kampagnendaten, sieht das Modell möglicherweise keinen Tracking-Fehler, sondern einen Performance-Einbruch, und liefert dazu eine überzeugende Begründung. Ist ein Lead im CRM zweimal angelegt, schließt es vielleicht auf eine wachsende Zielgruppe, statt das Duplikat zu erkennen. Beide Antworten können genauso souverän klingen wie eine richtige.

Fehler werden mit KI also nicht zwangsläufig sichtbarer. Sie werden oft leiser.

Bei Agentic AI wiegt das noch schwerer. Ein Agent beantwortet nicht eine Frage und hört dann auf. Er liest Daten, rechnet, formuliert Empfehlungen und kann nachgelagerte Aktionen auslösen. Ist die Datenbasis falsch, baut jeder weitere Schritt auf derselben falschen Annahme auf.

Die Zahlen dazu sind eindeutiger, als man es bei einem so unspektakulären Thema erwarten würde. Laut dem Data Integrity Report 2025 von Precisely vertrauen 67 Prozent der Unternehmen ihren eigenen Daten nicht genug, um darauf KI-gestützte Entscheidungen zu treffen. Im AI Survey 2024 von Deloitte geben 38 Prozent der Führungskräfte an, bereits eine Fehlentscheidung auf Basis falscher KI-Ergebnisse getroffen zu haben. Gartner nennt mangelnde Datenqualität als häufigsten Grund dafür, dass KI-Anwendungen scheitern.

Diese Zahlen handeln von Vertrauen, nicht von Technik. Und der größte Schaden unsauberer Daten liegt nicht in der einzelnen falschen Kennzahl. Er liegt in dem Punkt, an dem das Team dem Dashboard nicht mehr glaubt und wieder aus dem Bauch heraus entscheidet.

Was „gute Daten“ konkret bedeutet: die sechs Dimensionen von Data Quality & Governance

„Wir brauchen bessere Datenqualität“ ist als Satz genauso wahr wie unbrauchbar. Solange nicht klar ist, welche Art von Qualitätsproblem gemeint ist, lässt sich auch nicht prüfen, ob es behoben wurde. Deshalb arbeiten wir mit sechs Dimensionen. Jede beantwortet eine andere Frage, und jede kann unabhängig von den anderen fehlschlagen.

Vollständigkeit: Fehlen Datensätze oder Werte?

Eine Schnittstelle synchronisiert über das Wochenende nicht, ein Konto verliert seine Autorisierung. Nichts davon erzeugt eine Fehlermeldung, es erzeugt niedrigere Zahlen. Die Kampagne läuft weiter, aber ohne Rückmeldung über ihre Wirkung, und das Budget optimiert gegen nichts.

Korrektheit: Beschreiben die Daten die Realität?

Hier fehlen keine Werte, die vorhandenen sind falsch. Ein Conversion-Tag, das nach einem Relaunch doppelt feuert, liefert vollständige, aktuelle, formal einwandfreie Daten. Der ROAS sieht damit doppelt so gut aus, wie er ist, und die Empfehlung lautet, mehr Budget in einen schwächeren Kanal zu geben.

Eindeutigkeit: Verzerren Duplikate die Auswertung?

Doppelte Datensätze blähen nicht nur Zahlen auf, sie erzeugen Zielgruppen, die es nicht gibt. Liegt derselbe Kunde in drei Systemen unter drei Schreibweisen, optimiert ein Modell anschließend gegen Segmente aus Phantom-Personen. Je nachdem, wo die Duplikate entstehen, zählen sie außerdem Conversions doppelt oder verzerren Performance-Kennzahlen so, dass sich die Ursache kaum zurückverfolgen lässt.

Aktualität: Ist der Datenstand aktuell genug für die Entscheidung?

Diese Dimension ist relativ, nicht absolut. Für ein Monatsreporting sind Daten von gestern völlig ausreichend, für eine Budgetentscheidung am Mittag nicht. Entscheidend ist deshalb, ob die Aktualität zur Taktung der Entscheidungen passt, die auf ihr basieren.

Konsistenz: Stimmen die Werte über Systeme hinweg?

Marketing zählt Leads in der Ad-Plattform, Sales im CRM, Finance rechnet mit einer dritten Zahl, und jede ist in ihrem System korrekt. Für ein KI-System entsteht daraus Mehrdeutigkeit. Ohne klare fachliche Regeln kann es nicht verlässlich wissen, welche Definition gelten soll, und wer die Antwort liest, weiß nicht, welche verwendet wurde.

Gültigkeit: Halten die Daten die vereinbarten Regeln ein?

Formate, Wertebereiche, Namenskonventionen, Pflichtfelder. Das klingt nach Verwaltung, entscheidet in der Praxis aber darüber, ob die Daten überhaupt auswertbar sind. Halten Kampagnennamen die Konvention nicht ein, lässt sich nicht verlässlich nach Land, Funnel-Stufe oder Zielgruppe gruppieren. Die Daten selbst können korrekt sein, aber die Struktur, die für die Analyse nötig ist, fehlt.

Die sechs Dimensionen sind kein Prüfkatalog, den man einmal abarbeitet. Sie sind eine gemeinsame Sprache dafür, wo ein Qualitätsproblem sitzt. Das ist der Unterschied zwischen „unsere Daten sind schlecht“ und „wir haben ein Eindeutigkeitsproblem in der Kundendomäne, das unsere Zielgruppen um rund fünfzehn Prozent aufbläht“. Nur die zweite Aussage lässt sich priorisieren, messen und beheben.

Warum Datenqualität kein Projekt mit Enddatum ist

Der verbreitetste Denkfehler bei diesem Thema ist die Annahme, Datenqualität sei ein Zustand, den man einmal herstellt. Ein Audit, eine Aufräumphase, ein Häkchen.

Tatsächlich ist es ein laufender Prozess, weil sich Daten ständig ändern. Plattformen aktualisieren ihre APIs, Tracking-Implementierungen entwickeln sich weiter, neue Kanäle bringen eigene Namenskonventionen mit, und Geschäftsprozesse verändern sich über die Zeit. Menschen wechseln das Team und nehmen das Wissen mit, warum ein Feld existiert oder wie eine bestimmte Transformation funktioniert. Keine dieser Veränderungen wirkt für sich dramatisch, in Summe untergraben sie aber langsam das Vertrauen in die Daten. Ein Audit sagt, wie es heute aussieht. Erst automatisierte Prüfungen und Schwellwerte sagen, ob es morgen noch so ist.

Der Gewinn

Der Gewinn dieser Ebene ist Vertrauen, auch wenn das weniger wertvoll klingt, als es tatsächlich ist. Wenn die Daten verlässlich sind, werden Diskussionen über Zahlen kürzer, weil alle von derselben Grundlage ausgehen. Analysten verbringen weniger Zeit damit, Abweichungen zwischen Systemen zu erklären, und mehr Zeit mit den Fragen, für die sie eingestellt wurden. Probleme werden erkannt, bevor sie eine Budgetentscheidung beeinflussen, und nicht danach.

Dieser Nutzen entsteht unabhängig davon, ob am Ende überhaupt ein KI-Agent gebaut wird. Saubere Daten verbessern Reporting, Attribution, Forecasting und Entscheidungen im ganzen Unternehmen. KI erhöht lediglich den Einsatz: Sobald ein Sprachmodell Entwicklungen erklärt, Maßnahmen empfiehlt oder Entscheidungen für Nutzer trifft, wird aus schlechter Datenqualität eine fehlerhafte Argumentation und nicht nur eine falsche Zahl. Deshalb ist diese Ebene keine Vorarbeit, die man hinter sich bringt, bevor der interessante Teil beginnt. Sie liefert von Anfang an Nutzen und trägt gleichzeitig jede Ebene darüber.

Wie es weitergeht

Mit dieser Ebene sind die Daten selbst verlässlich. Eine Frage bleibt aber offen: Was bedeuten die Zahlen eigentlich? Saubere Daten heißen nicht automatisch, dass alle im Unternehmen sie gleich interpretieren. „Conversion“ kann in vier Tools vier leicht unterschiedliche Berechnungen bezeichnen, und jede einzelne kann technisch korrekt sein. Genau darum geht es im nächsten Beitrag dieser Serie: um den Semantic Layer. Er legt Metriken und Berechnungslogiken an einer Stelle fest, damit Menschen, Dashboards und KI-Systeme mit denselben Definitionen arbeiten.

Wer Agentic AI im Marketing zum Erfolg führen will, fängt nicht beim Agenten an. Er fängt bei den Daten an, auf die der Agent angewiesen ist.

Wollen Sie herausfinden, wie es um die Datenqualität in Ihrem Unternehmen steht? Vereinbaren Sie eine kostenfreie 30-minütige Erstberatung mit unserem Team.

Tobias Lanzl, Hopmann Marketing Analytics

Tobias Lanzl ist Manager Data Analytics bei Hopmann Marketing Analytics und spezialisiert auf KI-gestützte Analyse-Architekturen an der Schnittstelle von semantischen Modellen, Context-Layern und Large Language Models. Als ehemaliger wissenschaftlicher Mitarbeiter und Dozent bringt er die Fähigkeit mit, komplexe Zusammenhänge so aufzubereiten, dass sie in der Praxis funktionieren und verstanden werden.


Folgen Sie Hopmann Marketing Analytics auf LinkedIn für weitere Einblicke in Marketing Analytics und KI.


Was wir häufig gefragt werden.

FAQ: Datenqualität im Marketing

Was gehört zu einem Data Quality Framework?

Ein Data Quality Framework besteht aus zwei Teilen: einer Bestandsaufnahme, die zeigt, wo Qualität in der Datenkette bricht, und einer laufenden Überwachung, die Abweichungen automatisch erkennt. Der zweite Teil ist der wichtigere, weil er aus einer einmaligen Analyse eine dauerhafte Absicherung macht.

Was sind die sechs Dimensionen der Datenqualität?

Vollständigkeit, Korrektheit, Eindeutigkeit, Aktualität, Konsistenz und Gültigkeit. Jede Dimension beschreibt eine andere Art von Qualitätsproblem, und sie können unabhängig voneinander auftreten. Ein Datensatz kann vollständig und aktuell sein und trotzdem Duplikate enthalten, die jede Aggregation verzerren. Die Trennung der Dimensionen macht es möglich, ein Qualitätsproblem präzise zu beschreiben, statt pauschal von schlechten Daten zu sprechen.

Warum ist Datenqualität für KI wichtiger als für klassisches Reporting?

Weil KI Daten interpretiert und nicht nur anzeigt. Ein Report mit fehlenden Daten zeigt meist eine Lücke, die jemandem auffällt. Ein Sprachmodell bekommt dieselben Daten und versucht, sie zu erklären. Im besten Fall erkennt es, dass die Information unvollständig sein könnte. Im schlechtesten Fall formuliert es auf Basis fehlerhafter oder fehlender Daten eine überzeugende Erklärung und präsentiert sie mit Bestimmtheit. Agentic AI verstärkt das zusätzlich, weil derselbe Fehler über viele Entscheidungen und Abläufe hinweg wiederholt werden kann.

Wie erkennt man, ob die eigene Datenqualität ein Problem ist?

Es gibt mehrere verlässliche Anzeichen. Verschiedene Tools zeigen unterschiedliche Zahlen für dieselbe Kennzahl. Meetings beginnen damit, entscheiden zu müssen, welche Zahl richtig ist. Analysten korrigieren Reports manuell nach, bevor sie sie weitergeben. Und es gibt Kennzahlen, die niemand freiwillig als Entscheidungsgrundlage nimmt, ohne sie vorher gegenzuprüfen. Wenn davon mehr als eines zutrifft, liegt das Problem vermutlich in den Daten und nicht in den Tools.

Wie lange dauert es, Datenqualität in den Griff zu bekommen?

Eine belastbare Bestandsaufnahme über die relevanten Datenquellen lässt sich typischerweise in drei bis vier Wochen erstellen. Wie lange die Behebung dauert, hängt vom Ausgangspunkt ab, aber die Arbeit lässt sich priorisieren. Man beginnt bei den Datenquellen und Qualitätsproblemen, die unmittelbar auf wichtige Geschäftsentscheidungen wirken, und arbeitet den Rest nach und nach ab. Perfekte Daten sind keine Voraussetzung, um mit KI weiterzugehen.

Wie unterstützt Hopmann Unternehmen beim Aufbau eines Data Quality Frameworks?

Wir sehen uns die bestehende Datenkette von der Anbindung der Quellsysteme bis zum Reporting an, bewerten sie entlang der sechs Dimensionen und priorisieren die Risiken nach ihrer Auswirkung auf das Geschäft. Daraus entsteht ein praxistaugliches Regelwerk mit klaren Zuständigkeiten und eine automatisierte Überwachung, die lange nach dem eigentlichen Projekt noch Nutzen bringt.