Wenn jemand fragt, ob die eigenen Daten bereit für KI sind, meint er meist etwas Einfaches: Wenn wir ein KI-Tool mit unseren Informationen verbinden, sind die Ergebnisse dann nützlich und sicher?
Die Antwort hängt weniger von der KI ab als von den Daten. Ein KI-Schritt kann nur mit dem arbeiten, was er erhält. Wenn Kundendatensätze doppelt vorhanden sind, Produktinformationen veraltet sind oder die richtigen Informationen über Postfächer und Tabellen verstreut sind, spiegelt die KI diese Probleme wider. Manchmal versteckt sie sie hinter selbstsicheren, gut formulierten Ergebnissen.
Das ist kein Grund zu warten, bis alles perfekt ist. Kein Unternehmen hat perfekte Daten. Ziel ist es zu wissen, was Sie haben, wo die Schwachstellen liegen und ob sie für den konkreten Prozess, den Sie verbessern möchten, eine Rolle spielen.
Datenbereitschaft ist auch keine einfache Ja-oder-Nein-Frage. Ihre Daten können für einen Anwendungsfall bereit sein, etwa das Zusammenfassen von Support-Tickets, und für einen anderen nicht, etwa das automatische Aktualisieren Ihres CRM.
Dieser Leitfaden erklärt:
- was „bereit für KI“ tatsächlich bedeutet
- die wichtigsten Prüfbereiche: Qualität, Zugriff, Speicherort, Berechtigungen, personenbezogene Daten, maßgebliche Quelle und Dubletten
- wie Sie entscheiden, ob Ihre Daten für einen ersten Schritt gut genug sind
- häufige Fehler bei der Datenvorbereitung
- eine praktische Checkliste, die Sie selbst ausfüllen können
Was bedeutet „Daten bereit für KI“?
Daten sind bereit für KI, wenn sie für eine bestimmte Aufgabe gut genug, zugänglich genug und sicher genug sind.
Diese Definition hat drei Teile:
- gut genug: korrekt, vollständig und einheitlich für die Entscheidungen, die die KI unterstützen soll
- zugänglich genug: der Workflow kann zuverlässig und kontrolliert auf die Daten zugreifen
- sicher genug: Sie wissen, welche Daten beteiligt sind, wer sie sehen darf und wohin sie gesendet werden
„Gut genug“ ist wichtig. Daten, die für einen von einer Person geprüften Antwortentwurf ausreichen, sind für eine automatisch ausgeführte Aktion vielleicht nicht gut genug. Je größer die Folgen eines Fehlers, desto höher die Messlatte.
Warum ist Datenbereitschaft so wichtig?
Die meisten enttäuschenden KI-Pilotprojekte scheitern an den Daten, nicht am Modell.
Typische Anzeichen sind:
- Antworten, die formal richtig, inhaltlich aber falsch sind
- unterschiedliche Ergebnisse für etwas, das derselbe Kunde oder dasselbe Produkt sein sollte
- ein Workflow, der mit Testbeispielen funktioniert und mit echten Datensätzen versagt
- KI-Ergebnisse auf Basis alter Informationen, deren Aktualisierung jemand vergessen hat
- personenbezogene Daten an Stellen, an denen sie nicht erscheinen sollten
Die Daten vor dem Aufbau zu prüfen, spart Zeit, weil Sie die Ursache einmal beheben, statt die Ergebnisse immer wieder zu korrigieren.
Sind Ihre Daten korrekt und vollständig?
Beginnen Sie mit der Qualität. Sie brauchen kein formelles Audit. Eine kleine, ehrliche Stichprobe ist meist aufschlussreich.
Korrektheit
Korrektheit bedeutet, dass die Daten die Wirklichkeit abbilden. Fragen Sie:
- Sind Kontaktdaten, Preise, Lagerbestände oder Status heute korrekt?
- Wann wurden diese Informationen zuletzt aktualisiert und von wem?
- Gibt es Felder, die nachlässig ausgefüllt werden, weil sie „sowieso niemand nutzt“?
Vollständigkeit
Vollständigkeit bedeutet, dass die Informationen, die die KI braucht, tatsächlich vorhanden sind. Fragen Sie:
- Welche Felder sind häufig leer?
- Liegt wichtiger Kontext in Freitextnotizen, Anhängen oder E-Mail-Verläufen statt in Feldern?
- Folgen ältere Datensätze anderen Regeln als neuere?
Einheitlichkeit
Einheitlichkeit bedeutet, dass dasselbe auf dieselbe Weise erfasst wird. Achten Sie auf:
- unterschiedliche Schreibweisen desselben Unternehmens oder Produkts
- Datums- und Zahlenangaben in gemischten Formaten
- Kategorien oder Tags, die sich überschneiden oder für verschiedene Personen Unterschiedliches bedeuten
- Status, die von verschiedenen Teams unterschiedlich verwendet werden
Uneinheitlichkeit ist oft schädlicher als fehlende Daten, weil sie schwerer auffällt.
Kann der Workflow auf die Daten zugreifen?
Daten, die existieren, sind nicht immer Daten, die ein Workflow nutzen kann.
Prüfen Sie, wie jede Quelle erreichbar ist:
- Bietet das Tool eine API, einen Export oder eine Integration mit Plattformen wie n8n oder Make?
- Erfordert der Zugriff ein persönliches Login, oder können Sie ein eigenes Konto oder einen eigenen Schlüssel für den Workflow anlegen?
- Gibt es Grenzen dafür, wie viele Daten gelesen werden können oder wie oft?
- Sind die Daten nur als PDFs, gescannte Dokumente oder Bilder verfügbar?
Daten, die nur über manuelle Exporte verfügbar sind, sind ein Warnsignal. Sie führen oft zu Workflows, die davon abhängen, dass jemand daran denkt, eine Datei herunterzuladen.
Wenn der Zugriff das Haupthindernis ist, geht es bei der Arbeit vielleicht mehr um Integration als um KI. Der Service API-Integrationen und Automatisierungen von D4Hub deckt diese Art von Arbeit ab.
Wo liegen die Daten?
Der Speicherort ist aus zwei Gründen wichtig: aus praktischen und aus rechtlichen.
Praktischer Speicherort
Listen Sie auf, wo die relevanten Daten heute gespeichert sind. In vielen kleinen und mittleren Unternehmen gehören dazu:
- ein CRM oder Helpdesk
- eine E-Commerce-Plattform
- gemeinsam genutzte Tabellen
- Cloud-Speicher und freigegebene Ordner
- E-Mail-Postfächer
- Buchhaltungs- oder ERP-Software
- Notizen in Projekt-Tools wie Notion oder Airtable
Je mehr Orte beteiligt sind, desto mehr Verbindungen braucht der Workflow und desto mehr Stellen gibt es, an denen etwas schiefgehen kann.
Geografischer und vertraglicher Speicherort
Es lohnt sich auch zu wissen, wo Daten verarbeitet und gespeichert werden, besonders wenn ein KI-Schritt sie an einen externen Dienst sendet. Prüfen Sie die Bedingungen und Einstellungen jedes Anbieters: wo Daten verarbeitet werden, ob sie gespeichert werden dürfen und ob sie zur Verbesserung der Dienste des Anbieters genutzt werden dürfen. Diese Details unterscheiden sich je nach Anbieter, Tarif und Einstellung. Lesen Sie daher die aktuelle Dokumentation, statt sich auf Annahmen zu verlassen.
Wer darf die Daten sehen und ändern?
KI-Workflows können den Zugang zu Informationen ungewollt ausweiten.
Ein Chatbot, der mit einem freigegebenen Laufwerk verbunden ist, kann zum Beispiel Fragen anhand von Dokumenten beantworten, die nur einige Mitarbeitende sehen sollten. Eine Automatisierung, die mit einem Administratorkonto läuft, kann womöglich weit mehr ändern als nötig.
Prüfen Sie:
- wer derzeit jede Datenquelle lesen und bearbeiten kann
- welches Konto der Workflow verwenden wird und was dieses Konto darf
- ob der Workflow Daten schreiben muss oder nur lesen
- ob das Ergebnis für Personen sichtbar wird, die die ursprünglichen Daten nicht sehen sollten
Ein guter Grundsatz ist, dem Workflow nur den Zugriff zu geben, den er braucht, und nicht mehr. Ein eigenes Konto mit eingeschränkten Berechtigungen ist meist sicherer als ein persönliches oder ein Administrator-Login.
Enthalten die Daten personenbezogene Informationen?
Viele Geschäftsprozesse betreffen personenbezogene Daten: Namen, E-Mail-Adressen, Telefonnummern, Anschriften, Bestellhistorie, Support-Unterhaltungen, Angaben zu Mitarbeitenden.
Wenn Sie in der Europäischen Union tätig sind oder Daten von Personen in der EU verarbeiten, gilt für personenbezogene Daten die DSGVO, ob KI beteiligt ist oder nicht. Ein KI-Schritt ändert daran nichts, kann aber neue Fragen aufwerfen, etwa welche Anbieter die Daten erhalten und auf welcher Grundlage.
Praktische Schritte, die meist helfen:
- ermitteln, welche Felder und Dokumente personenbezogene Daten enthalten
- prüfen, ob der KI-Schritt diese Daten wirklich braucht oder mit weniger auskommt
- personenbezogene Angaben entfernen oder maskieren, wo sie nicht nötig sind
- die Bedingungen zur Datenverarbeitung jedes beteiligten externen Dienstes prüfen
- sicherstellen, dass Logs und Testkopien personenbezogene Daten nicht länger als nötig aufbewahren
- die für den Datenschutz verantwortliche Person in Ihrem Unternehmen frühzeitig einbeziehen
Dieser Leitfaden ist keine Rechtsberatung. Bei Fragen zu Ihren konkreten Pflichten wenden Sie sich an eine qualifizierte Beratung. Je nach Anwendungsfall können auch andere Vorschriften wie der EU AI Act relevant sein. Die Seite KI-Compliance erklärt, wie D4Hub Sie auf technischer Seite und bei der Dokumentation unterstützen kann.
Welches System ist die maßgebliche Quelle?
Eine maßgebliche Quelle (Source of Truth) ist das System, das die offizielle, aktuelle Version einer Information enthält.
Probleme beginnen, wenn dieselbe Information an mehreren Orten existiert und niemand weiß, welche Version stimmt. Zum Beispiel:
- Kundendaten im CRM, in der E-Commerce-Plattform und in einer Tabelle, jeweils leicht unterschiedlich
- Produktbeschreibungen in einem gemeinsamen Dokument, auf der Website und in einer Lieferantendatei
- Preise in einer internen Liste, die nicht mit dem Shop übereinstimmt
Legen Sie für jede Datenart, die die KI nutzen wird, fest, welches System die maßgebliche Quelle ist. Der Workflow sollte aus diesem System lesen, und andere Kopien sollten von dort aktualisiert und nicht separat bearbeitet werden.
Wenn Sie sich nicht auf eine maßgebliche Quelle einigen können, ist das ein wichtiges Ergebnis. Das muss meist geklärt werden, bevor ein KI-Workflow zuverlässig arbeiten kann.
Wie ernst sind Dubletten?
Dubletten gehören zu den häufigsten Datenproblemen und zu den schädlichsten für KI und Automatisierung.
Sie führen dazu, dass:
- derselbe Kunde zweimal oder mit widersprüchlichen Informationen kontaktiert wird
- Berichte dasselbe mehrfach zählen
- KI-Zusammenfassungen verschiedene Datensätze vermischen oder verwechseln
- Automatisierungen eine Kopie aktualisieren und eine andere unverändert lassen
Prüfen Sie auf:
- dieselbe E-Mail-Adresse oder dasselbe Unternehmen in mehreren Datensätzen
- dasselbe Produkt mit leicht unterschiedlichen Namen oder Codes
- Kontakte, die von verschiedenen Formularen oder Importen ohne Abgleichregel angelegt wurden
Dubletten zu bereinigen lohnt sich oft schon vor jeder KI-Arbeit, weil es jeden Prozess verbessert, nicht nur den neuen. Legen Sie zuerst eine Abgleichregel fest und sichern Sie die Daten, bevor Sie etwas zusammenführen, da sich Zusammenführungen oft nur schwer rückgängig machen lassen.
Wie entscheiden Sie, ob Ihre Daten gut genug sind?
Sie müssen nicht alles beheben. Konzentrieren Sie sich auf die Daten, die der konkrete Prozess nutzt, den Sie verbessern möchten.
Ein praktischer Weg zur Entscheidung:
- Wählen Sie einen Prozess und listen Sie die Daten auf, die er nutzt.
- Nehmen Sie eine kleine Stichprobe echter Datensätze.
- Prüfen Sie jeden Datensatz auf die in diesem Leitfaden beschriebenen Probleme.
- Fragen Sie die für den Prozess verantwortliche Person: Wäre das Ergebnis akzeptabel, wenn die KI diese Datensätze nutzen würde?
- Entscheiden Sie, ob Sie fortfahren, mit einem menschlichen Prüfschritt fortfahren oder zuerst die Daten bereinigen.
Oft lautet die Antwort, mit einem begrenzten Pilotprojekt und einem menschlichen Prüfschritt fortzufahren und parallel die gravierendsten Datenprobleme zu beheben. Der Leitfaden dazu, was eine KI-Integrations-Roadmap enthalten sollte, erklärt, wie Sie dieses Pilotprojekt aufbauen.
Was sind die häufigsten Fehler?
- Annehmen, dass die KI die Daten bereinigt. KI kann helfen, Unstimmigkeiten zu erkennen, sollte aber nicht stillschweigend entscheiden, welche Version korrekt ist.
- Nur mit guten Beispielen testen. Echte Daten enthalten die Probleme, auf die es ankommt.
- Alles auf einmal verbinden. Beginnen Sie mit den Daten, die der Prozess mindestens braucht.
- Persönliche oder Administratorkonten für Workflows nutzen. Das weitet den Zugriff aus und macht Änderungen schwer nachvollziehbar.
- Freitextfelder ignorieren. Notizen und E-Mail-Verläufe enthalten oft den wichtigsten Kontext und die meisten personenbezogenen Daten.
- Logs und Kopien vergessen. Testexporte und Workflow-Logs können noch lange nach dem Test sensible Daten enthalten.
- Datenschutzfragen bis zum Schluss aufschieben. Während der Planung lassen sie sich leichter beantworten.
Wie sieht ein guter Zustand aus?
Daten, die für einen ersten KI-Anwendungsfall bereit sind, haben meist diese Merkmale:
- die für den Prozess verantwortliche Person weiß, welche Daten der Workflow nutzt
- für jede Datenart gibt es eine vereinbarte maßgebliche Quelle
- der Workflow kann über eine API oder eine stabile Integration auf die Daten zugreifen
- der Workflow nutzt ein eigenes Konto mit eingeschränkten Berechtigungen
- personenbezogene Daten sind ermittelt und auf das Nötige reduziert
- Dubletten in den relevanten Daten wurden geprüft
- die Anbieterbedingungen externer Dienste wurden geprüft
- es gibt einen Plan, wie die Daten nach dem Start korrekt gehalten werden
Nichts davon erfordert ein großes Projekt. Für einen Prozess genügen vielleicht einige konzentrierte Sitzungen.
Wie D4Hub helfen kann
D4Hub kann Ihnen helfen zu verstehen, ob Ihre Daten den geplanten KI-Workflow tragen können und was zuerst behoben werden sollte.
Je nach Situation unterstützt D4Hub Sie bei:
- der Darstellung, wo die relevanten Daten liegen und wie sie zwischen Tools fließen
- der Prüfung, welche Systeme APIs oder zuverlässige Integrationen bieten
- der Festlegung einer maßgeblichen Quelle für jede Datenart
- dem Erkennen von Dubletten und Unstimmigkeiten und der Planung einer sicheren Bereinigung
- der Einrichtung eigener Konten und eingeschränkter Berechtigungen für Workflows
- der Reduzierung personenbezogener Daten, die an externe Dienste gesendet werden
- der Gestaltung von Workflows in n8n, Make oder eigenem Code, die aus den richtigen Quellen lesen
- der Erstellung technischer Dokumentation zur Unterstützung von Datenschutz und Compliance
Sie können in jeder Phase Unterstützung anfragen, ob Sie ein erstes Pilotprojekt planen oder einen bereits laufenden Workflow überprüfen.
Support-Ticket eröffnenFür Praktiker: eine Checkliste zur Datenbereitschaft
Nutzen Sie diese Checkliste jeweils für einen Prozess. Sie ist so angelegt, dass Sie sie mit einer Tabelle oder einem Notizblock ausfüllen können, ganz ohne technische Tools.
Arbeiten Sie vor Beginn mit Kopien oder Ansichten, die nur Lesezugriff erlauben. Führen Sie während der Prüfung keine Datensätze zusammen, löschen Sie keine und bearbeiten Sie keine in großen Mengen. Wenn Sie Daten exportieren, speichern Sie die Datei sicher und löschen Sie sie, wenn Sie fertig sind.
Schritt 1: Listen Sie die Datenquellen auf
Notieren Sie für den gewählten Prozess jeden Ort, aus dem Daten stammen. Halten Sie für jede Quelle fest:
- den Namen des Tools oder der Datei
- wer verantwortlich ist
- wie darauf zugegriffen werden kann (API, Integration, Export, manuelle Kopie)
- ob sie personenbezogene Daten enthält
Schritt 2: Nehmen Sie eine kleine Stichprobe
Wählen Sie eine kleine Anzahl aktueller, echter Datensätze aus der Hauptquelle, zum Beispiel einige Dutzend. Nehmen Sie auch einige ältere Datensätze hinzu, da diese oft anderen Regeln folgen.
Schritt 3: Prüfen Sie die Qualität
Markieren Sie bei jedem Datensatz der Stichprobe:
- Felder, die leer sind, aber ausgefüllt sein sollten
- Informationen, die offensichtlich veraltet sind
- Werte mit einem anderen Format oder einer anderen Schreibweise als die übrigen
- wichtige Informationen, die nur in Notizen oder Anhängen stehen
Zählen Sie, wie viele Datensätze mindestens ein Problem aufweisen. So erhalten Sie Ihren eigenen Ausgangswert, ohne sich auf externe Zahlen zu stützen.
Schritt 4: Prüfen Sie auf Dubletten
In der Stichprobe und, wenn möglich, in der vollständigen Liste:
- sortieren Sie nach E-Mail-Adresse, Firmenname oder Produktcode
- suchen Sie nach Einträgen, die dasselbe doppelt erfassen
- notieren Sie, wie die Dubletten wahrscheinlich entstanden sind (Formular, Import, manuelle Eingabe)
Schritt 5: Vereinbaren Sie die maßgebliche Quelle
Notieren Sie für jede Datenart (Kunden, Produkte, Preise, Bestellungen, Dokumente), welches System die offizielle Version enthält. Wenn sich das Team nicht einig ist, markieren Sie das als offenen Punkt.
Schritt 6: Prüfen Sie die Berechtigungen
Beantworten Sie für jede Quelle:
- Welches Konto würde der Workflow verwenden?
- Muss er nur lesen oder auch schreiben?
- Könnte das Ergebnis Informationen an Personen weitergeben, die sie nicht sehen sollten?
Schritt 7: Prüfen Sie die personenbezogenen Daten
Listen Sie die beteiligten Felder mit personenbezogenen Daten auf und beantworten Sie für jedes:
- Braucht der KI-Schritt es wirklich?
- Lässt es sich entfernen, kürzen oder maskieren?
- Welche externen Dienste würden es erhalten?
Teilen Sie die offenen Fragen mit der für den Datenschutz verantwortlichen Person in Ihrem Unternehmen.
Schritt 8: Entscheiden Sie
Wählen Sie auf Grundlage der Checkliste eine von drei Optionen:
- mit einem Pilotprojekt fortfahren
- mit einem Pilotprojekt und einem verpflichtenden menschlichen Prüfschritt fortfahren
- zuerst bestimmte Datenprobleme beheben und dann neu bewerten
Wenn Sie die Ergebnisse mit D4Hub teilen, senden Sie die Zusammenfassung, nicht die Rohdaten, und geben Sie niemals Passwörter oder API-Schlüssel weiter.
Häufig gestellte Fragen
Müssen unsere Daten perfekt sein, bevor wir anfangen?
Nein. Sie müssen für die konkrete Aufgabe gut genug sein, mit bekannten Schwachstellen. Viele Unternehmen beginnen mit einem begrenzten Pilotprojekt und einem menschlichen Prüfschritt, während sie die Daten verbessern.
Kann KI helfen, unsere Daten zu bereinigen?
KI kann helfen, wahrscheinliche Dubletten, uneinheitliche Formate oder fehlende Felder zu finden, und Korrekturen vorschlagen. Die endgültige Entscheidung, welche Version korrekt ist, sollte normalerweise bei einer Person bleiben, und Änderungen sollten gesichert und nachvollziehbar sein.
Ist es sicher, Kundendaten an einen KI-Anbieter zu senden?
Das hängt vom Anbieter, vom Tarif, von den Einstellungen und von Ihren Pflichten ab. Lesen Sie die aktuellen Bedingungen des Anbieters zur Datenverarbeitung, senden Sie nur die notwendigen Daten und beziehen Sie Ihre Ansprechperson für Datenschutz ein. Dieser Leitfaden ist keine Rechtsberatung.
Was, wenn unsere Daten überwiegend in Tabellen und E-Mails liegen?
Das ist häufig und machbar. Es bedeutet meist, dass es in den ersten Schritten um Struktur und Zugriff geht: eine maßgebliche Quelle festlegen, wichtige Informationen in Felder überführen und zuverlässige Verbindungen schaffen. D4Hub kann bei der Planung dieser Arbeit helfen.
Wie wählen wir eine maßgebliche Quelle aus?
Wählen Sie das System, in dem die Daten entstehen oder am sorgfältigsten gepflegt werden und in dem das Team bereits nach der offiziellen Version sucht. Sorgen Sie dann dafür, dass andere Systeme daraus lesen, statt eigene Kopien zu führen.
Hindert uns die DSGVO daran, KI zu nutzen?
Die DSGVO verbietet KI nicht. Sie legt Regeln für die Verarbeitung personenbezogener Daten fest, die mit und ohne KI gelten. Die beteiligten personenbezogenen Daten zu reduzieren und die Anbieterbedingungen zu prüfen, sind gute Ausgangspunkte, zusammen mit einer Beratung, die zu Ihrer Situation passt.
Kann D4Hub unsere Datenlandschaft prüfen, ohne Zugriff auf alles zu haben?
Ja. Eine erste Prüfung kann oft mit einer Beschreibung Ihrer Tools, einer Liste der Datenquellen und einigen anonymisierten Beispielen beginnen. Weiterer Zugriff kann später vereinbart werden, mit eigenen Konten und eingeschränkten Berechtigungen.