Hier ist ein Fehler, den ich schon öfter gesehen habe. Ein Analyst erstellt einen wöchentlichen Umsatzbericht, der Daten aus Salesforce, einer Gebietsdatei und einem Finanzexport bezieht. Beim ersten Mal funktioniert alles. Dann, eine Woche später, fallen die Zahlen etwas niedrig aus. Nicht besonders niedrig, aber niedrig genug, um jemanden stutzig zu machen. Nach einigem Nachforschen stellt sich heraus, dass das Problem ziemlich banal ist: Die Gebietsdatei enthält die vollständigen Namen der Bundesstaaten, Salesforce exportiert Zwei-Buchstaben-Codes, und die Verknüpfung zwischen ihnen verwirft unbemerkt jeden Datensatz, der nicht übereinstimmt. Kein Fehler. Keine Warnung. Nur fehlende Zeilen in einem Bericht, der bereits an den VP ging.
Der Analyst hatte kein Problem mit der Technik. Er wusste, wie man zwei Tabellen verknüpft. Das Problem bestand darin, dass die Fehlerbehebung aus einer Reihe manueller Schritte bestand, die man sich merken und wiederholen musste. Genau hier scheitert ein Großteil der Bereinigungsarbeit. Die Daten einmal zu bereinigen, ist meist nicht der schwierige Teil. Dass die Daten bei jeder Aktualisierung sauber bleiben, ist entscheidend.
In diesem Beitrag erfahren Sie, wie Sie die Bereinigungsschritte, die die meisten Data Analysts bereits kennen, in eine Workflow-Logik umwandeln, die bei der nächsten Ausführung Bestand hat, nicht nur bei der ersten.
Warum die Bereinigung so schnell monoton wird
Der erste Durchgang ist in der Regel machbar. Sie entscheiden, welche Zeilen als Duplikate gelten, wie fehlende Werte behandelt werden und welchen Feldern Sie als Verknüpfungsschlüssel vertrauen können. Dann wird die nächste Datei mit einer umbenannten Spalte, einem neuen Kategoriewert oder einem Datumsfeld angezeigt, dessen Format ohne Vorankündigung geändert wurde.
Einige Fehlermuster tauchen immer wieder auf.
Unbemerkte Schemaunterbrechungen. Eine Spalte ändert sich vorgelagert, aber Ihr Workflow verweist immer noch auf den alten Feldnamen. Der Prozess wurd abgeschlossen, erzeugt eine Ausgabe und technisch gesehen schlägt nichts fehl. Das Ergebnis ist einfach falsch.
Dieselbe Vorbereitungsarbeit bei jeder Aktualisierung. Bevor jemand die eigentliche Geschäftsfrage beantworten kann, muss er die gleiche Bereinigung erneut durchführen. Wenn sich die Quelle ändert, wird die Vorbereitung in der Regel etwas chaotischer und langsamer.
Bereinigungslogik, die nur einer Person bekannt ist. Manche Teams verlassen sich auf die Analystin, die weiß, welche Konten immer mit dem falschen Währungscode eingehen oder welches Quellsystem gerne nachgestellte Leerzeichen zu Schlüsselfeldern hinzufügt. Das funktioniert so lange, bis diese Person ausfällt oder das Unternehmen verlässt.
Korrekturen so hinterlegen, dass sie auch beim nächsten Aktualisieren Bestand haben
Die Techniken selbst sind vertraut. Der schwierigere Teil besteht darin, sie dauerhaft zuverlässig zu machen. Im Folgenden werden die gängigen Bereinigungsaufgaben beschrieben, die bei Datenänderungen häufig fehlschlagen, sowie die Workflow-Muster, die ihre Zuverlässigkeit erhöhen.
Deduplizierung
Duplikate werden knifflig, wenn es keine exakten Kopien sind. Möglicherweise haben Sie denselben Kunden in einem CRM-Export und in einer regionalen Tabelle mit einem etwas anderen Firmennamen. Manuell werden verdächtige Paare gescannt und eine Entscheidung getroffen. In einem Workflow werden die Übereinstimmungsfelder und der Schwellenwert einmalig definiert und diese Logik dann bei jedem Durchlauf angewendet.
Das Fuzzyübereinstimmung-Tool eignet sich gut zum Erkennen wahrscheinlicher Übereinstimmungen. Es bewertet nicht identische Datensätze mithilfe konfigurierbarer Abgleichfelder und Abgleichstile wie Firmenname, Adresse und Phonetik. Es entscheidet nicht für Sie, welchen Datensatz Sie behalten. Dieser Teil muss weiterhin nachgelagert mit Tools wie „Gruppe erstellen“, „Sortieren“, „Zusammenfassen“ oder „Formel“ erstellt werden.
Dennoch ist es eine bedeutende Verbesserung, die Erkennungslogik in den Workflow zu integrieren. Dieselben Felder werden jedes Mal auf die gleiche Weise überprüft, und eine andere Person kann überprüfen, welche Regel verwendet wurde.
Umgang mit Nullwerten
Ein fehlendes Enddatum in einer Prognose sollte die Ausgabe eines Berichts verhindern. Ein fehlender zweiter Vorname in einer Kundendatei ist wahrscheinlich irrelevant. Der Nullwert selbst gibt keine Auskunft über das weitere Vorgehen. Der Workflow muss dies tun.
Das Datenbereinigung-Tool kann Nullwerte durch Leerzeichen (für Zeichenfolgenfelder) oder durch Nullen (für numerische Felder) ersetzen. Wenn Sie eine spezifischere Füllstrategie benötigen, kann das Imputation-Tool berechnete oder angegebene Werte ersetzen. Sollte in einem kritischen Feld dennoch ein Nullwert durchrutschen, kann ein Filter-Tool diese Zeilen an eine Prüfausgabe weiterleiten, anstatt sie im weiteren Verlauf zu verarbeiten.
Standardisierung von Formaten
In einer Datei steht „CA“ und in einer anderen „Kalifornien“. Ein System exportiert Datumsangaben als Text und ein anderes speichert sie als tatsächliche Datumswerte. Wenn Sie manuell bereinigen, müssen Sie diese Inkonsistenzen jedes Mal beheben. In einem Workflow können Sie diese Bereinigung in einen wiederholbaren Zuordnungsschritt verschieben.
Das Suchen-Ersetzen-Tool ist hier nützlich. Eine Referenztabelle ordnet eingehende Varianten einem Standardwert zu, und der Workflow wendet diese Zuordnung automatisch an.
Der Haken ist, dass Werte, die in der Referenztabelle fehlen, normalerweise unverändert übernommen werden. Das ist in Ordnung, bis ein neuer Wert auftaucht und niemand es bemerkt. Wenn Ihnen dieser Fall wichtig ist, sollten Sie ihn gezielt berücksichtigen. Ein Filter kann nicht übereinstimmte Werte isolieren, und ein Meldungstool kann eine Warnung auslösen, sodass der Vorgang nicht fehlerfrei erscheint, obwohl er es nicht ist.
Vorbereitung der Verknüpfungsschlüssel
Eine fehlgeschlagene Verknüpfung ist ärgerlich. Eine Verknüpfung, die scheinbar funktioniert, aber Datensätze unbemerkt verwirft, ist schlimmer.
Das geschieht in der Regel, weil die Schlüssel nicht wirklich quellübergreifend ausgerichtet sind. Möglicherweise enthält eine Datei nachgestellte Leerzeichen, eine andere verwendet eine andere Groß- und Kleinschreibung und eine dritte hat irgendwo im Export ein Sonderzeichen übernommen.
Die Lösung ist im Prinzip einfach: Normalisieren Sie die Schlüssel vor der Verknüpfung. Entfernen Sie Leerzeichen, standardisieren Sie Groß- und Kleinschreibung und entfernen Sie Sonderzeichen mit der Datenbereinigung oder einem Formel-Tool. Verknüpfen Sie dann die bereinigten Felder anstelle der Rohfelder.
Es lohnt sich auch, die Join-Ausgaben im Nachhinein zu überprüfen. Zählen Sie übereinstimmende und nicht übereinstimmende Datensätze mit „Datensätze zählen“ oder „Zusammenfassen“, und verwenden Sie dann ein Test-Tool oder eine Formel, um sicherzustellen, dass das Ergebnis noch innerhalb der Grenzen liegt. Das ist die Workflow-Version davon, eine verdächtige Summe zu bemerken und zu beschließen, der Sache nachzugehen, bevor Sie etwas veröffentlichen.
Validierung der Ausgabe
Bestätigung ist meist das Erste, was übersprungen wird, wenn eine Frist knapp ist. Dabei ist sie eine der einfachsten Möglichkeiten, unbemerkte Schäden durch fehlerhafte Workflows zu verhindern.
Das Test-Tool wurde dafür entwickelt. Sie können Prüfungen konfigurieren, z. B. ob die Anzahl der Datensätze einem erwarteten Wert entspricht, ob eine Ausgabeanzahl mit einer Eingabeanzahl übereinstimmt oder ob ein Ausdruck für jede Zeile gilt.
In Kombination mit der Laufzeiteinstellung „Workflow bei Fehler abbrechen“ stoppt eine fehlgeschlagene Prüfung den Lauf, bevor fehlerhafte Ergebnisse in nachgelagerte Prozesse gelangen. Das ist fast immer günstiger, als schlechte Zahlen zu erklären, nachdem sie bereits geteilt wurden.
Vorgelagerte Schemaänderungen erkennen
Wenn „Close_Date“ beim nächsten Export zu „Opportunity_Close_Date“ wird, sollten Sie dies wissen, bevor die Hälfte des Workflows mit unvollständigen Daten ausgeführt wird.
Es gibt kein Tool, das dies vollständig abdeckt, aber Sie können die Prüfung selbst erstellen. Das Feldinformationen-Tool zeigt die Namen und Typen der eingehenden Felder an. Dort können Sie die Ergebnisse mit den Erwartungen des Workflows vergleichen und anschließend mithilfe eines Formel-, Test- oder Meldungsschritts frühzeitig einen Fehler ausgeben, sobald sich etwas Wichtiges geändert hat.
Die Hauptsache ist die Platzierung. Führen Sie diese Prüfung zuerst durch, bevor der Workflow so weit fortgeschritten ist, dass die Ausgabe plausibel erscheint.
Erstellen des Workflows in einer sinnvollen Reihenfolge
Ein paar praktische Regeln sind wichtiger als alle anderen.
Notieren Sie sich die Bereinigungsregeln, bevor Sie mit der Erstellung beginnen. Machen Sie deutlich, welche Felder ein Duplikat definieren, was mit jedem kritischen Nullwert geschehen soll und welche Schlüssel welche Quellen verbinden. Wenn die Logik während der Erstellung unklar ist, ist sie dies auch nach der Planung des Workflows.
Normalisieren Sie die Daten vor der Verknüpfung. Wenn zwei Quellen denselben Wert unterschiedlich darstellen, beheben Sie dies vor der Verknüpfung, anstatt später fehlende Datensätze zu beheben.
Halten Sie Ausnahmepfade transparent. Unbekannte Werte, fehlgeschlagene Übereinstimmungen und ungültige Nullwerte sollten an einer offensichtlichen Stelle erfasst werden. Ein Prüfergebnis ist viel einfacher zu handhaben als ein fehlerhafter Datensatz, der in einen Abschlussbericht integriert wird.
Testen Sie mit der tatsächlichen, fehlerhaften Datei. Eine saubere Stichprobe ist gut für die Einrichtung, aber sie sagt Ihnen nicht, ob der Workflow den Daten standhält, die an einem Freitagnachmittag tatsächlich exportiert werden.
Automatisieren Sie nicht alles. Wenn die Analyse wirklich einmalig ist, lohnt es sich möglicherweise nicht, einen Workflow zu erstellen. Das bessere Ziel sind wiederkehrende Arbeiten, bei denen die gleiche Bereinigung immer wieder durchgeführt wird und sich die Quelle auf vertraute Weise ändert.
Wie diese Schritte in der Praxis aussehen
Ein konkretes Beispiel verdeutlicht dies. Angenommen, eine Vertriebsanalystin gleicht den wöchentlichen Umsatz über Salesforce, eine Tabelle zur Gebietszuordnung und einen Finanzexport in Alteryx One ab. Bevor der Workflow existierte, dauerte der Prozess jede Woche ein paar Stunden: Dateien exportieren, inkonsistente Felder manuell korrigieren, nicht übereinstimmende Gebietswerte bearbeiten und dann die Summen überprüfen, bevor der Bericht gesendet wird.
Die im Eingangsbeispiel erwähnte Gebietsabweichung ist genau das Problem, das eine Automatisierung sinnvoll macht. Salesforce exportiert zweibuchstabige Bundeslandcodes. Die Gebietsdatei verwendet vollständige Namen. Wenn Sie diese Felder so verknüpfen, wie sie sind, gehen Datensätze unbemerkt verloren.
In der Praxis sieht der Workflow ziemlich einfach aus:
- Zuerst standardisieren. Ein Suchen-Ersetzen-Schritt ordnet vollständige Bundeslandnamen zweistelligen Codes zu, sodass beide Quellen dasselbe Format verwenden.
- Vor der Verknüpfung normalisieren. Datenbereinigungs- oder Formelschritte entfernen Leerzeichen, standardisieren Groß- und Kleinschreibung und entfernen unerwünschte Zeichen aus Schlüsselfeldern.
- Die Verknüpfung sichtbar machen. Die Verknüpfungslogik befindet sich in gekennzeichneten Workflow-Schritten und nicht im Gedächtnis oder in einer einmaligen Tabellenkalkulationsbearbeitung.
- Ausnahmen weiterleiten. Datensätze mit nicht übereinstimmenden Gebietswerten werden in eine Prüfausgabe ausgegeben, anstatt unbemerkt verloren zu gehen.
- Vor der Ausgabe validieren. Ein Testschritt prüft die Zeilenanzahl anhand der Erwartungen, bevor der Bericht nachgelagert erstellt wird.
- Die Ausführung planen. Sobald der Workflow stabil ist, wird er in regelmäßigen Abständen ausgeführt und die Analystin überprüft Ausnahmen, anstatt den Prozess von Grund auf neu zu erstellen.
Das ist der praktische Wandel, den Alteryx ermöglicht. Die Logik für die Datenvorbereitung und -transformation wird in einen visuellen, überprüfbaren Workflow überführt. Die Datenvorbereitungs- und Transformationsschritte, die früher in manuellen Bearbeitungen ausgeführt wurden, befinden sich jetzt in einem prüfbaren, wiederholbaren Workflow, den die IT überwachen und verwalten kann, ohne für die alltägliche Logik verantwortlich zu sein.
Was sich ändert, wenn Ihr Bereinigungsprozess automatisiert wird
Der größte Vorteil beschränkt sich nicht nur auf die Geschwindigkeit. Der Prozess wird vertrauenswürdiger und leichter nachvollziehbar.
Nachvollziehbarkeit ersetzt das Gedächtnis. Wenn jemand fragt, warum sich eine Zahl geändert hat, findet sich die Antwort im Workflow. Die Verknüpfungen, Standardisierungsregeln, Ausnahmepfade und Validierungsprüfungen sind sichtbar, anstatt im Gedächtnis einer Person.
Konsistenz ersetzt Variabilität. Bei jeder Aktualisierung gelten dieselben Bereinigungsregeln. Weicht die Quelle ab, erkennt der Workflow dies eher als Ausnahme, als dass sie unbemerkt in die Endausgabe gelangt.
Data Analysts können ihre Zeit für die Interpretation nutzen. Anstatt zwei Stunden damit zu verbringen, denselben wöchentlichen Bericht erneut zu bereinigen, können Data Analysts herausfinden, warum sich die Zahl geändert hat und welche nächsten Schritte für das Unternehmen notwendig sind.
Das ist der praktische Wert KI-gestützter Datenvorbereitung: KI ersetzt nicht den Analysten, sondern eine saubere, automatisierte Datengrundlage, die dem Analysten Raum gibt, sein Urteilsvermögen dort einzusetzen, wo es wirklich zählt. Gartner hat die Datenqualität als grundlegendes Hindernis für die Einführung von KI in der Analyse identifiziert, und die Daten- und Analyseprognosen für 2026 deuten auf einen wachsenden Druck auf Analyseteams hin, diese Lücke zu schließen. Forrester bestätigt dies: KI-Systeme entwickeln sich rasant, doch Menschen und die Datenbereitschaft hinken noch hinterher. Workflow-Automatisierung ist der Schlüssel, um die fehlende Daten-Readiness zu beheben.
Erste Schritte
Alteryx One unterstützt den oben beschriebenen Workflow: visuelle Datenaufbereitung und -transformation in einer kontrollierten, auditierbaren Umgebung, in der Data Analysts die Geschäftslogik verantworten und die IT-Abteilung die Aufsicht und Kontrolle übernimmt. Es gibt verschiedene Möglichkeiten, Alteryx One anhand Ihrer eigenen wiederkehrenden Workflows zu evaluieren:
- Kostenlose Testversion: Starten Sie eine Testversion der Datenvorbereitung und erstellen Sie eine wiederverwendbare Version eines Bereinigungs-Workflows, den Sie derzeit manuell ausführen. Für den Einstieg ist kein technischer Einrichtungsaufwand erforderlich.
- Fordern Sie eine Demo an: Wenn Sie die oben beschriebenen Workflow-Schritte für einen spezifischen Use Case konfiguriert sehen möchten, fordern Sie eine Demo an, um den Ablauf in Ihrem Kontext kennenzulernen.
- Stärken Sie die interne Argumentation: Wenn Sie eine interne Freigabe anstreben, erläutert der Überblick zur Self-Service-Datenaufbereitung die geschäftlichen Vorteile in einer Form, die sich besonders für diese Gespräche eignet.
