Werbekosten, Bestellungen und Retouren liegen in drei Systemen, und keines kennt die anderen. Ein Data Warehouse beantwortet keine neuen Fragen, es macht die alten überhaupt beantwortbar: welcher Kanal Gewinn bringt, nicht nur Klicks. Was der Aufbau verlangt und wann er sich nicht lohnt.

Was ein Data Warehouse ist und was es nicht ist

Ein Data Warehouse ist eine zentrale Datenbank, die Daten aus mehreren Quellsystemen zusammenführt, vereinheitlicht und für Auswertungen bereithält. Der Unterschied zu den Datenbanken, die Ihr Shop oder Ihr CRM betreiben, liegt im Zweck: Operative Datenbanken sind auf schnelle Einzelvorgänge optimiert, ein Warehouse auf Abfragen über große Zeiträume.

Drei Abgrenzungen, die in Projektgesprächen regelmäßig fehlen:

  • Kein Dashboard. Das Warehouse liefert die Datenbasis, die Visualisierung passiert darüber, etwa in Looker Studio, Power BI oder Tableau.
  • Kein Ersatz für Web-Analyse. Es ergänzt Google Analytics 4, weil es Daten aufbewahrt und verknüpft, die dort nicht zusammenkommen.
  • Kein reines Marketing-Werkzeug. Finanzen, Vertrieb und Logistik nutzen dieselbe Infrastruktur. Genau das ist ein Argument für das Budget und gegen einen Alleingang der Marketingabteilung.

Wer die strategische Ebene dahinter sucht, also die Frage, warum Datenarchitektur zur Führungsaufgabe wird, findet sie im Beitrag zum modernen Marketing-Daten-Stack. Hier geht es um die Umsetzung.

Wann sich der Aufwand lohnt, und wann nicht

Ein Warehouse ist kein Standardbaustein für jede Website. Es lohnt sich, wenn mindestens zwei dieser Bedingungen zutreffen:

  • Sie geben monatlich fünfstellige Media-Budgets aus und können Kanäle nicht nach Ergebnis, sondern nur nach Plattform-Kennzahlen bewerten.
  • Umsatz, Marge oder Retouren entscheiden über den Erfolg, liegen aber nur im Shop- oder ERP-System.
  • Ihr Verkaufszyklus ist länger als die Aufbewahrungsfristen Ihrer Analysewerkzeuge.
  • Mehrere Personen bauen jeden Monat dieselben Berichte manuell aus Exporten zusammen.

Es lohnt sich nicht, wenn die Berichte in den Plattformen ausreichen, wenn niemand die Pflege übernehmen kann oder wenn das eigentliche Problem eine unsaubere Messung ist. Ein Warehouse auf lückenhaften Daten liefert dieselben Lücken, nur teurer und mit mehr Nachkommastellen. Wer erst die Ereignisse und die Einwilligungssignale in Ordnung bringt, gewinnt oft mehr als mit jedem Infrastrukturprojekt.

Die Bausteine einer Marketing-Datenplattform

Schicht Aufgabe Verbreitete Werkzeuge
Quellen liefern Rohdaten GA4, Google Ads, Search Console, Meta Ads, Shop, CRM, ERP
Beladung holt Daten ab und schreibt sie unverändert ins Warehouse native Exporte, Airbyte, Fivetran, eigene Skripte
Speicher speichert und rechnet BigQuery, Snowflake, Amazon Redshift
Transformation vereinheitlicht, verknüpft, dokumentiert dbt
Semantische Schicht legt Kennzahlendefinitionen einmal verbindlich fest dbt Semantic Layer, LookML, Cube
Auswertung zeigt und verteilt Looker Studio, Power BI, Tableau

Quelle: Produktdokumentationen der genannten Anbieter (abgerufen August 2026).

Die Schichten sind ein Denkmodell, keine Produktkategorien: Mehrere Anbieter decken gleich mehrere davon ab. Databricks ist ein Lakehouse und verbindet Speicherung, Transformation, maschinelles Lernen und Auslieferung; Microsoft Fabric ist eine Suite über den gesamten Stack, von der Beladung über OneLake bis zur integrierten Auswertung in Power BI. Wer Fabric mit BigQuery vergleicht, vergleicht in Wahrheit eine Suite mit einer einzelnen Schicht. Die Reihenfolge beschreibt den heute üblichen ELT-Ansatz: erst laden, dann im Warehouse transformieren. Das klassische ETL, bei dem vor dem Laden transformiert wird, ist nicht falsch, verlagert die Rechenlast aber nach außen und erschwert das Nachvollziehen von Änderungen.

Eine Marktveränderung sollten Sie bei der Werkzeugwahl kennen: Fivetran und dbt Labs haben ihre Fusion am 1. Juni 2026 abgeschlossen, angekündigt war sie im Oktober 2025. Damit liegen Beladung und Transformation, in der Tabelle noch zwei getrennte Schichten, organisatorisch in einer Hand. Der Kern der dbt Fusion Engine ist seit Juni 2026 als dbt Core 2.0 unter Apache-2.0-Lizenz verfügbar; Fusion selbst erweitert diese Basis um Zusatzfunktionen, teils kostenlos, teils kostenpflichtig.¹ Für laufende Projekte heißt das vor allem: Lizenz- und Roadmap-Fragen vor einer Festlegung klären.

Der günstigste Einstieg: GA4-Export nach BigQuery

Bevor Sie ein Projekt aufsetzen, aktivieren Sie den BigQuery-Export in GA4. Er liefert Ereignisdaten auf Rohebene, ungesampelt, im täglichen Export bis zu einer Million Ereignisse pro Tag bei Standard-Properties. Der Streaming-Export hat kein Volumenlimit und kostet 0,05 US-Dollar pro Gigabyte, wobei rund 600.000 Ereignisse etwa einem Gigabyte entsprechen; Speicher- und Abfragekosten in BigQuery kommen hinzu.²

Damit haben Sie für kleines Geld genau das, woran die Auswertung in der Oberfläche scheitert: unbegrenzte Historie, keine Kardinalitätsgrenzen, freie Verknüpfung mit anderen Tabellen. Ein Hinweis aus der Praxis: Beim Streaming-Export fehlen Angaben zur Traffic-Quelle für neue Nutzer und neue Sitzungen.² Für Kampagnenauswertungen brauchen Sie den täglichen Export.

Vier Auswertungen, die erst im Warehouse möglich werden

Kanäle nach Deckungsbeitrag statt nach Klickkosten

Die häufigste Fehlsteuerung im Performance-Marketing entsteht, weil Media-Kosten und Warenkorbwerte in verschiedenen Systemen liegen. Eine Kampagne mit vielen Bestellungen, hoher Retourenquote und niedriger Marge kann schlechter abschneiden als eine mit halb so vielen Bestellungen. Sichtbar wird das erst, wenn Werbekosten, Umsatz, Retouren und Wareneinsatz in einer Tabelle stehen. Ab diesem Punkt diskutieren Sie über Deckungsbeitrag statt über Cost-per-Click.

Kampagnenwirkung ohne vollständige Nutzerdaten

Weil Einwilligungslücken und Plattformgrenzen die nutzerbasierte Zuordnung schwächen, gewinnt ein älterer Ansatz zurück an Bedeutung: Marketing-Mix-Modelling. Es schätzt den Beitrag von Kanälen aus aggregierten Zeitreihen von Ausgaben und Ergebnissen, ohne einzelne Nutzer zu verfolgen.

Google stellt dafür seit Januar 2025 Meridian bereit, ein quelloffenes Framework auf Basis bayesscher Kausalinferenz, das für Budgetallokation, Reichweiten- und Frequenzfragen und die Einbindung von Incrementality-Experimenten gedacht ist.³ Voraussetzung ist eine saubere, ausreichend lange Zeitreihe, und die liegt genau dort, wo das Warehouse steht.

Suchdaten über die Grenzen der Oberflächen hinaus

Search-Console-Daten sind in der Oberfläche zeitlich und im Zeilenumfang begrenzt. Über die Schnittstelle in ein Warehouse geladen, lassen sich Suchanfragen über Jahre hinweg gruppieren, mit Positionsverläufen und mit Ergebnissen aus der Suchmaschinenwerbung zusammenführen. Damit werden Fragen beantwortbar, die sonst Schätzung bleiben: Wo lohnt sich das Anzeigenbudget, obwohl organisch gute Positionen bestehen, und wo ersetzt organische Sichtbarkeit bezahlte Klicks.

Langzeitreihen jenseits der Aufbewahrungsfristen

Web-Analyse-Werkzeuge löschen Rohdaten nach festgelegten Fristen. Ein Warehouse tut das nur, wenn Sie es anweisen. Für Saisongeschäfte und lange Entscheidungswege ist das der eigentliche Grund für den Aufbau: Ein Jahresvergleich mit drei Vorjahren ist keine Analysefrage, sondern eine Speicherfrage.

Was die Einwilligungslage für das Warehouse bedeutet

Ein Warehouse macht Datenlücken nicht kleiner, es macht sie sichtbar. Zwei Konsequenzen:

  1. Gemessene und modellierte Werte getrennt halten. Wer beides in einer Spalte summiert, verliert die Möglichkeit, Abweichungen zu erklären. Die Grundlagen dazu stehen im Beitrag zum Google Consent Mode.
  2. Aggregierte Verfahren einplanen. Je unvollständiger die nutzerbezogene Zuordnung, desto wichtiger werden Modelle auf Zeitreihenebene und Experimente mit Kontrollgruppen.

Einen Nebeneffekt der Plattformentwicklung sollten Sie dabei einordnen: Google hat im April 2025 bestätigt, den bisherigen Ansatz bei Third-Party-Cookies beizubehalten, also keinen neuen Auswahldialog einzuführen, und im Oktober 2025 einen großen Teil der Privacy-Sandbox-Schnittstellen eingestellt. Der Statusseite vom 14. August 2026 zufolge ist die Abschaltliste seither weiter gewachsen, unter anderem um Fenced Frames und den Aggregation Service, und Google führt inzwischen eine eigene Kategorie für Technologien, die gar nicht erst starten. Weitergeführt werden unter anderem CHIPS, FedCM und Private State Tokens; für die Attributionsmessung verweist Google auf laufende Standardisierungsarbeit im W3C.⁴ Die technische Ablösung des Cookies ist damit nicht abgeschlossen, sondern verschoben. Wer seine Messung auf eigene Daten stellt, ist von diesen Kurswechseln weniger abhängig.

Datenschutz und Betrieb: die unbequemen Pflichten

Ein Warehouse verschiebt personenbezogene Daten in ein neues System, und damit verschieben sich Pflichten. Was in jedes Projekt gehört:

  • ein dokumentierter Zweck je Datenbestand,
  • ein Löschkonzept mit technisch umgesetzten Fristen,
  • Auftragsverarbeitungsverträge mit allen beteiligten Anbietern,
  • eine geklärte Rechtsgrundlage für die Zusammenführung von Marketing- und Kundendaten,
  • Rollen und Zugriffsrechte, die nicht „alle lesen alles" lauten.

Zum Drittlandtransfer: Der Angemessenheitsbeschluss zum EU-US Data Privacy Framework gilt weiter, das Gericht der Europäischen Union hat eine Nichtigkeitsklage am 3. September 2025 abgewiesen. Abschließend geklärt ist damit nichts: Gegen die Entscheidung ist seit dem 31. Oktober 2025 ein Rechtsmittel beim Gerichtshof anhängig, und nach dem Urteil des US Supreme Court vom 29. Juni 2026 zur Unabhängigkeit der FTC hat der Europäische Datenschutzausschuss die Kommission zur Überprüfung des Beschlusses aufgefordert, weil er an mehreren Stellen genau auf diese Unabhängigkeit verweist.⁵ Die datenschutzrechtliche Bewertung Ihres konkreten Aufbaus gehört in anwaltliche Prüfung.

KI auf dem Warehouse: Text-to-SQL und Agenten

Der praktische Nutzen von KI liegt hier nicht in Vorhersagen, sondern im Zugang. Wenn Fachabteilungen Fragen in natürlicher Sprache stellen können, sinkt die Abhängigkeit von wenigen Personen mit SQL-Kenntnissen.

Belegbar verfügbar ist das etwa bei Snowflake: Cortex Analyst für die Übersetzung von Fragen in SQL und Cortex Agents für mehrstufige Auswertungen, mit dokumentierten Verbesserungen im Verlauf von 2026.⁶ Die Einschränkung ist immer dieselbe: Die Antwortqualität hängt an der Modellierung. Ein Agent, der auf undokumentierte Rohtabellen zugreift, erzeugt plausible falsche Zahlen. Genau deshalb ist die Transformationsschicht mit ihrer Dokumentation kein Luxus, sondern die Voraussetzung dafür, dass KI-Zugriffe brauchbar sind. Wie weit solche Systeme in operative Marketingprozesse hineinreichen, behandelt der Beitrag zum Agentic Marketing.

Wo Projekte scheitern

  • Kein Eigentümer. Ohne benannte Zuständigkeit für Datenmodell und Definitionen driften Kennzahlen auseinander, bis zwei Berichte zwei Umsätze zeigen.
  • Zu viele Quellen zu früh. Zwei Quellen, eine belastbare Auswertung, dann erweitern. Nicht umgekehrt.
  • Uneinheitliche Definitionen. Wenn „Lead" in vier Systemen vier Bedeutungen hat, ist das ein Organisationsproblem, kein technisches.
  • Kosten ohne Kontrolle. Abfragen auf großen Tabellen kosten Geld. Ein Dashboard, das stündlich alles neu berechnet, ist der teuerste Weg zur gleichen Zahl.
  • Kein Abnahmekriterium. Vor dem Start festlegen, welche drei Fragen das Warehouse beantworten soll. Wer das nicht kann, sollte nicht anfangen.

Häufige Fragen zum Data Warehouse im Marketing

Was ist ein Data Warehouse im Marketing?

Eine zentrale Datenbank, die Marketing-, Website- und Geschäftsdaten aus verschiedenen Systemen zusammenführt und für Auswertungen vorhält. Sie ersetzt keine Analysewerkzeuge, sondern verbindet ihre Daten mit Umsatz-, Kosten- und Kundendaten und bewahrt sie länger auf.

Was ist der Unterschied zwischen Data Warehouse und Data Lake?

Ein Data Warehouse speichert strukturierte, aufbereitete Daten für definierte Auswertungen. Ein Data Lake nimmt Rohdaten in beliebigen Formaten auf, auch ohne festes Schema. Moderne Plattformen verwischen die Grenze, weil sie beide Ansätze in einem System abbilden.

Was kostet ein Marketing Data Warehouse?

Die Speicher- und Rechenkosten sind bei überschaubaren Datenmengen selten der größte Posten; der Aufwand liegt in Anbindung, Modellierung und laufender Pflege. Ein belastbarer Rahmen entsteht erst mit dem konkreten Umfang. [[REDAKTION: falls eine Preisspanne genannt werden soll, belastbare Zahlen aus abgeschlossenen Projekten freigeben, sonst Abschnitt so belassen]]

Brauche ich ein Data Warehouse für Marketing Mix Modelling?

Praktisch ja. Modelle wie Google Meridian brauchen konsistente Zeitreihen über Ausgaben, Ergebnisse und Rahmenbedingungen über mehrere Jahre. Diese Reihen entstehen nicht in den Werbeplattformen, sondern in einem System, das die Daten dauerhaft und einheitlich hält.

Quellen

  1. Fivetran und dbt Labs, Abschluss der Fusion am 01.06.2026, angekündigt am 13.10.2025; Kern der dbt Fusion Engine als dbt Core 2.0 unter Apache-2.0-Lizenz (Unternehmensmitteilungen und dbt-Dokumentation, abgerufen August 2026).
  2. Google Analytics-Hilfe, BigQuery Export: Exportlimits, Streaming-Kosten, fehlende Traffic-Source-Daten im Streaming (abgerufen August 2026).
  3. Google, Meridian: quelloffenes Marketing-Mix-Modelling-Framework, allgemein verfügbar seit 29.01.2025 (Google-Ankündigung und Entwicklerdokumentation, abgerufen August 2026).
  4. Google, Privacy Sandbox: Beibehaltung des bisherigen Cookie-Ansatzes (22.04.2025), Einstellung mehrerer Schnittstellen (17.10.2025) sowie Statusübersicht mit vier Kategorien, Stand 14.08.2026.
  5. Gericht der Europäischen Union, Abweisung der Nichtigkeitsklage gegen den Angemessenheitsbeschluss zum EU-US Data Privacy Framework, 03.09.2025 (Rechtssache T-553/23, Latombe); Rechtsmittel zum Gerichtshof eingelegt am 31.10.2025 (C-703/25 P), Verfahren anhängig. US Supreme Court, Trump v. Slaughter, 29.06.2026, zur Unabhängigkeit der FTC; anschließende Aufforderung des Europäischen Datenschutzausschusses an die Kommission zur Überprüfung.
  6. Snowflake, Dokumentation zu Cortex Analyst und Cortex Agents inklusive Versionshinweisen 2026 (abgerufen August 2026).

Verwandte Themen