Aus der Forschung

Was sind parallele Trends? Die Annahme hinter Difference-in-Differences

Parallele Trends sind eine kontrafaktische Annahme, kein Vortrend-Siegel. Schätzen Sie Estimand, Timing, Überlappung und Sensitivität gemeinsam.

746 Wörter 4 Min. Lesezeit 2 Quellen  Leser

Management Summary

Parallele Trends bezeichnen die Annahme, dass Behandlungs- und Vergleichsgruppe ohne Behandlung unter dem erklärten Design denselben Ergebnisverlauf genommen hätten. Das ist die kontrafaktische Brücke hinter Difference-in-Differences, kein allgemeines Muster und kein bestandenes Siegel nach einem nicht signifikanten Vortrendtest. Callaway und Sant'Anna entwickeln Gruppen-Zeit-Schätzer und kovariatenbedingte Identifikation für mehrere Perioden. Roth und Koautoren ordnen Heterogenität, Teststärke von Vortrendtests und Inferenz ein. Ein synthetisches Trenddiagramm zeigt, wie die Annahme dokumentiert werden kann, ohne Ähnlichkeit vor der Behandlung in Kausalität umzudeuten.

Schlagwörter: Parallele Trends · Difference-in-Differences · Kausale Inferenz · Kontrafaktum · Treatment-Timing · Common Support

Auf dieser Seite

Ein Difference-in-Differences-Ergebnis lässt sich sauber subtrahieren, während sein zentraler Vergleich unbeobachtet bleibt. Die behandelte Gruppe stieg um 10 Punkte. Die Vergleichsgruppe stieg um 4. Die berichtete Differenz beträgt 6. Diese Arithmetik wird erst dann zu einem Behandlungseffekt, wenn der Pfad der Vergleichsgruppe glaubwürdig für das ist, was ohne Behandlung mit der behandelten Gruppe geschehen wäre.

Parallele Trends sind die Annahme, dass behandelte und Vergleichseinheiten ohne Behandlung unter dem erklärten Design und gegebenenfalls nach Kovariaten denselben Ergebnistrend genommen hätten. Sie sind eine kontrafaktische Brücke, kein allgemeines Qualitätssiegel.

Der Artikel zu gestaffeltem Difference-in-Differences behandelt die Wahl eines Kohorten-Zeit-Estimands bei unterschiedlichen Behandlungszeitpunkten. Diese Seite behandelt die Annahme darunter und die Prüfdisziplin, bevor ein Trendvergleich kausal gelesen wird.

Sei Yt(0)Y_t(0) das unbehandelte potenzielle Ergebnis zum Zeitpunkt tt. Eine einfache Form der Annahme verlangt, dass die erwartete Veränderung von Yt(0)Y_t(0) für behandelte und Vergleichseinheiten im erklärten Vor- und Nachbehandlungsdesign gleich wäre. Nach einer möglichen Konditionierung auf beobachtete Vorbehandlungskovariaten muss die Veränderung der behandelten Gruppe aus der Veränderung der Vergleichsgruppe rekonstruierbar sein.

Die Annahme betrifft einen fehlenden Pfad. Nach der Behandlung beobachten wir die behandelte Gruppe, aber ihren unbehandelten Verlauf in derselben Periode nicht. Ein Diagramm kann Ähnlichkeit vor der Behandlung zeigen. Den kontrafaktischen Verlauf nach der Behandlung zeigt es nicht direkt.

Callaway und Sant’Anna identifizieren Gruppen-Zeit-Durchschnittseffekte in Designs mit mehreren Perioden und unterschiedlichen Behandlungszeitpunkten. Ihr Rahmen erlaubt parallele Trends bedingt auf beobachtete Kovariaten und unterstützt Outcome-Regression, Inverse-Probability Weighting und doubly robuste Verfahren (Callaway & Sant’Anna, 2021).

Was zeigt ein Trenddiagramm?

Das folgende Diagramm ist synthetisch. Der Index steht drei Perioden vor der Behandlung auf 100. Die Linien zeigen einen Vorbehandlungsverlauf mit ähnlicher Bewegung und eine spätere Trennung. Sie zeigen weder einen realen Eingriff noch identifizieren sie einen Effekt.

Der Vorbehandlungszeitraum ist keine dekorative Ja-Nein-Prüfung. Fragen Sie, ob Ergebnisdefinition, Gruppenzusammensetzung, Messung und Support im Raum der Effektmodifikatoren vergleichbar sind. Ähnliche Steigung kann mit unterschiedlichen Niveaus, Antizipation oder einem späteren Schock einhergehen, der beide Gruppen unterschiedlich trifft.

Warum reicht ein Vortrendtest nicht?

Roth und Koautoren ordnen die neuere Difference-in-Differences-Literatur und betonen, dass Two-Way-Fixed-Effects-Schätzer bei heterogenen Behandlungseffekten irreführend sein können. Sie weisen außerdem darauf hin, dass Vortrendtests wenig Teststärke besitzen und Vorprüfungs-Bias erzeugen können, wenn Stichprobe oder Schätzer nach Sichtung des Tests gewählt werden (Roth et al., 2023).

Ein nicht signifikanter Vortrendtest beweist daher keine parallelen Trends. Ein signifikanter Test bestimmt ohne Modell weder Richtung noch Größe einer möglichen Verzerrung. Der Test ist ein Evidenzstück neben Grafiken, institutionellem Timing, Kovariatenbalance, Placebozeitpunkten, alternativen Zeitfenstern, Änderungen in der Zusammensetzung und Sensitivitätsanalyse.

Welche Felder machen einen DiD-Vergleich reproduzierbar?

Halten Sie diese Felder vor der Schätzung fest:

  1. Einheit und Behandlungszeit: Wer wird nach welcher Regel und wann behandelt?
  2. Ergebnis: Exaktes Maß, Einheit, Konstruktion und Beobachtungsfenster.
  3. Vergleich: Warum kann die Vergleichsgruppe den fehlenden unbehandelten Pfad vertreten?
  4. Vorbehandlung: Anzahl der Perioden, Trenddefinition, Antizipationsgrenze und Ausschlüsse.
  5. Kovariaten: Effektmodifikatoren, Konditionierungsregel und Common-Support-Screen.
  6. Estimand: Gruppen-Zeit-Effekt, Ereigniszeit-Effekt, Durchschnittseffekt oder anderes Ziel.
  7. Schätzer: Outcome-Modell, Gewichtung, doubly robustes Verfahren oder andere Methode.
  8. Sensitivität: Alternative Fenster, Placebodaten, Zusammensetzungswechsel und plausible Trendabweichungen.

Auch hier ist Positivität oder Common Support entscheidend. Wenn behandelte Ziele Merkmalskombinationen besitzen, die in Vergleichs- oder Quelldaten fehlen, identifiziert Trendähnlichkeit der übrigen Einheiten nicht das Zielkontrafaktum.

Sie sind weder gleiche Niveaus noch identische Rohreihen, ein allgemeiner Unternehmensbenchmark oder ein Beweis für einen bestandenen Vortrendtest. Die Annahme lässt sich nicht unverändert übertragen, wenn Timing, Behandlung, Ergebnis, Einheit, Vergleich oder institutioneller Kontext wechseln.

Ein Difference-in-Differences-Schätzer ist nur so glaubwürdig wie seine erklärte kontrafaktische Brücke, sein Estimand, sein Support und die begleitende Sensitivitätsargumentation.

Der Artikel zur externen Validität erweitert dieselbe Disziplin auf die Population und den Kontext, in denen ein Vergleich gelten soll.

Quellen

  1. Callaway, B., & Sant'Anna, P. H. C. (2021). Difference-in-differences with multiple time periods. Journal of Econometrics, 225(2), 200-230. DOI
  2. Roth, J., Sant'Anna, P. H. C., Bilinski, A., & Poe, J. (2023). What's trending in difference-in-differences? A synthesis of the recent econometrics literature. Journal of Econometrics, 235(2), 2218-2244. DOI

Weitergeben

Diesen Beitrag teilen

Wenn er Ihnen etwas gebracht hat, bringt er jemandem in Ihrem Team vermutlich auch etwas.

Als PDF herunterladen

Ein vollständiges Dokument – Titelseite, Inhalt, Quellen, und die Zitierweise auf der letzten Seite.

Sinan Isoglu

Über den Autor

Sinan Isoglu, MBA (Quantic)

Führungskraft für Umsatzwachstum, Dozent und Doktorand

Sinan Isoglu ist Führungskraft für Umsatzwachstum, Dozent und Doktorand. Seine Arbeit verbindet Go-to-Market, Pricing und Revenue Operations; seine Promotion an der EM Normandie untersucht die Integration von Vertrieb und Marketing nach grenzüberschreitenden M&A. An der IU Internationalen Hochschule lehrt er Marketing und Wachstum.

Qualifikationen

  • Doktorand, EM Normandie Business School
  • MBA, Quantic School of Business and Technology
  • Dozent, IU Internationale Hochschule

Schreibt über

  • Go-to-Market
  • Pricing
  • Revenue Operations
  • KI im Handel
  • Grenzüberschreitendes Wachstum

Die Spur

Der Test hinter dieser Frage.

Dieser Beitrag gehört zur Forschung: der strengere Maßstab für die Muster, die aus der Praxis entstehen.

Kommentare

Mitdenken.

Kommentieren Sie den Text oder markieren Sie oben eine Passage, um sie direkt zu zitieren.

Kommentar schreiben

Kommentare werden vor der Veröffentlichung persönlich geprüft. Name und Kommentar werden für die Veröffentlichung gespeichert. Siehe den Datenschutzhinweis.