Die experimentelle Architektur des A/B-Tests
Analyse von statistischer Power, Signifikanzschwellen, Sample Ratio Mismatch und MDE-Grenzen.
| Experimentelle Komponente | Statistische Funktion | Operativer Standard-Schwellenwert | Hauptrisiko bei Nichtbeachtung |
|---|---|---|---|
| Statistische Power ($1 - \beta$) | Wahrscheinlichkeit, einen echten Effekt zu erkennen | 80 % bis 90 % ($\beta = 0,10$ bis $0,20$) | Beta-Fehler: Echte Innovationen werden fälschlich verworfen |
| Signifikanzniveau ($\alpha$) | Wahrscheinlichkeit, die Nullhypothese fälschlich abzulehnen | 5 % ($\alpha = 0,05$, zweiseitig, $Z \ge 1,96$) | Alpha-Fehler: Unwirksame oder schädliche Varianten gehen live |
| Sample Ratio Mismatch (SRM) | Chi-Quadrat-Anpassungstest für Zuteilungsintegrität | $\chi^2$-Test $p$-Wert $\ge 10^{-3}$ | Experimentelle Ungültigkeit durch Tracking- oder Bot-Filter-Fehler |
| Minimal erkennbarer Effekt (MDE) | Kleinster relativer Lift, für den der Test ausgelegt ist | Abgeleitet aus Basisvarianz und Stichprobengröße | Unterdimensionierte Tests mit uninterpretierbarem Rauschen |
Bei breiten Tabellen horizontal wischen oder scrollen.
Referenz & Evidenz
Quelle: Experimenteller Rahmen des Autors, fundiert in der Kausalinferenz- und Split-Testing-Literatur von Kohavi u. a. (2013), Kohavi u. a. (2009) sowie Lewis und Rao (2015).
Verwandte Abbildungen
-
Statistische Fehlentscheidungen und Teststärke (Power)
Aus dem Beitrag Was ist ein A/B-Test? Randomisierte Experimente, statistische Power und Governance
-
Taxonomie der Experimentier-Architekturen
Aus dem Beitrag Was ist ein A/B-Test? Randomisierte Experimente, statistische Power und Governance
-
Die Kennzahlen-Hierarchie kontrollierter Experimente
Aus dem Beitrag Was ist ein A/B-Test? Randomisierte Experimente, statistische Power und Governance