Was ist ein A/B-Test? — Kostenloses Tool
Ein A/B-Test stellt zwei Versionen gegeneinander, die sich in genau einem Element unterscheiden, und vergleicht die Ergebnisse. Warum diese eine Variable die ganze Disziplin ist, wie viele Ergebnisse eine Siegerin braucht, um etwas zu bedeuten, und die Fehler, die zu sicheren, aber falschen Schlüssen führen.
Zwei Varianten eines Beitrags oder einer Anzeige ausspielen, die sich in genau einem Element unterscheiden — Überschrift, Bild, Handlungsaufforderung — und die Ergebnisse vergleichen. Ändert man mehr als eine Variable, lässt sich der Sieger nicht erklären.
Was es ist
Ein A/B-Test, auch Split-Test, stellt zwei Versionen desselben Beitrags oder derselben Anzeige gegeneinander und vergleicht, was passiert. Version A ist meist das, was Sie ohnehin veröffentlicht hätten; Version B ändert genau eine Sache. Ziel ist nicht, einen besseren Beitrag zu finden, sondern zu erfahren, welches Element die Zahl bewegt hat, damit die Erkenntnis diesen einen Beitrag überdauert.
Wie es gemessen wird
Die Kennzahl wird vorher festgelegt, nicht hinterher: Klickrate bei einem Link, Conversion-Rate bei einer Anzeige, Abschlussrate bei Video. Dann braucht es genug Ergebnisse, damit der Unterschied etwas bedeutet. Eine Signifikanzrechnung trennt einen echten Unterschied vom Rauschen, und je kleiner der Abstand zwischen den Versionen, desto mehr Ergebnisse braucht es, um ihn überhaupt zu sehen.
Häufig missverstanden
Der häufigste Fehler ist nicht, zwei Variablen zu ändern, sondern zu früh aufzuhören. Am Anfang eines Tests ziehen die beiden Versionen ständig aneinander vorbei, wer also zusieht und abbricht, sobald eine vorn liegt, findet fast immer eine Siegerin, auch wenn die Versionen identisch sind. Der zweite Fehler ist, etwas zu Kleines zu testen: ein getauschtes Emoji schlägt das Rauschen bei keiner erreichbaren Stichprobe, der Test kostet also eine Woche und liefert nichts. Testen Sie das Angebot, den Aufhänger oder das Format, bevor Sie die Zeichensetzung testen.
Wann es zählt
Am meisten zählt es dort, wo Geld ausgegeben wird, weil sich dort zwei Prozentpunkte aufsummieren. Organisch ist der ehrliche Nutzen schmaler: Sie können Publikum und Zeitpunkt nicht konstant halten, behandeln Sie organische Vergleiche also als Quelle von Hypothesen, die ein bezahlter Test dann wirklich klären kann.
Verwandte Begriffe
Funktionen
- Klare Definition, mit ausbuchstabierter Ein-Variablen-Regel
- Warum ein Unterschied in den Zahlen kein Unterschied zwischen den Versionen ist
- Wie lange ein Test laufen sollte, und warum Abbrechen bei der ersten Führung der klassische Fehler ist
- Was organisch ehrlich testbar ist und was nicht, verglichen mit bezahlt
- Links zum Signifikanzrechner, um ein Ergebnis zu prüfen statt zu schätzen
Häufig gestellte Fragen
Wie viele Variablen darf ich gleichzeitig ändern?
Eine. Das ist keine Stilfrage, sondern das, was das Ergebnis erklärbar macht: Hat die Siegerversion neue Überschrift und neues Bild, sagt der Test, dass das Paar gewonnen hat, und nichts darüber, welche Hälfte die Arbeit gemacht hat.
Wie lange sollte ein Test laufen?
Lange genug für eine Stichprobe, die nicht an einer Handvoll Ergebnisse kippt, und mindestens einen vollen Zyklus Ihres normalen Wochenmusters. Ein Test von Dienstag bis Donnerstag misst Dienstag bis Donnerstag, nicht Ihr Publikum.
Wann darf ich eine Siegerin ausrufen?
Wenn der Unterschied größer ist als das Rauschen, und genau das sagt eine Signifikanzrechnung. Abzubrechen, sobald eine Version vorn liegt, ist der häufigste Weg zu einer sicheren falschen Antwort, weil frühe Führungen sich ständig umkehren.
Kann ich organische Beiträge A/B-testen?
Nur ungefähr. Sie können nicht zwei Versionen demselben Publikum unter denselben Bedingungen zeigen, ein organischer Vergleich schleppt also Tageszeit, Wochentag und Algorithmus mit. Behandeln Sie ihn als Hinweis und heben Sie echte Tests für bezahlte Reichweite auf.
Und wenn es keinen Unterschied gibt?
Das ist ein Ergebnis, und ein nützliches. Es heißt, dass das geänderte Element nicht das ist, was den Beitrag begrenzt, der nächste Test sollte also zu etwas anderem wechseln statt zu einer kleineren Variante desselben.