Zum Inhalt springen
· 6 Min. Lesezeit

A/B-Test Retouren: Echte Gewinner nach Rücksendungen erkennen

Ein A/B-Test kann den Umsatz pro Besucher (ARPU) deutlich erhöhen und trotzdem wirtschaftlich verlieren. Das passiert, wenn die Variante mehr Rücksendungen oder höhere Erstattungen auslöst. A/B-Test Retouren gehören deshalb in die Auswertung, sobald ein Test Produktauswahl, Mengen, Rabatte, Größenberatung oder Kaufdruck verändert. Ohne diese zweite Betrachtung riskierst du den Rollout eines scheinbaren Gewinners, der nach Ablauf der Rückgabefrist weniger Umsatz hält.

A/B-Test Retouren verändern die Gewinnerentscheidung

Die erste Testauswertung basiert meistens auf dem Umsatz zum Bestellzeitpunkt. Das ist sinnvoll, weil dieser Wert schnell verfügbar ist und direkt auf Preis, Conversion Rate und Warenkorb reagiert. Er zeigt jedoch noch nicht, welchen Umsatz die Brand nach Stornierungen, Teilrückerstattungen und vollständigen Retouren behält.

Besonders relevant ist der Effekt bei Tests, die das Kaufverhalten stark beeinflussen. Dazu gehören Mengenrabatte, Bundles, Gratisversandsschwellen, aggressive Knappheit, geänderte Größentabellen und Empfehlungen für ergänzende Produkte.

Eine Variante kann mehr Bestellungen erzeugen, obwohl Besucher Produkte mit geringerer Kaufabsicht in den Warenkorb legen. Eine andere Variante erhöht vielleicht den durchschnittlichen Bestellwert, lenkt Kunden aber zu Größen oder Varianten mit überdurchschnittlicher Retourenquote.

Deshalb betrachte ich zwei Werte:

  • Den ARPU zum Zeitpunkt der Bestellung für die schnelle operative Einordnung.
  • Den retourenbereinigten ARPU nach einer vorab definierten Reifezeit für die wirtschaftliche Entscheidung.

Der zweite Wert ersetzt die ursprüngliche Auswertung nicht. Er ergänzt sie um den Umsatz, den die Brand nach Rückerstattungen tatsächlich hält.

Welche Erstattungen in die Auswertung gehören

Eine saubere Berechnung braucht eine feste Umsatzdefinition. Shopify stellt Bestellumsatz, Rückerstattungen und einzelne Rückerstattungspositionen bereit. Das Datenmodell muss diese Werte anhand der Bestellnummer mit der ursprünglichen Testvariante verbinden.

Vollständige Rückerstattungen

Bei einer vollständigen Rückerstattung ziehst du den gesamten zuvor erfassten Umsatz der Bestellung ab. Die Bestellung bleibt in der Besuchergruppe, der Shopify sie beim Kauf zugeordnet hat. Eine spätere Erstattung darf diese Zuordnung nicht verändern.

Teilrückerstattungen

Bei einer Teilrückerstattung ziehst du nur den erstatteten Betrag ab. Das ist bei Bundles und Bestellungen mit mehreren Artikeln wichtig. Eine reine Zählung retournierter Bestellungen würde hier zu viel Umsatz entfernen.

Stornierungen und Umtausch

Stornierungen behandelst du wie Erstattungen, sofern der ursprüngliche Bestellumsatz bereits in die Testmetrik eingeflossen ist. Bei einem Umtausch legst du vor dem Test fest, ob du den Vorgang als Rückerstattung mit neuer Bestellung oder als Anpassung der ursprünglichen Bestellung abbildest. Entscheidend ist eine identische Regel für Kontrolle und Variante.

Versandkosten, Steuern und Gutscheine brauchen ebenfalls eine feste Behandlung. Nutze dieselbe Umsatzdefinition, die du in der primären A/B-Test Auswertung mit ARPU verwendest. Sonst vergleichst du zwei unterschiedliche wirtschaftliche Größen.

So baust du die Retourenauswertung auf

Die technische Grundlage ist eine dauerhafte Verbindung zwischen Besucher, Testvariante, Bestellung und Rückerstattung. Eine reine Sitzung reicht nicht aus, weil viele Retouren erst Wochen nach dem Besuch eintreffen.

  1. Speichere die Variantenkennung beim ersten qualifizierten Testkontakt.
  2. Übertrage diese Kennung beim Kauf an dein Testing System oder deine Datensammlung.
  3. Ordne jeder Bestellung die ursprüngliche Variante und Besucherkennung zu.
  4. Importiere vollständige und teilweise Rückerstattungen anhand der Shopify Bestellnummer.
  5. Berechne den gehaltenen Umsatz für jede Bestellung neu.
  6. Aggregiere diesen Umsatz über alle ursprünglich zugeordneten Besucher der jeweiligen Variante.

Die zentrale Berechnung lautet:

Retourenbereinigter ARPU =
(Bestellumsatz minus Rückerstattungen) / zugeordnete Besucher

Der Nenner bleibt unverändert. Du darfst Besucher mit retournierten Bestellungen nicht aus der Analyse entfernen. Sonst verzerrst du die Stichprobe zugunsten der Variante mit mehr Rücksendungen.

Shopify stellt Rückerstattungsdaten über die Admin API bereit. Die offizielle Shopify Dokumentation zum Refund Objekt zeigt die verfügbaren Felder. Für die ursprüngliche Kaufzuordnung brauchst du zusätzlich ein belastbares A/B-Test Tracking für Shopify Käufe.

Mini Case: Aus einem Gewinner wird ein Verlierer

Ein Shopify Shop testet eine neue Mengenauswahl auf der Produktseite. Jeweils 50.000 Besucher sehen Kontrolle oder Variante. Die erste Auswertung nach dem Testende ergibt folgende Zahlen.

  • Die Kontrolle erzielt 2.000 Bestellungen mit 60 EUR durchschnittlichem Bestellwert.
  • Die Variante erzielt 1.900 Bestellungen mit 66 EUR durchschnittlichem Bestellwert.

Die Kontrolle erzeugt damit 120.000 EUR Umsatz. Ihr ARPU liegt bei 2,40 EUR. Die Variante erzeugt 125.400 EUR Umsatz und erreicht einen ARPU von 2,51 EUR. Auf Basis des Bestellumsatzes liegt die Variante rund 4,5 Prozent vorn.

Nach Ablauf der definierten Reifezeit zeigt sich ein anderes Bild. Bei der Kontrolle fließen 10 Prozent des Umsatzes zurück. Bei der Variante sind es 18 Prozent.

  • Die Kontrolle hält 108.000 EUR. Der retourenbereinigte ARPU beträgt 2,16 EUR.
  • Die Variante hält 102.828 EUR. Der retourenbereinigte ARPU beträgt rund 2,06 EUR.

Nach Rückerstattungen liegt die Variante damit rund 4,8 Prozent hinter der Kontrolle. Der höhere Warenkorb hat die schlechtere Umsatzqualität verdeckt. Ohne Retourenauswertung hätte das Team die Variante möglicherweise als nachgewiesenen Gewinner ausgerollt.

Die Zahlen erklären noch nicht die Ursache. Eine Analyse auf Artikel und Variantenebene könnte zeigen, dass Kunden häufiger eine zusätzliche Einheit mit geringer Kaufabsicht bestellt haben. Diese Erkenntnis liefert die Grundlage für einen neuen Test mit klarerer Mengenkommunikation.

Wann du mit der finalen Entscheidung warten solltest

Du musst nicht bei jedem Test die vollständige Rückgabefrist abwarten. Die Hypothese und das beobachtete Verhalten bestimmen, wie wichtig die verzögerte Auswertung ist.

Ich lege vor dem Start eine Reifezeit für Rückerstattungen fest. Dafür eignet sich der Zeitpunkt, zu dem beispielsweise 90 Prozent der üblichen Erstattungen eingetroffen sind. Wenn die meisten Rückerstattungen innerhalb von 21 Tagen erscheinen, frierst du die Testkohorte am Testende ein und wertest sie 21 Tage später erneut aus.

Eine verzögerte Gewinnerentscheidung ist besonders sinnvoll, wenn der Test folgende Größen verändert:

  • Produktmix oder verkaufte Größen
  • Anzahl der Artikel je Bestellung
  • Rabatte und Gratiszugaben
  • Kommunikation zu Passform oder Produkteigenschaften
  • Bestellwert und Anteil neuer Kunden

Bei einer rein visuellen Änderung mit stabiler Produktverteilung kann die Retourenquote als Guardrail dienen. Zeigt sie keine relevante Verschlechterung, reicht häufig die reguläre Entscheidung anhand des vorab gewählten Hauptziels. Wie du solche Grenzen definierst, zeigt der Beitrag zu A/B-Test Guardrail-Metriken.

Verändert eine Variante die Retouren stark, prüfe ich zusätzlich die Unsicherheit des retourenbereinigten ARPU. Einzelne große Bestellungen können die Kennzahl verzerren. Vollständig auswertbare Tests brauchen deshalb genug Besucher, ausreichend gereifte Bestellungen und eine vorab festgelegte Entscheidungsregel.

Häufige Fragen

Sollte der retourenbereinigte ARPU immer die Hauptmetrik sein?

Das hängt von Hypothese, Retourenanteil und Datenverfügbarkeit ab. Bei Tests zu Bundles, Größen, Rabatten oder Produktempfehlungen ist er oft entscheidungsrelevant. Bei anderen Tests kann er als Guardrail neben dem regulären ARPU dienen.

Wie lange muss ich nach dem Testende warten?

Nutze die historische Verteilung deiner Rückerstattungen. Ein sinnvoller Zeitpunkt liegt dort, wo ein großer Teil der Erstattungen bereits eingetroffen ist, etwa beim 90. Perzentil. Die Regel sollte vor dem Test feststehen.

Darf ich retournierende Kunden aus der Analyse entfernen?

Nein. Jeder qualifizierte Besucher bleibt in seiner ursprünglich zugeordneten Variante. Du korrigierst den Umsatz im Zähler, aber veränderst den Nenner nicht.

Wie behandle ich Teilretouren?

Ziehe den tatsächlich erstatteten Betrag vom ursprünglichen Bestellumsatz ab. Eine binäre Einteilung in retourniert und nicht retourniert verliert wichtige Informationen und kann Varianten mit großen Warenkörben falsch bewerten.

Was passiert, wenn eine Variante beim ARPU gewinnt, aber mehr Retouren erzeugt?

Prüfe den retourenbereinigten ARPU und die vorab definierte Guardrail Grenze. Erst danach triffst du die Rollout Entscheidung. Bei unklaren Ergebnissen kann ein Folgetest die Ursache gezielt isolieren.

Du willst in deinem Shop testen statt raten? Wenn du eine D2C Brand ab 200.000 EUR Monatsumsatz führst, zeige ich dir in einem kostenlosen Testing Audit in 30 Minuten, wo dein größter Hebel liegt. Termin buchen. Wenn du noch nicht so weit bist, starte mit meinen kostenlosen Frameworks und Checklisten.

Nicolai Clöß

Nicolai Clöß

Founder von Socivolve. Übernimmt das A/B-Testing von Shopify-D2C-Brands vollständig, von der ersten Beobachtung bis zum dauerhaft ausgerollten Gewinner. Trier.

Bevor du den nächsten Artikel liest:

Mein A/B-Test-Playbook fasst zusammen, was hier über viele Artikel verteilt steht: Testaufbau, Stichprobenberechnung, Auswertungsregeln und mein Priorisierungs-Framework. Kostenlos, kein Newsletter-Zwang.

Playbook laden (PDF)

Weiterlesen