MaxDiff

Wenn nicht alles gleich wichtig sein kann

Du möchtest herausfinden, was Gästen bei der Auswahl eines Hotels wichtig ist. Also fragst du danach.

Wie wichtig ist Ihnen die Sauberkeit des Zimmers? 10 von 10. Eine gute Lage? 9 von 10. Ein ruhiges Zimmer? 10 von 10. Freundliches Personal? 9 von 10. Ein gutes Frühstück? 8 von 10. Ein günstiger Preis? 9 von 10.

Das Ergebnis ist wenig überraschend: Fast alles ist wichtig.

Das ist zunächst einmal nicht falsch. Natürlich möchten Hotelgäste ein sauberes und ruhiges Zimmer in guter Lage, freundliches Personal und am besten noch ein gutes Frühstück zu einem günstigen Preis.

Nur hilft uns diese Erkenntnis wenig, wenn wir tatsächlich eine Entscheidung treffen müssen. Vielleicht können wir in die Schalldämmung investieren oder das Frühstück verbessern, aber nicht beides. Vielleicht kostet eine zentralere Lage mehr und zwingt uns dafür zu höheren Zimmerpreisen.

Dann interessiert uns nicht mehr nur, ob etwas wichtig ist. Wir müssen wissen, was wichtiger ist als etwas anderes.

Genau an dieser Stelle setzt MaxDiff an.

Dann entscheide dich

Statt jede Eigenschaft einzeln bewerten zu lassen, zeigen wir unserem Hotelgast vier Eigenschaften gleichzeitig:

EigenschaftAm wichtigstenAm wenigsten wichtig
Sauberkeit
Frühstück
Parkplatz
WLAN

Die Aufgabe ist einfach: Wähle aus diesen vier Eigenschaften die wichtigste und die am wenigsten wichtige aus.

Unser Gast entscheidet sich für Sauberkeit als wichtigste und WLAN als am wenigsten wichtige Eigenschaft.

Damit haben wir ihn zu etwas gezwungen, was bei der Bewertung von 1 bis 10 nicht notwendig war: zu einem Trade-off.

Er kann nicht mehr sagen, dass alles wichtig ist. Mindestens eine Eigenschaft muss gewinnen und eine muss verlieren.

Das ist im Kern bereits MaxDiff – kurz für Maximum Difference Scaling. Gesucht wird innerhalb einer Gruppe von Alternativen das Paar, zwischen dem aus Sicht des Befragten der größte Unterschied besteht: die wichtigste und die am wenigsten wichtige Alternative.

Eine Antwort verrät mehr, als es zunächst aussieht

Die Entscheidung unseres Hotelgasts war:

Sauberkeit    ← am wichtigsten
Frühstück
Parkplatz
WLAN          ← am wenigsten wichtig

Auf den ersten Blick haben wir damit zwei Informationen erhalten: Sauberkeit gewinnt, WLAN verliert.

Tatsächlich wissen wir mehr.

Wenn Sauberkeit von diesen vier Eigenschaften die wichtigste ist, wurde Sauberkeit gegenüber Frühstück, Parkplatz und WLAN bevorzugt:

Sauberkeit > Frühstück
Sauberkeit > Parkplatz
Sauberkeit > WLAN

Wenn WLAN gleichzeitig die am wenigsten wichtige Eigenschaft ist, wissen wir außerdem:

Frühstück > WLAN
Parkplatz > WLAN

Was wir dagegen nicht wissen:

Frühstück ? Parkplatz

Darüber hat der Gast keine Entscheidung getroffen.

Eine einzige Best-Worst-Auswahl erzeugt damit mehrere relative Vergleiche, ohne dass wir jeden möglichen Vergleich einzeln abfragen müssen.

Das ist eine der interessanten Eigenschaften von MaxDiff.

Warum zeigen wir nicht einfach alles gleichzeitig?

Nehmen wir an, wir möchten acht Eigenschaften untersuchen:

Preis
Lage
Sauberkeit
Ruhiges Zimmer
Frühstück
Freundliches Personal
Parkplatz
WLAN

Wir könnten natürlich alle acht gleichzeitig anzeigen und nach der wichtigsten und der am wenigsten wichtigen Eigenschaft fragen.

Damit würden wir aber Informationen verschenken. Wir wüssten zwar, was ganz oben und ganz unten steht, aber über die sechs Eigenschaften dazwischen hätten wir erstaunlich wenig erfahren.

Außerdem wird die Entscheidung schwieriger, je länger die Liste wird.

MaxDiff arbeitet deshalb mit mehreren kleineren Gruppen. Solche Gruppen werden häufig als Choice Sets bezeichnet.

Zum Beispiel:

Set 1:
Sauberkeit · Frühstück · Parkplatz · WLAN

Set 2:
Preis · Lage · Frühstück · Personal

Set 3:
Sauberkeit · Ruhiges Zimmer · Lage · Parkplatz

Set 4:
Preis · WLAN · Personal · Ruhiges Zimmer

Für jedes Set trifft der Gast wieder genau dieselbe Entscheidung: Was ist am wichtigsten und was am wenigsten wichtig?

Nach mehreren Runden entsteht ein Netz von Vergleichen.

Sauberkeit tritt einmal gegen Frühstück an, später gegen Lage und ein anderes Mal vielleicht gegen den Preis. Der Preis trifft wiederum auf WLAN, Personal und Frühstück.

Nach und nach lassen sich dadurch alle Eigenschaften relativ zueinander einordnen.

Muss es dafür wirklich MaxDiff sein?

An dieser Stelle liegt ein berechtigter Einwand nahe: Wenn wir nur wissen möchten, was unseren Hotelgästen besonders wichtig ist, warum brauchen wir dafür überhaupt mehrere Choice Sets und eine anschließende Auswertung?

Wir könnten wesentlich einfacher fragen:

Welche vier dieser acht Eigenschaften sind Ihnen am wichtigsten?

Oder, wenn es konkret um Verbesserungen geht:

Wenn sich sofort vier Dinge verbessern sollten, welche wären das?

Der Teilnehmer wählt vier von acht Möglichkeiten aus und wir zählen anschließend, wie häufig jede Eigenschaft gewählt wurde.

Das funktioniert – liefert uns aber nur eine grobe Trennung.

gewählt:
✓ Sauberkeit
✓ Ruhiges Zimmer
✓ Lage
✓ Preis

nicht gewählt:
○ Personal
○ Frühstück
○ Parkplatz
○ WLAN

Wir wissen nicht, ob Sauberkeit mit großem Abstand die wichtigste Eigenschaft war oder gerade noch vor dem Preis liegt. Genauso wenig wissen wir, ob Personal die Top 4 nur knapp verpasst hat oder für diesen Teilnehmer weit hinter WLAN liegt.

Für unsere Fragestellung ist eine einfache Multiple-Choice-Auswahl deshalb die schwächste der drei Möglichkeiten. Sie sagt uns, was ausgewählt wurde, aber wenig darüber, wie die acht Eigenschaften relativ zueinander stehen.

Ein Ranking kann schon ausreichen

Wir müssen deshalb aber noch nicht bei MaxDiff landen.

Eine bessere Alternative wäre, ebenfalls vier der acht Eigenschaften auswählen zu lassen, diese vier aber zusätzlich in eine Reihenfolge zu bringen:

1. Sauberkeit
2. Ruhiges Zimmer
3. Lage
4. Preis

Damit wissen wir wesentlich mehr. Wir kennen die vier wichtigsten Eigenschaften und deren Reihenfolge.

Wenn unsere Fragestellung tatsächlich nur lautet:

Was sind die vier wichtigsten Eigenschaften?

dann kann ein solches Top-4-Ranking vollkommen ausreichend sein. Es ist einfach zu verstehen, einfach umzusetzen und einfach auszuwerten.

Seine Grenze liegt dort, wo die Top 4 aufhören.

Über Personal, Frühstück, Parkplatz und WLAN wissen wir nur, dass sie nicht unter den ersten vier gelandet sind. Wir wissen nicht, wie sie untereinander einzuordnen sind. Und wir wissen auch nicht, wie groß der Abstand zwischen Platz 4 und Platz 5 oder zwischen Platz 1 und Platz 2 ist.

MaxDiff nimmt den längeren Weg

MaxDiff verzichtet auf diese eine große Entscheidung. Stattdessen bekommt der Teilnehmer immer wieder kleine Gruppen vorgelegt:

Sauberkeit · Frühstück · Parkplatz · WLAN
Preis · Lage · Frühstück · Personal
Sauberkeit · Ruhe · Lage · Parkplatz
Preis · WLAN · Personal · Ruhe
...

In jeder Gruppe wählt er nur die wichtigste und die am wenigsten wichtige Eigenschaft.

Dadurch tritt auch ein Item wie WLAN, das bei einem Top-4-Ranking vielleicht niemals ausgewählt worden wäre, mehrfach gegen andere Items an. Es kann gegen Parkplatz gewinnen, gegen Frühstück verlieren und in einem anderen Set als unwichtigstes Item gewählt werden.

Aus vielen solchen Entscheidungen entsteht nach und nach ein wesentlich dichteres Netz von Vergleichen.

Das ist der eigentliche Mehrwert von MaxDiff – und gleichzeitig sein Preis. Wir stellen mehr Fragen, müssen die Choice Sets sinnvoll zusammenstellen und benötigen anschließend ein Auswertungsverfahren.

Wenn uns lediglich die Top 4 interessieren, wäre das möglicherweise unnötiger Aufwand.

Wenn wir dagegen wissen möchten, wie sich alle acht Eigenschaften relativ zueinander verhalten, liefert MaxDiff Informationen, die uns eine Top-4-Auswahl nicht gibt.

Die Frage lautet deshalb nicht, ob MaxDiff besser ist als Multiple Choice oder Ranking.

Die Frage lautet, wie viel wir über die Präferenzstruktur tatsächlich wissen müssen.

Einfach zusammenwürfeln reicht nicht

Nun könnte man die acht Eigenschaften einfach zufällig mischen und für jeden Teilnehmer daraus einige Vierergruppen erzeugen.

Technisch wäre das einfach:

Items mischen
→ jeweils vier auswählen
→ Best und Worst abfragen

Methodisch wäre es keine besonders gute Idee.

Durch Zufall könnte der Preis sehr häufig erscheinen, der Parkplatz dagegen nur selten. Sauberkeit könnte ständig gegen WLAN antreten, aber nie gegen die Lage. Eine Eigenschaft hätte dann viel mehr Gelegenheiten zu gewinnen oder zu verlieren als eine andere.

Ein gutes MaxDiff-Design versucht deshalb, die Vergleiche möglichst ausgewogen zu gestalten.

Jede Eigenschaft sollte ungefähr gleich häufig vorkommen. Auch die Kombinationen sollten so gewählt werden, dass nicht ständig dieselben Eigenschaften gegeneinander antreten. Idealerweise wird außerdem darauf geachtet, dass die Position innerhalb eines Sets keinen systematischen Einfluss bekommt.

Die Zusammenstellung der Choice Sets ist deshalb kein nebensächliches Detail der Befragung. Sie ist ein Teil des Messverfahrens.

Erst an dieser Stelle brauchen wir einen weiteren Begriff: Experimental Design.

Das Experimental Design legt fest, welche Eigenschaften wann und gemeinsam mit welchen anderen Eigenschaften gezeigt werden.

Ein gutes Design sorgt dafür, dass wir am Ende sinnvolle Vergleiche ziehen können. Ein schlechtes Design lässt sich auch durch eine aufwendige statistische Auswertung nicht vollständig reparieren.

Was am Ende tatsächlich gespeichert wird

Hinter der Darstellung steckt zunächst ein erstaunlich einfaches Datenmodell.

Für jeden Teilnehmer müssen wir im Wesentlichen wissen:

Teilnehmer | Set | gezeigte Items                       | Best        | Worst
--------------------------------------------------------------------------------
4711       | 1   | Sauberkeit,Frühstück,Parkplatz,WLAN | Sauberkeit | WLAN
4711       | 2   | Preis,Lage,Frühstück,Personal       | Lage       | Frühstück
4711       | 3   | Sauberkeit,Ruhe,Lage,Parkplatz      | Ruhe       | Parkplatz

Wir speichern also nicht unmittelbar:

Sauberkeit = 92
Lage       = 84
WLAN       = 31

Solche Werte existieren in den Rohdaten überhaupt nicht.

Wir haben zunächst nur Entscheidungen.

Aus diesen Entscheidungen müssen wir anschließend rekonstruieren, welche Eigenschaften über alle Choice Sets hinweg stärker oder schwächer bevorzugt wurden.

Best minus Worst

Die einfachste Auswertung liegt nahe: Wir zählen.

Wie oft wurde eine Eigenschaft als wichtigste gewählt? Wie oft als am wenigsten wichtige?

Angenommen, nach vielen Befragungen ergibt sich:

EigenschaftBestWorstDifferenz
Sauberkeit31040+270
Lage27070+200
Ruhiges Zimmer24090+150
Preis210130+80
Personal150160-10
Frühstück110200-90
Parkplatz70260-190
WLAN40300-260

Schon diese einfache Rechnung zeigt eine klare Tendenz.

Sauberkeit wird häufig als besonders wichtig und nur selten als unwichtig gewählt. Beim WLAN verhält es sich umgekehrt.

Das ist erheblich aussagekräftiger als acht Bewertungen zwischen 8 und 10.

Aber auch diese Rechnung hat Grenzen.

Nicht jeder Sieg ist gleich

Stellen wir uns zwei Eigenschaften vor, die jeweils hundertmal als wichtigste ausgewählt wurden.

Das klingt zunächst nach einem Gleichstand.

Die erste Eigenschaft ist aber überwiegend gegen schwach bewertete Alternativen angetreten. Die zweite musste sich regelmäßig gegen Eigenschaften behaupten, die ihrerseits häufig gewählt wurden.

Sind hundert Siege dann wirklich dasselbe?

Spätestens hier reicht einfaches Zählen nicht mehr aus.

Professionelle MaxDiff-Auswertungen betrachten deshalb die Entscheidungen im Zusammenhang. Sie versuchen Werte zu finden, mit denen sich die beobachteten Entscheidungen möglichst gut erklären lassen.

Diese Werte werden häufig Utility, auf Deutsch etwa Nutzenwerte, genannt.

Man kann sich einen solchen Nutzenwert zunächst einfach als unsichtbare Punktzahl vorstellen.

Der Befragte nennt uns diese Punktzahl nicht. Wir beobachten nur seine Entscheidungen:

Sauberkeit > Frühstück
Lage > Preis
Sauberkeit > Lage
Preis > WLAN
...

Aus vielen solchen Entscheidungen versucht das Modell zurückzurechnen, welche zugrunde liegende Präferenzstruktur dazu passt.

Wir beobachten also die Entscheidungen und schließen daraus auf etwas, das wir nicht direkt beobachten können.

Dafür gibt es unterschiedliche statistische Verfahren. Wer MaxDiff lediglich verstehen und einsetzen möchte, muss deren Mathematik nicht im Detail beherrschen. Wichtig ist zunächst die Unterscheidung:

Die Best-Worst-Entscheidungen sind die gemessenen Daten. Die daraus berechneten Präferenzwerte sind bereits das Ergebnis eines Auswertungsverfahrens.

Ein niedriger Wert bedeutet nicht unwichtig

Nehmen wir an, unsere Auswertung liefert am Ende diese Reihenfolge:

Sauberkeit          ███████████████████
Ruhiges Zimmer      █████████████████
Lage                ███████████████
Preis               █████████████
Personal            ██████████
Frühstück           ███████
Parkplatz           █████
WLAN                ███

Eine naheliegende Interpretation wäre:

WLAN ist Hotelgästen unwichtig.

Das haben wir aber gar nicht gemessen.

Vielleicht würden dieselben Gäste bei einer klassischen Wichtigkeitsfrage WLAN mit 8 von 10 bewerten. Niemand möchte heute unbedingt ein Hotel ohne funktionierendes WLAN.

MaxDiff sagt uns etwas anderes:

Unter den untersuchten Eigenschaften wurde WLAN relativ zu den anderen Eigenschaften am wenigsten priorisiert.

Das ist ein wichtiger Unterschied.

MaxDiff misst keine absolute Wichtigkeit. Es erzeugt eine relative Präferenz innerhalb der Alternativen, die wir in die Untersuchung aufgenommen haben.

Wenn wir die Liste der untersuchten Eigenschaften verändern, verändern wir damit auch den Kontext, in dem die Entscheidungen getroffen werden.

Der letzte Platz bedeutet deshalb nicht „unwichtig“.

Er bedeutet zunächst nur: Von diesen Alternativen am wenigsten wichtig.

Und warum nicht einfach zwei Dinge miteinander vergleichen?

Wir könnten die Aufgabe noch weiter vereinfachen und immer nur zwei Eigenschaften zeigen:

Was ist wichtiger?

Sauberkeit oder Lage?

Danach:

Lage oder Preis?

und so weiter.

Das nennt man einen paarweisen Vergleich.

Das Problem ist die Anzahl der möglichen Kombinationen. Bei wenigen Eigenschaften ist das noch überschaubar, mit zunehmender Anzahl wächst die Zahl möglicher Paare aber schnell.

MaxDiff gewinnt aus einer einzigen Aufgabe Informationen über mehrere Paarbeziehungen. Best und Worst innerhalb eines Sets mit vier oder fünf Alternativen liefern deshalb mehr Vergleichsinformation als ein einzelner Paarvergleich.

Auch hier gilt allerdings: Der aufwendigere Ansatz ist nicht automatisch der bessere. Bei drei oder vier Alternativen können direkte Paarvergleiche vollkommen ausreichen.

MaxDiff ist keine komplizierte Frage

Wenn man Begriffe wie Experimental Design, Utility und statistische Choice-Modelle hört, kann MaxDiff schnell nach einer komplizierten Forschungsmethode klingen.

Für den Teilnehmer selbst ist die Aufgabe dagegen ausgesprochen einfach:

Von diesen Dingen: Welches ist dir am wichtigsten und welches am wenigsten wichtig?

Die Komplexität liegt nicht in der Frage.

Sie liegt darin, welche Alternativen wir gemeinsam zeigen und was wir anschließend aus den Entscheidungen ableiten.

Genau deshalb besteht eine MaxDiff-Untersuchung eigentlich aus drei getrennten Aufgaben:

Choice Sets sinnvoll zusammenstellen
Best/Worst-Entscheidungen erheben
Präferenzen aus den Entscheidungen schätzen

Ein Umfragesystem kann den mittleren Teil problemlos darstellen und speichern. Damit allein hat man aber noch keine vollständige MaxDiff-Analyse.

Das Experimental Design vor der Befragung und die Auswertung danach gehören genauso zum Verfahren wie die sichtbare Best-Worst-Frage.

Wenn „wichtig“ nicht mehr reicht

Eine klassische Bewertungsskala ist nicht grundsätzlich schlecht. Wenn wir wissen möchten, ob Hotelgäste mit der Sauberkeit zufrieden sind, kann eine Skala genau das richtige Instrument sein.

Eine Multiple-Choice-Frage ist ebenfalls nicht grundsätzlich schlechter. Wenn wir lediglich vier Dinge auswählen lassen möchten, kann genau das die passende Frage sein.

Und wenn wir nur wissen möchten, welche vier Eigenschaften ganz oben stehen und in welcher Reihenfolge, kann ein Top-4-Ranking wesentlich einfacher sein als eine MaxDiff-Untersuchung.

Problematisch werden diese Verfahren erst, wenn wir von ihnen eine Antwort auf eine Frage erwarten, die sie gar nicht gestellt haben.

MaxDiff interessiert sich nicht nur dafür, welche Items ausgewählt werden. Es sammelt über viele kleine Entscheidungen Informationen darüber, wie die untersuchten Items relativ zueinander stehen.

Die Ausgangsfrage lautet deshalb nicht:

Welche Methode ist die beste?

Sondern:

Was möchte ich am Ende über die Präferenzen meiner Befragten wissen?

Wenn die Antwort darauf lautet, dass wir nicht nur einige Gewinner suchen, sondern die relative Präferenzstruktur aller untersuchten Alternativen verstehen möchten, dann wird MaxDiff interessant.

Denn manchmal reicht es nicht zu wissen, dass etwas wichtig ist.

Man muss wissen, was wichtiger ist als etwas anderes.