Task-Erfolg braucht eine dokumentierte Erfolgsdefinition

Task-Erfolg braucht eine dokumentierte Erfolgsdefinition

Task-Erfolg braucht eine dokumentierte Erfolgsdefinition

Task-Erfolg braucht eine dokumentierte Erfolgsdefinition

|

Wirkung messen

Von

leefs Redaktion

Ob eine Aufgabe als gelöst gilt, ist eine Festlegung und keine Beobachtung. In der Sitzung sieht die auswertende Person, was passiert ist. Ob das als Erfolg zählt, entscheidet eine Regel, die vorher aufgeschrieben wurde. Der Beitrag zeigt, wie Erfolg, Erfolg mit Umweg, Teilerfolg und Abbruch vorab abgegrenzt werden, damit die Erfolgsquote zwischen Sitzungen und zwischen Auswertenden stabil bleibt.

Ausgangslage: dieselbe Sitzung, zwei Quoten

Zwei Auswertende sehen dieselbe Aufzeichnung. Die Teilnehmerin erreicht den Zielbildschirm, nachdem die Moderation auf den richtigen Bereich hingewiesen hat. Sie speichert, lässt aber ein Pflichtfeld leer, das das System nicht prüft. Die eine Auswertende zählt Erfolg, weil der Zielbildschirm erreicht wurde. Die andere zählt Abbruch, weil es Hilfe gab und das Ergebnis unvollständig ist. Beide haben dieselbe Sitzung gesehen und kommen zu verschiedenen Erfolgsquoten.

Der Unterschied liegt nicht in der Beobachtung. Er liegt in der Regel, die jede der beiden im Kopf hatte. Solange diese Regel nicht aufgeschrieben ist, misst die Erfolgsquote die auswertende Person mit.

Erfolg ist eine Festlegung

ISO 9241-11 definiert Effektivität als Genauigkeit und Vollständigkeit, mit der Nutzende ein Ziel erreichen. Die Erfolgsdefinition übersetzt das je Aufgabe in prüfbare Kriterien: den Endzustand, der das Ziel anzeigt, die Angaben, die korrekt sein müssen, und die Angaben, die vollständig sein müssen. Wie das Nutzungsziel und der Endzustand vorab beschrieben werden, steht im Beitrag `nutzungsziele-vor-der-messung`. Dieser Beitrag setzt dort an und legt die Stufen zwischen Erfolg und Abbruch fest.

Vier Stufen und ihre Abgrenzung

Erfolg. Der Endzustand ist erreicht, ohne Hilfe, mit den vereinbarten Angaben korrekt und vollständig. Der Weg dorthin spielt für diese Stufe keine Rolle.

Erfolg mit Umweg. Der Endzustand ist erreicht, ohne Hilfe, aber der Weg enthält Rückschritte, Fehleingaben mit Korrektur oder Suchphasen. Was als Umweg zählt, wird vorab festgelegt, zum Beispiel das Verlassen des Zielbereichs und die Rückkehr oder eine Fehleingabe, die die Teilnehmende selbst bemerkt und korrigiert. Für die Erfolgsquote zählt diese Stufe als Erfolg. Für die Effizienz und für den Befundkatalog wird sie getrennt ausgewiesen.

Teilerfolg. Der Endzustand ist erreicht, aber unvollständig oder mit einem Fehler, der nach Definition das Ziel beeinträchtigt, ohne es zu verfehlen. Oder der Endzustand wurde nur mit Hilfe erreicht. Ob Hilfe als Teilerfolg oder als Abbruch gilt, ist eine Entscheidung, die vor der ersten Sitzung im Testplan steht.

Abbruch. Das Ziel wurde nicht erreicht. Dazu gehören drei Fälle: Die Teilnehmenden geben auf, die Moderation bricht wegen der Zeit ab, oder die Teilnehmenden halten die Aufgabe für erledigt, obwohl der Endzustand nicht erreicht ist. Der dritte Fall wird gesondert markiert. Im Betrieb löst er keine Rückfrage aus und bleibt deshalb unbemerkt, bis der Fehler an anderer Stelle auffällt.

Hilfe der Moderation als Grenzfall

Die häufigste Unschärfe entsteht bei der Hilfe. Die Erfolgsdefinition legt deshalb fest, was als Hilfe zählt. Die Wiederholung der Aufgabe im Wortlaut ist keine Hilfe. Die Frage „Was würden Sie jetzt tun?" ist keine Hilfe. Der Hinweis auf einen Bereich, einen Begriff oder einen Schritt ist Hilfe. Die Moderation protokolliert jede Hilfe mit Zeitmarke, damit die Auswertung sie zuordnen kann.

Kalibrierung zwischen Auswertenden

Vor der ersten Auswertung stufen zwei Personen eine Probesitzung unabhängig voneinander ein. Wo sie abweichen, wird die Definition ergänzt und der Fall als Zweifelsfall dokumentiert. Diese Liste wächst über die Auswertung mit und wird Teil des Testplans. In unserem Auswertungsverfahren für moderierte Usability-Tests gehört diese Kalibrierung zum Standard, zusammen mit stabilen Befund-IDs und kalibrierten Schweregraden. Das Ziel ist, dass eine dritte Person mit der Definition und der Zweifelsfall-Liste zu derselben Einstufung kommt.

Grenzen

Die Erfolgsdefinition gilt für eine Version des Produkts. Verändert ein Release den Endzustand, etwa weil ein Schritt entfällt, wird die Definition angepasst und mit neuem Versionsstand geführt. Der Vergleich zur vorherigen Erhebung erhält dann einen Vermerk.

Die Erfolgsquote ist ein aggregierter Wert. Mit wenigen Sitzungen verschiebt eine einzelne Einstufung die Quote deutlich. Die Stufen sind deshalb im Bericht einzeln ausgewiesen, zusätzlich zur Quote.

Die Definition ersetzt die Beobachtung nicht. Warum eine Teilnehmende gescheitert ist, steht im Befundkatalog. Die Erfolgsdefinition sagt nur, dass sie gescheitert ist und in welcher Stufe.

Was danach vorliegt

Je Aufgabe liegt eine Erfolgsdefinition mit vier Stufen vor, mit der Regel für Hilfe und mit einer Liste dokumentierter Zweifelsfälle. Die Erfolgsquote, die daraus entsteht, ist zwischen Sitzungen und zwischen Auswertenden stabil und kann in der nächsten Erhebung mit demselben Maßstab wiederholt werden. Im Bericht stehen Quote und Stufenverteilung nebeneinander, mit Verweis auf die Befunde, die die Abbrüche erklären.