Ein Team berichtet nach dem Release, die Erfolgsquote sei gestiegen, und kann auf Nachfrage nicht sagen, mit wem und unter welchen Bedingungen gemessen wurde. ISO 9241-11 definiert Gebrauchstauglichkeit über drei Messgrößen: Effektivität, Effizienz und Zufriedenstellung. Alle drei gelten nur für einen festgelegten Nutzungskontext. Wer einen Wert aus zwei verschiedenen Kontexten vergleicht, hat zwei Zahlen ohne gemeinsamen Bezugsrahmen und damit keine Aussage über eine Verbesserung.
Ausgangslage: eine Zahl ohne Bezugsrahmen
Im Review nach dem Release steht auf der Folie: Erfolgsquote gestiegen. Wir fragen, mit wem, an welcher Aufgabe und in welcher Umgebung gemessen wurde, und die Antwort dauert. Der neue Wert stammt aus einem unmoderierten Remote-Test mit Mitarbeitenden aus dem eigenen Haus, der alte aus einem moderierten Test mit Kundinnen und Kunden vor Ort. Beide Zahlen sind für sich richtig. Gegeneinander gehalten sagen sie nichts über die Wirkung des Releases. Diese Situation haben wir in mehreren Projekten erlebt, und sie ist der Grund, warum wir den Nutzungskontext vor die Kennzahl stellen.
ISO 9241-11 gibt dafür die Struktur vor. Die Norm definiert Gebrauchstauglichkeit als das Ausmaß, in dem ein System, ein Produkt oder eine Dienstleistung durch bestimmte Nutzende in einem bestimmten Nutzungskontext genutzt werden kann, um bestimmte Ziele effektiv, effizient und zufriedenstellend zu erreichen. In dieser Definition stecken die drei Messgrößen und die Bedingung, unter der sie gelten.
Effektivität: Genauigkeit und Vollständigkeit der Zielerreichung
Effektivität beschreibt, ob Nutzende ihr Ziel erreichen, und mit welcher Genauigkeit und Vollständigkeit. Die übliche Kennzahl ist die Erfolgsquote je Aufgabe: der Anteil der Sitzungen, in denen das Ziel erreicht wurde. Dazu kommen Fehlerarten und der Grad der Vollständigkeit, etwa wenn ein Auftrag angelegt, aber ohne eine Pflichtangabe gespeichert wurde.
Legen Sie das Ziel fest, bevor die erste Sitzung läuft. Ohne Zielbeschreibung entscheidet die auswertende Person im Nachhinein, was als Erfolg zählt, und zwei Auswertende kommen zu zwei Quoten. Das ist uns in einer frühen Testreihe passiert; seitdem steht die Erfolgsdefinition je Aufgabe im Testplan, bevor rekrutiert wird. Wie Nutzungsziele vorab festgelegt werden, beschreibt der Beitrag `nutzungsziele-vor-der-messung`.
Effizienz: Aufwand im Verhältnis zum Ergebnis
Effizienz setzt den eingesetzten Aufwand ins Verhältnis zur erreichten Effektivität. Gemessen wird der Aufwand als Zeit bis zur Zielerreichung, als Anzahl der Schritte oder Eingaben, als Anzahl der Hilfeanfragen oder als Zahl der Korrekturen. Welche dieser Größen sinnvoll ist, hängt von der Aufgabe ab. Bei einer Aufgabe, die mehrmals pro Schicht anfällt, zählt die Zeit. Bei einer Aufgabe, die einmal im Quartal ansteht, zählt eher die Zahl der Rückfragen.
Effizienz ohne Effektivität ist keine Aussage. Eine Aufgabe, die schnell abgebrochen wurde, hat eine kurze Bearbeitungszeit und keinen Erfolg. Deshalb bilden wir Effizienzwerte nur über die erfolgreichen Sitzungen oder weisen sie getrennt nach Erfolg und Abbruch aus.
Zufriedenstellung: Einstellungen und Reaktionen
Zufriedenstellung umfasst nach der Norm die physischen, kognitiven und emotionalen Reaktionen der Nutzenden sowie ihre Einstellung zur Nutzung. Gemessen wird sie in der Regel über standardisierte Fragebögen nach der Aufgabe oder nach der Sitzung, ergänzt um Äußerungen während der Beobachtung.
Zufriedenstellung ist die einzige der drei Messgrößen, die aus der Selbstauskunft stammt. Sie weicht regelmäßig von dem ab, was wir beobachtet haben: Eine Testperson bewertet eine Aufgabe als einfach, die sie im Test nicht abgeschlossen hat. Diese Abweichung ist selbst ein Befund und gehört in den Bericht. Der Beitrag `subjektiv-und-beobachtet-im-selben-bericht` beschreibt ein Berichtsformat dafür.
Die Bedingung: der festgelegte Nutzungskontext
Jede der drei Messgrößen gilt für einen Nutzungskontext. Der Nutzungskontext besteht nach ISO 9241-11 aus den Nutzenden, ihren Zielen und Aufgaben, den Ressourcen und der Umgebung, und zwar der physischen, sozialen, organisatorischen und technischen Umgebung. Wird eines dieser Elemente verändert, verändert sich der Wert, ohne dass sich das Produkt verändert hat.
Daraus folgt die Regel für den Vergleich: Zwei Werte lassen sich nur dann als Verbesserung oder Verschlechterung lesen, wenn sie im selben dokumentierten Nutzungskontext erhoben wurden. Im Beispiel oben unterscheiden sich Nutzergruppe, Umgebung und Erhebungsform. Der Vergleich ist damit ungültig, unabhängig davon, wie sorgfältig jede einzelne Messung war.
Der Einwand, dass ein Team nicht jede Messung unter denselben Bedingungen wiederholen kann, trifft zu. Deshalb schreiben wir den Nutzungskontext in jeden Messbericht, so vollständig, dass eine spätere Messung ihn reproduzieren kann oder die Abweichung benennt. Welche Angaben dafür nötig sind, listet der Beitrag `nutzungskontext-macht-werte-vergleichbar`.
Grenzen der drei Messgrößen
Die drei Messgrößen beschreiben die Gebrauchstauglichkeit eines Systems. Sie sind keine Geschäftskennzahl. Ob eine höhere Erfolgsquote zu weniger Support-Anfragen führt, ist eine eigene Messung mit eigener Vergleichsbasis.
Sie sind außerdem aggregierte Werte. Eine Erfolgsquote sagt, wie viele Sitzungen das Ziel erreicht haben. Woran die übrigen gescheitert sind, steht im Befundkatalog, der aus der Beobachtung entsteht. Kennzahl und Befund gehören zusammen in den Bericht.
Schließlich hängen die Werte von der Stichprobe ab. Mit wenigen Sitzungen schwankt jede Quote von Erhebung zu Erhebung. Eine Veränderung ist erst dann ein Hinweis auf das Produkt, wenn sie sich über mehrere Erhebungen im selben Kontext wiederholt.
Was danach vorliegt
Wer mit den drei Messgrößen arbeitet, hat nach der ersten Erhebung je Aufgabe eine Erfolgsquote mit dokumentierter Erfolgsdefinition, einen Effizienzwert über die erfolgreichen Sitzungen, einen Fragebogenwert für die Zufriedenstellung und ein Kontextblatt, das Nutzende, Aufgaben, Arbeitsmittel und Umgebung beschreibt. Mit dieser Grundlage wird die nächste Erhebung vergleichbar, und die Frage aus dem Review, ob das Release gewirkt hat, bekommt eine prüfbare Antwort.
