Wiederholte Aufgaben zeigen die Streuung einer KI-Funktion

Wiederholte Aufgaben zeigen die Streuung einer KI-Funktion

Wiederholte Aufgaben zeigen die Streuung einer KI-Funktion

Wiederholte Aufgaben zeigen die Streuung einer KI-Funktion

|

KI menschzentriert

Von

leefs Redaktion

In moderierten Usability-Tests einer Funktion mit generierter Ausgabe haben wir beobachtet, dass Teilnehmende dieselbe Funktion unterschiedlich bewerten, je nachdem welche Ausgabe sie im ersten Durchlauf gesehen haben. Die erste Ausgabe setzt den Maßstab für die folgenden. Der Beitrag beschreibt den Effekt, wie wir ihn in der Auswertung gefunden haben und was er für die Interpretation von Zufriedenheitsurteilen bedeutet.

Die Situation

Getestet wurde eine Fachanwendung, in der eine Funktion aus eingehenden Vorgängen eine Zusammenfassung erzeugt, mit der Sachbearbeitende den Vorgang einer Bearbeitungsgruppe zuordnen. Die Testaufgaben enthielten je Fall mehrere Durchläufe; die Teilnehmenden bearbeiteten denselben Fall im Verlauf der Sitzung mehrfach und bewerteten nach jedem Durchlauf die Ausgabe. Am Ende der Sitzung gaben sie ein Gesamturteil zur Funktion ab.

Die Ausgaben streuten wie erwartet. Manche enthielten alle Pflichtangaben, andere ließen eine aus oder ordneten eine Angabe falsch zu. Welche Ausgabe eine Person im ersten Durchlauf bekam, war Zufall. Dass dieser Zufall die Ergebnisse prägen würde, hatten wir im Testdesign nicht vorgesehen.

Was sich zeigte

Aufgefallen ist es beim Blick auf die Gesamturteile. Sie lagen weit auseinander, weiter als bei anderen Funktionen derselben Anwendung, und mein erster Gedanke war, dass wir zwei Gruppen in der Stichprobe hatten: erfahrene Sachbearbeitende, die der Funktion misstrauen, und weniger erfahrene, die sie begrüßen. Wir haben die Urteile nach Berufserfahrung sortiert. Das Bild wurde dadurch nicht klarer. Dann hat eine Kollegin die Reihenfolge der Ausgaben je Person danebengelegt, und die Urteile ordneten sich neu.

Teilnehmende, deren erste Ausgabe vollständig war, bewerteten die Funktion im Gesamturteil positiv, auch wenn spätere Durchläufe Ausgaben mit fehlenden Angaben enthielten. In den Protokollen zeigte sich dazu ein Verhaltensmuster: Sie lasen die späteren Ausgaben kürzer, prüften seltener gegen das Original und übernahmen fehlende Angaben häufiger unbemerkt. Die fehlerhafte Ausgabe erschien ihnen als Ausnahme einer Funktion, die sie als zuverlässig kennengelernt hatten.

Teilnehmende, deren erste Ausgabe eine Angabe ausließ, bewerteten die Funktion im Gesamturteil schlechter, auch wenn die folgenden Ausgaben innerhalb des Toleranzbereichs lagen. Sie prüften jede weitere Ausgabe gegen das Original, brauchten dafür länger und beschrieben die Funktion im Nachgespräch als unzuverlässig. Einige dieser Personen umgingen die Funktion in den späteren Durchläufen und ordneten den Fall ohne Zusammenfassung zu.

Die Bewertungen je Durchlauf zeigten das Muster ebenfalls: Dieselbe Ausgabe erhielt von Personen mit guter erster Erfahrung ein besseres Urteil als von Personen mit schlechter erster Erfahrung. Das Gesamturteil zur Funktion sagte damit weniger über die Funktion als über die Reihenfolge, in der die Person die Ausgaben gesehen hatte.

Einordnung

Zufriedenstellung nach ISO 9241-11 ist eine Größe, die sich aus der Nutzung ergibt. Bei einer deterministischen Funktion erleben alle Teilnehmenden dieselbe Nutzung, und Unterschiede im Urteil gehen auf die Personen zurück. Bei einer schwankenden Ausgabe erlebt jede Person eine andere Abfolge, und das Urteil enthält beides: die Funktion und den Zufall der Reihenfolge.

Der Effekt hat eine zweite Folge, und die halte ich für die wichtigere. Die Personen mit guter erster Erfahrung prüften weniger und übernahmen mehr Fehler. Das ist eine Frage der Effektivität: Ob das Endergebnis stimmt, hängt dann davon ab, welche Ausgabe die Person zuerst gesehen hat. Ein Zufriedenheitsurteil, das für die Funktion spricht, kann mit einem Endergebnis zusammenfallen, das gegen sie spricht. Wer allein die Zufriedenstellung misst, gibt diese Funktion frei.

Ob sich das Muster in anderen Anwendungen und mit anderen Nutzergruppen wiederholt, können wir aus einer Testreihe nicht sagen. Meine Vermutung ist, dass es sich bei jeder Funktion zeigt, deren Ausgabe schwankt und deren Fehler nicht auf den ersten Blick sichtbar sind; ein Nachweis über mehrere Projekte fehlt uns. Wie viele Durchläufe nötig sind, bis sich das Urteil vom ersten Eindruck löst, ist offen. Der Einwand, dass ein solcher erster Eindruck auch im Betrieb entsteht und der Test damit die Nutzung abbildet, trifft zu. Er ändert nichts daran, dass das Urteil dann über die Reihenfolge Auskunft gibt und nicht über die Funktion.

Was sich abstellen lässt

Im Testdesign wird die Reihenfolge der Ausgaben kontrolliert. Wenn das Testteam Fehlerfälle vorab festlegt, verteilt es sie über die Positionen: Ein Teil der Teilnehmenden sieht den Fehlerfall im ersten Durchlauf, ein Teil später. In der Auswertung werden die Urteile nach dieser Position getrennt betrachtet. Die Bewertung wird je Durchlauf erhoben, damit sich das Urteil zu einer einzelnen Ausgabe vom Gesamturteil trennen lässt. Und das Protokoll hält je Durchlauf fest, wie gründlich die Person geprüft hat, damit sich der Zusammenhang zwischen erster Erfahrung und späterer Prüfung zeigen lässt.

Für die Gestaltung der Funktion folgt daraus, dass die Oberfläche die Schwankung von Anfang an erkennbar machen sollte. Eine Ausgabe, die als Vorschlag gekennzeichnet ist und ihre unsicheren Stellen zeigt, gibt der Person mit guter erster Erfahrung einen Anlass, weiter zu prüfen. Ob das ausreicht, ist im Test zu prüfen.