Wer im Test nicht vertreten ist, erzeugt keine Befunde. Ob eine KI-Funktion eine Gruppe benachteiligt, zeigt sich deshalb nur, wenn diese Gruppe in der Testgruppe sitzt. Diese Anleitung beschreibt, wie Sie die Zusammensetzung der Testgruppe aus der Kontextbeschreibung ableiten, wie Sie die Merkmale in Screener-Kriterien überführen und woran Sie im Recruiting erkennen, dass eine relevante Gruppe fehlt. Sie richtet sich an Teams, die einen Usability-Test für eine Fachanwendung oder ein Kundenportal mit generierten Ausgaben planen.
Voraussetzungen
Sie brauchen eine Kontextbeschreibung nach ISO 9241-210 mit Nutzergruppen, Aufgaben, Arbeitsmitteln und Umgebung, erhoben aus Beobachtung und Interviews. Sie brauchen die Liste der KI-Funktionen im Produkt mit den Aufgaben, in denen sie wirken. Und Sie brauchen Zugang zu Rekrutierung: ein eigenes Panel, den Kundenstamm, ein Verzeichnis der Beschäftigten oder einen Dienstleister, der zur Domäne passt.
Schritt 1: Die betroffenen Aufgaben je Funktion bestimmen
Was: Gehen Sie jede KI-Funktion durch und notieren Sie, in welcher Aufgabe aus der Kontextbeschreibung sie eine Ausgabe liefert, was die Person mit der Ausgabe tut und was passiert, wenn die Ausgabe falsch ist. Eine Funktion, die Anfragen im Kundenservice zusammenfasst, wirkt in der Aufgabe „Anfrage bearbeiten"; die Person entscheidet auf Grundlage der Zusammenfassung, und eine falsche Zusammenfassung führt zu einer falschen Antwort an die Kundin.
Warum: Die Testgruppe wird je Aufgabe zusammengestellt. Wer die Aufgabe nicht kennt, kann die Gruppen nicht benennen, die sie ausführen.
Ergebnis: Eine Tabelle mit Funktion, Aufgabe, Verwendung der Ausgabe und Folge eines Fehlers.
Schritt 2: Die Nutzergruppen je Aufgabe aufteilen
Was: Ziehen Sie je Aufgabe die Nutzergruppen aus der Kontextbeschreibung und teilen Sie sie nach Merkmalen auf, die das Ergebnis der Funktion oder seine Verwendbarkeit verändern können. Aus unseren Projekten sind das in der Regel fünf Merkmale: die Eingabe, mit der die Gruppe arbeitet (Fachsprache, Dialekt, Schreibweise, Format der Dokumente); die Arbeitsmittel, mit denen sie die Ausgabe wahrnimmt (Gerät, Bildschirmgröße, Screenreader, Vergrößerung, Sprachsteuerung); die Umgebung, in der sie prüft (Licht, Lärm, Zeitdruck, freie Hände); der Fallmix, den sie bearbeitet (Standardfälle, Ausnahmen, seltene Sparten); und der Erfahrungsgrad mit der Aufgabe und mit vergleichbaren Systemen.
Warum: Eine Nutzergruppe, die in der Kontextbeschreibung „Sachbearbeitung" heißt, enthält Personen, für die die Funktion verschieden gut arbeitet. Die Aufteilung nach diesen Merkmalen macht die Untergruppen sichtbar, bevor der Test beginnt.
Ergebnis: Je Aufgabe eine Liste von Untergruppen mit den Merkmalen, die sie unterscheiden, und mit der Quelle in der Kontextbeschreibung.
Schritt 3: Die Sollzusammensetzung festlegen
Was: Legen Sie fest, welche Untergruppen in der Testgruppe vertreten sein müssen. Untergruppen, bei denen die Folge eines Fehlers aus Schritt 1 hoch ist, oder deren Merkmale die Funktion vermutlich schlechter bedient, gehören in jedem Fall hinein. Halten Sie die Sollzusammensetzung als Raster fest: Untergruppe, Merkmale, Zahl der Sitzungen. Wie viele Sitzungen je Untergruppe nötig sind, legen Sie je Projekt aus der Fragestellung fest; einen allgemeinen Wert gibt es nicht.
Warum: Ohne Sollzusammensetzung füllt das Recruiting die Testgruppe mit den Personen, die am leichtesten zu erreichen sind. Das sind selten die Personen, für die die Funktion am schlechtesten arbeitet.
Ergebnis: Ein Raster mit Untergruppen und Sitzungen, das dem Recruiting als Auftrag dient.
Schritt 4: Die Merkmale in Screener-Kriterien überführen
Was: Formulieren Sie je Merkmal aus Schritt 2 eine Frage für den Screener, die sich mit einer Angabe beantworten lässt: welche Dokumente die Person in der Aufgabe bearbeitet, mit welchem Gerät und welcher assistiven Technologie sie arbeitet, an welchem Ort und zu welcher Zeit, welche Fälle sie zuletzt bearbeitet hat, seit wann sie die Aufgabe ausführt. Fragen Sie nach der Tätigkeit, nicht nach der Zugehörigkeit zu einer Gruppe. Eine Frage nach der Behinderung ist weder nötig noch zulässig; die Frage nach der eingesetzten Technologie liefert die Angabe, die der Test braucht.
Warum: Der Screener ist die Stelle, an der eine Untergruppe in die Testgruppe kommt oder nicht. Eine Untergruppe, nach der der Screener nicht fragt, ist im Test nur zufällig vertreten.
Ergebnis: Ein Screener, dessen Fragen sich auf das Raster aus Schritt 3 abbilden lassen.
Schritt 5: Das Recruiting gegen das Raster prüfen
Was: Vergleichen Sie während des Recruitings laufend die rekrutierten Personen mit dem Raster und achten Sie auf fünf Zeichen, dass eine Untergruppe fehlt: Alle Teilnehmenden kommen aus derselben Abteilung oder demselben Standort. Alle wurden über denselben internen Verteiler gewonnen. Eine Zelle des Rasters bleibt leer, während die anderen voll sind. Absagen häufen sich in einer Untergruppe, etwa weil der Termin in ihrer Arbeitszeit liegt oder der Zugang zur Sitzung für ihre Technologie nicht funktioniert. Oder jemand im Team schlägt vor, eine Untergruppe wegzulassen, weil sie klein sei.
Warum: Standard-Panels liefern Teilnehmende, aber selten Ihre Nutzenden. Die Untergruppen, die am schwersten zu rekrutieren sind, sind oft die, für die die Funktion am schlechtesten arbeitet. Ein Recruiting, das nur die erreichbaren Personen liefert, bestätigt die Funktion für die Gruppen, für die sie ohnehin gebaut wurde.
Ergebnis: Ein gefülltes Raster oder eine dokumentierte Lücke mit dem Vermerk, welche Untergruppe nicht vertreten ist und was der Test über sie deshalb nicht aussagen kann.
Schritt 6: Aufgaben und Auswertung je Untergruppe planen
Was: Alle Untergruppen bekommen dieselben Testaufgaben mit denselben Erfolgskriterien, darunter Aufgaben, in denen die Ausgabe der Funktion einen Fehler enthält. Die Auswertung führt je Befund die Untergruppe, in der er aufgetreten ist, und vergleicht Effektivität, Effizienz und Zufriedenstellung nach ISO 9241-11 zwischen den Untergruppen.
Warum: Verzerrung ist eine Differenz zwischen Gruppen. Sie wird nur sichtbar, wenn die Gruppen dieselben Aufgaben bekommen und die Auswertung nach Gruppen trennt.
Ergebnis: Ein Testplan mit Aufgaben, Erfolgskriterien und einem Auswertungsraster, das Befunde je Untergruppe ausweist.
Typische Fehler
Die Testgruppe wird aus der Liste der Pilotanwender zusammengestellt, die sich freiwillig gemeldet haben; sie sind erfahren, motiviert und arbeiten am Hauptstandort. Der Screener fragt nach der Rolle und nicht nach Arbeitsmitteln und Umgebung. Eine Untergruppe wird gestrichen, weil ihre Rekrutierung länger dauert als der Testtermin erlaubt, und die Lücke steht nicht im Bericht. Die Auswertung fasst alle Sitzungen zusammen, und eine Untergruppe, die an der Aufgabe gescheitert ist, verschwindet im Durchschnitt.
Was am Ende vorliegt
Ein Raster mit Untergruppen je Aufgabe, ein Screener, der auf das Raster abbildet, ein Recruiting-Stand mit gefüllten Zellen oder dokumentierten Lücken, und ein Testplan mit Auswertung je Untergruppe. Nach dem Test liegen Befunde vor, die einer Untergruppe zugeordnet sind, und eine Aussage darüber, für welche Untergruppen der Test keine Aussage erlaubt.
