Der Stand der Zugänglichkeit eines Angebots ergibt sich aus drei Prüfebenen, die verschiedene Fragen beantworten. Werkzeuge prüfen maschinenlesbare Regeln, die Expert Evaluation prüft die Gestaltung gegen Kriterien, der Test mit Nutzenden prüft Effektivität, Effizienz und Zufriedenstellung nach ISO 9241-11. Dieser Beitrag ordnet die drei Ebenen nach Reichweite und Grenzen, damit Teams sehen, welche Frage sich auf welcher Ebene beantworten lässt.
Ausgangslage
In vielen Organisationen gilt eine bestandene automatisierte Prüfung als Nachweis der Zugänglichkeit. Dann kommt eine Beschwerde: Eine Kundin konnte mit Screenreader das Formular nicht abschicken, das die Prüfung ohne Befund passiert hat. Beide Aussagen stimmen. Das Werkzeug hat geprüft, was es prüfen kann, und die Kundin hat erlebt, was das Werkzeug nicht prüft.
Die drei Ebenen ersetzen sich nicht gegenseitig. Sie bauen aufeinander auf, und jede hat eine Reichweite, die sich benennen lässt.
Ebene 1: Die automatisierte Prüfung
Werkzeuge prüfen, was sich aus dem Code ablesen lässt: fehlende Alternativtexte, fehlende Beschriftungen von Formularfeldern, Kontrastwerte, Überschriftenhierarchie, Sprachauszeichnung, doppelte Kennungen. Sie tun das schnell, wiederholbar und über viele Seiten hinweg.
Ihre Grenze liegt in der Frage, die sie stellen. Ein Werkzeug erkennt, dass ein Formularfeld eine Beschriftung hat. Es erkennt nicht, ob die Beschriftung das Feld erklärt. Es erkennt, dass eine Seite eine Überschriftenhierarchie hat. Es erkennt nicht, ob die Überschriften die Struktur wiedergeben, mit der eine Person mit Screenreader navigiert. Und es erkennt keine Reihenfolge: Ob der Fokus nach dem Absenden an einer sinnvollen Stelle landet, ob die Fehlermeldung angesagt wird, ob die Sprachausgabe im PDF die Absätze in der richtigen Reihenfolge liest, steht in keiner Regel, die ein Werkzeug prüft.
Die automatisierte Prüfung beantwortet die Frage: Welche maschinenlesbaren Regeln verletzt der Code? Sie ist die Grundlage der beiden anderen Ebenen, weil sie Befunde liefert, die niemand von Hand suchen sollte.
Ebene 2: Die Expert Evaluation
In der Expert Evaluation prüfen Fachleute das Angebot gegen Kriterien, die sich nicht aus dem Code ablesen lassen: gegen die Erfolgskriterien der WCAG, gegen die Grundsätze der Dialoggestaltung nach ISO 9241-110 und gegen die Erwartungen, die sich aus dem Nutzungskontext ergeben. Sie bedienen das Angebot mit Tastatur, mit Screenreader, mit Vergrößerung, und sie beurteilen, ob Beschriftungen verständlich sind, ob der Fokus nachvollziehbar wandert, ob Fehlermeldungen erwartungskonform sind.
Ihre Reichweite ist größer als die des Werkzeugs: Sie findet die unverständliche Beschriftung, den Fokus, der ins Leere springt, das Menü, das sich mit Tastatur öffnet, aber nicht schließt. Und sie ist schneller als ein Test mit Nutzenden, weil sie keine Rekrutierung braucht.
Ihre Grenze liegt in der Perspektive. Fachleute prüfen mit Wissen über das Angebot und über die Regeln. Sie sehen, was gegen ein Kriterium verstößt. Sie sehen nicht, ob eine Person, die das Angebot zum ersten Mal mit ihrer eigenen Technologie in ihren eigenen Einstellungen bedient, die Aufgabe zu Ende führt. Eine Expert Evaluation kann ein Formular für bedienbar halten, das im Test an einer Ansage scheitert, die die Fachleute überhört haben, weil sie wussten, was kommt.
Die Expert Evaluation beantwortet die Frage: Welche Kriterien verletzt die Gestaltung?
Ebene 3: Der Test mit Nutzenden assistiver Technologien
Im Test führen Menschen, die Screenreader, Vergrößerung oder Sprachsteuerung routiniert einsetzen und zur Nutzergruppe des Angebots gehören, Aufgaben aus dem Nutzungskontext aus. Sie arbeiten mit ihrer eigenen Technologie in ihrer eigenen Umgebung. Wir beobachten und messen nach ISO 9241-11: Wird das Ziel erreicht (Effektivität)? Mit welchem Aufwand (Effizienz)? Wie beurteilt die Person die Aufgabe (Zufriedenstellung)?
Seine Reichweite ist die Aufgabe als Ganzes. Der Test zeigt Abbrüche, die weder Werkzeug noch Expert Evaluation gemeldet haben, weil sie an einem Zusammenspiel liegen: eine Ansage, die formal korrekt ist und im Kontext in die Irre führt; ein Fokus, der an einer Stelle landet, die den Fachleuten sinnvoll erschien und den Nutzenden nicht; ein Umweg, den eine routinierte Person nimmt und der im Protokoll als Aufwand erscheint, obwohl die Aufgabe gelingt. Geprüft mit Menschen, die Screenreader, Vergrößerung und Sprachsteuerung benutzen.
Seine Grenze liegt im Umfang. Ein Test prüft die Aufgaben, die im Testplan stehen, mit den Technologien, die rekrutiert wurden, zu einem Zeitpunkt. Er findet keine fehlenden Alternativtexte auf Seiten, die keine Aufgabe berührt. Er ist aufwendiger als die beiden anderen Ebenen, und er braucht die Rekrutierung von Teilnehmenden, die ihre Technologie beherrschen und zur Domäne passen.
Der Test beantwortet die Frage: Können die Menschen, für die das Angebot gedacht ist, ihre Aufgaben damit zu Ende führen?
Die Ebenen zusammensetzen
Aus den drei Fragen ergibt sich die Reihenfolge. Die automatisierte Prüfung läuft zuerst und wiederholt sich mit jedem Release; ihre Befunde behebt die Entwicklung, bevor Fachleute oder Nutzende Zeit darauf verwenden. Die Expert Evaluation läuft vor dem Test und räumt die Verstöße aus, die den Test sonst an Stellen abbrechen lassen, die schon bekannt sind. Der Test mit Nutzenden läuft für die Nutzungssituationen mit der größten Reichweite und den schwersten Folgen eines Abbruchs, und er wiederholt sich als Nachprüfung nach der Korrektur.
Der Stand der Zugänglichkeit ist die Summe der drei Berichte, je mit Umfang, Methode und Datum. Eine bestandene Werkzeugprüfung allein beschreibt Ebene 1. Ob und wie Regelwerke wie BFSG, BITV oder WCAG-Konformitätsstufen eine dieser Ebenen verlangen, klärt die Rechtsabteilung; die drei Ebenen beantworten die Frage nach der Bedienbarkeit, und diese Frage steht unabhängig davon.
Grenzen des Modells
Die drei Ebenen decken nicht alle Prüfgegenstände gleich gut ab. Bei Korrespondenz, also E-Mails, PDFs, Formularen und Bescheiden aus dem Output-Management, ist die automatisierte Prüfung besonders begrenzt, weil Lesereihenfolge und Formularbeschriftungen im PDF von Werkzeugen kaum geprüft werden. Hier verschiebt sich das Gewicht auf Ebene 2 und 3.
Und die Ebenen sagen nichts über die Behebung. Ein Befund mit Schweregrad ist ein Befund; ob er behoben wird, entscheidet die Organisation, und ob die Behebung angekommen ist, zeigt erst die Nachprüfung.
Was danach vorliegt
Nach dem Vorgehen liegt je Angebot ein Stand aus drei Berichten vor: die Regelverstöße aus der Werkzeugprüfung, die Kriterienverstöße aus der Expert Evaluation und die Befunde mit Schweregrad aus dem Test mit Nutzenden, je mit Umfang, Methode und Datum. Das Team kann für jede Frage sagen, auf welcher Ebene sie beantwortet wurde und welche Ebene noch fehlt.
