AI Evaluation (Eval)
Ein Eval ist ein geplanter Test, mit dem überprüft wird, wie ein KI-Modell oder ein darauf aufbauendes System bei festgelegten Aufgaben abschneidet. Dazu gehören passende Testfälle, ein Bewertungsmaßstab und die klare Trennung von gültigen Ergebnissen und technischen Ausfällen.
Eine Evaluation beginnt mit der Frage, was überhaupt gemessen werden soll. Danach werden repräsentative Aufgaben und Kriterien festgelegt, Antworten erfasst und nach einem dokumentierten Verfahren bewertet.
Ein einzelner Zahlenwert erzählt wenig, wenn Testfälle, Nenner oder Ausfälle unklar sind. Ein Eval kann Modellverhalten, ein komplettes System oder einen konkreten Arbeitsablauf untersuchen. Sein Ergebnis gilt zunächst für genau diesen Aufbau.
Praktische Bedeutung
Ein Eval hilft, vor einer Einführung oder Änderung konkret zu prüfen, ob ein KI-System die gewünschte Aufgabe erfüllt. Testfälle, Kriterien und Ausfälle müssen dokumentiert sein, damit Ergebnisse vergleichbar bleiben.
Gesellschaftliche Bedeutung
Evaluationen können Risiken und Grenzen sichtbar machen. Ihre Aussagekraft hängt aber von den getesteten Situationen ab; ein guter Wert für einen engen Test ersetzt keine Prüfung des realen Einsatzes.
Ein einfaches Beispiel
In einem SchmittAInander-Pilot waren 16 Entscheidungen geplant, aber nur drei gültig – alle in derselben Bedingung. Daraus ließ sich kein A/B-Unterschied bestimmen. Zwei spätere, anders aufgebaute Läufe hatten jeweils 80 gültige Trials; dort wurde in beiden Bedingungen keine Regelumgehung beobachtet.
Nicht verwechseln mit
Ein Benchmark ist meist eine festgelegte Aufgabensammlung. Ein Eval umfasst den konkreten Prüfprozess mit Testfällen, Kriterien, Datenerhebung und Auswertung. Ein einzelnes Eval beweist keine allgemeine Sicherheit.
Verwandte Begriffe
Quellen und weiterführende Links
Redaktionell verantwortlich: David Schmitt · KI-Unterstützung bei Recherche und Formulierung.
Veröffentlicht: · Aktualisiert: