Prompt Evaluation ist eine strukturierte Methode zur Bewertung und Vergleichbarkeit von Prompt-Varianten für KI-Modelle. Sie definiert Metriken, Testszenarien und einen Bewertungsworkflow, um Qualität, Robustheit und Bias zu messen. Anwendbar in Forschung und Produktteams zur systematischen Prompt-Iterationen.
Nutze diesen Steckbrief, um den Baustein kurz zu verstehen, ihn im Modell einzuordnen und bei Bedarf in die 360°-Bewertung zu wechseln.
Ausführbares Vorgehen: kann angewendet werden und erzeugt ein Ergebnis.
Was Zusammenhänge ordnet, verbindet oder entscheidbar macht.
Prompt Evaluation prüft systematisch, wie zuverlässig und passend ein Prompt für definierte Aufgaben, Eingaben und Qualitätsmaßstäbe arbeitet.
Die Praxis entstand mit der Nutzung großer Sprachmodelle und verbindet Testmethoden aus Softwarequalität, Information Retrieval und maschinellem Lernen. Sie ist ein junges Feld ohne einzelne allgemein anerkannte Urheberschaft.
Lege Datensätze, erwartete Eigenschaften und Bewertungsmaßstäbe fest, bevor du Promptvarianten vergleichst. Führe sie unter gleichen Bedingungen aus, bewerte Ergebnisqualität und Fehlermuster und dokumentiere Kosten sowie Latenz. Wiederhole den Test mit schwierigen Fällen und prüfe menschliche oder modellbasierte Bewertungen.
Repräsentative und schwierige Eingaben machen Promptverhalten vergleichbar.
Explizite Kriterien übersetzen gewünschte Qualität in prüfbare Urteile.
Wiederholte Tests zeigen, ob eine Änderung Verbesserungen oder neue Fehler bringt.
Prompt Evaluation macht Modellarbeit reproduzierbarer und schützt vor intuitiven Einzelbeispielen. Ergebnisse bleiben abhängig von Datensatz, Rubrik und Modellversion; automatische Scores brauchen Stichproben und menschliche Plausibilisierung.
Wo dieser Baustein im Themenmodell verortet ist.
Erkunde, wie dieser Wissensbaustein mit Konzepten, Methoden, Technologien und Tools verbunden ist.
Diese Quellen belegen den Begriff und seine fachliche Bedeutung.
Alle direkten Verbindungen des aktuellen Wissensbausteins in einer kompakten, textuellen Darstellung.
Diese Einordnung zeigt, in welchem Kontext der Baustein typischerweise relevant wird, wie anspruchsvoll er ist und welche Wirkung er im Modell hat.
Die Ebene innerhalb der Organisation (Unternehmen, Domäne, Team), auf der der AssetBlock angewendet wird.