Dieser Cluster bündelt Konzepte, Plattformen und Praktiken rund um KI-Modelle und deren Betriebsumgebungen.
Umfang: Beinhaltet Bewertungsmetriken, Metrikdefinitionen, Benchmarks, Performance-Reports, Vergleich von Modellen, Testdatensätze, Testdesigns, Validierungsprotokolle, Reproduzierbarkeitsanforderungen, Fehler- und Ausreißeranalysen, Konfidenzintervalle sowie standardisierte Auswertungskriterien für KI-Plattformen und Modelle. Abgrenzung: Schließt Trainingspipelines, Modellbereitstellung, Datenaufbereitung und laufende Betriebsprozesse außerhalb der Evaluation aus. Ebenso nicht umfasst sind Governance- und Compliance-Richtlinien sowie Infrastrukturbetrieb und Produktionsmonitoring.
Systematische Bewertung von Machine‑Learning‑Modellen anhand von Metriken, Validierungstechniken und Fehleranalysen zur Entscheidung über Einsatzreife.
Eine strukturierte Methode zur systematischen Bewertung von Prompts für KI-Modelle mit klaren Metriken, Testfällen und Ranking-Kriterien.