„Eval Awareness“ bei KI und warum Benchmark-Ergebnisse immer schwieriger zu interpretieren sind
Weiß KI, dass sie gerade getestet wird? Reagiert sie desswegen anders? Warum bedeutet das eine schechtere Interpretierbarkeit für meine Tests?
Weiß KI, dass sie gerade getestet wird? Reagiert sie desswegen anders? Warum bedeutet das eine schechtere Interpretierbarkeit für meine Tests?