„Eval Awareness“ bei KI und warum Benchmark-Ergebnisse immer schwieriger zu interpretieren sind

Weiß KI, dass sie gerade getestet wird? Reagiert sie desswegen anders? Warum bedeutet das eine schechtere Interpretierbarkeit für meine Tests?