Prio: NIEDRIG
Befund: Die vermeintlichen Test-Retest-Duplikate in der Eval-Historie sind keine echten Eval-Wiederholungen — der Cache liefert bei identischem Input byte-identische Repeats, während echte Re-Runs zugleich regenerierte Notes (also einen anderen Input) haben. Reines Eval-Rauschen (gleicher Note-Inhalt, wiederholt bewertet) wurde dadurch nie gemessen; alle bisherigen Nullband-Schwellen beruhen auf Gesamtsystem-Rauschen (~7,3pp SD, Generierung + Eval zusammen). generative/reeval_baseline.py hat aktuell keine --repeat-Option (per Grep verifiziert — kein Treffer für „repeat" im File).
Wirkung: Ohne eine Messung des reinen Eval-Rauschens bleibt unklar, welcher Anteil der ~7,3pp SD auf Generierungs-Varianz vs. Judge-Varianz entfällt — Nullband-Schwellen könnten zu grob oder zu eng kalibriert sein.
Fix-Richtung: 2-3 Wiederholungs-Sweeps unter Eval-Version 4.3 mit umgangenem Cache (neue --repeat-Mechanik in reeval_baseline.py, separater PR bereits in Arbeit), danach Schwellen neu justieren.
Hinweis: Umsetzung ist bereits von Till beauftragt — dieses Issue dient nur dem Tracking.
Quelle: Fable-Studie 16.07., STUDIE-eval-trendfaehigkeit-2026-07-16.md.
Prio: NIEDRIG
Befund: Die vermeintlichen Test-Retest-Duplikate in der Eval-Historie sind keine echten Eval-Wiederholungen — der Cache liefert bei identischem Input byte-identische Repeats, während echte Re-Runs zugleich regenerierte Notes (also einen anderen Input) haben. Reines Eval-Rauschen (gleicher Note-Inhalt, wiederholt bewertet) wurde dadurch nie gemessen; alle bisherigen Nullband-Schwellen beruhen auf Gesamtsystem-Rauschen (~7,3pp SD, Generierung + Eval zusammen).
generative/reeval_baseline.pyhat aktuell keine--repeat-Option (per Grep verifiziert — kein Treffer für „repeat" im File).Wirkung: Ohne eine Messung des reinen Eval-Rauschens bleibt unklar, welcher Anteil der ~7,3pp SD auf Generierungs-Varianz vs. Judge-Varianz entfällt — Nullband-Schwellen könnten zu grob oder zu eng kalibriert sein.
Fix-Richtung: 2-3 Wiederholungs-Sweeps unter Eval-Version 4.3 mit umgangenem Cache (neue
--repeat-Mechanik inreeval_baseline.py, separater PR bereits in Arbeit), danach Schwellen neu justieren.Hinweis: Umsetzung ist bereits von Till beauftragt — dieses Issue dient nur dem Tracking.
Quelle: Fable-Studie 16.07., STUDIE-eval-trendfaehigkeit-2026-07-16.md.