Skip to content

[NIEDRIG] Wiederholungs-Sweeps: reines Eval-Rauschen erstmals messen #325

Description

@TillQuandel

Prio: NIEDRIG

Befund: Die vermeintlichen Test-Retest-Duplikate in der Eval-Historie sind keine echten Eval-Wiederholungen — der Cache liefert bei identischem Input byte-identische Repeats, während echte Re-Runs zugleich regenerierte Notes (also einen anderen Input) haben. Reines Eval-Rauschen (gleicher Note-Inhalt, wiederholt bewertet) wurde dadurch nie gemessen; alle bisherigen Nullband-Schwellen beruhen auf Gesamtsystem-Rauschen (~7,3pp SD, Generierung + Eval zusammen). generative/reeval_baseline.py hat aktuell keine --repeat-Option (per Grep verifiziert — kein Treffer für „repeat" im File).

Wirkung: Ohne eine Messung des reinen Eval-Rauschens bleibt unklar, welcher Anteil der ~7,3pp SD auf Generierungs-Varianz vs. Judge-Varianz entfällt — Nullband-Schwellen könnten zu grob oder zu eng kalibriert sein.

Fix-Richtung: 2-3 Wiederholungs-Sweeps unter Eval-Version 4.3 mit umgangenem Cache (neue --repeat-Mechanik in reeval_baseline.py, separater PR bereits in Arbeit), danach Schwellen neu justieren.

Hinweis: Umsetzung ist bereits von Till beauftragt — dieses Issue dient nur dem Tracking.

Quelle: Fable-Studie 16.07., STUDIE-eval-trendfaehigkeit-2026-07-16.md.

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions