Experimentelles Framework
Agent Eval Lab
Framework zur Evaluation von Policies auf synthetischen Daten mit einem eigenen PPO-artigen Trainer, Tests unter Verteilungsverschiebung, schwellenwertbasierter Checkpoint-Bewertung und Reproduzierbarkeitskontrollen.
GitHub ↗Überblick
Untersucht Policy-Verhalten und Checkpoint-Akzeptanz unter kontrollierten synthetischen Verteilungsverschiebungen.
Architektur
- Synthetische Umgebungen mit Seeds für Retrieval-Shift und Label-Rauschen liefern einstufige Aufgaben (environments/).
- Ein PyTorch-MLP für Policy und Value wird mit PPO-artigen Updates trainiert (training/ppo_trainer.py).
- Checkpoint-Bewertung und Shift-Evaluation prüfen Schwellenwerte, Genauigkeitsunterschiede und die KL-Divergenz der Aktionsverteilungen (environments/retrieval_shift/judge.py und evaluation/ood_eval.py).
Engineering-Entscheidungen
- Akzeptanzkriterien für Checkpoints durch konfigurierte Schwellenwerte explizit machen.
- Seeds und Konfigurationshashes zur Unterstützung wiederholbarer Experimente aufzeichnen.
- Entropie, Gradienten und KL überwachen, um problematische Trainingsläufe abzubrechen.
Implementierte Komponenten
- Eigener PPO-artiger Trainer mit Rollouts und begrenzten Policy-Updates.
- Synthetische Datensätze mit Retrieval-Shift und Label-Rauschen.
- Stabilitätsprüfungen für Entropie, Gradienten und KL; Checkpoint-Bewertung und Out-of-Distribution-Metriken.
- Seeding und Konfigurationshashing in core/seed.py.
Aktuelle Grenzen
- Die Umgebungen bilden synthetische einstufige Contextual-Bandit-/Klassifikationsaufgaben ab, keine LLM-Agenten-Workflows.
- Das Bestehen der Schwellenwertprüfung bezieht sich auf konfigurierte Experimentkriterien und ist keine allgemeine Qualitätsgarantie.
- Die Konfiguration deterministischer Algorithmen verwendet einen Warnmodus; plattformübergreifender Determinismus ist nicht garantiert.