← Alle Projekte

Experimentelles Framework

Agent Eval Lab

Framework zur Evaluation von Policies auf synthetischen Daten mit einem eigenen PPO-artigen Trainer, Tests unter Verteilungsverschiebung, schwellenwertbasierter Checkpoint-Bewertung und Reproduzierbarkeitskontrollen.

GitHub ↗

Überblick

Untersucht Policy-Verhalten und Checkpoint-Akzeptanz unter kontrollierten synthetischen Verteilungsverschiebungen.

Architektur

  • Synthetische Umgebungen mit Seeds für Retrieval-Shift und Label-Rauschen liefern einstufige Aufgaben (environments/).
  • Ein PyTorch-MLP für Policy und Value wird mit PPO-artigen Updates trainiert (training/ppo_trainer.py).
  • Checkpoint-Bewertung und Shift-Evaluation prüfen Schwellenwerte, Genauigkeitsunterschiede und die KL-Divergenz der Aktionsverteilungen (environments/retrieval_shift/judge.py und evaluation/ood_eval.py).

Engineering-Entscheidungen

  • Akzeptanzkriterien für Checkpoints durch konfigurierte Schwellenwerte explizit machen.
  • Seeds und Konfigurationshashes zur Unterstützung wiederholbarer Experimente aufzeichnen.
  • Entropie, Gradienten und KL überwachen, um problematische Trainingsläufe abzubrechen.

Implementierte Komponenten

  • Eigener PPO-artiger Trainer mit Rollouts und begrenzten Policy-Updates.
  • Synthetische Datensätze mit Retrieval-Shift und Label-Rauschen.
  • Stabilitätsprüfungen für Entropie, Gradienten und KL; Checkpoint-Bewertung und Out-of-Distribution-Metriken.
  • Seeding und Konfigurationshashing in core/seed.py.

Aktuelle Grenzen

  • Die Umgebungen bilden synthetische einstufige Contextual-Bandit-/Klassifikationsaufgaben ab, keine LLM-Agenten-Workflows.
  • Das Bestehen der Schwellenwertprüfung bezieht sich auf konfigurierte Experimentkriterien und ist keine allgemeine Qualitätsgarantie.
  • Die Konfiguration deterministischer Algorithmen verwendet einen Warnmodus; plattformübergreifender Determinismus ist nicht garantiert.

Stack

  • Python
  • PyTorch
  • PPO
  • Evaluation
  • Distribution Shift
  • Synthetic Data