PurposeBuilds the evaluation harness that gates every fine-tuning run by creating golden sets from traces, per-failure-mode graders, calibrated judges, and base-model baselines. Method: error analysis, deterministic grading, judge calibration, baseline generation. Value: provides training data and a regression gate for checkpoints.

Domains

Business

Forms

Workflow
Required Tools
None
Languages
python
Package Manager
N/A
Skill Composition
  • SKILL.md33.3%
  • references66.7%