用途概括使用 GRPO 与 RLVR 训练推理及可验证任务行为。提供 TRL GRPOTrainer 配方、复合奖励设计、强制奖励检查门与变体选择。产出经验证的 GRPO 配置,降低奖励黑客风险,在算法可校验任务上强化模型能力。

业务领域

Coding

技能形态

Workflow
所需工具
语言环境
python
包管理器
pipuv
技能组成
  • SKILL.md33.3%
  • 文档66.7%