业务领域
技能形态
业务领域
技能形态
技能解析
剖析技能的工作原理和产出物,快速判断你的场景与价值。
当任务成功可被算法校验(数学、代码、工具调用、结构化输出),设计 GRPO 奖励函数,或 GRPO 训练发散/奖励黑客时。
一份经验证的 GRPO 配置(参数值与奖励函数),可直接供训练工程师消费,降低奖励黑客风险,产出具备可验证行为的推理模型。
使用场景
某团队构建数学辅导 LLM,答案可通过精确匹配评分。他们用本技能配置带正确性与格式奖励的 GRPO,训练前用奖励函数检查 80 个样本输出,发现格式错误答案与正确答案同分的问题。修复后训练稳定,在留存题上准确率提升且无奖励黑客。
工程师发现 GRPO 在长思维链上熵崩溃。依据技能变体表切换至 DAPO 以放宽 KL 惩罚并解耦裁剪边界。训练恢复探索,生成更长有效推理且避免退化输出——且未在故障出现前预选变体。
技能关系
依赖关系读作「上一格指向下一格」。当前 Skill 位于第二格,上下分别是影响它与被它影响的 Skill。
第一层 · 这些 Skills 用了我
第二层 · 当前 Skill
第三层 · 我用了这些 Skills
在所属技能集的全局上下文中浏览当前 Skill 的关系。点击节点切换右侧详情,搜索框可快速定位技能。
技能文件