技能解析

何时触发 · 如何工作 · 产出什么

剖析技能的工作原理和产出物,快速判断你的场景与价值。

触发时机

  • 用户需要微调模型(SFT/DPO/RFT)时触发。
  • 包括数据准备、训练提交、评分器校准、模型部署和评估等子场景。

工作机理

  • 黄金规则:始终先评估基础模型(baseline)→ 验证数据 → 校准 RFT 评分器 → 评估检查点 → 衡量 token 成本和准确率。
  • 提供 11 个 Python 脚本覆盖全流程:数据转换、验证、训练提交、监控、评分器校准、部署、评估、蒸馏数据生成、清理等。
  • 引用多个流程指南和参考文件,分别覆盖快速开始、完整管线、数据集创建、迭代训练和深度分析。

产生结果

  • 微调后的模型部署到 Foundry,附带评估报告(准确率、token 成本对比基线模型)。训练过程中的检查点可选择替换。

使用场景

两种典型用法

场景 01

模型微调全流程自动化

AI 工程师需要对基础模型进行微调以适应特定领域任务。技能支持 SFT/DPO/RFT 三种训练类型,从数据准备开始:格式化训练数据、运行校验器检查数据质量,然后提交训练任务、监控进度、分析训练曲线,最后部署微调后的模型并进行评估。提供完整的脚本工具链。

场景 02

RFT 评分器校准与多轮迭代训练

使用 RFT(基于评分器的强化学习)微调时,需要精确校准评分器的通过阈值(pass_threshold),目标是在基础模型上达到 25-50% 的失败率。技能提供评分器校准脚本,支持多轮迭代训练,通过分析训练曲线和检查点评估来选择最佳模型,避免盲目部署最后一个检查点。

技能关系

我用了哪些 Skills · 哪些 skills 用了我

依赖关系读作「上一格指向下一格」。当前 Skill 位于第二格,上下分别是影响它与被它影响的 Skill。

第一层 · 这些 Skills 用了我

第二层 · 当前 Skill

  • finetuningWorkflow

第三层 · 我用了这些 Skills

完整关系图

在所属技能集的全局上下文中浏览当前 Skill 的关系。点击节点切换右侧详情,搜索框可快速定位技能。

技能文件

SKILL.md

在 GitHub 打开 ↗
SKILL.md从 GitHub 加载中…