技能解析
何时触发 · 如何工作 · 产出什么
剖析技能的工作原理和产出物,快速判断你的场景与价值。
触发时机
- 用户需要微调模型(SFT/DPO/RFT)时触发。
- 包括数据准备、训练提交、评分器校准、模型部署和评估等子场景。
工作机理
- 黄金规则:始终先评估基础模型(baseline)→ 验证数据 → 校准 RFT 评分器 → 评估检查点 → 衡量 token 成本和准确率。
- 提供 11 个 Python 脚本覆盖全流程:数据转换、验证、训练提交、监控、评分器校准、部署、评估、蒸馏数据生成、清理等。
- 引用多个流程指南和参考文件,分别覆盖快速开始、完整管线、数据集创建、迭代训练和深度分析。
产生结果
- 微调后的模型部署到 Foundry,附带评估报告(准确率、token 成本对比基线模型)。训练过程中的检查点可选择替换。
使用场景
两种典型用法
场景 01
模型微调全流程自动化
AI 工程师需要对基础模型进行微调以适应特定领域任务。技能支持 SFT/DPO/RFT 三种训练类型,从数据准备开始:格式化训练数据、运行校验器检查数据质量,然后提交训练任务、监控进度、分析训练曲线,最后部署微调后的模型并进行评估。提供完整的脚本工具链。
场景 02
RFT 评分器校准与多轮迭代训练
使用 RFT(基于评分器的强化学习)微调时,需要精确校准评分器的通过阈值(pass_threshold),目标是在基础模型上达到 25-50% 的失败率。技能提供评分器校准脚本,支持多轮迭代训练,通过分析训练曲线和检查点评估来选择最佳模型,避免盲目部署最后一个检查点。
技能关系
我用了哪些 Skills · 哪些 skills 用了我
依赖关系读作「上一格指向下一格」。当前 Skill 位于第二格,上下分别是影响它与被它影响的 Skill。
第一层 · 这些 Skills 用了我
第二层 · 当前 Skill
- finetuningWorkflow
第三层 · 我用了这些 Skills
完整关系图
在所属技能集的全局上下文中浏览当前 Skill 的关系。点击节点切换右侧详情,搜索框可快速定位技能。
技能文件
SKILL.md
SKILL.md从 GitHub 加载中…
