最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
Agent Skill 如何自动进化?SkillOpt 训练流程解析
时间:2026-07-24 13:32:01 编辑:袖梨 来源:一聚教程网
Agent Skill 的“自动进化”很容易被误解成让模型读完失败记录,再自由发挥写一版新提示词。SkillOpt 走的是另一条路:模型权重不动,Skill 文档成为唯一被训练的状态;每次改动有预算、有记录,还要经过独立验证。它更像训练循环,而不是一次灵感式润色。
一轮训练先制造证据,再谈修改
当前 Skill 先交给目标模型执行一批任务。每个任务留下消息、工具调用、验证反馈、元数据和最终得分,这一步相当于 forward pass。没有可评分轨迹,后面的优化器就只能猜哪里需要修改,所以“多收集几段聊天”并不等于已经具备训练条件。

失败样本负责纠错,成功样本负责守住已有能力
轨迹被拆成 minibatch 后,优化模型分别分析失败与成功。失败告诉它哪些步骤反复漏掉,成功则提醒它哪些策略已经有效,不能被大改覆盖。随后产生的不是整篇新 Skill,而是有结构的 add、delete、replace 编辑。
相近编辑先聚合去重,再按相关性排序。配置里的 optimizer.learning_rate 不是浮点梯度,而是每一步最多应用多少条文字编辑。预算太大,Skill 容易语义跳跃;预算太小,可能长期修不到关键问题。cosine、linear、constant 三种调度决定训练后期是否逐渐收紧修改幅度。
候选写得再顺,也可能当场被拒绝
选中的编辑应用到当前 Skill,形成 candidate_skill.md。系统随后在 selection split 上重新评分:默认 gate 开启时,候选得分必须严格高于当前版本才被接受。没有提升,当前 Skill 原样保留,失败修改进入 rejected-edit buffer。验证集在这里不是报告用附件,而是防止“越改越差”的刹车。

跨过一个 epoch,还要回头看遗忘
从第二个 epoch 开始,slow update 会拿上一个 epoch 与当前 Skill 在同一批样本上的表现做纵向比较,把结果分成 improved、regressed、persistent-fail 和 stable-success,再生成高层指导。它要解决的不是某一道题,而是多轮修改后逐渐忘掉旧能力的问题。
meta skill 则保存优化器自己的策略记忆:哪些编辑曾经有效,哪些方向失败,剩下的错误模式是什么。它不会塞进最终部署 Skill,而是在后续反思阶段继续约束优化器。这让训练历史有用,却不必把线上 Skill 膨胀成日志仓库。
best_skill.md 只是终点文件,不是终点判断
运行目录会同时保存版本化 Skill、每步候选、轨迹摘要、慢更新和 meta skill。best_skill.md 指向验证表现最好的部署产物,线上 Agent 只需读取它,不增加额外优化模型调用。真正上线前仍应在锁定测试集上单独评估,并查看能力提升是否伴随别的回归。
所以,Agent Skill 的自动进化并不是“让 Agent 自己改自己”。更准确的说法是:用可评分任务制造训练信号,用受限文字编辑控制步幅,再让独立验证集决定哪次变化有资格留下。缺少其中任何一环,自动化都可能只是在更快地积累规则。
相关文章
- 鹅鸭杀手游公测常见问题全解析:核心要点大公开 07-24
- 鹅鸭杀侦探玩法全解析 核心要点速掌握 07-24
- 鹅鸭杀秃鹫流派深度剖析与强力推荐:助你称霸游戏战场 07-24
- 失控进化里哪个近战武器好用 07-24
- 三国杀vip满级得花多少钱 07-24
- 时空猎人觉醒猎魔战场通关攻略 07-24