3B激活参数,智能体编程同规模第一!快手开源KAT-Coder-V2.5-Dev

发布时间:2026年07月31日 来源:AIGC开放社区 作者:suani 浏览量:24

7月,快手KwaiKAT团队发布了KAT-Coder-V2.5,在PinchBench上拿下智能体工具调用第一,在SWE-Bench Pro上仅次于Opus 4.8。

图片

现在,开源版KAT-Coder-V2.5-Dev来了。

图片

KAT-Coder-V2.5-Dev,MOE架构,总参数350亿,激活参数30亿,在相近参数规模的模型中,智能体编程(Agentic Coding)做到了当前最优。

图片

图片

KAT-Coder-V2.5-Dev选了采用广受认可的Qwen3.6-35B-A3B作为后训练的基础模型。这个规模跑在消费级显卡上非常适合,快手选择它做后训练基础模型,系统性地概述在数据与算法方面的突破,让社区能参与进来。

训练分两步。先在127K样本上做SFT(监督微调),再在SFT模型上跑RL(强化学习)。数据构建、训练流程、优化策略,基本照搬V2.5的方案。

团队在技术报告里反复强调一个判断:做智能体编程,瓶颈不在模型规模,在训练基础设施。

可执行的沙箱环境太难规模化构建。真实仓库的依赖、构建系统、测试框架千差万别,naive的做法会悄悄放进一堆根本跑不起来的环境。轨迹质量不能只看最终测试通没通过。有些通过的轨迹靠的是硬编码、绕过机制、面向测试的捷径;有些失败的轨迹里,搜索、定位、修复的行为其实很有价值。长程RL训练不稳定,奖励稀疏,环境反馈不可靠,信用分配粗糙。

V2.5的整套方案,就是围绕这些问题展开的。Dev版继承了这套方案。

环境和数据怎么来的

V2.5搭了一个叫AutoBuilder的环境构建引擎。它把真实仓库重建成可复现、可执行、可验证的沙箱环境。

图片

具体流程是这样的。从真实的Pull Request和Commit里挖任务,拿到golden patch(代码补丁)和test patch(测试补丁)。但原始的issue描述往往模糊、不完整、跟最终合并的代码对不上,所以团队从这些可验证的产物出发,重新生成结构化的任务描述,包含问题陈述、行为需求、接口约束3个部分。再做一轮清晰度检查,把含糊的、自相矛盾的样本剔掉。

环境构建本身是个agent驱动的循环。一个build agent分析仓库,生成配置脚本,装依赖、跑测试;一个verification agent在隔离沙箱里执行脚本,验证结果。

验证标准不看命令退出码,不看日志表面模式,而是解析测试框架的结构化输出,只有超过90%的预期测试被收集到、且多次运行结果可复现,才算通过。失败就把结构化错误信息喂回build agent,迭代修复。

配合预配置的基础环境、语言和构建系统模板、可复用的构建配方库,环境构建成功率从16.5%拉到了57.2%,最终产出超过10万个可验证环境,覆盖12种编程语言。

数据这边,V2.5设计了一个数据缩放飞轮。

很多失败轨迹其实是差一点就成功的。模型找到了相关代码区域,但漏了关键一步,比如没读那条决定性的测试断言,没匹配上精确的schema。

团队用两阶段hint-in-the-loop来救这些轨迹。先注入过程级提示,告诉模型该看什么、该验证什么,但不透露答案,这一步就把之前零通过的任务通过率拉到了约20%。然后固定验证通过的补丁,从原始任务上下文重新生成一条无提示轨迹,只保留通过验证、无提示泄漏、与补丁一致的样本。提示只是临时脚手架,最终训练数据忠于原始任务分布。

团队用规则门控加启发式过程打分来过滤。规则层去掉无效、不稳定、exploitative的轨迹;打分层评估探索、定位、编辑前推理、规格保真度、仓库惯例遵循、补丁最小性、验证质量、恢复行为、诚实度等维度。捷径型成功被降权或移除,可挽救的近似失败被送回恢复管线。

为了让模型不只在单一Harness(执行框架)下会做题,团队还做了Harness重写。随机化工具名、参数格式、输出格式、prompt模板,注入依赖缺失、命令瞬时失败、输出截断、噪声日志等扰动。验证锚定在结构化测试结果上,跟Harness无关,所以同一个任务可以在多种等价Harness配置下重新出题。

通用智能体能力这边,V2.5搭了KwaiClawEnv。

图片

Service层构建原子能力单元,支持人写的Skill和LLM生成的Service,经过自动验证后才进入下游;Task层从真实任务种子出发,通过参数扩展、约束增强、工具链编排生成变体,并行rollout记录完整交互轨迹;Eval层做多阶段过滤,硬规则去不安全、无效、幻觉轨迹,LLM-as-Judge从语义正确性、执行效率、交互自然度3个维度打分。质量信号回传前两层,形成闭环迭代。

Service层用双源策略。解析OpenClaw等开源社区的标准Skill定义,生成成功率超90%;对欠覆盖领域用类别引导的LLM生成新变体。

Task层生成数百万候选任务,多阶段验证后保留超10万高质量实例,轨迹平均15次工具调用,最长超100步。

训练的核心设计

RL阶段,Dev版保留了V2.5验证有效的4个关键设计。

图片

1,Token-in-Token-out(TITO)一致性。主流推理引擎的chat接口会内部重新apply_chat_template、重新分词,长程智能体任务下token漂移不可忽略。V2.5团队在约200轮规模的智能体任务上观测到,约40%的样本存在retokenization drift。他们的做法是绕过chat接口,所有请求直接走推理后端的/generate端点,从源头消除漂移,保证每个可训练token跟rollout时行为策略发出的token完全一致。Dev版沿用了这个设计。

2,截断重要性采样(Truncated Importance Sampling,TIS)。异步rollout天然带来策略陈旧和离策略问题,重要性权重过大时方差爆炸。TIS对权重做截断,压住不稳定性。

3,可靠的沙箱与验证器。V2.5早期训练频繁崩溃,奖励曲线爬升极慢。团队一开始以为是RL算法的问题,后来扩大样本量、引入更深监督后才发现,大量训练失败根源在环境。抽样审计早期rollout,约16%的轨迹包含至少一次沙箱本身导致的失败,而非模型策略的问题。最严重的情况,一次沙箱边界错位就能让后续约40步的观测全部为空,整条轨迹的奖励信号报废。

稳定性方面,RL训练要并发拉大量容器镜像,镜像体积又大,物理磁盘峰值使用率到95%,垃圾回收几乎不停跑,超时导致的无效rollout占6%到7%。重新设计镜像管理模块、引入提前释放策略后,稳态磁盘使用率降到60%,超时无效rollout降到1%以下。

执行正确性方面,某些系统环境变量在远程沙箱初始化时被覆盖,导致验证器读错变量、产出错误验证结果,修复前这类问题污染了约6%到7%样本的奖励信号,修复后降到1%以下。整体沙箱反馈错误率从约16%降到2%以下,训练崩溃频率降了约一个数量级。

4,基于Harness执行反馈的分层奖励。V2.5设计了3层结构化规则奖励。

Core Task Score权重最高,只有fail_to_pass和pass_to_pass测试全部通过才给满分,防止生成无效代码、绕过逻辑、弱化测试等reward hacking。

Standard Behavior Constraints在全轨迹上施加辅助惩罚,覆盖内容重复率、乱码率、工具调用准确率、异常工具调用位置、单轮重复调用、并行调用过多等维度。

Failed Trajectory Incentives给失败轨迹中有意义的进展赋正奖励,包括文件搜索准确率的F2分数和单元测试通过率,让不完整的轨迹也有训练价值。

规则奖励之外,V2.5还训练了一个专门的judge模型GRM,用轨迹级rubric做模型打分,覆盖故障诊断与复现、修复后验证、执行策略3个维度。GRM本身也经过RL训练,用历史轨迹配人工标注做样本,优化recall和false positive的平衡。

算法层面,V2.5用PPO(近端策略优化)做骨架,配合GAE(广义优势估计)做turn级信用分配。

在整个训练过程中,奖励呈现出持续稳定的上升趋势。

图片

Dev版在RL阶段还遇到了一个Qwen3.6特有的问题。简单的二元0到1奖励在第二个epoch就把模型训崩了。

分析轨迹发现,随着训练推进,模型越来越倾向于在单个回合内发出大量并行工具调用,有时超过70次。上下文长度迅速膨胀,产生大量无效轨迹和执行错误,RL训练彻底不稳定。

为解决这个问题,团队在原有分层奖励的基础上,增加了许多针对 Qwen3.6 的惩罚项。例如,单回合过多并行工具调用、工具调用失败、空的工具调用块、大量重复内容。

这些调整压住了病态行为,RL训练稳定跑完了10个epoch。在整个训练过程中,奖励也呈现出持续稳定的上升趋势。

图片

最终,Dev版在相近参数规模中性能做到了智能体编程SOTA。350亿总参数、30亿激活参数,跑在消费级硬件上非常香。

KAT-Coder-V2.5-Dev开源,把V2.5验证过的整套后训练方案,环境构建、数据飞轮、Harness随机化、沙箱加固、非对称PPO、分层奖励、多教师蒸馏等交给了社区。

Qwen3.6上踩过的坑和对应的奖励调整,也一并公开。30亿激活参数这个量级的智能体编程模型,对开源社区是一份相当完整的参考。

参考资料:

https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-Dev

https://arxiv.org/pdf/2607.05471

https://modelscope.cn/models/Kwaipilot/KAT-Coder-V2.5-Dev/summary

免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。

0 0 0
有话要说  人讨论    24 人阅读
发表

游客

这位投稿者太神秘了,什么都没留下~

超天才网©2017 www.supergenius.cn All Rights Reserved ICP备09005826号 京ICP证130304号

联系我们| 加入我们| 法律声明| 关于我们| 评论互动

超天才网©2013-2014 All Rights Reserved ICP备09005826号 京ICP证130304号

关注我们: