SWE-Bench 卷到 73.4% 之后,国产编程模型还能卷什么

📅 发布时间:2026/10/9 20:27:43
SWE-Bench 卷到 73.4% 之后,国产编程模型还能卷什么
SWE-Bench 卷到 73.4% 之后国产编程模型还能卷什么【免费下载链接】KAT-Coder-V2.5-Dev项目地址: https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev当快手 Kwaipilot 团队把闭源旗舰 KAT-Coder 在 SWE-Bench Verified 上的解决率推到 73.4% 时这个数字本身已经不是新闻——它只是过去一年国产编程模型榜单竞速的又一个注脚。真正值得追问的是当各家模型在同一个榜单上的差距从断档缩小到小数点后两位时编程模型竞争的胜负手究竟移到了哪里答案藏在这份开源权重仓库 KAT-Coder-V2.5-Dev 的细节里。它总参数量 35B、激活仅 3B在 README.md 的评测表中以 69.40% 拿下 SWE-bench Verified 的同规模 SOTA但比分数更有信息量的是它后训练管线里针对异常工具调用并行调用爆炸重复生成的一整套奖励工程以及 config.json 中为长上下文 Agent 任务设计的混合注意力结构。本文以这份开源仓库为解剖样本拆解 73.4% 之后国产编程模型正在卷的三件事榜单的真实含金量、从写代码到做工程的转向以及私有化部署与 Agent 工作流的下沉。一、榜单内卷的现状与天花板先看榜单本身。SWE-bench Verified 是当前 Agentic Coding 公认的高考它要求模型在真实 GitHub 仓库中定位问题、修改代码并通过隐藏测试比单轮代码补全更贴近真实工程。KAT-Coder 系列的路线图清晰可查开源的 KAT-Dev-32B 先做到 62.4%闭源旗舰 KAT-Coder 随后冲到 73.4%而本次开源的 KAT-Coder-V2.5-Dev35B MoE、3B 激活以 69.40% 成为同参数量级下的开源标杆。但把 README.md 那张评测表横向展开能看到另一层现实在同一条统一评测管线agentclaude_code2.1.195、passk1、256k 上下文下69.40 分的身后紧跟着 68.60、64.40、60.60、58.60、55.80 一长串名字榜首与第五名之间的差距不足 14 个点。而在 Terminal-Bench 2.1终端多步任务上README 甚至用两个 Agent harnessTerminus-2 / Claude Code的平均值作为最终成绩——评测本身正在变得环境敏感。README 的评测附注对这种内卷给出了更诚实的脚注同一模型在不同 harness 版本和测试集优化下可能产生约 10 个百分点的偏差Qwen3.5-35B-A3B 在评测中频繁幻觉调用当前环境不存在的 MultiEdit 工具Gemma4 则出现 256k 上下文溢出。换句话说榜单位置有很大一部分取决于模型工具偏好与评测 harness 允许工具集是否匹配而非纯粹的模型能力差。分数曲线的边际收益在递减榜单头部的游戏已经从能力竞赛变成了评测工程竞赛。这也解释了为什么 KAT-Coder-V2.5-Dev 的亮点描述里排在第一位的不是又涨了几个点而是通过 RL 将异常工具标签从 9.34% 压到 0.28%、单轮连续重复从 0.34% 压到 0%。当分数逼近上限模型的行为可靠性——不幻觉工具、不重复输出、不产生无效轨迹——成为比绝对分数更稀缺的能力。二、从「写代码」到「做工程」的集体转向73.4% 之后最明显的转向是整个行业把竞争定义从代码生成质量改写为工程任务完成度。KAT-Coder-V2.5-Dev 的仓库为此提供了三层源码级证据。第一层Agent 协议不再是临时拼凑。打开 chat_template.jinja能看到一套完整的工具调用语言模型被约束以tool_call包裹function...与parameter...的结构化格式调用工具系统提示中明确要求函数调用必须遵循指定格式可在函数调用前给出自然语言推理但不可在调用后补充。模板还实现了multi_step_tool检测——它会回溯消息序列识别以tool_response包裹的多轮工具反馈把工具调用-结果-再调用的循环编码进序列化逻辑。这不是为单次补全设计的模板而是为多轮 Agent 交互设计的会话协议。第二层长程推理被显式训练并保留。模板中preserve_thinking与enable_thinking两个开关对应了 README 中保留思考与非思考模式两节模型默认先思考再作答而preserve_thinking: True会让历史消息中的think块被完整保留进上下文。README 给出的理由是直接指向 Agent 场景的——保留完整推理上下文可以增强多步决策的一致性同时通过减少重复推理来降低总 token 消耗、优化 KV cache 利用率。把历史思考轨迹当作一等公民来训练和序列化是典型的为 Agent 工作流而设计而非为对话体验而设计。第三层RL 奖励不再只看过没过测试。README 的 Post-training 章节披露了完整的强化学习配方先以 127K 样本做 SFT再进行 RL。RL 阶段保留了 KAT-V2.5 验证过的四件套——Token-in-Token-outTITO保证 rollout 与训练阶段的 token 序列严格一致、Truncated Importance SamplingTIS抑制异步 rollout 的策略陈旧性、可靠的沙箱与验证器防止基础设施故障污染奖励信号、以及基于 harness 执行反馈的层级奖励hierarchical rewards。层级奖励的意义在于失败的轨迹只要包含有意义的中间进展也能获得奖励信号让没做完的任务也能参与训练。更值得注意的是 Qwen3.6 基座带来的特殊挑战。README 记录了一个几乎可以当作AI 编程模型训练事故案例的细节简单的 0-1 二元奖励在第二个 epoch 就导致模型崩溃——随着训练推进模型倾向于单轮内发起大量并行工具调用峰值超过 70 次导致上下文迅速膨胀、无效轨迹和执行错误激增。团队的解法是为原始层级奖励叠加针对单轮并行调用过多、工具调用失败、空工具调用块、大量重复内容的专项惩罚。这张 RL 奖励曲线图展示的正是这套奖励工程下训练得以稳定进行 10 个 epoch 的过程。从追求上限分数到治理病态行为这是做工程和写代码在训练层面的分野。三、下一站私有化部署与 Agent 工作流分数之外国产编程模型真正在卷的第三条线是如何让模型跑进开发者的真实环境。KAT-Coder-V2.5-Dev 的仓库配置几乎是为私有化与工作流集成的每一种形态预留了接口。先看架构层面的底气。config.json 显示这是一个 256 专家、每 token 激活 8 个专家的 MoE 模型num_experts: 256、num_experts_per_tok: 840 层中混合排布linear_attention与full_attention——每 4 层插入一个全注意力层其余为线性注意力层layer_types字段清晰可见linear_conv_kernel_dim: 4。线性注意力把长上下文推理的复杂度降了一个量级配合max_position_embeddings: 262144的原生 262K 上下文这个 35B/3B 的模型在长仓库级任务上具备远超同尺寸密集模型的性价比——这正是35B 模型只激活 3B单卡能跑编程 Agent传闻的架构来源。社区实测也验证了这一点基于 llama.cpp 的 GGUF 量化版本可在 CPU/GPU 混合环境下本地运行甚至有边缘 MaaS 平台将其上线为 API 服务宣称实现低于 300ms 的推理延迟。再看部署层面的完成度。README 的 Quickstart 同时给出了 SGLang、vLLM、KTransformers、Hugging Face Transformers 四套推理框架的启动命令且全部对齐 OpenAI 兼容的/v1API 形态工具调用场景只需追加--tool-call-parser qwen3_coder即可获得标准解析。针对超长文本仓库给出了 YaRN 的两种开启方式直接修改 config.json 的rope_parametersfactor: 4.0、original_max_position_embeddings: 262144或通过--hf-overrides命令行注入将上下文上限推到 1,010,000 token——百万级上下文配合混合线性注意力意味着一个 Agent 可以把整个中型仓库的代码树装进上下文里做全局推理。社区生态的走向印证了同样的趋势有人在华为开发者空间的容器里把 Claude Code 与 KAT-Coder 接成 AI 编程助手有人用统一 API Key 网关TaoToken把开源版与闭源版同时接入生产级 Agent 工作流快手 StreamLake 则以三位一体产品矩阵的姿态同时覆盖云端 API、开源权重与本地工具链。这些实践指向一个共同判断编程模型的竞争已经离开排行榜进入谁能以最低成本、最高可控性嵌入开发者工作流的阶段。开源权重 OpenAI 兼容接口 多框架支持 百万级长上下文构成了一整套面向私有化部署与 Agent 化改造的标准化接口。结语SWE-bench 卷到 73.4% 之后答案不是继续卷到 80%而是竞争维度本身发生了迁移从榜单分数转向行为可靠性异常工具调用率 0.28%、工程化协议工具调用与思考轨迹的结构化序列化、训练方法论层级奖励与专项惩罚的精细调校以及部署生态四框架兼容、百万级上下文、量化与边缘化落地。KAT-Coder-V2.5-Dev 这份开源权重恰好把下一站的答案写进了配置文件和模板里——当分数趋同能被复用的不是排行榜而是让模型在真实仓库、真实终端、真实工作流里稳定干活的工程能力。这或许才是 73.4% 之外国产编程模型真正开始卷的东西。【免费下载链接】KAT-Coder-V2.5-Dev项目地址: https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考