把“训练中间态“也开源:这可能是今年 AI 圈最安静的一次突破
凌晨四点陈默又失眠了。他是一家小团队的算法负责人白天刚被一个念头卡住他想用别人的开源模型做持续预训练把自家那批领域数据喂进去让模型长得更贴合业务。可试了几个月卡点始终不在算力也不在数据。在于他拿到的模型永远只有一个成品。他能看到模型最后长成什么样却看不到它这一路是怎么长过来的。预训练走到哪一步、中期训练拐了哪个弯、权重在哪个阶段发过什么脾气——这些都被打包在一个最终 checkpoint 里像一张冲洗好的照片底片和过程全被抽走了。直到昨天他看到蚂蚁百灵的一条消息睡意一下子没了。那张被抽掉的底片8 月 21 日蚂蚁百灵宣布把 Ling-3.0-tiny 和 Ling-3.0-flash 两个 Base 模型正式开源。这件事本身不算什么新闻——开源大模型早就不是什么稀罕事。真正让陈默坐起来的是后面那句容易被略过的说明除了最终 Base checkpoint官方还同步开放了两个模型预训练和中期训练的权重 checkpoint加在一起一共 6 个。换句话说他们开源的不只是一个结果而是一段过程。预训练的 checkpoint是刚做完大规模预训练、还没进入中期训练的样子中期训练的 checkpoint是做完了中期训练、还没做 WSM 合并和后训练的样子。这三个切片摆在一起任何研究者都能像打开一台机器的说明书一样看到同一个模型在不同阶段的长相。对陈默这种要做持续预训练的人这意味着什么以前他只能在别人的照片上二次创作现在他能拿到底片知道曝光到哪一步、显影停在哪个瞬间。把学习率衰减换成权重合并这条消息里藏着一个多数人没注意到的细节叫 WSM全称是 Warmup-Stable and Merge。传统的大模型训练走到中后段通常会做学习率衰减——让学习率一点点降下去像慢慢松油门让模型别在最后阶段翻车。这几乎是所有团队默认的动作。但蚂蚁百灵这回做了一个不太一样的决定在中期训练结束后把传统的学习率衰减改写成多个 checkpoint 的加权合并。为什么这么改因为他们想做的是可继续训练的底座。一旦模型用学习率衰减收了尾后面想再喂新数据进去做持续预训练就会很别扭——油门已经松到底了再踩反而容易破坏已经收敛的状态。而用权重合并替代衰减相当于给模型留了一个还能再启动的口子训练完之后你依然可以在离线状态下去探索不同的衰减曲线找到最适合自己数据的那一条。这听起来有点技术洁癖但它指向一个更实际的诉求让开源模型真正变成一个活的东西而不是一件封了口的成品。对陈默他们这样的团队来说这个改动比任何跑分数字都值钱。它意味着别人把路修到一半停了下来并且告诉你剩下的一半你可以按自己的方式继续修。开源从结果走到过程过去两年开源模型这四个字的含义其实一直在悄悄变化。最早开源指把权重放出来你能跑一个聊天机器人。后来进阶到把训练配方、数据配比、技术报告都讲清楚让你知道这模型是怎么训出来的。而蚂蚁百灵这次做的事又往前迈了一小步——它开始开放训练的中间态让后来者不光能看成品还能看过程。这一小步对普通用户可能无感但对真正在模型上做二次开发的团队分量极重。因为持续预训练、领域微调、蒸馏、长上下文研究、MoE 系统研究这些方向最缺的恰恰不是强大的成品模型而是一个留了口子、能继续往里加东西的开放底座。值得一提的是Ling-3.0-tiny-base 总参数只有 7.9B、激活参数 1.3B却用前代大约一半的参数量在大多数评测里拿到了更高的结果。flash-base 则是 124B 总参数、5.1B 激活参数的稀疏设计专门给需要更大容量、又想在真实场景里继续训练和适配的团队准备的。陈默看完那条消息后在收藏夹里建了个文件夹把六个 checkpoint 的链接一个个存了进去。窗外天快亮了他反而没了睡意脑子里盘算的是另一件事等白天到了得先拿那几个中间态的权重跑一遍自己那批领域数据看看模型在哪个阶段停下来继续长效果最好。他忽然觉得开源这件事好像又变得有意思了一点。不是因为它给了你一个更厉害的模型而是因为它终于开始愿意把模型是怎么长大的这件事也一并交出来。文中所用图片来源于网络仅供技术学习与交流。如权利人认为存在侵权请联系我们我们将在24小时内处理。