DeepSeek 为什么开源权重,还把能力蒸馏给小模型
把结论放前面开放权重和蒸馏解决的是两个不同的问题前者解决能不能用、能不能改后者解决跑不跑得起。一个是生态策略一个是工程手段。两者叠在一起才让一个原本只有大厂跑得动的模型变成很多团队真能落地的方案。开放权重开放的到底是什么不是开源代码也不是公开训练数据。放出来的是推理所需的模型参数——一组能直接加载、能直接做前向计算的权重。它的意义有三层可以自行部署不依赖对方接口可以用自己的数据微调改变模型行为可以本地审计至少能看清模型在自己环境里对什么输入给出什么输出。至于能不能商用要看具体许可条款不同版本、不同用途的限制可能并不一致别默认开源就等于随便用。蒸馏把大模型的能力抄进小题蒸馏的核心很朴素让一个已经很强的模型教师回答大量问题把它的输出整理成训练数据再让一个小模型学生去学这些输出。流程大致是这样教师模型在海量提示上生成回答筛选与整理为训练数据学生模型学习教师的输出分布更小、更便宜、可本地部署的模型学生学的不是唯一正确答案而是教师的输出分布——包括怎么措辞、怎么组织推理、遇到模糊问题时倾向哪种处理方式。这也是为什么蒸馏出的小模型常常比同规模从头训练的模型更像会思考而不只是会背。但蒸馏有天花板学生容量有限学得下风格学不下全部能力教师答错的地方学生通常也会一起学错。为什么这波动静大因为它同时压低了两道门槛。一是成本门槛能力不再只能通过接口租用团队可以用更小的模型覆盖高频、固定的场景。二是可控性门槛数据不出本地、行为可微调、版本可锁定——这些在合规敏感的场景里比单纯的跑分更有价值。连带影响是模型能力开始像可下载的组件而不是只能按次租用的服务。开发者怎么选维度本地部署小模型调用云端 API成本形态一次性硬件投入 持续电费与运维按调用量计费前期零投入数据可控性数据不出本地便于合规需评估隐私与合规边界延迟与稳定性取决于自有硬件与并发能力取决于网络与服务方水平能力上限受学生模型容量限制可用到规模更大的模型版本与维护自己掌控版本也自己承担升级服务方维护但版本可能被动变更典型场景高频、固定、数据敏感低频、能力要求高、快速试错实务上很少二选一。更常见的是分层高频且简单的走本地小模型复杂长尾的走云端大模型。三个常见误解误解一蒸馏就是复制。复制不了。学生学的是输出模式不是搬运参数容量差多少能力就差多少。误解二开源等于无限制。许可是有条件的商用、再分发、衍生模型的约束各不相同落地前要逐条看清。误解三小模型就是弱模型。在收窄到某个任务上时蒸馏过的小模型经常稳定优于通用大模型——因为它的能力分布被刻意压到了这个任务里。收尾开放权重让能力可以被拥有蒸馏让小模型有能力去承载。对开发者来说真正要判断的往往不是哪个模型更强而是这个任务值不值得为它付大模型的成本。