“397B 追平万亿“刷屏,但科学模型评测的含金量经得起推敲吗

📅 发布时间:2026/10/10 15:54:18
“397B 追平万亿“刷屏,但科学模型评测的含金量经得起推敲吗
397B 追平万亿刷屏但科学模型评测的含金量经得起推敲吗【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B2026 年的 WAIC 上上海 AI 实验室放出的一则消息让整个开源圈炸开了锅397B 参数的 Intern-S2-397B 在多项科学任务上追平了此前的万亿级旗舰 Intern-S1-Pro社区里小马拉大车参数翻倍不如架构翻新的讨论铺天盖地。紧接着一篇篇35B 如何超越万亿模型结构生成通过率超 40% 优于 GPT-5.5的标题党文章开始刷屏。数字很性感但数字也最容易骗人。一个 397B 的模型凭什么和万亿模型掰手腕评测跑分背后的口径到底是什么这篇基于仓库源码逐行核查试图回答一个问题当追平万亿从新闻标题变成可检验的技术陈述时它的含金量还剩多少。一、先把追平万亿的评测口径还原出来1.1 型号与架构397B 到底是什么打开仓库根目录的 config.json型号定义一目了然架构为Qwen3_5MoeForConditionalGeneration即混合 MoE 混合注意力架构文本侧 60 层其中线性注意力linear_attention与全注意力full_attention按 3:1 交错排布专家总数为 512每 token 激活 10 个另有共享专家mtp_num_hidden_layers: 1即内建 1 层多头预测MTP模块为推测解码加速留了原生接口。也就是说397B是总参数量不是激活参数量。512 选 10 的稀疏路由意味着单次前向实际计算量远小于万亿级稠密模型的对应开销——追平万亿的第一层含义本质上是稀疏化与混合注意力换来的计算效率而非同等算力下纯粹的性能反超。这一点在解读任何参数越小越能打的宣传时都必须先钉在墙上。权重清单也支持这一判断model.safetensors.index.json 中记录了 188 个分片、总存储约 807GB配合 deployment_guide.md 中8×H100 或 8×H200 即可部署的说明可以看出官方定位就是万亿级能力实验室级可部署。1.2 评测工具链与推理预算README 自己交代了什么README.md 的 Performance 一节写得很诚实值得逐句拆We use the OpenCompass, VLMEvalKit, and AgentCompass to evaluate all models. For text reasoning benchmarks, Intern-S2-397B is evaluated with a maximum inference length of 256K tokens, while for multimodal benchmarks, it is evaluated with a maximum inference length of 64K tokens.这短短一段透露了三个关键口径评测框架OpenCompass文本推理、VLMEvalKit多模态、AgentCompass智能体全部是实验室自研工具链。用自研评测框架跑自家模型本身没有错但它意味着每个分数都应当回到谁来出题、谁来阅卷的问题上审视。推理预算不同文本基准允许最长 256K token 的推理长度多模态基准 64K。对于以长思维链著称的科学推理模型256K 的推理预算意味着模型可以慢慢想而部分对比模型在各自官方评测里可能只给了几千到几万 token。推理预算不对齐分数就不可比——这是追平万亿刷屏报道中最容易忽略、也最致命的细节。结论自带限定词README 的注脚明确写了下划线为开源模型最佳加粗为全体模型最佳也就是说官方自己把开源最佳与全模型最佳分开陈述。社区传播时把这两层经常混为一谈追平万亿的表述正是在这种混淆中完成了二次加工。1.3 社区流传的具体任务到底平在哪儿综合社区情报追平万亿主要由以下几条证据支撑分子/科学问答如 MolecularIQ 一类评测中拿下高分有文章称其超越 Gemini-3.1-Pro材料结构生成晶体结构生成通过率宣称超过 40%显著优于同期闭源旗舰科学编程与智能体SciCode 等代码类基准上的表现以及 SWE-bench-Multilingual 等长程任务上的成绩推理效率MTP 推测解码在 8×H200 SGLang 环境下长输出吞吐接近翻倍、延迟下降约 61%。逐条看这些证据的含金量并不均匀效率指标吞吐、延迟是硬事实可以复现而超越某旗舰的表述高度依赖对比模型的版本、推理配置与评测集的选择。同一张榜单换个对手、换个采样参数结论可能完全反转。二、科学评测的常见水分不是造假而是口径偏差追平万亿这类话术之所以有市场是因为科学 AI 评测领域存在几个结构性的水分来源它们不违法、不造假但足以让一个 0.5 分的差距在传播中被放大成代际超越。2.1 基准过拟合与训练数据泄露科学基准大多来自公开论文与公开数据集分子库、晶体库、基因序列库。开源模型在训练时几乎必然会接触到这些数据的影子——哪怕不是逐字泄露同类分布的题目早已进入预训练语料。当模型在某个科学基准上拿了高分我们很难区分这是推理能力还是记忆检索。尤其当该基准的题目被反复用于 RL 训练如仓库所述20 领域多任务强化学习联合训练模型对题型的适应会进一步推高分数而这种适应并不迁移。2.2 任务选择偏差只报强项不报全景追平万亿的宣传口径集中在分子、材料、科学编程这类 Intern-S2 的强项上。但一个严谨的评测应该同时报告通用能力的下滑幅度——毕竟任何针对科学任务的 RL 训练都可能挤占通用能力空间。仓库 README 声称同时保持通用能力却未在正文给出完整的通用基准对照表评测图figs/intern-s2-397b.jpg 为 Git LFS 指针文件需下载权重后才能查看又无法在仓库内直接核验。只展示赢面、淡化输面的选择性呈现是评测话术里最常见的合法水分。2.3 推理预算、采样参数与工具开关不对齐科学模型评测比通用模型更复杂因为存在三个额外自由度思考/非思考模式README 明确 Intern-S2-397B 默认开启 thinking 模式且不建议在 agent 任务中关闭。若对比模型用的是短答案模式而 Intern-S2 用的是长思维链 256K 预算分数的差距很大程度上是算力换准确率。工具调用AgentCompass 类的评测允许模型调用计算器、代码解释器等工具。能查资料做题和闭卷裸考含金量天然不同。采样温度仓库推荐temperature0.8, top_p0.95而部分评测为了稳定性会用更低的温度。不同采样策略下分数波动可达数个点。2.4 评测集版本与对比模型的移动靶超越 Gemini-3.1-Pro优于 GPT-5.5这类说法在传播中最容易变质对比模型是什么版本、什么量级、是否开了工具、评测集是哪一版、是否经过 RL 针对性优化——这些信息在社区二创中几乎全部丢失。当基准没有冻结、对手没有定格超越就只是一个营销时点而不是一个科学结论。三、一套识别评测话术的 Checklist以后再看到XX 参数追平 YY 万亿的标题别急着转发。按下面这张表逐项盘问大多数刷屏稿会在第三行就露出马脚盘问维度具体问题通过标准参数口径说397B是总参数还是激活参数明确区分MoE 模型必须标注激活量推理预算双方评测的最大推理 token 是否一致明确列出各模型推理长度上限采样配置温度、top_p、是否开 thinking 模式给出完整采样参数工具使用是否允许调用外部工具/代码执行区分闭卷与开卷对比对象万亿模型具体指哪个版本、哪个量级版本号 参数量 评测日期基准清单除了赢的基准输的基准是否也公示完整评测矩阵含通用能力评测框架用的是独立第三方还是自研框架公布框架版本与评测脚本可复现性评测脚本、prompt、后处理是否开源他人可跑出同一分数效率归属追平是否部分源于稀疏架构的算力红利单 token 激活 FLOPs 透明披露训练数据边界基准题目或其分布是否可能已进入训练集披露数据去重与污染检测流程把这 10 问对照仓库现有材料会发现官方 README.md 与 deployment_guide.md 在效率和可复现性两项上做得相当扎实——MTP 加速配置、512K 长上下文 YaRN 参数、LMDeploy/vLLM/SGLang 三套部署命令全部可复现而在对比对象定格和完整基准矩阵两项上仓库同样留了明显的开口。这不是这家实验室独有的问题而是整个行业的通病。结论把追平从口号还原为工程事实回到最初的问题科学模型评测的含金量经得起推敲吗答案是部分经得起。经得起推敲的部分是硬工程事实512 专家的稀疏 MoE 架构config.json、原生 MTP 推测解码带来的近倍吞吐提升社区多篇实测互相印证、FP8 量化下 8 卡可部署的工程成熟度deployment_guide.md、以及 OpenAI 兼容 API 工具调用 时间序列分析的能力边界README.md 的完整示例代码。这些是 397B 真正值钱的地方——它证明了科学智能不必以万亿参数为门票稀疏化、混合注意力与长上下文推理预算的工程组合能把科学能力装进实验室搬得动的机箱里。经不起推敲的部分是营销修辞以 256K 推理预算 思考模式 工具调用跑出的分数与闭卷、短答案、默认配置的对比模型比高低再压缩成追平万亿四个字信息损耗率接近百分百。对读者而言正确的姿势不是不信评测而是把评测当成起点而非终点拿着 10 问清单去读每一个数字然后用自己的任务、自己的数据、自己的预算跑一遍。当397B 追平万亿不再是一句口号而变成你机器上一条可复现的 throughput 曲线和一组任务完成率时这场关于评测含金量的讨论才算真正有了答案。【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考