256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型

📅 发布时间:2026/8/25 10:44:30
256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型
256个专家只激活3B参数Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3BOrnith-1.5-35B-A3B 是 Ornith-1.5 家族中基于 MoEMixture of Experts混合专家架构的多模态推理模型总参数约 35B但每个 token 只激活约 3B 参数推理成本接近小模型却在 SWE-bench Verified、Terminal-Bench 等编码与 Agent 基准上全面超过 Gemma-4-31B 等稠密模型。一、什么是 MoE把全员加班改成按需点将传统稠密模型处理每个 token 时所有参数都要参与计算模型越大、每次推理越贵。MoE 的思路是把每一层里最重的专家网络FFN 模块拆成很多个小组再配一个路由器Router每个 token 只选少数几个专家来处理。这样总参数大→ 知识容量大能记住更多模式激活参数小→ 单次推理计算量小、速度快Ornith-1.5-35B-A3B 的名字就概括了它的身份35B是总参数A3BActivated 3B是每 token 实际激活的参数。二、256个专家、每层选8个它是怎么分配的打开 config.json能看到核心 MoE 参数关键配置数值含义num_experts256每层配备 256 个专家 FFNnum_experts_per_tok8每个 token 只激活 8 个专家num_hidden_layers40语言主干共 40 层hidden_size2048隐藏层维度moe_intermediate_size512单个专家内部宽度vocab_size248320词表规模也就是说每层有 256 个专家路由器为每个 token 挑选 8 个约 3%。256 个专家 × 40 层就是它 35B 总参数的大头所在而每次前向传播真正干活的只有 3B 左右这就是 A3B 的由来。从权重清单 model.safetensors.index.json 还能看到一个重要细节每层除了 256 个可选专家外还额外配了 1 个shared_expert共享专家。 为什么需要共享专家被选中的 8 个专家只负责个性化能力而所有 token 都会经过的共享专家则承载通用语言能力两者相加保证任何 token 都有稳定的基础能力托底。这是当前 MoE 模型的常见稳健设计。三、不只是 MoE线性注意力让长上下文更便宜config.json里的layer_types字段揭示了另一个隐藏亮点——注意力混合结构每 4 层中有3 层是linear_attention线性注意力只有第 4 层是full_attention完整注意力层还采用 GQAnum_key_value_heads2仅 2 个 KV 头这意味着 262,144256Ktoken 的上下文窗口下历史信息的记忆与计算开销大幅降低长文档、大代码库场景不再被 KV Cache 拖垮。这也是为什么官方推荐在 2×80GB GPU 上以 256K 上下文部署并用--enable-prefix-caching复用前缀。四、3B激活参数凭什么碾压稠密巨兽MoE 的优势不是玄学而是三个因素的叠加容量与成本的解耦稠密模型想要更强能力只能把每个 token 的计算量一起做大Ornith-1.5-35B-A3B 用 256 个专家堆出 35B 容量推理却只花 3B 的算力——装得下大知识跑得快。稀疏激活 专家分工路由器让不同专家逐渐擅长不同类型的任务语法、数学、代码、工具调用……token 按需点将。对比同规模的 Qwen3.6-35B-A3B 和稠密的 Gemma-4-31BOrnith-1.5-35B-A3B 在 Agent 编码类基准上领先幅度最大正说明这种分工在多步骤工具使用上收益最高。自改进训练放大了架构红利根据 READMEOrnith-1.5 的突破在于端到端自改进循环模型持续自己生成训练任务、构造求解脚手架、用强化学习打磨策略。好的架构MoE 线性注意力提供了能力上限自改进训练把上限兑现了出来。五、官方基准成绩一览以下为 README 公布的五次独立运行均值节选基准Ornith-1.5-35B-A3BQwen3.6-35B-A3BGemma-4-31B稠密Qwen3.5-397BSWE-bench Verified79.073.452.076.4SWE-bench Pro59.649.535.751.6Terminal-Bench 2.1 (Terminus-2)67.852.542.153.5NL2Repo46.229.415.536.8GPQA Diamond89.286.084.388.4可以看到一个只跑 3B 参数的 MoE 模型在多数编码/Agent 项上追平甚至超过了 397B 的 Qwen3.5——这就是稀疏激活对稠密大模型的降维打击。六、新手部署速查2×80GB 显卡跑满 256K 上下文完整参数bf16约70GB官方推荐 2×80GB GPU 部署并保留 256K 上下文的显存余量运行时要求Transformers ≥ 5.8.1、vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9关键启动参数--tensor-parallel-size 2、--max-model-len 262144、开启前缀缓存并启用推理解析器--reasoning-parser qwen3与工具调用解析器建议采样参数通用任务temperature0.6, top_p0.95, top_k20与 generation_config.json 一致上下文不够用时官方验证过 YaRN 缩放factor4.0 可扩到约 1M token⚠️ 注意Ornith-1.5-35B-A3B 是推理模型助手回复会先输出think…/think思考块再给答案服务端需开启 reasoning parser否则思维链会混进正文。七、写在最后为什么值得你关注这个模型对新手而言Ornith-1.5-35B-A3B 的价值可以浓缩成三句话MoE 让大模型变得可部署——35B 容量 3B 激活成本双 80G 卡即可本地跑 Agent 编码256 专家 1 共享专家的组合兼顾了专业分工与基础稳定线性注意力 256K 上下文让它能吞下整个代码库成为真正可用的终端编码 Agent。想深入了解架构与自改进训练细节可直接阅读仓库内的 README.md含全部评测口径说明与 config.json全部结构参数。【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考