Mac 上跑 35B:mlx 量化版实测 50 tokens/s 的参数表

📅 发布时间:2026/10/10 23:09:52
Mac 上跑 35B:mlx 量化版实测 50 tokens/s 的参数表
Mac 上跑 35Bmlx 量化版实测 50 tokens/s 的参数表【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini把一款 35B 总参数的智能体模型装进笔记本还能以约 50 tokens/s 的速度实时推理——这在两年前还属于云上算力专属的场景如今却可以在一台 Mac 上完成。这一切的钥匙是 MLX 生态里的 mlx-optiq 量化工具链它把 Nex-N2.5 家族最小的成员 Nex-N2.5-mini 的 bf16 权重约 70.2GB压到 17.8GB 的混合 3/6 位量化版峰值内存约 17.9GB恰好落入 M 系列统一内存的甜区。本文结合模型仓库的真实配置与社区实测数据拆解这条35B 上 Mac的完整链路架构适配原理、环境搭建、一键启动以及那张决定 50 tokens/s 的关键参数表。35B 为什么能塞进统一内存先看模型出身Nex-N2.5-mini 是一个典型的总参数大、激活参数小的 MoE 模型。仓库根目录的 config.json 给出了明确的架构指纹架构为Qwen3_5MoeForConditionalGeneration文本侧hidden_size2048、num_hidden_layers40专家配置num_experts256、num_experts_per_tok8即每生成一个 token 只激活 8/256 的专家约 3B 级激活参数这是35B 级别模型却能维持高吞吐的根本原因混合注意力结构40 层中按full_attention_interval: 4交替layer_types明确标注了 10 层 full_attention 与 30 层 linear_attention线性注意力层还带有linear_conv_kernel_dim、mamba_ssm_dtype: float32等状态空间模型SSM 系字段用于压低长上下文下的注意力开销上下文窗口max_position_embeddings262144262Knum_key_value_heads仅 2长上下文场景的 KV cache 压力可控文本侧之外还带一个 27 层、hidden_size 1152 的视觉编码器processor_config.json 中对应Qwen3VLProcessor说明这是延续 Nex-N2 的多模态路线。权重总量在 model.safetensors.index.json 的metadata.total_size里写得很清楚70,214,363,872 字节约 70.2GB 的 bf16 全精度。70.2GB 显然是任何消费级 GPU 的显存都装不下的但 Mac 的 M 系列芯片采用 CPU/GPU 统一内存架构64GB 以上机型天然可以整模型驻留。剩下的问题只有一个怎么把 70.2GB 压进可用内存同时不把推理速度拖垮。mlx-optiq 与 Apple Silicon 的适配原理社区围绕 Nex-N2-mini 发布的 mlx-optiq 量化版模型static-mixed-3_6bits给出了答案基于 mlx-optiq 0.0.11 的分层混合精度量化把 70.2GB 权重压缩到 17.8GB压缩率约 74.6%实测峰值内存仅 17.873GB推理速度约 50 tokens/s。这套方案的工程要点是按张量角色分配位宽而非一刀切低比特对模型输入端敏感的张量嵌入层、in_proj_qkv投影采用 3 位量化对输出端与关键路径上的张量down_proj、lm_head保留 6 位中间部分取折中位宽整体形成静态混合 3/6 位布局。这样的分配逻辑在仓库的权重清单里能找到一一对应的实体model.language_model.embed_tokens.weight、layers.*.linear_attn.in_proj_qkv.weightmodel.safetensors.index.json 中可检索到全部 30 个线性注意力层的该张量、layers.*.mlp.experts.gate_up_proj / down_proj、以及lm_head.weight等。MoE 专家权重在 70.2GB 中占比极高把专家矩阵压到低比特、同时给共享专家和输出头留更高精度是兼顾体积与质量的关键决策。对 Apple Silicon 而言mlx-optiq 的核心价值在于MLX 框架把权重与激活都放在统一内存中GPU 与 CPU 共享同一块高带宽内存量化后的模型可以做到整卡加载、无需 offload而 M 系列尤其 M1 Pro/Max 及以上的高内存带宽直接决定了解码阶段逐 token 的吞吐上限。这也是 17.8GB 量化模型能在笔记本上跑到每秒数十 token 的硬件前提。环境、依赖与一键启动社区教程总结的部署路径非常短核心依赖只有两个mlx-lmMLX 生态的模型加载与推理入口负责 safetensors 读取、chat template 应用与采样mlx-optiq社区实测使用 0.0.11 版本负责按预设的分层量化配置读取原始权重并生成混合位宽模型。推荐流程是新建虚拟环境后安装上述依赖随后把量化后的权重目录放入内存充裕的机型。启动推理只需 mlx-lm 的生成入口等价于以下模板python -m mlx_lm.generate \ --model /path/to/nex-n2-mini-mlx-optiq-static-mixed-3_6bits \ --prompt 你的 prompt \ --max-tokens 4096 \ --temperature 0.7 --top-p 0.95 --top-k 40实际路径按本地存放位置替换如需 OpenAI 兼容服务可将generate换成mlx_lm.server启动接口。值得注意的是这个量化版虽然是社区基于 Nex-N2-mini 制作但仓库的 chat_template.jinja 同样适用于本家族的推理侧模板支持reasoning_effort参数控制思考模式并能将多轮工具调用序列化为tool_call/tool_response结构——这意味着 Mac 本地跑的不只是聊天而是带函数调用与多轮反馈的轻量 Agent 工作流与 Nex 系列为长程任务而生的定位一致。50 tokens/s 是怎么来的生成参数实测速度不是单一变量决定的而是架构 × 量化 × 采样参数三者叠加的结果。拆开看第一激活参数少。256 专家每 token 只激活 8 个加上共享专家shared_expert.gate_proj / up_proj / down_proj中间维度 512单 token 实际参与计算的有效参数量级仅 3B 左右。decode 阶段的计算量被 MoE 结构砍掉了一个数量级这是 50 tokens/s 的底层来源。第二量化释放了内存带宽。bf16 下权重读取量约 70.2GB 摊到每次前向而 3/6 位混合后降为 17.8GB单位 token 需要从统一内存搬运的字节数减少约四分之三。在内存带宽固定的 M 系列上这直接换算为吞吐提升。第三采样参数与思考模式影响 token 产出节奏。仓库 README.md 明确推荐的采样参数为temperature 0.7、top_p 0.95、top_k 40评估与部署均以此为准这也是社区实测时的基准配置。同时reasoning_effort提供三档控制none直接回答、medium默认自适应思考、high强制思考。实际使用中思考 token 也计入吞吐统计——如果开启高思考强度模型会先生成大段think内容感知上的有效输出速度会低于原始 token 速率追求极致响应速度时可设reasoning_effortnone。第四上下文长度是隐性变量。262K 上下文意味着线性注意力层承担大部分长程记忆但 10 层 full_attention 的开销会随序列长度上升社区实测的 50 tokens/s 通常是短中上下文、单请求场景下的数值长上下文或并发请求下会明显回落。这是一张需要读者心里有数的理想值。一张表看懂全部关键参数把上文涉及的核心参数汇总如下便于直接对照调参类别参数值来源架构总参数规模35B 级MoE社区情报架构专家数 / 每 token 激活256 / 8config.json架构层数 / 注意力类型40 层30 linear 10 fullconfig.json架构hidden_size / head_dim2048 / 256config.json架构上下文窗口262144262Kconfig.json架构词表 / KV heads248320 / 2config.json权重bf16 全精度体积70,214,363,872 B≈70.2GBmodel.safetensors.index.json量化位宽方案static mixed 3/6 bits社区实测量化压缩后体积17.8GB压缩率约 74.6%社区实测推理峰值内存≈17.873GB社区实测推理吞吐≈50 tokens/s社区实测采样temperature / top_p / top_k0.7 / 0.95 / 40README.md思考模式reasoning_effortnone / medium / highREADME.md / chat_template.jinja能跑多快更要知道它值不值得跑在下结论前有必要把基准分数摆到桌面上。仓库给出的 Nex-N2.5 基准总览图显示Nex-N2.5-mini 在代码与智能体场景的表现明显强于其mini身份Terminal-Bench 2.1 达 73.4、SWE-Bench Pro 43.8、BrowseComp 83.4、Toolathlon Verified 54.6、OSWorld-Verified 71.2、OmniDoc 89.7。也就是说Mac 上跑出的这 50 tokens/s服务的不是一个玩具模型而是能够在终端里执行任务、调用工具、操作浏览器并自我纠错的智能体。结合本文的参数表一条清晰的判断线已经浮现如果你的场景是笔记本上跑带工具调用的 Agent 开发调试mlx-optiq 混合量化版是最省事的路径——内存 64GB 起步的 Mac 即可整模型驻留50 tokens/s 足够完成函数调用与多轮反馈的交互节奏如果你的场景是追求极致长上下文或高并发那么 17.8GB 量化模型的上限就摆在那里SGLang 双卡 H100 的官方部署见 README.md 的 Docker 配置才是产能取向。量化的本质是权衡而这套参数表就是权衡开始的地方。【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考