【清华代码熊】DeepSeek V4.1 Flash 后训练详解

📅 发布时间:2026/10/4 14:32:38
【清华代码熊】DeepSeek V4.1 Flash 后训练详解
上期解析了 DeepSeek V4.1 Flash 模型架构改进本期解析 DeepSeek V4.1 Flash 预训练/后训练技术 预训练45T 文本 多模态混合语料、直接训练 sparse attention取消 DeepSeek V4 的 dense 冷启动、DeepSeek-ViT 通过 contrastive pre-training autoregressive fine-tuning 两阶段预训练。 后训练复用 V4 后训练 Pipeline不引入新的后训练算法投入在数据和环境 Scaling。包括大规模 Agent 任务-环境合成、Scaffold Compute 的异步 RL Scaling、40 Teacher full-vocabulary OPD。