AI前沿日报_2026-08-13

📅 发布时间:2026/8/14 22:40:18
AI前沿日报_2026-08-13
AI 前沿日报2026年8月13日三大模型同日发布Qwen 3.8开源2.4万亿参数MoE、Grok 4.6对标GPT-5.6、DeepSeek V4 Pro上线APIAI代理自主发现开源项目安全漏洞并获人类维护者合并OpenAI伦理负责人入职不到一年辞职Lovable估值133亿美元NVIDIA组建5000亿美元融资联盟DeepMind发布手语转文字模型RTX 6000 PRO涨价至1.6万美元Muse Glimmer新量化刷新SoTAAI代理编排器翻车Terminal-Bench。 今日头条1. 三大模型同日发布——Qwen 3.8、Grok 4.6、DeepSeek V4 Pro今天堪称AI模型的超级星期三——三家巨头同日发布重磅模型Qwen 3.8阿里Qwen团队同时发布两个版本——Qwen3.8-27B社区高度期待的27B参数模型和Qwen3.8-2.4T-A95B2.4万亿参数MoE活跃参数95B。大版本在SWE-bench Pro达到67.7%GPQA Diamond达到92.6%Deep SWE达到56.6%Grok 4.6xAI发布Grok 4.6社区称其为等同于GPT-5.6 Sol的模型基准测试已出DeepSeek V4 Pro 0813DeepSeek新版Pro模型正在滚动推送到API与Fable 5和Opus 4.8正面对决2. AI 代理自主发现开源项目安全漏洞——人类维护者已合并修复一个AI Agent正在自主扫描开源代码仓库发现真实安全漏洞编写修复补丁并提交PR——所有这些无需人工监督。它的标准极其严格只有当人类维护者实际审查并合并补丁后才算一次有效发现。该Agent已在多个知名项目中发现漏洞包括一个26万Star的阿里巴巴项目。每个修复都是公开的已合并PR任何人都可以去查看。这展示了AI Agent在安全领域的实际落地能力——不是炒作不是末日预言而是一个具体的、可验证的中间案例。3. Qwen3.8-2.4T-A95B 登陆 HuggingFace——2.4万亿参数开源MoEQwen团队在HuggingFace正式发布Qwen3.8-2.4T-A95B模型总参数2.4万亿2,446,182,725,504全部BF16精度活跃参数95BMoE架构Licenseqwen3.8-max基准测试SWE-bench Pro67.7%GPQA Diamond92.6%Deep SWE56.6%HLE43.6%已有494个Like978次下载支持Together推理提供商输出价格$6.25 开源模型前沿4. Muse-Glimmer-30B 新 SoTA 量化发布社区开发者发布了Muse-Glimmer-30B的新一轮SoTA量化版本希望开启新的量化产品线。Meta的Muse Glimmer 30B自发布以来持续受到社区关注此前已有实测表明它在部分用例中超越Qwen 3.6-27B。5. Meta’s Muse Glimmer 30B 在 Mac 上提速 3.3 倍开发者使用mlx-dspark让Muse Glimmer 30B在Mac上运行速度提升至原来的3.3倍。这为Mac用户提供了一种极具吸引力的本地大模型运行方案。6. Gemma 4 QAT 优化 KV Cache 量化——KLD 基准测试表现优异社区分享了对Gemma 4 QAT量化感知训练模型的KV Cache量化测试结果。KLDKullback-Leibler Divergence基准测试表明Gemma 4 QAT在KV Cache量化方面表现远超预期为在有限显存上运行长上下文提供了可行方案。7. LiquidAI LFM2.5-VL-3B——3B视觉模型在 iPhone 17 上识别 MinecraftLiquidAI发布了LFM2.5-VL-3B视觉模型仅3B参数就能在iPhone 17上本地运行并成功识别出Minecraft中的Steve角色。这展示了小型视觉模型在移动端实际部署的可行性。8. CohereLabs 发布 North-Micro-Vision-InstructCohereLabs在HuggingFace发布了North-Micro-Vision-Instruct模型进一步丰富了开源视觉语言模型生态。9. DeepSeek V4 Flash 0731 越狱版发布社区开发者发布了DeepSeek V4 Flash 0731 的越狱版本jailbreak pt2移除了模型的安全限制。这引发了关于开源模型安全边界的持续讨论。 行业动态10. OpenAI 伦理负责人入职不到一年辞职OpenAI的伦理负责人Head of Ethics在加入公司不到一年后宣布离职。这引发了对OpenAI安全治理架构稳定性的担忧——在AI安全成为全球焦点的当下核心伦理岗位的频繁变动令人关注。11. Lovable 估值达 133 亿美元——Vibe Coding 平台 Series C 融资 4 亿美元瑞典vibe-coding平台Lovable宣布完成4亿美元Series C融资估值达到133亿美元较去年12月B轮的66亿美元翻倍。融资由Menlo Ventures领投欧盟Scaleup Europe Fund由EQT管理联合领投2024年成立2026年6月已达到5亿美元ARR目标2026年下半年实现65%利润率投资方还包括CapitalG、Salesforce Ventures、NVentures、DST Global、Khosla Ventures等12. NVIDIA 组建 5000 亿美元 AI 基础设施融资联盟NVIDIA与华尔街六大金融巨头合作组建了5000亿美元的融资计划帮助AI公司直接对接机构资本无需自行承担芯片、建筑、电力和散热的巨额前置成本。六家合作方包括Apollo Global Management、BlackRock、Blackstone、Brookfield、Goldman Sachs、KKR。据Morgan Stanley估计超大规模厂商2026-2028年间可能支出3.5万亿美元总AI基建投资可能超过8万亿美元。但NVIDIA现在帮助为其硬件买家融资的做法引发了循环融资的担忧。13. RTX 6000 PRO 涨价至 16,000 美元——几乎翻倍NVIDIA将其最快的Blackwell GPU、96GB显存的RTX PRO 6000价格从原来的约8,500美元提升至16,000美元几乎翻倍。这一涨价在本地大模型社区引发强烈反响进一步加剧了对NVIDIA定价策略的批评。14. Sam AltmanAI 不会带来四天工作制——人类暗自享受忙碌OpenAI CEOSam Altman表示AI不会带来四天工作制因为人类暗自享受保持忙碌的状态。他认为技术承诺了人们可以减少工作但人的本性决定了人们会继续寻找事情来做。这番言论在社区引发激烈争论。15. DeepMind 发布 SL2T 手语转文字模型——听障用户可对手机打手语Google DeepMind发布了SL2TSign Language-to-Text模型这是一项突破性的无障碍AI技术听障用户可以直接对手机打手语无需打字模型同时读取手部、身体和面部运动实时转为英文姿势追踪在设备端进行保护隐私翻译在服务器端运行已集成到Gboard和Live Transcribe首发Pixel 11与聋人社区深度合作开发计划扩展到更多语言16. Meta AI 连接邮箱和日历——变身个人助理Meta AI现在可以连接用户的邮箱和日历创建幻灯片并执行周期性任务。这标志着Meta AI从对话助手向个人生产力助理的转型。17. Intel LLM-Scaler 支持 Muse GlimmerIntel宣布其LLM-Scaler工具已支持Muse Glimmer模型及其他LLM和功能为Intel平台用户提供更多本地模型选择。18. 书商怀疑 AI 公司购买并销毁稀有书籍OpenAI社区传出消息书商怀疑AI公司正在大量购买稀有书籍后销毁以获取训练数据同时消除痕迹。这一指控如果属实将涉及文化和知识遗产保护的法律与伦理问题。 AI 视频生成19. MiniMax H3 vs LTX 2.5 大战持续——社区两派分化r/StableDiffusion社区今日被MiniMax H3和LTX 2.5的对比测试刷屏社区出现两蛋糕阵营——有人喊LTX是我们的盟友也有人要求停止把两者对比当作政治立场MiniMax H3被测试在4070上的预算方案25步被认为是最低设置LTX 2.5在RTX 5070 Ti上的生成时间测试已出有人将MiniMax H3 LTX 2.5组合作为上采样器MiniMax H3 Prompt Writer v0.3和Prompt Studio工具发布Anima-2.9B-Preview-v1模型发布扩展了Anima系列 研究前沿20. Claude 和 GPT 的隐藏推理过程被解码社区研究者成功解码了Claude和GPT的隐藏推理过程加密思维链并分享了详细的分析结果。这与昨日报道的窃取闭源大模型加密思维链论文相呼应——厂商用于保护推理过程的加密机制在实际中远不如想象中安全。21. The Loss Does Not See the Basis, But Adam Does [R]一篇新研究论文揭示了优化器与损失函数之间的有趣差异损失函数看不到基的选择但Adam优化器可以。这一发现对理解神经网络训练动力学有重要理论意义。22. Agentic AI 将推动 CPU-GPU 比从 1:4 趋向 1:1据AMD、Arm和Microsoft的分析Agentic AI工作负载将推动数据中心中CPU与GPU的配比从当前的1:4向1:1转变。这对芯片行业和数据中心架构设计有深远影响。23. AI 的气候问题比我们想象的更严重新研究指出AI的碳排放和能耗问题比此前估计更为严重。随着模型规模和部署量的指数级增长AI的气候足迹正在加速扩大。24. “护栏税”——企业 AI 安全开销比实际推理还耗算力社区讨论了一个被忽视的问题企业AI部署中安全护栏guardrails消耗的算力比实际推理还多。这种护栏税正在成为企业AI规模化部署的隐性瓶颈。 热议25. Claude Code 编排器翻车——4 个模型协同反在 Terminal-Bench 排第七一位开发者在Claude Code中编排了4个模型协同工作结果在Terminal-Bench上仅排第七成本却是顶尖单模型的两倍。更令人惊讶的是Opus模型在被委派任务时直接拒绝执行。这一发现挑战了用强模型编排弱模型执行的常见 wisdom揭示了多模型编排的复杂性。26. DeepSeek V4 Pro 对决 Fable 5 和 Opus 4.8社区发布了DeepSeek V4 Pro 0813与Fable 5和Opus 4.8的正面对决测试。三大闭源/半闭源模型的同台竞技引发了关于谁是当前最强模型的热烈讨论。27. GPT-5.6 Sol 和 Fable 5 解决了一个 25 年历史的无线问题社区发现GPT-5.6 Sol和Fable 5竟然解决了一个悬置25年的无线通信数学问题。这再次证明了顶级AI模型在科学研究中的突破能力。28. Custom GPTs 即将退役有消息称OpenAI正在退役Custom GPTs功能这引发了依赖该功能构建工作流的用户的担忧和讨论。29. Samsung 报告 AI 带来效率提升Samsung Electronics报告称通过使用AI工具实现了显著的效率提升成为又一家公开承认AI提升生产力的科技巨头。30. AI 疲劳与倦怠讨论升温多个社区同时出现了关于“AI疲劳”AI Fatigue和“AI倦怠”AI Burnout的讨论。随着AI工具渗透到工作流的方方面面越来越多的用户表达了信息过载和工具疲劳的感受。这反映了AI从新酷炫到日常负担的心理转折点。31. Qwen 3.8 27B 发布页面被下线有用户发现Qwen 3.8 27B的发布日期页面一度被下线引发了关于发布是否延期或遇到问题的猜测。不过社区整体预期Qwen 3.8 27B仍将如期发布。32. Qwen3.6 35B vs Muse Glimmer 30B 编码对比开发者在自定义Llama.cpp构建RTX 5080上对比了Qwen3.6 35B2分钟和Muse Glimmer 30B4分钟的编码性能为选择本地编码模型提供了实测参考。