别再“多喂信息“了——你以为的认真,正在让 AI 变蠢

📅 发布时间:2026/8/18 21:04:02
别再“多喂信息“了——你以为的认真,正在让 AI 变蠢
导语很多人有个本能给 AI 喂得越多越安心。但 Anthropic 的研究告诉我们这恰恰是 AI 在长任务后半程犯迷糊的元凶。你有没有过这种体验一个长任务你把所有可能相关的资料、历史对话、背景说明一股脑全塞进去生怕漏了哪条它就答偏。结果呢对话拉长到后半程它反而开始犯迷糊——前面说好的约束忘了之前否掉的方案又拐回来了明明资料就在上下文里它却像没看见一样。你以为问题是提示词没写好于是改了又改加了更多规则、更多请注意。越改越长越长越糊。Anthropic 给这种现象起了个名字context rot上下文腐化。腐化的不是信息是用信息的能力请注意腐化这个词的精确含义——这非常重要信息没有消失它还好好待在上下文里。腐化的是模型用它的可靠性。这不是存储失败是调取失败。你的上下文窗口明明还空着一大半信息明明一个字没少但模型就是想不起来该用哪条。这不是容量问题是注意力问题。所有模型都有这个毛病只是退化得平缓些或陡些没有谁能幸免。为什么会这样两层原因第一层注意力是有预算的。就像人的工作记忆容量有限模型也有一份注意力预算。你每往上下文里加一个 token就从这份预算里扣掉一点。所以每个 token 都有成本——问题从来不是这条信息相不相关而是它带来的价值够不够抵它消耗的注意力。你塞进去的那些也许用得上的资料大多数时候带来的价值抵不上它消耗的注意力预算。净亏。第二层架构天生如此。现在的大模型基于 Transformer它的特点是每个 token 都要去关注其他所有 token。于是 n 个 token就要处理大约 n² 量级的两两关系。token 一多模型分给每条关系的精细度就被摊薄了。这就是覆盖更多内容和保持注意力集中之间天然的矛盾。再加上训练数据里短序列比长序列常见得多模型对跨越整个长上下文的远距离依赖练得就少。“等窗口更大就好了”想多了有人指望技术进步能解决——位置编码插值这类技术确实能让模型吃下更长的序列但文章泼了盆冷水代价是模型对 token 位置的理解会有损耗。性能下降是渐进的不是到某个长度突然崩掉。它会一边语言依旧流畅一边悄悄把事实召回和长程推理的精度往下调。这种温水煮青蛙式的退化恰恰最难发现——因为输出看起来依然通顺、依然自信只是悄悄地答错了。关键认知在可预见的将来任何尺寸的窗口都逃不过上下文污染和相关性问题只要你追求最强表现。那该怎么办把这句话刻进脑子上下文是一种珍贵而有限的资源边际收益递减。衡量它的标准不是能装下多少而是能可靠地用上多少。具体来说三件事追求最小充分而非最全。目标是能最大化正确结果概率的、最小的高信号 token 集合。少了会跑偏多了制造冗余。能现找的就别提前全喂。上下文里只放轻量引用文件路径、查询、链接运行时按需加载。长任务用三板斧压缩、结构化笔记、子 Agent 架构。这套思路不只对 AI 成立文章最后那句特别打动我。我们自己也管理知识、管理注意力——真正的问题从来不是我知道得够不够多而是此刻我有没有把有限的注意力放在最值得处理的那件事上。给机器做上下文工程读着读着像是在提醒我们给自己也做一次。小结真正厉害的 Agent不是历史记得最全的那个而是每一步都只让模型看见此刻最该看见的东西的那个。从今天起别再无脑多喂了——你以为的认真可能正是让 AI 变蠢的原因。