950 个 Agent 跑 21.5 小时只交 19 份报告:Claude 挖出 ART 酶系统,难点在 Harness

📅 发布时间:2026/9/26 4:25:33
950 个 Agent 跑 21.5 小时只交 19 份报告:Claude 挖出 ART 酶系统,难点在 Harness
一个 Agent 读到一段原始 DNA在分析记录里写下我肉眼就能看到串联重复阵列。写下这句话的不是人类科学家。它来自 Anthropic 跑的一次自主基因组挖掘。949 个Claude 会话21.5 小时2.156 亿token。最后只交了 19 份报告。其中一份定义了一个全新酶系统名字叫 ART。但工程界更该看的是另一件事。同样的搜索任务重跑 10 次没有一次再看见那串重复。ART 是什么三个零件加一串没人看的重复ART 全称 array-associated reverse transcriptases。中文一般译作阵列相关逆转录酶。它由三个部分组成。一个逆转录酶也就是把 RNA 抄回 DNA 的酶。一个紧挨着它的伴侣基因功能未知。还有一长串等间距排列的非编码 DNA 重复。这三样东西主要出现在噬菌体基因组里。噬菌体就是感染细菌的病毒。底层那个逆转录酶其实早就被记录过。过去研究巨型噬菌体时就有人见过它。Claude 第一个注意到的是它旁边的重复阵列和伴生蛋白。重复单元长15 到 49 个碱基中间有一个约 15 碱基的回文核心。单元之间的间隔长120 到 220 个碱基而且彼此序列不同。每个阵列有3 到 21 个拷贝跨度0.3 到 4.1 kb。阵列附近找不到任何 cas 基因。所以它不是 CRISPR只是长得像。研究团队在 95 个同源度 90% 的 RT 簇里找到 28 个带可检测阵列。重复序列在 ART 各支内部共享跨支就不共享了。间隔序列在同一个阵列内部彼此也基本不相关。在 MarsHill 和 SA1 这类近缘噬菌体之间间隔按原顺序保留。它们的分化速率与旁边的 RT 基因接近。那个 RT 的 N 端异常长。催化结构域之前有约180 个残基普通 RT 通常在 50 以内。93 个跨过催化区的成员都保留了 YxDD 基序。湿实验给出的第一条证据是转录。在金黄色葡萄球菌噬菌体 SA1 的感染时间序列里阵列 RNA 在 15 分钟时占噬菌体 RNA 的8%。它还会被切成边界固定的几段短 RNA。团队把 SA1 的 ART 放进大肠杆菌表达也检测到了类似片段。阵列 RNA 的丰度远高于酶本身。论文的推测是一个酶配了一整套模板或诱饵。但作者把话说得很死。没证明这个逆转录酶有活性。没证明那些短 RNA 是它的底物。为什么它和 CRISPR 不是一回事两者最容易被混淆的是那串重复阵列。但把参数摆在一起看差别相当大。特征CRISPR 阵列ART 阵列重复单元长度约 28 到 37 nt15 到 49 nt间隔长度约 30 nt120 到 220 nt间隔来源既往入侵病毒菌株间频繁增减阵列内互不相关近缘噬菌体间保序相邻 cas 基因有无阵列拷贝数通常数十3 到 21功能状态已做成可编程基因编辑工具完全未知漏斗949 个会话到底在做什么科学家给 Claude 的简报只有一句。在 DNA 序列数据库里找有趣的逆转录酶。数据库规模是19 亿个蛋白簇。Agent 收回约20 万个RT。给3564 个候选搭档家族打分。收敛到 20 个深挖最终交 19 份报告。Anthropic 说这种量级的分析人类专家要数周到数月。组织方式值得细看。一个 Agent 规划并执行任务另一个 Agent 负责复核。Agent 可以自己开新任务。ART 不在简报的目标里。简报要找的是编码蛋白的搭档基因。ART 的线索来自一个被否决的候选。Agent 先注意到某类 RT 旁边总跟着一个未知基因。深挖之后发现那只是巨型噬菌体自己的 RNA 聚合酶亚基。它否掉了这个关联。但它转念一想巨型噬菌体带着一个类似 retron 的 RT本身就不寻常。retron 通常是细菌用来防噬菌体的系统。复核 Agent 提议retron 的 RT 一般要配合上游的非编码 RNA。下一个 Agent 顺着去查上游。它发现这些酶的近亲上游普遍空出900 多个碱基。这个空间足够装下一段 RNA。于是它把一段2900 碱基的原始序列直接读进了上下文窗口。读完没有调用任何工具。紧接着记录下来的就是那句我肉眼就能看到。然后它开始怀疑自己。把近两年新报道的 RT 系统挨个梳理了一遍。自己写脚本算出该位点有14 个 16 碱基重复间隔 100 到 200 碱基不等。还主动发起一轮文献检索试图推翻自己的猜想。全对不上之后才提交报告。报告特别强调全程没有运行任何现成的重复序列查找工具。这串重复是它通读原始序列时自己看出来的。把家族定下来靠的不是一次会话Agent 交出候选只是整条链的第一步。团队随后用 Profile HMM 在宏基因组库和公开基因组里搜同源。这才有了前面那 95 个 90% 同源的 RT 簇。系统发育分析把这些 RT 放在 retron 旁边的一支。结构上它们的聚合酶域能和已解析的 retron、DGR 逆转录酶叠合。真正不同的是 N 端那 180 个残基。它在这个家族的每个成员身上都在。但它和任何已知蛋白家族或折叠都只有很弱的相似性。研究团队因此把它列为 ART 的第二个标志。被否决的那一支后来成了对照最初把 Agent 引向 ART 的那些 RT其实属于姊妹支。它们的 N 端也很长。但在 17 个可评估位点里没有一个带重复阵列。也没有一个编码 ART 那种伴侣蛋白。团队把它们叫作 NART非阵列相关逆转录酶。这条支线能留下来恰恰因为否决记录被完整保存了。为什么这么多年没人看见工具的窗口太窄论文给了一个很具体的技术解释。识别 CRISPR 阵列的常用工具参数都照 CRISPR 的尺寸设。MinCED 的默认设置只认26 到 50 个碱基的间隔。CRISPRCasFinder 只认25 到 60 个碱基。ART 的间隔是 120 到 220 个碱基。本来就在它们的筛查范围之外。这不是工具的 bug是工具的假设。而假设来自已知样本的分布。当真实世界出现分布外的样本工具会安静地漏掉它。不报错不告警只是什么都不返回。研究团队后来专门写了一个扫描程序。去找间距在 100 到 450 个碱基之间的重复。这件事可以用十几行 Python 复现。import random def make_art_like_array(unit_len16, copies14, gap_range(120, 220), seed7): 造一段 ART 样阵列固定重复单元 长度 120-220nt 且各不相同的间隔。 rng random.Random(seed) unit .join(rng.choice(ACGT) for _ in range(unit_len)) parts [unit] for _ in range(copies - 1): gap .join(rng.choice(ACGT) for _ in range(rng.randint(*gap_range))) parts.append(gap) parts.append(unit) return .join(parts), unit def scan_tandem_arrays(seq, unit_len, gap_min, gap_max, min_copies3): 在指定重复单元长度与间隔窗口内统计串联重复拷贝数。 unit seq[:unit_len] copies, pos, gaps 1, unit_len, [] while pos unit_len len(seq): nxt seq.find(unit, pos, pos gap_max unit_len) if nxt 0: break gap nxt - pos if gap_min gap gap_max: gaps.append(gap) copies 1 pos nxt unit_len return (copies, gaps) if copies min_copies else (0, []) if __name__ __main__: seq, unit make_art_like_array() print(f阵列长度 {len(seq)}nt重复单元 {unit}) print(MinCED 默认窗口 gap 26-50 :, scan_tandem_arrays(seq, 16, 26, 50)) print(CRISPRCasFinder 窗口 25-60:, scan_tandem_arrays(seq, 16, 25, 60)) print(ART 实测窗口 gap 100-450 :, scan_tandem_arrays(seq, 16, 100, 450))同一个阵列换个间隔窗口结果完全不同。上面这段脚本只是把参数窗口摆在一起做对照。它解释不了 ART 的生物学但解释了它为什么能被藏这么久。10 次重跑全错过可复现性才是真问题团队把同样的搜索任务重跑了 10 次。几乎每次完成全面检索的会话都碰到了 ART 相关位点。其中两次还对这一谱系展开了后续研究。但没有一次去读这些 RT 基因上游的 DNA。所以 10 次全部错过了阵列。论文把原因归给搜索规模以及 Agent 行为的不可预测性。这条比 ART 本身更值得工程团队停下来看。一个跑一次能出结果的 Agent 系统不等于一台可靠的科学仪器。你没法把某次会话刚好读了那段序列写成 SOP。传统基因组挖掘的可复现性来自确定性扫描程序。Agent 挖掘的可复现性目前来自运气加提示词。论文自己的定位也很清楚。这次展示的是异常检测能力不是一条可复现的发现流水线。对照实验工具越多模型读得越少论文做了一组固定输入的对照实验。把 ART 序列固定下来让 7 个 Claude 模型分析。再由最强的 Mythos 5 按 10 个关键特征打分。这套评分本身也是模型给的不是人工标注。能力最强的四个模型明显更好。Opus 5.5、Mythos 5.1、Mythos 5、Opus 5 排在前列。Opus 4.6、Opus 4.8、Sonnet 5 落在后面。更关键的是失败模式。直接给 DNA 时四个最强模型至少90%的尝试能描述出阵列。改成给文件加工具这个比例最低掉到32%。近四成的尝试从头到尾没读过 200 个碱基以上的连续文本。连一个完整的重复单元都没看全。直接读进上下文的 DNA 越长认出阵列的比例越高。Mythos 5 在最好的条件下达到96%。投喂方式描述出阵列的比例典型失败模式直接给 DNA 序列四个最强模型均不低于 90%几乎不失败给文件加工具最低 32%近四成尝试未读满 200 碱基连续文本直接给长 DNAMythos 5 最高 96%读得越长识别率越高结论有点反直觉。工具不是越多越好。当工具替模型做了找模式这件事模型反而不读原始数据了。而这次发现恰恰来自直接读原始序列。论文把它称为 genomic vision基因组视觉。论文还说这个行为可归因于 Mythos 5 内部对重复 DNA 有响应的特定信号。换句话说它是模型内部表征的产物不是提示词写出来的。它和另一条路线差在哪里论文在讨论里做了一个横向对照。斯坦福那篇工作用的是专门的基因组语言模型。目标就是挖非编码元件。它找到的是 UG27 逆转录酶旁边的 ncRNA 阵列。那是一条专用模型的路线。这次是通用模型直接读 DNA 看出来的。论文据此认为这类阵列架构在自然界至少独立出现过两次。但两次的技术路线完全不同。19 份报告里ART 只排第三19 份报告交上去之后。用 Mythos 5 做两两比较打分。ART 那份排在第三位。最终是人类研究员凭经验从排名靠前的几份里把它挑了出来。自动排序可以给出候选但不能定终局。这轮流程里人类的位置并不只是按一下回车。这也解释了 Anthropic 为什么反复强调所有湿实验都由人类科学家完成。把生物学放一边五条工程结论可以带走第一异常检测需要原始数据进上下文。工具封装会切断这条路径至少在当前的模型上是这样。如果 Agent 只在工具返回值上做判断它会漏掉分布外的东西。第二可复现性必须显式设计。长跑 Agent 的自由度越高执行路径越难复现。需要把读了哪些原始数据当成一等公民记录下来。否则你连它为什么成功都说不清。第三筛选环节要留人。自动打分可以排序不能定终局。第四工具的默认参数是一份历史假设。当你要找的是分布外的东西先检查工具的窗口。第五日志要能回答读了什么而不只是调了什么。这次能定位原因靠的是会话记录里那几行原始序列和 Agent 的原话。没有这些记录10 次重跑失败只能被解释成随机。这五条跟生物学无关。任何做 Agent 数据挖掘的团队都会撞上。这次没有证明什么最后把边界说清楚。ART 的生物学功能完全未知。没证明那个逆转录酶有活性。没证明那些短 RNA 是它的底物。没证明逆转录酶和伴侣蛋白会结合。更没证明它能做基因编辑。论文是预印本还没有同行评审。张锋审阅后的评价是值得进一步研究。他没说这是下一个 CRISPR。底层那个酶早在过去的巨型噬菌体研究里出现过。Claude 的贡献是注意到阵列和伴生蛋白。这个贡献是真的边界也就在这里。