Hyperresearch 配置完全指南:oa_min_full_text_chars 如何拦截 200 字摘要冒充全文?

📅 发布时间:2026/9/18 18:50:53
Hyperresearch 配置完全指南:oa_min_full_text_chars 如何拦截 200 字摘要冒充全文?
Hyperresearch 配置完全指南oa_min_full_text_chars 如何拦截 200 字摘要冒充全文【免费下载链接】hyperresearchAgent-driven research knowledge base. Agents collect, search, and synthesize web research into a persistent, searchable wiki.项目地址: https://gitcode.com/GitHub_Trending/hy/hyperresearchHyperresearch 是一个Agent 驱动的开源研究知识库能自动收集、搜索并综合网络研究沉淀为可持久检索的 wiki。其中OA 全文恢复功能可以把付费墙后只剩摘要的论文替换为合法的开放获取全文——而oa_min_full_text_chars就是决定候选文本算不算真全文的关键参数。为什么 200 字摘要会冒充全文想象一下 Agent 帮你抓取论文时的场景访问出版社页面 → 撞上付费墙只拿到约 1,500 字符的摘要Hyperresearch 启动 OA 恢复按顺序向Unpaywall → Europe PMC → CORE索取该论文的合法开放获取版本有些返回结果并不是真全文而是仓库记录页——标题、作者名加一段 200 字的简介。问题就出在第 3 步这种记录页比出版社摘要稍长如果只比长度更长它就会被误当成全文存进笔记。Agent 后续基于它推理、引用质量就悄悄下降了。oa_min_full_text_chars就是为此而生的长度底线页面类型典型文本长度真实论文正文约 20k ~ 80k 字符摘要落地页约 1k ~ 3k 字符默认阈值6,000 字符这个分界线在配置模块中定义并附了经验注释真实论文正文是 2 万到 8 万字符摘要落地页只有 1 千到 3 千见 src/hyperresearch/core/config.py。这个参数在哪些地方生效oa_min_full_text_chars会在两个检查点发挥作用一个负责触发一个负责验收。检查点 1触发 OA 全文查找当抓取结果太薄且带有 DOI 时Hyperresearch 才会去查找全文。判断逻辑很简单页面文本长度低于阈值 → 判定为薄页面启动查找见 src/hyperresearch/core/oa.py。这里故意做得比较宽——宁可误判一次只多一次有缓存的 API 调用也不漏掉该救的论文。检查点 2候选全文必须过两道门槛这是本配置的核心。一个候选全文要被接受必须同时满足✅ 比已有内容更长不缩水原则✅ 长度达到oa_min_full_text_chars阈值。第二道门槛正是拦截器仓库记录页虽然比摘要稍长但远不到 6,000 字符直接被跳过见 src/hyperresearch/core/oa.py。if recovered_len beat_chars: continue # 不比已有内容长 → 跳过 if recovered_len settings.oa_min_full_text_chars: continue # 不够长 → 还是不算全文跳过如果所有候选都过不了这两关保留原摘要笔记里不会出现oa块——而不是塞一个名不副实的全文。如何修改 oa_min_full_text_chars最快配置方法配置写在知识库根目录的.hyperresearch/config.toml的[scholar]段中[scholar] oa_recovery true # 总开关 contact_email # Unpaywall 必填留空则跳过 Unpaywall oa_min_full_text_chars 6000 # 低于此长度的正文触发全文查找 oa_prefer_published true # 优先正式版而非预印本 oa_max_attempts 3 # 最多尝试几个候选副本 oa_rescue_blocked true # 源完全不可读时也尝试 OA 补救建议默认 6,000 适合绝大多数学科一般不用改 如果你大量处理短文献评论、书评、章节节选可以把阈值调低例如oa_min_full_text_chars 2000避免漏掉合法的短全文⚠️ 不建议设得太高阈值越高越多正常短全文被拒摘要冒充的风险虽小但该救不救的损失更大。配置段落的完整说明见 README.md配置解析逻辑在 src/hyperresearch/core/config.py。设计哲学失败总是软失败质量只升不降Hyperresearch 对 OA 恢复有一条铁律恢复永远不会让一次抓取失败也永远不会降低质量。查询报错、URL 过不了安全检查、PDF 提取效果差 →原文原样保留没有任何候选同时过两道门槛 →保留摘要不出现oa块补救rescue只会把失败的抓取变成笔记从不反向把成功变失败。相关行为由测试套件完整覆盖阈值触发、配置解析、候选验收等场景见 tests/test_core/test_oa_recovery.py。小结要点说明是什么[scholar]段下的全文长度底线默认6000 字符防什么仓库记录页标题作者200 字简介冒充全文何时生效① 判断抓取页面是否太薄需触发查找② 验收 OA 候选是否够格改不改多数场景保持默认短文献场景可适当调低一句话记住它宁可信摘要不存假全文。这个小小的字符阈值是 Agent 研究质量的第一道质检门。【免费下载链接】hyperresearchAgent-driven research knowledge base. Agents collect, search, and synthesize web research into a persistent, searchable wiki.项目地址: https://gitcode.com/GitHub_Trending/hy/hyperresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考