从 GraphRAG 到 ColQwen:大模型文本分析有哪些新玩法?

📅 发布时间:2026/9/24 7:47:01
从 GraphRAG 到 ColQwen:大模型文本分析有哪些新玩法?
温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。作者艾米丽 (连享会)邮箱lianxhcn163.comTitle: 从 GraphRAG 到 ColQwen大模型文本分析有哪些新玩法Keywords: 语义标注, 关系抽取, RAG, GraphRAG, 多模态检索, 历史信息集, AI 生成变量提要: 同样一批年报除了统计词频和判断情绪还可以用来识别投资计划、追踪业务调整以及寻找企业之间的间接联系。GraphRAG 将不同文档中的企业及其关系组织成网络帮助研究者连接分散的披露查找跨企业的关联证据。ColQwen 则将文字与页面视觉信息结合用于检索包含相关图表的文档页面再结合字段抽取可以尝试整理地区收入、项目预算等分项数据。这些方法为构造现成数据库尚未充分覆盖的变量与关系网络提供了新的途径。本文围绕六类研究任务结合经济研究中的应用和方法之间的横向评测介绍代表性方法的原理、适用场景与使用入口并说明如何检验其输出能否成为可靠的研究数据。1. 文本里还藏着哪些研究对象提到文本分析你想到的也许还是分词、词频统计、情感分析收集几千份年报统计「不确定性」出现了多少次再构造一个风险指标。这些方法仍然有用但文本能够提供的信息远不止词语出现的次数和语气的正负。如果换几个问题研究空间就不同了同样提到「扩产」哪些企业已有明确计划哪些还停留在一般表态两家没有直接交易的企业是否经由不同供应商依赖同一家上游厂商一项风险造成损失之前企业究竟披露了哪些线索我们要寻找的是意向、关系以及这些信息随时间展开的过程。这类探索在大模型出现之前就已有成果。Hoberg and Phillips (2016,Journal of Political Economy) 根据年报中的产品描述构造企业竞争关系不再仅依赖统一行业代码界定竞争对手。Kelly et al. (2021,American Economic Review: Insights) 则比较专利与前后技术文本的联系识别不同于已有技术、又与后续创新相关的重要专利。两篇论文并未使用今天的大语言模型但都说明文本可以成为构造经济关系与测量新概念的数据来源。大语言模型 (LLM) 进一步扩展了这条路径。它可以按研究者的编码规则识别意向、抽取实体和关系结合检索、图结构与视觉模型还可以连接不同文档中的证据读取图表中的信息。例如Jha et al. (2024) 利用 ChatGPT 从业绩说明会提取管理层投资预期并与首席财务官调查和后续资本开支比较。财务数据记录实际投资文本则补充管理层此前打算做什么。新方法的价值不只是更快地读材料而是让熟悉的问题可以被问得更细。本文按研究任务梳理六条路线。选取的材料包括方法原论文、真实资料上的应用和横向评测原理说明能做什么应用展示可以得到什么比较证据帮助判断何时值得用。我们不按引用量或工具知名度排序也不把新预印本与经过长期检验的经济测量等同看待。整体研究脉络可结合 Hassan et al. (2025) 的综述阅读。2. 六条路线怎样对应研究任务下面的六条路线可以组合并非六种互相替代的算法。各节开头的场景用于说明研究用途进一步提出的问题是研究设想已有文献的实际成果则随文说明。想进一步研究的问题对应路线可以整理的记录扩产是一般表态还是明确计划语义标注与抽取意向、计划细节、证据句同样的业绩变化有哪些不同解释上下文与层级检索解释类别、跨章节依据无直接交易的企业有何共同依赖关系构网与图检索企业关系、间接路径海外收入具体在哪些市场变化多模态检索与抽取地区收入、口径、出处项目预算对应哪些具体活动工作流与检索 Agent活动分类、预算归属风险发生前有哪些公开线索记忆与时间约束披露日期、版本、历史信息集2.1 从关键词到语义主题发现、标注与抽取同样频繁提到「扩产」一家企业只说看好市场另一家却列出了预算、建设地点和进度。研究企业投资时更有用的可能是区分一般表态、明确计划与已披露的实施进展再观察计划是否兑现。语义标注与抽取要做的就是把这些差别整理成可核验的标签和字段。实现这一目标可以从两种操作入手。尚不知道文本中有哪些稳定议题时可以用语义嵌入把文本表示为数值向量将含义相近的表达归在一起再通过聚类发现主题已有明确研究概念时则可以给 LLM 一套编码规则让它按上下文判断。例如「暂缓新增产能」与「优先消化现有产能」措辞不同却可能表达相近的投资安排。主题发现帮助形成分类体系标注按既定体系赋予标签结构化抽取进一步返回公司、时间、金额和证据句。这里识别的是文本披露的内容计划写得具体不代表已经实施。从管理层表述走向经济测量可以参考 Jha et al. (2024) 的ChatGPT and Corporate Policies。作者没有停在展示几条模型回答而是将投资预期指标与调查资料和后续资本开支比较。这个做法提供了一个检验思路新指标是否反映预期概念是否补充了现成变量之外的信息指标能够预测后续投资与识别投资变化的因果效应仍是不同问题。标注质量也要在具体任务中检验。Gilardi et al. (2023) 比较了新闻、推文中的主题与立场等标注任务展示了 LLM 相对众包标注的潜力。借鉴时应保留其评价框架——交代文本、标签、人工参照和指标而不是把特定任务中的优势推广到所有语言和专家标注。如果分类体系还不明确可以先做主题探索。Grootendorst (2022) 的 BERTopic 结合语义嵌入、聚类和代表词提取让研究者通过典型文本理解各个主题。主题编号只是分类标识不能直接作为有经济量纲的风险指数。回到扩产问题经过人工验证的计划明确程度、计划调整和披露进展可以与后续资本开支或项目资料匹配考察哪些计划更容易延后。初次尝试可参考 BERTopic 文档 与作者代码做固定标签时则先定义「明确计划」「条件性设想」「一般讨论」「无法判断」并为每个判断保存原文依据。2.2 从相似段落到完整依据上下文与层级检索几家企业的利润同样下降管理层给出的解释却可能不同订单减少、原材料涨价或新工厂仍在投产爬坡。相关解释可能分散在业务介绍、问答和报表附注中。把依据找齐就可以比较企业如何描述同一种业绩变化而不只给整份报告一个情绪分数。检索增强生成 (Retrieval-Augmented Generation, RAG) 的基本分工是先找证据再依据证据整理答案。但如果检索结果只剩「本期增长明显」公司、指标和比较口径都可能丢失。Anthropic 的 Contextual Retrieval 在索引前依据完整文档为片段补充简短语境。补充内容用于帮助检索应与可以直接引述的原文分开保存。另一种办法是保留原文同时逐层聚类和概括形成由细节到摘要的组织结构。Sarthi et al. (2024) 的 RAPTOR 就构造了这样的检索树。查一个数值时回到具体片段理解整份报告时利用上层摘要。在业绩变化的例子中可以据此定位订单、成本和工厂进展的内容再返回原文核对限定条件。增加结构之前仍应比较简单检索。BM25 按词项匹配语义检索处理含义相近的表达混合检索合并候选重排序再筛选相关内容。Akarsu et al. (2026) 在其金融文档基准上报告BM25、向量检索、混合检索加重排序的Recall5分别为 0.644、0.587、0.816。这里衡量的是前五个结果对相关文档的召回不是回答准确率它支持将混合检索列入对照而不是认定复杂流程普遍更好。评价设计可以参考 Islam et al. (2023) 的 FinanceBench。公开仓库 提供 150 个问答案例及依据适合检查问题、答案与证据如何对应。先区分漏检、年度错配、口径错误和计算错误再决定是否需要补充上下文或构造摘要树。整理后的证据可以形成「公司—年份—管理层解释类别—出处」记录再与库存、价格或订单资料对照。它测量的是管理层披露的解释而非已经确认的利润下降原因。RAPTOR 代码 和上下文检索教程 提供了两种实现入口。2.3 从独立文档到关系网络构网与 GraphRAG两家企业没有直接交易是否仍可能依赖同一个上游厂商假设它们各自的供应商都采购同一家公司的关键零部件这种共同暴露就不会出现在两家企业之间的直接交易记录中。连接不同年报中的关系可以寻找这类间接联系为研究供应链集中度和共同风险提供候选数据。图 1 用一组虚构披露说明这一过程甲向丙采购乙由丁供货继续阅读丙、丁的年报发现二者都依赖戊。把四份文档中的主体统一后就能连接出两条供货路径戊→丙→甲以及戊→丁→乙。甲与乙没有直接交易也可能共享同一个上游风险来源。图 1跨文档关系连接示意。公司与披露文字均为教学设定实线箭头表示供货方向甲乙之间的灰色虚线只提示二者没有直接交易不属于供应关系。连接这些路径时还需核验各条关系是否在同一时期有效。共同上游是候选暴露线索是否实际受到冲击、影响有多大仍要结合采购占比、替代来源及事件资料判断。这里需要区分三个目标构造关系数据、寻找跨文档证据以及归纳整个语料库。它们都可以利用图结构但分别要交付关系表、原文依据和综合摘要评价标准也不同。构造关系数据需要先统一抽取口径。Arun et al. (2025) 的 FinReflectKG 从 SP 100 企业的 SEC 年报建图将文档解析、保留表格信息的分块、模式约束抽取和审核连接起来。这里的「模式」(schema) 是实体类型、关系类型及其定义。例如供应、客户和合作关系应分别记录不能统统记为「有关联」。这一框架值得借鉴但审核轮数不是越多越好。FinReflectKG–EvalBench 在其模型评审协议下发现反思式抽取在完整性、表达的明确性与具体程度以及相关性上得分较好单次抽取的原文忠实性得分则略高 (Dimino et al., 2025, 2026 年修订)。这里的 precision 是对三元组表述的评分不是按人工真值计算的分类精确率。适合自己的方案仍应通过独立样本比较不能把模型间评分一致当成人工真值。跨文档构网还要统一关系表达。Zhang and Soh (2024) 的 EDC 将流程分为抽取、定义与标准化。例如「甲向乙供货」与「乙从甲采购」应转换为相容的关系表示而不是形成互不相连的两类信息。企业名称也要结合公司标识归并避免把集团、上市公司和子公司误作同一主体。寻找跨文档证据可以参考 HippoRAG 2 (Jiménez Gutiérrez et al., 2025)。它将文本关系和原文段落纳入图结构结合语义匹配与个性化 PageRank从问题涉及的线索扩展到有关联的材料。问题只提到甲时也可能找回有关乙、丙的段落。图在这里帮助返回证据不能未经验证就作为真实供应链数据。金融应用中的 HybridRAG 同样结合图与向量检索但使用的是另一套流程 (Sarmah et al., 2024)。若问题是「所有企业反复提到哪些供应链风险」则需要全库归纳。Edge et al. (2024) 的 Microsoft GraphRAG 为图中联系密切的社群生成分层摘要再综合回答。社群只是图结构的分组不宜直接解释为行业或企业集团。回到共同上游的场景关系表用于识别共同依赖检索系统返回支持关系的原文摘要系统概括样本中的风险叙述。关系路径不是经济传导系数。要估计上游停产如何影响下游还需要真实冲击、结果数据与相应识别设计。实现时可分别查看 EDC、HippoRAG、Microsoft GraphRAG 和 LightRAG。前两项侧重关系标准化和关联检索后两项提供图增强检索工作流。Microsoft GraphRAG 官方仓库截至 2026-09-21 已说明主要进入维护状态部署时还应考虑依赖与维护成本。2.4 从纯文字到整页文档多模态检索一家企业的海外收入下降是各个市场普遍收缩还是退出了某个地区如果现成数据库只有海外收入总额细分金额却藏在年报表格、图形或扫描页中研究就容易停在总量上。多模态检索与后续抽取可以尝试将这些页面整理成企业—地区—年份记录让业务调整的空间差异进入分析。关键不只是识别文字还要保留数字与表头、单位、脚注的对应关系。光学字符识别 (OCR) 能把图像中的字转成文本但若后续只使用纯文本位置关系就可能丢失。多模态检索同时利用文字与视觉信息先找页面再进行字段抽取与核验。Faysse et al. (2025) 的 ColPali 用视觉语言模型表示文档页面通过细粒度匹配执行检索。它的主要职责是找出相关页面而不是独立完成变量构造。后续模型还要读取字段程序负责计算研究者负责核验口径。金融文档上的检验可参考 FinRAGBench-V (Zhao et al., 2025)。该基准提供中英文检索语料和人工标注问答要求答案落实到页面及证据区域。因此可以分别评价页面是否找对、证据区域是否定位准确以及答案本身是否正确。其对 ColQwen2 等模型的结果不应直接归给原始 ColPali。图 2 将多模态路线拆成三个环节。ColQwen 帮助定位包含地区收入的页面字段抽取再读取地区、年份和金额核对表头、单位与出处后将宽表整理为企业—地区—年份长表。图中的三个地区、两个年份对应六条记录。同一页面可以产生多条记录每条都应能返回原表核验。温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。