Agentic AI与检索增强模型在保险核保自动化中的实践与架构解析

📅 发布时间:2026/8/18 1:07:07
Agentic AI与检索增强模型在保险核保自动化中的实践与架构解析
1. 项目概述当“智能体”遇见“检索增强”重塑核保流程最近和几位在保险科技领域深耕的朋友聊天大家不约而同地提到了一个词“Straight-Through Underwriting”直通式核保。这玩意儿说白了就是希望投保申请从提交到出单中间没有人工干预全流程自动化。听起来很美对吧但做过的人都知道这简直是核保领域的“圣杯”——理想丰满现实骨感。传统的规则引擎和简单的机器学习模型面对复杂的健康告知、财务证明、甚至非结构化的体检报告时往往力不从心要么拒得太死要么放得太松最后还是得靠核保员那双“火眼金睛”。直到我们开始把Agentic AI智能体AI和Retrieval-Augmented Models检索增强模型简称RAM这两项技术揉在一起事情才出现了转机。这不再是简单地把问题扔给一个大语言模型LLM然后祈祷它别胡说八道而是构建了一个有“大脑”、有“记忆”、有“工具”的智能工作流。今天我就结合我们团队最近在尝试的一个项目来拆解一下这个组合拳是怎么打的里面有哪些门道以及我们踩过哪些坑。简单来说这个项目的核心目标就是构建一个能够理解复杂核保场景、自主调用知识库和工具链、并做出可靠决策或清晰建议的AI智能体系统。它不再是传统IT系统里那个被动的、按固定路径执行的“程序”而是一个主动的、具备一定推理和决策能力的“虚拟核保专家助理”。2. 核保自动化从规则引擎到智能体的演进之路要理解为什么需要Agentic AI和RAM我们得先看看核保自动化走过的路。2.1 传统自动化方案的瓶颈最早期的自动化我们称之为“规则引擎时代”。我们把核保手册里的条条框框比如“BMI大于30需加费”、“特定疾病史需除外责任”写成一条条“if-then”规则。这套系统速度快、解释性强但问题也显而易见僵化。现实情况千变万化一条规则无法覆盖所有边界案例。比如客户告知“5年前有过轻度脂肪肝现已痊愈体检指标全部正常”规则引擎可能因为触发了“肝病史”这个关键词而直接转人工无法进行更精细的风险评估。后来我们进入了“机器学习模型时代”。我们收集历史核保数据训练分类模型比如预测是否需要转人工、或预测风险评分。模型能发现一些人类难以总结的复杂模式但它的瓶颈在于“黑箱”和“知识固化”。首先模型决策难以解释这在强监管的金融保险领域是个大问题。核保员无法理解为什么模型给出了某个建议自然不敢完全放手。其次模型的知识来自于训练数据一旦核保规则、医学指南、药品清单更新模型就需要重新训练和部署滞后严重成本高昂。2.2 智能体与检索增强带来的范式转变Agentic AI的引入改变了系统的行为模式。你可以把它想象成一个虚拟的、刚入行的核保员。它不是一个单一的模型而是一个具备“感知-规划-行动-反思”循环的智能系统。感知它能理解用户提交的投保单、健康告知问卷中的自然语言描述。规划它会根据当前的信息缺口制定一个行动计划比如“我需要去查一下客户提到的这个手术的常规恢复期和远期风险”。行动它会自主调用“工具”比如去内部的核保知识库RAM发挥作用的地方检索相关条款或者调用一个专门的医学模型来分析上传的体检报告影像。反思它会评估行动的结果是否解决了问题如果没有则调整计划继续行动。而Retrieval-Augmented Models就是给这个智能体配了一个超强的“即时记忆库”和“参考书库”。传统的LLM是“死记硬背”它的知识截止于训练数据。RAM则不同它让LLM在需要回答问题时实时地从外部知识源如最新的核保手册、医学数据库、公司内部案例库中检索最相关的文档片段然后基于这些最新的、权威的片段来生成答案。这完美解决了核保知识更新快、要求精准的问题。注意这里的一个关键设计是我们绝不让LLM依赖其内部记忆来回答专业的核保或医学问题。所有专业结论必须基于检索到的、有出处的文档来生成。这既是准确性的要求也是风险控制和可解释性的基础。两者的结合就形成了一个既能动态思考、又能确保答案基于最新最准知识的智能系统。它处理的不再是结构化数据字段而是理解客户的整体健康状况描述关联相关的核保规则和医学证据最终推理出一个核保结论。3. 系统核心架构与组件拆解我们的系统架构可以概括为“一个大脑两类记忆多种工具”。下面这张图描绘了核心的数据流与决策循环flowchart TD A[投保申请与健康告知录入] -- B[智能体调度中心brOrchestrator] B -- C{感知与理解brLLM核心} C -- D[规划下一步行动] D -- E{行动决策} E -- 需要专业知识 -- F[检索增强生成brRAG模块] E -- 需要计算/判断 -- G[专用工具调用br如规则引擎、医学模型] F -- H[向量知识库检索] H -- I[最新核保手册、医学指南等] G -- J[返回工具执行结果] F J -- K[信息综合与反思] K -- L{是否达成br明确结论} L -- 是 -- M[生成最终核保建议br附证据链] L -- 否 -- N[生成清晰的信息补充清单] M -- O[输出至业务系统] N -- P[返回给客户或坐席]3.1 智能体调度中心Orchestrator这是整个系统的“大脑”或“指挥中心”。我们通常使用LangChain、LlamaIndex这类框架来构建。它的核心职责是任务解析接收初始投保信息理解这是一个“核保风险评估”任务。规划基于预设的工作流模板和当前信息决定第一步该做什么。例如“客户提到了‘甲状腺结节’首先需要检索关于甲状腺结节核保的细则。”工具调用根据规划调用相应的工具函数。工具可以是检索知识库、调用规则引擎计算评分、调用OCR接口解析体检报告图片等。状态管理与反思汇总各个工具返回的结果判断信息是否充足。如果不足则生成新的问题或规划下一步行动比如“结节大小和TI-RADS分级未知需要请客户补充近期B超报告”。实操心得在规划环节我们采用了“少样本提示Few-shot Prompting”来引导智能体。我们会提供几个高质量的例子告诉它“面对类似情况一个优秀的核保员会如何思考和提问”。这比单纯用自然语言描述指令要有效得多能显著提升智能体行动规划的合理性和专业性。3.2 检索增强生成RAG模块这是系统的“专业记忆库”。其构建质量直接决定输出的专业性。知识源准备我们将PDF格式的核保手册、医学临床指南、药品目录、既往的核保案例脱敏后等文档进行收集和清洗。文档切片与向量化这是最关键的一步。不能简单地把整本手册扔进去。我们根据文档结构如章节、条款进行智能切片确保每个切片包含一个相对完整的知识单元如“甲状腺结节核保要点”。然后使用嵌入模型如text-embedding-3-small将切片转换为向量存入向量数据库如Pinecone、Chroma。检索与生成当智能体需要专业知识时它会将问题如“客户有5年2型糖尿病史目前服用二甲双胍血糖控制良好如何核保”也转换为向量在向量库中搜索最相关的几个文档切片。然后将问题和检索到的片段一起送给LLM指令其“请严格基于以下提供的资料回答用户的问题。如果资料中未提及请回答‘根据现有资料无法确定’。”踩坑记录我们最初切片太大导致检索结果不精准LLM从大段文字里“挑”答案容易遗漏关键限制条件。后来调整为更精细的切片并给每个切片添加丰富的元数据如适用产品类型、疾病分类、条款编号检索时结合向量相似度和元数据过滤效果提升非常明显。3.3 专用工具集智能体不能只靠“说”LLM生成还得靠“做”调用工具。我们为它装备了多种工具规则引擎工具对于非常明确、无争议的规则如年龄、职业类别限制仍直接调用规则引擎速度快且确定。医学图像/报告解析工具调用专门的AI服务分析体检报告中的异常指标将其转化为结构化的数据供智能体使用。外部API工具连接内部系统查询该客户的历史保单、理赔记录。计算器工具计算BMI、财务核保中的负债收入比等。设计要点每个工具都需要定义清晰的输入/输出格式。智能体通过“函数调用Function Calling”能力来使用它们。这要求我们对LLM进行细致的提示工程让它学会在什么情况下该调用哪个工具以及如何解析工具的返回结果。4. 核心工作流与决策逻辑实现让我们跟踪一个具体的案例看看这个智能体是如何工作的。假设客户张先生35岁投保重疾险健康告知提及“2年前体检发现肺磨玻璃结节GGN直径5mm今年复查大小未变医生建议定期观察。”4.1 工作流触发与初始分析智能体调度中心收到案件启动“重疾险核保”工作流。LLM核心首先解读健康告知文本识别出关键实体“肺磨玻璃结节”、“2年前”、“5mm”、“复查未变”、“定期观察”。它初步判断这是一个关于“肺结节”的核保评估且结节性质为磨玻璃、尺寸较小、稳定。4.2 规划与行动知识检索与信息补全智能体开始规划行动一检索核保知识。调用RAG工具查询“肺磨玻璃结节 重疾险 核保”相关条款。系统返回最新的核保手册片段内容可能包括“对于直径≤8mm的纯磨玻璃结节且持续稳定超过2年可考虑标准体承保需提供近期胸部CT报告及影像学描述。”行动二评估信息完整性。智能体对比检索结果和现有信息。发现现有信息已包含“直径5mm”符合≤8mm、“2年前发现”、“今年复查未变”暗示稳定但需明确是否满2年。但缺少关键的“近期胸部CT报告”文档。行动三制定交互策略。智能体不会简单地说“请提供CT报告”。它会生成一个更专业、更清晰的请求“尊敬的客户根据您告知的肺磨玻璃结节情况为完成准确评估需要您补充最近一次建议3个月内的胸部CT检查报告及影像学诊断结论以便确认结节的具体性质纯GGN还是混合型、大小是否稳定已满2年。这将直接关系到最终的核保结论。”4.3 信息综合与结论生成假设客户上传了最新的CT报告工具解析出结论“右肺上叶纯磨玻璃结节直径约5mm较前片2年前无明显变化。” 智能体此时再次检索确认“纯磨玻璃结节”、“稳定超过2年”与条款的匹配度。综合所有信息结节类型纯GGN、大小5mm8mm、稳定性2年无变化、客户年龄35岁非高龄。这些因子都指向低风险。生成核保建议与证据链智能体生成最终输出格式如下核保建议可标准体承保。支持证据根据公司《重疾险核保手册2024版》第X章第Y条对于直径≤8mm的纯磨玻璃结节稳定超过2年可标准体承保。客户提供资料显示结节为纯GGN直径5mm2022年最新CT2024年显示大小未变已满足稳定2年条件。无其他需关注的健康告知事项。后续建议建议在保单中备注并提醒客户定期进行肺部CT随访。这个输出不仅给出了结论还附上了清晰的、可追溯的证据链极大方便了核保员进行快速复核或审批。5. 落地挑战与实战调优经验理想很美好但把这套系统真正用起来我们遇到了不少挑战。5.1 幻觉与准确性的平衡LLM的“幻觉”是最大风险。我们的应对策略是多层过滤严格RAG约束所有专业回答必须引用检索片段。在提示词中强力约束“你的回答必须且只能基于提供的参考信息。如果信息不足请明确说明需要补充什么。”关键结论交叉验证对于“标准体”、“加费”、“拒保”等关键结论设计第二道验证流程。例如让智能体将关键事实疾病、尺寸、时间提取出来输入一个轻量级的、训练好的分类模型进行复核两者结果一致才最终通过。置信度评分让LLM对自己生成的答案输出一个置信度分数。对于低置信度的输出系统自动标记为“需人工复核”。5.2 流程效率与用户体验智能体如果陷入多轮低效问答体验会很差。我们做了以下优化一次性告知在首次交互时智能体就应基于常见核保场景预判可能需要的所有材料如特定疾病的复查报告、病理报告、近期体检全套等一次性清晰列出减少来回次数。设置超时与回退为智能体的“思考-行动”循环设置最大步数如10步。如果超过步数仍未达成明确结论则自动转人工并附上智能体已进行的所有分析和已收集的信息方便人工快速接手。结构化信息提取在交互过程中智能体就应实时将用户提供的非结构化文本如“医生说我这个没事”转化为结构化的核保因子如“医生临床诊断良性可能大”存入案件上下文便于后续步骤使用。5.3 知识库的构建与维护知识库不是一劳永逸的。版本控制核保手册会更新。我们的向量库必须与手册版本同步。每次更新都需要重新处理文档、切片、向量化。我们建立了自动化流水线当知识源Git仓库有更新时触发重建索引。冷启动与迭代初期知识库内容少检索效果可能不好。我们采用“主动学习”思路将所有智能体“不确定”或人工复核后纠正的案例进行分析。如果发现是因为知识库缺失导致的就将该案例及其对应的正确核保依据作为新的知识片段人工审核后加入知识库。切片策略优化除了按章节切片我们还针对“疾病核保”这种高频查询专门创建了“问答对”形式的切片。例如直接录入“Q乙肝小三阳肝功能正常如何核保 A根据…通常可标准体需提供近期肝功能与乙肝DNA定量报告。”这种切片在回答具体问题时匹配度和准确性更高。6. 效果评估与未来展望我们目前在一个试点产品线上运行了该系统评估期三个月。核心指标对比如下评估维度传统规则引擎人工模式Agentic AI RAM 智能系统提升/变化直通率约35%约65%提升约86%平均处理时间2.5天4小时大部分为等待客户补充材料时间缩短超过90%人工复核干预率100%所有案件约20%仅复杂、低置信度案件降低80%核保结论一致性依赖核保员经验存在波动基于统一知识库一致性高显著提升客户满意度流程不透明等待时间长流程透明反馈及时要求明确NPS大幅提升最大的价值不仅仅是效率提升更在于风险控制的标准化和知识的沉淀。所有通过系统的案件其决策依据都被完整记录和结构化这为后续的审计、模型优化和核保员培训提供了宝贵的数据资产。当然这套系统远非完美。目前它更擅长处理“有明确规则和医学证据支持”的常见情况对于极端复杂的、涉及多重疾病交互或社会伦理因素的个案仍然需要人类核保员的最终判断。它的定位是“超级助理”而非“替代者”。未来的迭代方向我们关注几点一是让智能体具备更复杂的多轮谈判和解释能力比如向客户解释为什么需要某项检查而不仅仅是生硬地要求提供。二是探索多模态能力让智能体能直接解读CT影像的DICOM文件而不仅仅依赖于报告文字。三是建立更完善的模拟与对抗测试环境用海量的历史案例和边缘案例去持续“拷问”和训练这个智能体让它变得更稳健、更可靠。这条路还很长但看到一个个投保申请在几分钟内走完过去需要几天甚至几周的核保流程并且每一步都有理有据那种感觉就像给一台精密的机器注入了灵魂。技术终究是工具但好的工具能让专业的价值更快、更准、更一致地传递出去。