LLM4Onto: Automated Domain Ontology Construction Using Large Language Models——使用大型语言模型的自动化领域本体构建

📅 发布时间:2026/8/10 12:14:10
LLM4Onto: Automated Domain Ontology Construction Using Large Language Models——使用大型语言模型的自动化领域本体构建
1. 研究背景与问题背景领域本体是知识图谱的基础但构建过程长期以来依赖领域专家手动完成效率低、成本高。现有方法缺陷多数方法依赖中间状态数据如已有知识图谱导致原始文本中的完整语义丢失。基于LLM的方法常受限于僵化的预定义模式无法让数据“自主表达”。直接使用LLM生成本体容易产生幻觉且关系抽取能力弱。2. 核心贡献LLM4Onto框架作者提出了一个端到端的自动化本体构建框架主要创新点包括组件功能与方法本体命名使用Spacy提取所有名词/名词短语 → 过滤无意义词如代词→ 用BERT生成语义嵌入 → 采用亲和力传播聚类无需预设簇数自动发现潜在实体类型 → 用LLM为每个簇生成本体名称并支持多轮对话合并相似簇关系抽取提出HT-R-O头-尾-关系-本体范式① 将实体-本体对与原文片段输入LLM抽取实体级三元组② 映射为本体级三元组③ 利用LLM归纳合并语义相同但表达不同的关系输出标准化关系集。减少幻觉将复杂本体构建任务分解为多个简单的子任务命名、聚类、关系归纳降低LLM认知负担并严格基于原文生成抑制幻觉。数据驱动完全无需人工预定义本体结构遵循“让数据说话”原则适应任何领域。3. 技术实现要点聚类亲和力传播算法可自动确定类别数量且通过设置偏好参数倾向生成更细粒度的簇后续再用LLM合并保证结构精细度。阈值过滤只保留实体数量 ≥ n 的簇剔除稀疏簇增强输入信号。上下文学习在提示词中给出领域示例引导LLM生成符合领域命名规范的本体名称。多轮对话识别并合并被分散在不同簇中的同类本体。4. 实验与数据集在三个不同类型的数据集上进行了评估数据集特点结果MultiWOZ 2.1多领域对话数据酒店、餐厅等LLM4onto在所有指标上大幅领先基线如TeQoDOLiteral F1达49.5% vs 2.8%Wikipedia大规模百科全书4级层次结构在二级概念上表现良好但因领域开放且生成粒度更细与标准答案匹配度受罚总体指标略低于部分基线ArXiv学术论文摘要2级学科分类在Literal、Continuous、Graph F1上均取得最优结构组织能力突出网络安全数据集真实威胁分析报告580篇构建出483种实体类型 72种关系类型的细粒度本体远超现有NER模型仅支持10~40种类型且无关系建模5. 评估指标采用四种指标全面衡量生成本体与标准答案的差异Literal F1严格匹配重叠边过于严格。Fuzzy F1利用嵌入相似度识别同义词有一定容错性。Continuous F1基于匈牙利算法优化边匹配注重结构。Graph F1使用GCN生成图感知嵌入综合语义与结构。6. 主要结论优势在专业、领域受限场景如对话系统、网络安全表现卓越能捕捉丰富语义和复杂关系。完全自动化、可扩展仅需修改提示词即可迁移到新领域。有效减轻LLM幻觉问题生成结构合理、关系清晰的本体。局限性在开放通用领域如Wikipedia因领域边界模糊、生成的粒度与标准答案不匹配部分指标落后于基线。未来工作改进构建范式以解决粒度对齐问题提升层次关系和命名精度。LLM4onto为领域本体构建提供了一种可落地、可扩展、数据驱动的自动化方案尤其在专业性强、缺乏现成本体资源的领域如网络安全具有重要应用价值。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要领域本体是知识图谱的基础但其构建仍然是一个瓶颈。当前基于大型语言模型LLM的本体构建方法受限于僵化的模式这些模式无法让数据“发声”也难以捕捉真实世界的语义。此外缺乏结构化的任务分解范式会导致幻觉现象和较差的关系抽取效果阻碍了可靠领域本体的开发。为解决这些局限我们提出了LLM4onto一个旨在直接从原始文本自动化构建领域本体的框架。LLM4onto集成了亲和力传播聚类算法无需预定义约束即可自主发现潜在的实体类型同时它采用了“头-尾-关系-本体”Head-Tail-Relation-Ontology范式以三元组格式总结本体间的关系。这种将整体构建任务分解为更简单单元的做法显著降低了模型的认知负担从而最大程度地减少了幻觉。广泛的实证评估表明LLM4onto在多种数据集上均取得了优越的性能特别是在网络安全语料库上的验证凸显了其在构建专业领域本体架构方面的强大能力。关键词大型语言模型本体构建引言在过去的几十年里知识图谱被广泛用于表示、推理和补全知识在自然语言处理和知识推理领域发挥了重要作用。知识图谱的本体是构建知识图谱的关键和首要步骤。它描述了知识图谱中包含的实体类型以及它们之间的逻辑关系。尽管自然语言处理技术已从早期方法发展到当代的生成式大型语言模型并在实体抽取和关系抽取等任务上取得了显著进展但构建知识图谱本体的方法在很大程度上仍然依赖于领域专家的传统手动工作。近年来一些研究采用从结构化数据中直接提取潜在本体模式的方法而另一些研究则利用大型语言模型来承担或直接构建本体框架。然而这些本体构建方法大多从中间状态的数据中提取本体忽略了现实世界文档中文本的完整语义。这一局限性从根本上导致了所构建领域本体的不完整性。现实世界的领域文本本身就蕴含着特定领域内所有知识的结构关系。因此“让数据发声”是构建全面领域本体最可靠的方法。在没有过多监督和人工干预的情况下直接从文本构建可靠领域本体这一挑战提出了若干需要原理性解决方案的基本技术难题。这使得它比利用中间状态数据的方法复杂得多。在中间状态知识图谱数据上构建领域本体的方法可能导致显著的信息丢失。这是因为中间数据通常由其他人工智能模型提取这些模型本身存在性能限制无法充分捕捉文本中承载的结构化知识信息。这些固有的限制要求设计有效的技术组件。这些组件必须经过专门设计以处理原始文本数据的复杂性并准确、全面地提取文本中隐藏的知识及其间的结构信息。技术挑战首先无监督的本体识别和抽取要求模型从海量文本中找出相同类型的实体并提供这些实体所属的本体名称。系统必须具备丰富且专业的自然语言处理能力。模型必须对领域特定词汇敏感因为它需要具备从大量知识稀疏的文本中检测和命名相似类型实体的能力。其次除了从文本中提取本体识别不同类型本体之间的关系同样至关重要。除了将上层本体划分为多个不同的下层本体即“is-a”关系之外建立完全不同类型本体之间的关系也同样重要。以往的研究忽略了这一点未关注这些关系。此外系统必须能够同时处理实体及其关系。这需要一个额外的专用模块来抽取本体间的关系该模块可以根据文本提供的内容总结本体间关系的类型。第三使用大型语言模型直接从文本构建领域本体框架可能会导致严重的“幻觉”问题。因此我们的方法需要将这个复杂问题分解为更简单的任务在这些任务中“幻觉”问题的影响可以被降到最低。我们的贡献为应对这些挑战我们引入了LLM4onto一个基于大型语言模型的框架用于直接从原始文本构建领域本体结构。我们的方法采用了亲和力传播聚类策略该策略巧妙地聚类从知识稀疏文本中提取的所有名词和名词短语无需预定义聚类数量从而将语义空间中相同类型的实体分组到同一个簇中。这确保了LLM4onto框架不会遗漏文本中存在的任何实体类型对应的本体。另一方面聚类结果可以作为实体抽取的标准数据集。为了准确确定本体间的关系LLM4onto采用了一种新颖的关系识别范式称为HT-R-O头-尾-关系-本体。与现有依赖人工定义本体框架的方法不同LLM4onto不依赖专家精心制作的本体定义使其能够反映现实世界数据中知识的结构关系。本体命名和HT-R-O范式始终忠于原始文本从而防止大型语言模型生成幻觉内容。这个基于大型语言模型的本体构建框架可以在不依赖外部人工干预的情况下从海量文本中全面细致地提取本体及其相互关系。它表现出强大的可扩展性和广阔的应用前景。相关工作传统本体构建在大型语言模型出现之前本体构建依赖于基于统计规则和语言学特征的方法。这些方法通常通过利用数据中的词频统计信息和预训练模型的语义洞察来提取本体具体如下所述。在很长一段时间里本体构建是通过依赖频率分析的方法从文本中提取本体来进行的。Carriero等人引入了一种基于知识图谱的本体构建方法。该方法从图中提取公理和约束依赖关系作为经验性的本体设计模式并根据与这些模式关联的类别来构建本体。在整个过程中它采用阈值来过滤掉低频类别从而确保统计显著性。Finch等人引入了一种基于生成式对话状态推断的创新方法该方法涉及训练一个无需先验任务知识即可运行的生成模型该模型能够同时生成槽位名称及其对应的值以有效地总结对话中的关键信息。类似地Yu等人也采用了一种无监督方法通过粗到细的聚类来无约束地归纳槽位类型。基于LLM的本体构建大型语言模型在自然语言处理和知识图谱领域展现出了卓越的能力。在这些成就的基础上当前的研究正逐步涉足本体工程领域sup1-3,14,15,20/sup。目标是利用LLM强大的理解和生成能力来自动化本体构建过程从而显著减少对复杂人工劳动的依赖。Li等人对LLM在本体工程中的应用进行了全面分析涵盖了LLM在该领域的具体角色、数据集选择以及评估指标。DOREsup21/sup利用Gemma-2B指令模型通过受限的思维链解码来提取对话级别的本体关系将预测限制在已知术语和关系内并根据置信度分数选择输出。TeQoDOsup22/sup通过使用GPT-4o-mini进行端到端的本体生成融合了这些范式其中包含了通过迭代ChatGPT优化改进的人工制作提示并使用SQLite3进行结构化输出验证。OLLMsup16/sup从头开始构建本体的分类骨架并使用自定义正则化器对LLM进行微调以减轻对频繁概念的过拟合从而能够对目标本体的所有子组件进行建模。为保证本体生成的质量NeOn迭代本体工程框架sup11/sup引入了LLM来加速关键任务同时保留了由领域专家进行的验证过程。该框架通过结合人类专家与机器能力的协作过程促进了复杂本体的创建和操作。检索增强生成RAG模型将语言模型与信息检索技术相结合。具体来说当模型被要求生成文本或回答问题时它首先从庞大的文档库中检索相关信息随后利用这些信息来指导文本生成过程。DRAGON-AIsup19/span/sup将检索增强生成与LLM集成以从非结构化文本来源和多个本体中提取知识并随后生成本体。此外将大型语言模型与成熟的本体构建工具如Protege集成可以共同帮助完成本体工程过程中的一系列任务sup5,12,27/sup。在本体工程领域除了从头开始构建本体之外对现有本体进行自动化补充也同样重要。Dong等人利用预训练模型识别本体中的潜在插入点边并利用大型语言模型进行判断和选择从而促进将文本中新概念自动整合到已有本体中sup6/sup。Garcia等人设计了一个用于本体扩展的过程框架该框架结合了人类专家与LLM的能力提供了可定制的提示模板sup9/sup。除了本体构建领域本体正逐渐在其各自领域内发挥影响力。此外Yang等人提出了一种基于LLM的本体扩展方法利用LLM制定能力问题来扩展初始本体然后基于扩展后的本体构建知识图谱sup25/sup。从本体应用的角度来看本体提供的结构和语言信息促进了它们在各个领域的应用包括网络安全sup10/sup。例如OntoCSDsup23/sup采用网络本体语言来设计防御推理规则从而为网络空间防御提供全面的解决方案。与上述工作相比我们的方法直接从原始文本构建本体以及不同本体类别之间的关系并将此任务分解为大型语言模型擅长的各种小任务以减少幻觉问题对生成本体质量的影响。方法问题定义LLM4Onto框架我们现在介绍LLM4onto一个新颖且可扩展的、利用大型语言模型构建本体的框架。在本体抽取层面LLM4onto采用数据驱动的方法。它使用聚类技术将语义相似的名词分组到同一类别然后利用大型语言模型为这些名词集合生成本体名称。除了抽取本体的节点类型确定本体之间的关系同样重要。这些节点类型和关系共同构成了完整的本体架构。该架构可以通过使用本体三元组本质上是实体-关系-实体三元数据来指导知识图谱的构建。在图1中我们展示了LLM4onto的架构。LLM4onto的每个组件都专门设计用于解决当前基于文本的本体自动构建方法中识别出的关键限制。这些组件共同实现了我们的研究目标自动化构建领域特定本体自动识别这些本体之间的关系以及解决大型语言模型在本体构建领域的幻觉局限。本体命名LLM4onto专注于实现无监督的自动化本体构建。它直接处理文本数据无需任何人工标注。由于自然语言中的实体主要通过名词和名词短语来传达而本体可以视为这些实体的高层抽象因此一组语义相似实体之间的共享信息可以揭示潜在的本体概念。为实现“让数据发声”的目标LLM4onto首先使用Spacy从文本中提取所有名词和名词短语。这有效地捕捉了那些经常以名词短语形式出现的领域实体例如“卷积神经网络”。然而Spacy的输出包含像“it”、“that”和“which”这样缺乏明确语义的代词这些对于后续大型语言模型的本体抽象工作是不利的。因此从名词短语中过滤掉代词是一个必要的预处理步骤。幸运的是构建这样一个用于过滤无明确意义名词的词典是简单的特别是在大型语言模型的支持下。在获得具有清晰语义的词汇后LLM4onto需要将语义相似的词分组到同一类别。由于在构建特定领域本体时最终的概念数量通常是未知的传统聚类算法所需的预定义聚类数 KK 在此场景下难以确定。因此LLM4onto采用了亲和力传播聚类算法该算法无需预先指定聚类数量因此特别适合此任务。具体过程如下首先LLM4onto使用BERT模型为所有过滤后的名词和名词短语生成语义嵌入向量。然后基于这些嵌入向量执行亲和力传播聚类。通过这个过程具有相同或相似语义的实体被聚合到同一个簇中从而初步揭示了领域内潜在的概念结构。值得注意的是AP算法中的偏好preference超参数会影响簇的大小。在LLM4onto中它被设置为倾向于生成更多、更细粒度的簇。这种策略有助于建立更精细的本体分类结构。即使一些本应属于同一类别的实体被暂时划分到两个相邻的簇中这个问题也可以在后续使用大型语言模型进行概念命名和合并的阶段得到有效解决。获得聚类结果后需要对每个簇进行后处理以确保后续本体生成的有效性。具体来说为确保大型语言模型能从簇中提取足够信息进行可靠的抽象LLM4onto设置了一个大小阈值只保留实体数量不少于 nn 的簇所有成员少于 nn 的簇都被丢弃。这一步过滤掉稀疏的小簇使得输入模型的语义信号更加突出。为了生成语义准确且符合领域命名惯例的本体名称LLM4onto采用了一种上下文学习策略。系统提供少量针对领域命名风格的示例并明确指定生成本体所属的领域引导大型语言模型根据簇内的实体集合推断合适的本体概念名称并丢弃不属于该领域的本体。相关提示词和示例设计的详细信息见附录A。此外考虑到初始聚类可能将同一本体的实体放置在不同的簇中此方法还引入了一种多轮对话机制。通过与大型语言模型的迭代问答系统可以识别具有相似语义或属于同一本体的不同簇并合并它们的输出结果从而增强本体结构的完整性和一致性。关系抽取要构建一个全面的领域本体不仅需要识别和定义其中的概念类型还需要对这些不同概念之间的关系进行建模和表示。受AutoREsup24/sup的启发我们总结了现有的本体构建范式并设计了一种独特的本体构建HT-R-O范式不同的本体构建范式如图2所示。文本-本体范式输入文本模型直接输出本体框架。这种方法直接了当。如果文本中的词元数量远超大型语言模型的内容窗口则需要将文本分割。这可能会对大型语言模型生成的本体框架产生负面影响。此方法将所有文本直接输入提示词然后让大型语言模型一步生成文本中包含的本体框架。关系-本体范式在该范式中大型语言模型采用两阶段策略。首先它识别文档中所有潜在的关系类型。随后它将这些关系类型作为结构化约束纳入提示词引导模型根据文档内容生成与这些关系对应的本体三元组。头-尾-关系-本体范式在我们新设计的范式中我们将构建好的实体-本体对及其原始文本片段输入大型语言模型让模型识别并输出文本中实体间的关系形成形如 (e1,Ri,e2) 的三元组。此步骤旨在利用大型语言模型的上下文理解能力在已定义的本体类型下发现特定实体之间的关联。值得注意的是LLM4onto在较短的文本片段上执行此任务效果更佳。在获得大量三元组后借助实体与本体之间已有的映射关系系统将所有特定的实体级关系 (e1,Ri,e2) 抽象为本体级关系 (O1,Ri,O2)从而捕捉本体间的初步关系。然而由于大型语言模型抽取的关系 Ri​ 严格遵循原始文本的表达方式这导致了语义相同的关系在表达上存在多样性即Ri​ 和 Rj​ 指的是同一关系。因此HT-R-O范式将进一步把所有本体级三元组 (On,Ri,Om) 输入大型语言模型利用其强大的语义归纳能力引导模型识别并合并那些表达不同但语义相同的关系最终输出一套标准化、统一的本体关系集合。这部分对于理解大型语言模型在本体关系标准化中扮演的关键角色至关重要。然而由于大型语言模型抽取的关系 Ri​ 严格遵循原始文本的表达方式这导致了语义相同的关系在表达上存在多样性即Ri​ 和 Rj​ 指的是同一关系。因此HT-R-O范式将进一步把所有本体级三元组 (On,Ri,Om) 输入大型语言模型利用其强大的语义归纳能力引导模型识别并合并那些表达不同但语义相同的关系最终输出一套标准化、统一的本体关系集合。这部分对于理解大型语言模型在本体关系标准化中扮演的关键角色至关重要。值得注意的是HT-R-O范式抽取的关系严格遵循原始文本的表达方式。这意味着原始数据中实体和关系的粒度直接决定了LLM4onto能够构建的本体和关系的详细程度。这种方法在本体和关系两个层面都完全遵循了“让数据发声”的核心原则。总之LLM4onto将直接从文本构建本体的过程分解为几个可管理的子任务。当大型语言模型处理像本体命名和关系抽取这样简单的任务时它们受到提示词的引导严格基于现有数据生成结果从而显著减少了本体构建过程中“幻觉”问题的发生。实验数据集MultiWOZ我们采用的第一个数据集是MultiWOZ 2.1一个基于现实场景的多领域对话数据集。它包含1,000段人与人之间的自然对话涵盖了酒店预订、餐厅预订、出租车调度和景点推荐等六个高频服务场景。每个对话都标注了领域-槽位-值结构以捕捉用户在特定服务上下文中的意图表达。这些对话模拟了用户在真实任务导向对话环境中与服务代理的多轮交互为对话系统中的本体构建提供了高保真的语义环境。通用本体数据它包括维基百科和ArXiv数据集两者均完全来源于学术和百科全书资源。维基百科数据集包含242,148个文章标题和摘要具有一个复杂的4级层次本体包含8,033个节点和14,673条边捕捉了细粒度的现实世界概念。相比之下ArXiv数据集包含27,630篇论文摘要结构化为一个两级抽象本体61个节点61条边形式化了诸如“数学”这样的学术学科及其子类别如“交换代数”强调高层级的概念分类法而非具体实体。关键的是这两个本体都不同于领域-槽位-值模式而是反映了学术知识组织中微妙的层级关系维基百科通过基于实体的详细分类而ArXiv通过学科驱动的抽象。网络安全数据集该网络安全数据集包含从真实世界网络安全场景中收集的威胁情报主要来源于Ahnlab。这个广泛的数据集包含超过580篇威胁分析文本涵盖了广泛的安全事件报告包括恶意软件分析、攻击归因、漏洞披露、入侵指标以及威胁行为者的战术、技术和程序。每篇文本都提供了关于攻击描述、影响范围、技术细节和缓解策略的详细信息并附有相应的威胁分类标签和严重性等级评估。评估指标与知识图谱上的其他任务这些任务有基于事实或简单直观的评估指标不同评估本体一直是一个相对困难的问题因为很难定量地定义一个“好的本体”。当前的指标通常只能反映本体的某一个方面。我们选择了具有高置信度标准答案的实验数据集并将生成的本体与标准答案进行比较。我们采用Lo等人sup16/sup的评估框架来评估我们的LLM4onto方法。具体来说我们采用Literal F1、Fuzzy F1、Continuous F1和Graph F1作为评估指标因为它们能够展示生成本体与标准答案之间的差异。Literal F1指标计算简单源于精确率和召回率的调和平均值通过计算生成本体与标准答案之间重叠的边的数量得出。该指标过于严格对语义不敏感适用于粗略评估生成的本体。Fuzzy F1指标使用节点嵌入计算节点间的相似度并采用阈值t来确定节点匹配。值得注意的是阈值t设为0.436反映了WordNet中同义词对余弦相似度的中位数。Fuzzy F1的优点在于能够识别同义词和语义相似的概念提供了一定程度的容错性以适应合理的表达差异。然而它可能忽略图结构的差异。Continuous F1指标采用匈牙利算法寻找最优的边匹配其中一条边的相似度由其两个端点的最小相似度决定。该指标对结构敏感与Fuzzy F1指标相比能更有效地区分不同的图结构。然而其计算复杂度较高。Graph F1指标采用图卷积网络生成图感知的节点嵌入。它计算最佳节点匹配并提供图相似度分数其方法类似于Continuous F1指标。因此Graph F1指标融合了节点语义和结构信息对生成本体的质量提供了更全面的评估。关于上述指标计算方法的详细信息请参考Lo等人sup16/sup的工作。评估我们首先评估LLM4onto是否能够准确地创建包含大量概念和关系的本体。从可扩展性的角度来看LLM4onto仅需根据领域文本数据对提示词进行少量修改即可生成该领域的本体框架。在当前标准下这是一个相对合理的成本表明LLM4onto在实际应用中具有显著的灵活性。在性能方面与我们提出的基线方法相比对于通用本体数据下的两个数据集LLM4onto在大多数指标上生成的本体最为准确如表2所示。关于维基百科数据集LLM4onto的Literal F1为4.50Fuzzy F1为50.38Continuous F1为32.61Graph F1为49.72。虽然这些定量结果总体上低于大多数基线模型但细粒度分析揭示了不同层级间明显的性能差异。具体来说LLM4onto在预测二级本体概念时表现出较高的准确性然而其精度在三级概念上显著下降。这种现象主要归因于维基百科数据集的无约束特性。缺乏特定的领域边界使得三级本体名称的精确词汇匹配 inherently 困难因为开放领域的范围允许大量有效但不匹配的具体描述符。此外与其设计一致LLM4onto生成了一个显著更细粒度的本体结构该结构直接来源于源词汇。虽然这种方法捕捉了更丰富的语义细节但它导致了与较粗粒度的标准答案在结构上的差异。因此这种源于模型倾向于生成详细、具体节点而非基线方法偏好的宽泛通用术语的不匹配不可避免地惩罚了指标计算结果。关于Arxiv数据集LLM4onto在大多数评估指标上均表现出优越的性能包括Literal F1、Continuous F1和Graph F1但Fuzzy F1除外。LLM4onto在Literal F1上取得了最高分尽管这是一个对精确边匹配敏感的严格指标但它表明LLM4onto能够有效且准确地对一组实体进行概念化。此外LLM4onto在Continuous F1和Graph F1上的领先尤为显著。Graph F1更进一步通过使用图卷积网络生成图感知的节点嵌入从而融合了语义内容和全局拓扑信息。在这两个对结构敏感的指标上的高性能证实了LLM4onto擅长将概念组织成逻辑的、层次化的骨架而不仅仅是生成一组概念。相反LLM4onto在Fuzzy F1上的得分低于基线方法。这种现象可归因于LLM4onto倾向于构建一个显著更细粒度的本体架构。与可能输出更宽泛或更通用术语的基线模型不同LLM4onto生成了大量特定的子本体节点以捕捉细微的语义差别。虽然这种粒度丰富了信息内容但导致了大量特定概念节点这些节点在严格的相似度阈值t0.436下可能无法与较粗粒度的标准答案完美对齐。因此这种由LLM4onto优越的细节导向生成引起的不匹配无意中惩罚了Fuzzy F1的计算。相比之下LLM4onto优先考虑本体的结构完整性和关系准确性。在多领域对话数据集MultiWOZ的情况下LLM4onto与TeQoDO的性能比较如表3所示。对于MultiWOZ数据集LLM4onto展现出显著的性能优势在所有评估指标上均持续优于所有基线模型。例如在Literal F1方面LLM4onto达到了49.5%的显著得分远超仅达到2.8%的基线模型。在Fuzzy F1和Continuous F1上也观察到类似的提升我们的模型分别领先19.1%和41.7%。这种卓越的性能主要得益于MultiWOZ数据集的内在特性它包含了日常对话且领域相对较小且受限。与Arxiv中复杂的科学概念不同MultiWOZ的语义范围更加集中语言模式也更直接。这些因素使得LLM4onto能够充分发挥其归纳能力以结构和语义保真度重建领域本体。这里我们将在表4中展示LLM4onto在网络安全数据集上的结果。它对比了我们的LLM4onto框架构建的广泛本体与现有NER模型支持的有限标签集。现有的提取器如SecureBERT和CyBERT通常操作在13到40种实体类型的狭窄范围内并且忽略了关系建模这限制了它们在复杂网络安全场景中的适用性。LLM4onto旨在通过生成一个包含483种实体类型和72种关系类型的高度细粒度的模式来弥合这一语义鸿沟。虽然LLM4onto本身专注于模式归纳而非实体抽取但由此产生的本体为未来开发更有能力、更全面的NER系统提供了一个关键的、扩展的语义蓝图。总而言之LLM4onto在多种基准测试中均表现出稳健的性能并在网络安全领域得到了有效验证突显了其在专业领域中快速、可扩展地构建全面本体的独特能力。结论本文介绍了LLM4onto一个自动化框架它利用亲和力传播和HT-R-O范式直接从原始文本构建领域本体。实验结果表明LLM4onto在大多数基准测试中均取得了优越的性能尤其是在专业的、领域受限的环境中它能以高保真度捕捉复杂的语义细微差别。通过减轻幻觉和结构僵化问题该框架为知识工程提供了一种可扩展的、数据驱动的解决方案。一个显著的局限性存在于通用领域本体构建中即缺乏领域相关的名词过滤以及细粒度分类粒度导致的对齐差异导致了性能欠佳。未来的研究将侧重于开发更精确的构建范式以解决这些粒度不匹配问题并进一步提高层级关系和命名惯例的精度。附录A. 本体分类的提示模板template 你是一位网络安全本体专家。你的任务是根据中心词及其最近邻词为一组相关术语分配最具体、最准确的本体标签。 - - ## 核心本体列表首选类别 # 行为体与目标 - 威胁行为体特定的 adversary 团体或个人例如APT28, Lazarus Group。 - 组织合法的非对抗性实体例如微软谷歌。 - 国家和地区与活动相关的国家或地理区域。 # 恶意软件与工具 - 恶意软件家族恶意软件集群例如Emotet, TrickBot。 - 勒索软件特指为加密而设计的恶意软件例如LockBit, Conti。 - 安全工具防御性或诊断性软件例如Wireshark, Snort。 - 进攻性安全工具用于利用的工具例如Metasploit, Cobalt Strike。 ## 指令 1. 分析中心词和最近邻词。 2. 如果核心本体列表中的标签精确匹配则使用该标签。 3. 如果没有核心标签完全匹配则定义一个新的、特定的网络安全类别。 4. 如果术语是通用的、模糊的或与网络安全无关请回答“无”。 5. 确保输出是一个单一的、标准化的术语。 ## 示例 示例 1中心词the Kimsuky group | 最近邻词[Thallium, APT43] | 本体Threat Actor 示例 2中心词basis | 最近邻词[foundation] | 本体None 现在请确定以下内容的本体中心词{center.word} | 最近邻词{nearest.words} 本体翻译说明专业性确保了术语如“ontology”本体、“affinity propagation”亲和力传播、“hallucination”幻觉、“knowledge graph”知识图谱、“triple”三元组等翻译的准确性和一致性。流畅性在保证忠实原文的基础上对长句和复杂句式进行了符合中文阅读习惯的调整使译文更加流畅自然。格式尽量保留了原文的标题、图表指代如“表1”、“图1”、数学符号、代码片段和引用标记。细节对文中提到的具体数据集名称如MultiWOZ、模型名称如SecureBERT、算法名称如匈牙利算法等专有名词保留了英文原名或采用了通用译法。对部分英文单词如inherently在不影响理解的前提下有时保留了原文或进行了意译以更好地传达作者意图。