A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models

📅 发布时间:2026/8/20 22:18:42
A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models
一、文章主要内容总结该研究针对中医领域大语言模型(LLMs)的临床应用能力评估问题,提出了首个聚焦“辨证论治(SDT)”全流程的综合基准数据集TCM-BEST4SDT。数据集由中医专家主导构建,涵盖中医基础知识、医学伦理、LLM内容安全、辨证论治4大任务,共600道题目,覆盖257种证候和20个ICD-11疾病组,数据标注经过专家标注、交叉验证、第三方审核三阶段流程,确保专业性和可靠性。评估框架创新设计了三种机制:选择题评估(随机选项顺序+多轮独立评估)、判断模型评估(结合专家提示的LLM评分)、奖励模型评估(量化“方证对应”程度),同时首次引入过程导向指标(思维链完整性与准确性),突破了现有基准仅关注结果准确性的局限。通过对15个主流通用域(如GPT-5、Gemini 2.5 Pro)和中医域(如华陀GPT、仲景GPT)LLM的零样本实验验证,发现优质中医语料与监督微调可提升模型临床推理能力,但多数中医域LLM因参数规模小、真实临床场景语料不足,性能不及部分通用域模型;模型规模与性能呈正相关(如Qwen3系列),验证了数据集的鉴别有效性。该数据集已公开,为中医智能模型的性能评估、迭代优化及产业化提供支撑。二、文章创新点数据集聚焦核心任务:首次构建以“辨证论治”为核心的综合基准,覆盖从证候辨识到治疗决策的完整临床链,弥补现有基准仅关注基础知识或单一证候辨识的缺陷。评估维度全面化:兼顾结果导向(14个辨证论治核心维度)与过程导向(思维链完整性、准确性)评估,同时纳入医学伦理、内容安全等通用规范维度,实现多维度综合