LLM-SrcLog: Towards Proactive and Unified Log Template Extraction via Large Language Models

📅 发布时间:2026/8/28 8:15:58
LLM-SrcLog: Towards Proactive and Unified Log Template Extraction via Large Language Models
文章总结与翻译一、主要内容本文针对现有日志模板提取方法“被动响应式”和“日志中心主义”的局限性,提出了一种主动式、统一化的日志模板解析框架LLM-SrcLog。该框架核心是在系统部署前通过静态代码分析提取日志模板,同时结合数据驱动方法处理无源代码的“黑盒日志”,实现白盒解析与黑盒解析的融合。核心模块静态代码分析器(SCA):跨文件、跨函数追踪数据流,重构日志生成的完整上下文,解决动态字符串拼接、异常嵌入等日志的模板提取难题。LLM驱动的白盒模板提取器(WTE):基于静态分析结果构建丰富提示词,利用LLM区分日志中的常量与变量,通过后处理模块过滤无效模板、保证一致性。黑盒模板提取器(BTE):采用无监督聚类算法(Drain3)处理第三方库、动态加载组件等无源代码的日志,确保模板覆盖完整性。实验与效果在Hadoop、Zookeeper公开数据集和阿里Sunfire-Compute工业数据集上,相比DivLog、LLMLog等LLM基线方法,F1分数平均提升2%-35%。在线解析延迟与传统数据驱动方法(如Drain)相当,比逐日志LLM推理快约1000倍,实现精度与效率的平衡。在阿里真实生产环境中部署验证,成功支持故障根因分析(如定位网络重传导致的TAIR服务访问错误)。