可信AI赋能IC签核与制造:从模型跑通到敢签核
芯片行业这两年有个特别明显的风向聊AI的人越来越多但聊“可信AI”的才是真正在一线干活的。我自己做IC签核和制造支持这块见过太多团队拿神经网络一上来就跑结果跑出几个漂亮数字落到流片环节根本不敢用。原因很简单——签核和制造这两个场景错了是要赔钱的不是调个阈值就完事。这个标题里“可信AI”三个字核心就在这。这篇文章我想聊聊AI在IC签核与制造里到底怎么落地怎么从“模型跑通了”走到“结果敢签核、敢指导产线”包括我自己踩过的坑和现在常用的套路。适合刚准备引入AI的签核工程师、DFM团队、制造工艺工程师以及所有对“AI辅助芯片流片”这件事既兴奋又有点拿不准的同行。1. 可信AI在IC行业的落地背景1.1 为什么是“可信”而不是单纯“好用”先说一个我经常被问到的问题AI工具在签核环节跑得又准又快为什么不直接替代传统EDA工具答案藏在“签核”两个字里。签核的本质不是算出一个结果而是为这个结果承担责任。无论时序签核、功耗签核还是物理验证签核最终交付的是“这个芯片可以量产”的承诺。传统EDA工具基于确定性的物理模型和数学方法每一个结果都有明确的推导链路出了问题能回溯、能定位。而AI模型本质上是个黑盒给出一组特征就能吐出结果但中间过程通常不可解释。在制造端这个问题更尖锐。工艺窗口每收窄一点良率波动的影响就放大一点。如果AI告诉你“这批晶圆缺陷率偏高”你总得知道是哪个工艺参数引起的否则怎么调机台怎么跟Fab沟通所以“可信AI”这四个字在IC行业里的定义不是“AI很准”而是三个关键词可解释、可验证、可容错。模型不仅要给出预测还要给出判断依据不仅要在测试集上准还要在真实分布变化时能感知模型出错时流程能兜住不让错误一路传导到流片和量产。1.2 IC签核与制造对AI的特殊要求IC设计签核和互联网推荐系统最大的区别在于错误代价不对称。推荐系统推错一个商品损失可能就是一次点击签核漏掉一个时序违例回来就是一次改版几百万美元起步。制造端更是如此一批晶圆处理到一半发现参数漂移报废的就是几万片晶圆。这种“错误容忍度极低”的行业特性决定了AI在这里的落地路径和其他行业完全不同。具体到工程实现签核和制造场景对AI的要求基本可以拆成四层精确性输出不能只是“趋势正确”关键指标要能逼近传统工具或实测数据的精度。比如用ML做IR drop预测误差超过5%就没有实用价值。一致性同一个输入在不同运行条件下结果必须稳定不能因为微小扰动就给出跳跃性输出。可解释性模型决策依据需要可以被工程师理解才能帮助调试和信任建立。不确定性表达模型给出预测时最好同时给出置信度让用户知道什么时候该采信、什么时候该回到传统工具深入分析。这四层缺一不可。我见过不少团队在“精确性”上打磨得很好却在“不确定性表达”上栽了跟头——模型预测某个路径的时序违例值非常准结果拿去做签核Flow跑了一半还是检查出来了违例原因就是模型在特定条件下置信度很低但界面上的数字没有体现这一点。工程师看到“数值很准”就会放松警惕这才是最危险的。2. IC签核环节的可信AI赋能2.1 时序签核的AI加速与可信验证时序签核是整个数字IC设计流程中最耗时、也最需要“背锅”的环节之一。传统的时序签核要基于寄生参数文件做SPICE级别的精度仿真但在全芯片规模上太慢所以通常的做法是先做STA静态时序分析圈出关键路径再做SPICE精算。这个过程在先进工艺节点下一个顶层设计跑一遍全芯片时序签核几十个小时是家常便饭。AI介入时序签核的切入方式目前比较成熟的是ML加速的静态时序分析。思路不复杂先用传统STA工具跑一部分路径把延迟计算结果喂给模型做训练让模型学习输入特征逻辑级数、负载电容、转换时间、工艺角参数等到路径延迟的映射关系然后用训练好的模型去预测剩余大量路径的时序结果。设计规模越大的时候主要的时间节省来自那些不需要百分之百动态仿真的路径区块。但这里有个可信性陷阱传统STA是穷举式验证每条路径都算一遍所以结果确定。用ML做预测就等于跳过了一部分路径的精确计算这对签核来说是不可接受的。实际落地的做法是分级处理。高风险的临界路径不走ML全部保持完整STA计算中低风险的路径才用ML加速而且还要定期抽样回灌到传统工具验证确保模型没有因为设计改动而失效。我称之为“ML铺路传统工具把关”。另一个值得提的工具场景是PrimeTime这类专业时序签核工具与ML结合的使用。市面上有些流程会把ML模型嵌入到工具里做signoff-quality的延迟计算辅助。使用这类方案时我的经验是一定要保留传统的golden结果作为回归基线。每次设计版本更新后把上一版的签核结果跟新版本跑出来做比对如果差异模式明显集中在某个逻辑区域大概率是那个区域附近的训练数据分布出了变化需要增量补训。对比维度传统STA签核ML辅助签核精度基准SPICE级精算逼近SPICE需定期回归校准运行时间全芯片数十小时核心路径全算其余ML预测可缩短30%60%可解释性完整推导链路依赖特征归因分析签核责任EDA工具厂商保证由流程设计者负担验证责任适用场景最终signoff必须全量中期迭代与多版本探索2.2 功耗签核中的AI建模方法功耗签核在低功耗芯片设计里越来越重要特别是移动终端和AI加速芯片功耗预算卡得很死。传统功耗签核工具在动态功耗仿真的时候需要大量翻转率信息靠的是门级仿真产生VCD/FSDB文件数据量巨大跑一轮时间长而且后仿阶段才有比较准的开关活动信息。用AI做功耗建模核心逻辑是学一个**“输入组合-内部节点翻转率-总功耗”**的映射关系。训练数据可以从早期综合仿真结果里取把RTL级仿真得到的翻转率、时钟门控统计信息、模块负载特征作为输入特征目标是模块级或实例级的平均功耗。这样设计团队在还没有完整后端数据的情况下也能提前把握功耗风险。可这个环节我可太熟了太容易出问题。最经典的坑就是训练数据来自某一个工艺角或者某一种工作负载模型学了一堆数据分布之外的“经验”一旦切换到另一个场景预测功耗完全偏离。比如移动芯片的温控降频场景电压和时钟频率都会动态变化训练数据里如果没有覆盖这种相关性模型直接把功耗预测成线性外推那就完全失真了。我的做法是三个担保策略同时上一训练数据覆盖多工艺角落点至少包含SS、TT、FF三个典型角二给模型加物理约束比如功耗必须随电压平方近似变化允许模型中等程度违背但要有惩罚项三预测结果必须附带适用域声明当输入特征超出训练分布范围时模型要返回低置信度拒绝预测。第三点尤其重要宁可让流程回退到传统仿真也不能让一个不靠谱的AI功耗数字进签核报告。2.3 签核结果的可信度评估机制签核和AI结合后一个绕不开的问题是谁来评估评估者——模型自己说“置信度98%”凭什么信它我所在的团队在实践中建立了一套“三层置信”评估机制第一层是数据分布匹配检测每次用模型预测前先用密度估计方法检查当前输入特征和训练集分布的距离距离超标的自动降级第二层是集成模型分歧度同时跑两到三个不同结构或不同初始化的模型如果分歧很小说明对这个输入比较稳分歧很大就说明输入落在模型不擅长的区域需要人工介入第三层是和传统签核工具做回灌对比随机抽取一定比例我常用5%10%的路径或模块用传统工具重新精确计算对比差异是否在允许误差范围内。这个评估机制如果做完前置分布检查再做集成一致性和回灌校准整体流程能覆盖绝大部分“模型盲目自信”的问题。实际跑下来感受是模型精度本身达标不难真正花时间的是这套配套的信任链路。没有这套链路AI预测结果再漂亮签核负责人也不敢签字。有了这套链路即使模型偶尔出错也能在传导到下一环节之前就被拦截。3. IC制造环节的可信AI赋能3.1 良率预测与工艺窗口优化芯片制造环节AI价值最明显的是良率预测与工艺窗口优化。Fab里面每一道工序都依赖大量工艺参数光刻的焦深、曝光剂量刻蚀的气体比例、腔室压力、RF功率薄膜沉积的温度、均匀性——这些参数和最终良率的关系是高维、非线性且带交互效应的。传统做法依赖工程师经验和DOE实验设计但参数空间太大DOE只能覆盖很小一部分。AI模型可以从历史生产数据中学习参数到良率的映射关系。以光刻工艺为例把曝光剂量、数值孔径、焦深偏移量、光刻胶厚度、线条关键尺寸目标值当作输入特征输出是对应区域的缺陷概率或关键尺寸偏差。模型训练好之后反过来还能做工艺窗口探索——在给定良率目标的前提下搜索满足工艺规格的参数组合范围帮助工艺工程师找到更宽裕的工作区间。不知道你们有没有这种感觉工艺窗口优化说起来容易做起来特别怕模型推荐了一个反直觉的参数组合。比如模型说“加大曝光剂量加上减小焦深”工程师一看这种组合违反了传统经验第一反应就是不信。这个情况我们处理过好几次后来得出结论是——模型推荐不能只输出最佳参数点一定要输出推荐参数周围的可行域。这个可行域是通过鲁棒优化或贝叶斯优化得到的能够显示参数在一定波动范围内依然能保持良率目标。工程师看到的是一个区域而不是一个点决策空间就大了也更愿意实际去试。3.2 缺陷检测的视觉AI与人工复核闭环晶圆缺陷检测应该算AI在制造里落地最早的环节之一。光靠传统图像算法很多微小缺陷信号很弱容易漏检。基于深度学习的视觉检测模型在缺陷识别率上确实远超传统算法这个现状大家都承认。但难点不在检测精度而在误报处理。半导体制造里有个概念叫overkill和underkill。Underkill是真实缺陷没检出来后果是坏die流到封装环节Overkill是冤枉了好die把正常die判成缺陷直接损失良率。传统视觉检测系统误报率已经很低但AI模型在某些光照条件、工艺噪声模式下会产生系统性误报——不是随机错误是看到某种纹理就稳定触发误报。这个问题非常隐蔽如果只统计总误报率看起来没问题但按缺陷类型分拆后才发现某几类模式的误报率飙升。我推荐的做法是人机协同闭环AI模型负责初筛把高置信度的缺陷直接放行进入统计低置信度或中等置信度的图像必须送人工复核。人工复核的结果持续回流到模型微调。这个闭环一旦跑起来模型长期运行也不会忘掉那些真实缺陷的特征。关键是要设计好抽样策略不能只回流被判定为缺陷的样本正常样本也要按一定比例回灌防止模型的判定边界持续漂移。3.3 设备参数预测性维护的可信框架设备维护这块AI用得好是省钱利器用得不好就是故障放大器。预测性维护的原理很简单从设备传感器的时间序列数据中学习正常模式的基线当实时数据偏离基线时提前预警潜在故障。但制造设备的数据噪声大、工况变化多随便一个温度波动都可能把模型触发。在可信框架下预测性维护模型需要区分漂移与故障。设备老化导致的参数缓慢漂移是正常物理现象不代表马上会坏而断崖式的异常跳变才是真正的预警信号。单一模型很难同时捕获这两种模式我建议拆成两个模型一个慢速漂移模型用于长期趋势分析和预防性维护排期一个快速异常检测模型用于实时告警。二者信号合并后还要送入一个决策层判断是否真的要触发维护工单避免维护动作本身打乱生产节拍。这个决策层我倾向于用规则引擎实现而不是再用一个AI模型去套——规则透明、可审计、责任明确方便工程师回溯每一个告警的触发原因这也是制造产线管理者比较看重的一个特性。4. 实操路径从工具链到工作流落地4.1 数据治理与模型训练准备聊完了场景落回到实操。AI在IC行业落地最大的阻碍不是算法是数据。签核数据、制造数据分散在工程师的服务器、Fab的数据库、EDA工具的存档文件里格式不统一、语义不统一、时间跨度不统一直接拉出来训练模型就是一场灾难。我自己踩过最大的坑是用错版本的签核结果做训练。有一版数据里混了ECO前后两套网表对应的签核结果特征数据是ECO后的标签数据是ECO前的模型训练出来误差巨大排查了两天才发现是数据对齐问题。所以数据治理第一步永远是确定统一的数据版本锚点比如用GDS版本号加上网表版本号的双重指纹确保每个训练样本的输入特征和标签来自同一设计版本。数据标签这一环节也容易出问题。签核结果里的“throughput”和“violation slack”这些标签相对明确但制造数据里有些标签需要人来标比如缺陷图像的分类。多个工程师标注的粒度不一致会造成标签噪声。我的建议是训练前做一次标注一致性校验按10%的比例抽样让两位工程师重复标注和一致率低于80%的类别合并或重新设计标注规范。4.2 测试集建立与模型验证模型验证环节很多团队习惯把历史数据按比例随机切分训练验证集。这在IC场景下不一定合理。因为签核和制造数据通常是按项目或批次组织的同一项目的训练样本和测试样本之间相关性很高直接随机切分会造成信息泄漏模型验证成绩虚高。正确的做法是按项目/批次分组切分。训练集只包含某几个完整项目的数据验证集用另外几个完全没参与训练的项目数据。这种“留出法”虽然会让验证精度看起来没那么漂亮但更接近真实使用场景——你训练模型就是为了在新项目里用项目之间当然是有差异的。我见到太多团队在随机切分的验证集上报告99%的准确率一到新项目应用就掉到85%以下数据划分方式要负主要责任。另外模型上线不等于工作完结。我在实际流程里会设置一个定期回归机制每季度或者每个新工艺节点出来之后用历史模型在当前数据上重新跑一遍对比关键指标的漂移量。一旦发现漂移超过阈值就自动触发数据搜集和模型增量训练流程。这个机制看上去笨但真能持续保住模型质量。4.3 签核工具与AI模型的协同配置工具协同这块要分情况讨论。如果是商用EDA工具自带的AI引擎比如一些签核工具内置的ML模块使用相对省心但要注意确认工具的golden flow仍然是传统算法AI只是加速或优化辅助两者结果要能无缝对齐。如果是自研AI模型需要重点解决与工具链的数据交换格式和结果回灌接口。以我自己的实践为例用AI模型辅助时序签核时模型的输出是CSV格式的路径延迟预测表同时包含每个路径的置信度。脚本工具把置信度高的路径标记为“AI通过”置信度低的路径标记为“需全量计算”下游的签核流程就会自动只对后者做完整计算并回注结果。这样虽然是混合流程但签核报告的最终结果仍然来自传统工具AI的作用是帮我们裁剪了不需要重点关注的路径保证报告本身的可信底线的同时省下时间。5. 常见问题与排查技巧实录5.1 数据漂移模型精度衰减的元凶模型线上一段时间后精度下降这是IC行业AI应用最普遍的问题。原因在于工艺线本身在持续变化——Fab会根据良率数据调整工艺参数设计团队会换库、换IP版本甚至EDA工具升级都会改变签核结果的分布。排查思路很直接先检查输入特征分布有没有变化。我这里有个习惯每次模型预测精度出现肉眼可见下降时第一步不是去调模型结构而是把最近一个月输入特征的统计量均值、方差、分位数和训练集对比一遍。大概率会发现是某一个特征的分布偏移了。举个例子我们的功耗预测模型曾经过一段时间频繁低估芯片功耗检查后发现是时钟门控比例大幅提高了这个特征在早期训练集里几乎是个常数所以模型几乎没学到它对功耗的贡献。把这个问题定位清楚后做增量补训就好。5.2 过拟合在工艺节点迁移时的陷阱一个在28nm工艺上训练得很好的模型直接拿到7nm工艺上往往不能用。很多团队会误以为是模型不行其实背后是物理规律变了——先进工艺下的短沟道效应、栅极漏电等机制跟成熟工艺差异太大特征之间的相关性也随之改变。这说明模型过拟合了旧工艺节点的数据分布而不仅仅是“精度不够”。迁移到新节点时我建议的训练策略是少量新节点数据加上旧节点数据做联合训练同时在新节点数据上做更大的采样权重。这样模型既保留了旧节点学到的基础物理知识又能适应新节点的独特规律。纯新数据训练虽然可行但对数据量的需求会成倍增加在先进工艺数据本身就稀缺的情况下不划算。5.3 从“能用”到“可信”的流程治理最后聊聊流程治理。技术层面的可信是必要不充分条件流程层面必须有治理机制兜底。我把这套流程整理成一个简洁清单每次评审的时候都过一遍数据说明文档训练集来源、版本、时间跨度、清洗规则都是明确的能定位到具体的设计和批次。模型版本管理每个模型的训练时间、训练数据版本、关键超参数、验证报告都纳入版本管理可追溯、可回滚。人工复核机制模型输出关键决策时必须有相应的工程师复核环节复核结论可记录、可追踪。风险分级响应不同置信度结果的处置策略要预设而不是靠临场判断。这套清单跑顺之后团队对AI的态度会有明显变化从“这东西能不能信”变成“哪些环节信哪些环节不信我都能说清楚”。这才是我理解的可信AI在IC行业真正落地的样子。最后分享一个实际工作中的体会。有一次我们在做新项目的功耗签核AI模型给出了一个很乐观的结果按照传统估算应该是偏紧的。恰好那天模型回灌对比的抽样比例被设置得比较低差点就没发现异常。后来查下来是模型训练数据里的一个宏单元功耗模型版本和当前库里不一致导致该模块功耗被系统性低估。这件事之后我把所有AI辅助签核的项目统一强制设置最低10%的回灌抽样比例无论模型跑出来的置信度多高。做AI辅助签核这行主动权必须始终保留在工程师手里AI负责筛选和提示最终判断永远由人来下。