ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

高功率芯片散热三要素:功率密度、封装与热管理协同设计

高功率芯片散热三要素:功率密度、封装与热管理协同设计 芯片设计圈子里最近有个话题越来越绕不开明明单个晶体管的功耗在下降芯片整体的发热量却一年比一年夸张。我做热设计这些年最直观的感受是——现在跟结构工程师、封装工程师开会话题几乎都围着散热转。这个标题把高功率芯片散热拆成芯片封装、功率密度提升、热管理系统优化三个维度来讲确实是目前行业里最核心的切入方式。这篇文章我就结合自己的实际项目经验把这三个维度背后的技术挑战掰开揉碎聊一聊。先说一个很多人容易忽略的基础认知芯片热问题的严重程度从来不是看总功耗有多少瓦而是看单位面积上的发热量也就是热流密度。随着先进制程不断微缩晶体管越做越小、越排越密芯片的热流密度一直在向上突破。目前主流的高性能计算芯片热流密度已经可以达到几百瓦每平方厘米的量级局部热点区域甚至能逼近一千瓦每平方厘米。这个数字意味着什么作为对比火箭发动机喷嘴的热流密度大约在几十瓦每平方厘米的级别太阳表面的热流密度也不过是几千瓦每平方厘米的量级。换句话说芯片在正常工作状态下局部发热强度已经接近一些极端工程场景了。1. 从功耗墙说起功率密度为什么是热问题的总源头1.1 只看瓦数不够算清热流密度才知道事态多严重我做过的不少项目里经常遇到需求方只给一个总功耗200W的指标然后说你们散热团队看着办吧。如果只盯着瓦数那你大概率会在后续测试中被热点问题打得措手不及。因为芯片发热的真正烈度要看功率密度。功率密度的核心定义是单位面积上的功耗常见的表达方式是[ q \frac{P}{A} ]其中q就是热流密度P是芯片实际功耗A是有效发热面积。举个例子一颗200W的芯片如果热源面积是400平方毫米简单除法算下来热流密度是50W/cm²这个水平对风冷来说已经需要认真对待了。但真实情况远比这个粗略计算复杂芯片内部并不是均匀发热的计算核心、缓存、IO接口的功耗密度可能相差好几倍。某些高性能计算Die的局部面积只有几个平方毫米却承担了几十瓦的功耗局部热流密度直接冲到几百W/cm²甚至更高。这个差异在实际工程中直接决定了散热方案的选型。我之前参与过一个GPU散热项目规格书上标注的功耗是300W平均热流密度看着大约40W/cm²一开始团队觉得常规风冷加热管就能覆盖。结果拿到工程样品一测热点区域温度比Die平均温度高出接近20摄氏度原因是内部有几块执行单元阵列功耗密度特别集中热管的均温能力完全压不住最后被迫改成均热板加多热管并联的方案整个散热模组的成本翻了一倍还多。所以后来我在做热设计的时候第一步永远是先跟芯片团队要功耗分布图而不是只拿一个总的功耗数字。没拿到热分布图之前所有散热方案都只能算是盲猜。功率密度这个维度是理解后续封装和系统散热所有问题的起点。1.2 让功率密度飙升的三个推手功率密度为什么会在近几年集中爆发我总结下来背后有三个主要推手在同时作用。第一个推手是先进制程带来的漏电功耗占比上升。晶体管的尺寸越缩越小栅氧化层越来越薄源漏之间的漏电流也在增长。漏电功耗本身不干活只是凭空把热量散在芯片里。尤其是在5nm、3nm这些先进节点上漏电功耗在总功耗中的占比变得非常可观而且这部分功耗的发热位置往往很分散没有明显的热点规律给热设计增加了不少不确定性。第二个推手是并行计算架构对晶体管密度的持续堆叠。现在的CPU动辄十几个核心GPU更是几千个核心同时工作再加上AI芯片里动辄几十MB、上百MB的片上缓存这些晶体管不是摆设只要跑起来就会产生热量。同时为了在单芯片里塞进更多计算单元Die的面积本身也在扩大但这并没有缓解局部热点的问题反而因为总线、接口、电压域这些非均匀结构的存在让功耗分布更加不均匀。第三个推手是工作模式的剧烈变化。现代芯片不再是稳态运行了瞬时加速、睿频、超频这些机制让芯片功耗在毫秒级别内大幅波动。比如一个CPU在待机时可能只有十几瓦满载瞬间冲到两百多瓦这种瞬态功耗冲击对散热系统来说非常棘手因为散热路径上的每种材料都有热容响应速度跟不上就会导致瞬时结温飙升。这三个推手叠在一起结果就是芯片的平均功耗在涨峰值功耗涨得更快局部热点的增长速度又比峰值功耗还快。只靠把散热器做大做厚已经解决不了根本问题必须在封装结构和系统热管理手段上做文章。2. 芯片封装散热路径上的第一个限制器2.1 封装决定热量从结温到外壳有多难走芯片封装在大多数人眼里就是一块黑色的塑料或者陶瓷外壳但在热设计人员看来封装是整个散热链条里最关键也最容易被低估的环节。芯片内部产生的热量要经过Die本身、封装基板、焊球或者引脚、然后再跑到散热器上去这中间的每一层材料都在贡献热阻。理解封装散热能力的一个核心概念是结壳热阻(\theta_{jc})它表示从芯片内部的结温到封装外壳表面之间的热阻。(\theta_{jc})越低说明同样功耗下芯片结温越低留给系统级散热器的温度预算就越多。举个直观的例子一颗功耗200W的芯片如果结壳热阻是0.15K/W那么从结到壳的温升就是30K如果封装优化后热阻降到0.1K/W同样的功耗温升就变成20K直接给散热器省出10摄氏度的余量。在大功耗芯片的散热设计中这10度可能意味着风冷和液冷的分界线。封装类型对散热能力的影响非常直接。传统的有引线封装比如QFP、SOP热量主要靠引脚往PCB上传导塑封材料的导热系数只有0.6到1W/(m·K)左右导热能力极差这种封装形式基本只能应对几瓦到十几瓦的芯片。到了几十瓦到上百瓦的级别就必须往倒装芯片封装、金属基板封装这些方向上走。倒装封装直接把芯片的背面暴露出来或者贴一层金属盖热量可以直接从Die背面传到散热器路径短、热阻低这也是目前高性能CPU、GPU几乎全都采用倒装封装的原因。封装基板的材料也在不断演进。传统的有机基板如BT树脂、ABF膜导热系数虽然不高但胜在成熟便宜。到了HPC和AI芯片这个级别很多团队开始评估氮化铝陶瓷基板甚至叠层铜基板为的就是把基板这一层的热阻压下来。不过材料一升级成本和制造工艺难度也会跟着上来这就是封装环节最现实的工程取舍。2.2 先进封装带来的新麻烦热点与热串扰如果说传统封装是在跟热阻较劲那么先进封装面临的挑战就更复杂了。2.5D封装、3D堆叠、Chiplet这些技术确实解决了芯片互联带宽和良率的问题但它们也在热设计上制造了新的麻烦。2.5D封装里多个Die通过硅中介层互联。硅中介层本身导热性能不错但它下面连接的是有机基板两者之间的热膨胀系数差异会带来可靠性风险。更重要的是多个Die被封装在同一个基板上之后它们之间的热耦合变得非常强。一个Die在满载运行旁边另一个Die即使处于空闲状态也会被烤到温度上升。我在一个多Die封装的服务器芯片项目里就遇到过这种情况负责IO的Die明明功耗很低温度却总是压不下来排查到最后发现是紧挨着它的计算Die通过基板把大量热量传了过来。这就是典型的热串扰在先进封装设计里几乎无法避免只能通过合理布局发热源和散热通道来减轻。3D堆叠封装则是另一个量级的难题。上下层Die通过硅通孔TSV连接TSV本身是铜填充的导热性不错但TSV周围必须要有绝缘层这些绝缘层通常是二氧化硅导热系数只有铜的几十分之一。而且堆叠Die之间还有微凸点、底部填充胶这些材料每一层都是热阻的贡献者导致垂直方向的热阻非常高。当堆叠的顶层Die在大量发热时热量想要穿过下面几层Die传到底部再做散热路径上的热阻已经大到不可接受的程度。针对这种结构目前行业里比较认可的方向是近结冷却也就是把散热结构尽量靠近发热源甚至直接集成到芯片内部。比如在后道工序做嵌入式微流道直接在芯片背面或者硅中介层上刻出微通道灌入冷却液带走热量。这种方式的热阻可以做到比任何外部散热器都低但带来的流体密封、防腐、压降、系统复杂度这些工程问题每一项都是硬骨头。封装层面的核心挑战本质上是在有限的面积和体积里既要保证电气互联的性能又要给热量开辟出低阻力的逃逸通道。这两者在物理空间上存在天然的竞争关系散热通道占用的面积大了互联布线就得让路这种博弈在先进封装时代会更加激烈。3. 热管理系统优化从芯片到机柜的每一环都在拖后腿3.1 散热路径上的关键环节与选型逻辑芯片封装决定的是热量怎么从Die内部传到封装外壳而热管理系统要解决的是热量从外壳到最终环境这一整条路径的输运问题。这条路径上每个环节的短板都会成为整个散热系统的瓶颈。排在第一步的是热界面材料TIM也就是芯片顶盖和散热器底座的接触层。很多人的直觉是两块金属面直接贴在一起导热应该很好。但实际上微观层面上两个金属面的接触面积非常小大部分区域都是空气间隙而空气的导热系数只有0.026W/(m·K)几乎等于隔热层。TIM的作用就是填充这些间隙把热量从芯片顶盖传导到散热器底座。目前高性能场景用的相变硅脂、液态金属、铟片这些材料导热系数可以做到5到80W/(m·K)不等差距非常大选型时要在导热性能、长期可靠性、可返修性之间做权衡。我自己踩过一个坑某款相变硅脂初期性能很漂亮热循环跑了两千次之后性能衰减严重导致芯片结温整体抬高了8度最后不得不换成铟片方案才解决。再往上是热扩展和均温环节。热管和均热板是风冷方案里的核心部件原理都是利用工作介质的相变潜热来快速传递热量。热管适合把热量从一点导到另一点均热板则适合把热源面积小但热流密度高的热量先扩散到大面积上再交给散热鳍片。选择标准我一般这样把握芯片热流密度超过50W/cm²或者热源面积非常集中时优先考虑均热板热源比较分散、热量不需要大面积均温的场景热管阵列就够用。当风冷压不住的时候液冷就成了主流选择。冷板式液冷是目前数据中心里最常见的方案冷却液通过微通道冷板流经芯片上方通过对流换热带走热量。微通道冷板内部的流道尺寸通常在0.1到1毫米量级越小的流道换热系数越高但流动阻力也越大水泵的功耗会跟着涨。这个流量和压降之间的平衡是微通道冷板设计里最核心的优化问题。到了散热需求更极端的场景还有直接浸没式液冷把整个服务器甚至整个机柜泡在不导电的冷却液里消除了一切中间传热环节散热效率极高但对冷却液的绝缘性、材料兼容性、系统维护都提出了全新的要求。3.2 热管理的瓶颈往往在系统而不在芯片我在项目里经常跟团队里的新人强调一个观点芯片散热做得好不好很多时候不是看某个单一散热器件有多强而是看整个系统的配合。散热器再猛如果风扇的风压不够、风道有回流效果照样出不来冷板换热能力再强如果水泵流量不足或者流体分配不均照样会有芯片过热报警。系统级热管理涉及的问题非常杂。首先是流体和热的耦合问题冷却液在不同流道之间的分配是否均匀直接影响每个芯片的温度是否一致。我之前调试过一个四路服务器液冷系统四个CPU共用一套冷板回路结果四颗芯片的温度最大差了15度。排查原因的时候发现问题出在进液歧管的设计上靠近进液口的流道流量大、压力高远端流道流量不足导致远端芯片散热差。后来把歧管重新设计成等阻力结构温度差才压到了3度以内。这种问题在仿真阶段其实可以通过CFD计算提前发现但很多人做仿真的时候只关注单颗芯片的冷板模型忽略了整个歧管网络的影响这是很典型的一个盲区。其次是热膨胀和结构可靠性的问题。芯片与散热器之间、多层材料之间热膨胀系数总是不一致的温度循环下会产生热应力。应力积累到一定程度轻则导致TIM开裂分层重则让焊点疲劳失效、芯片翘曲变形。这也就是为什么高温工况下长期运行的服务器散热性能往往明显下降不一定是散热器坏了很多时候是界面的可靠性出了问题。还有一个不容忽视的环节是动态热管理。芯片功耗是实时波动的但散热系统的供冷能力不会瞬间跟上去。现在很多芯片内部都有温度传感器和功耗管理单元会根据温度数据实时调频降压这就是俗称的热降频。从系统层面看把芯片的功耗调度策略和散热系统的制冷能力联动起来让水泵和风扇根据真实负载动态调整转速既能在散热极限之内榨出性能又能避免散热系统长时间满负荷运转带来的能源浪费。这种闭环控制的思路在过去只是锦上添花现在几乎成了高功率密度机柜的标配。4. 把三个维度串起来工程视角的散热协同设计4.1 封装-功耗-散热之间的量化联动一个算例前面分别讲了功率密度、封装和热管理系统这三个维度但在实际项目里这三者永远是绑在一起协同设计的。这里我分享一个简化的算例用来展示这种协同是怎么量化的。假设一颗芯片目标结温(T_j)不能超过100摄氏度工作环境温度(T_a)是35摄氏度总功耗是250W那么从结到环境的可用温升就是65K。根据这个预算我们可以倒推每一段热阻的分配[ R_{total} \frac{T_j - T_a}{P} \frac{100 - 35}{250} 0.26\ K/W ]然后这个总热阻要分配到封装热阻、TIM热阻、散热器热阻包括对流热阻和流体温升这几段上。如果封装阶段能做到(\theta_{jc} 0.12\ K/W)TIM用高性能铟片做到0.03K/W那么留给散热器的热阻预算就只剩下0.11K/W。这个数字对传统风冷散热器来说已经是极限范围通常需要非常大的散热面积和非常高的风量才能实现这时候要么缩小封装热阻的余量去用均热板要么直接切换成液冷。一旦散热器热阻预算大于0.1K/W液冷的必要性就大大下降了。这个算例看起来很简单但每改动任何一个维度的假设整个方案就可能完全不同。比如芯片功耗分布如果非常不均匀存在热流密度超过500W/cm²的局部热点那么即使平均热流密度算出来的散热方案是可行的实际的散热器也必须在热点位置额外强化散热否则结温还是会超标。这也解释了为什么热设计工作必须从芯片设计阶段就介入而不是芯片做好了才开始想着怎么散热。同步进行协同设计的核心目标就是在需求定义阶段就把三个维度的参数拉通芯片的功耗密度分布、封装的热阻目标、系统散热方案的能力边界。4.2 我推荐的热协同设计落地流程在多个项目里跑下来我沉淀了一套比较实用的热协同设计流程大概可以分四个阶段。第一阶段是需求冻结前的前期评估。芯片架构团队给出初步的功耗估算和版图规划后散热团队就要介入快速评估功耗密度热点位置、封装形式可行性、系统级别的散热方案空间。这个阶段不要追求精度重点是识别出不可行区域避免后面推倒重来。第二阶段是详细仿真和结构迭代。这时候要搭建完整的从Die到环境的热模型包括封装内部结构、TIM材料特性、散热器或者冷板的详细几何、流体的流动和换热特性。仿真工具一般用Ansys Icepak或者Flotherm这类专门做电子散热的软件网格质量和边界条件的设置非常影响结果准确性。我这边的经验是实测数据校准过的模型才算数没有实测数据支撑的纯仿真结果只能用来做相对比较不能直接用于结论性判断。第三阶段是样品测试和模型校准。样品回来之后一定要做热测试用热电偶或者红外热像仪测Die表面温度分布和仿真结果做对比反过来修正模型参数。芯片封装内部的具体结构很多时候代工厂不会给详细资料所以TIM的性能参数、封装内各层材料的等效热导率都要通过实测去校准。这一步做得扎实后续做系统级设计变化时才敢放心依赖仿真数据。第四阶段是系统级验证和长期稳定性评估。把散热方案装进真实的整机环境里跑高温高湿、温度循环、长时间满载这些可靠性测试。热设计千万别只盯着初始性能长期运行后的性能衰减才是决定产品寿命的关键。这个流程走下来大部分散热问题都能在设计阶段被发现和解决而不是等产品量产了再去市场上承受不良反馈。在赶进度的项目里最忌讳的就是跳过前面阶段直接进开模一旦散热方案在实测中出现问题改模具的周期和费用都非常痛苦。再说几个我踩过的具体坑。一个是芯片规格书里的功耗参数经常偏乐观实际跑业务场景的功耗可能比标称高20%到30%热设计余量这方面宁多勿少。另一个是冷板的流道设计一定要留清洗和排气的考量系统长期运行后微粒沉积和气泡聚集会导致换热性能下降如果没有维护口后期维护成本极高。还有一个容易被忽略的是噪音指标。高功耗芯片的散热方案散热器可以通过增大面积来压热阻但风扇噪音和体积往往是用户更早感知到的限制条件。热、声、体积、成本四者的平衡才是真正的工程功力所在。高功率芯片散热是一项典型的系统工程封装、功耗、系统散热三个维度缺一不可忽视任何一个维度都会在开发后期付出成倍的代价。这几年材料科学和制造工艺的进步确实给散热方案提供了更多选项但基本的热设计逻辑并没有变把每一段热阻看清楚把每一个瓶颈找出来然后用最合适的工程手段去解决它。希望这篇文章能把一些工程实践中的判断思路讲清楚对正在做或者准备做高功率芯片散热方案的朋友们有所启发。
返回列表