设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 765|回复: 10
打印 上一主题 下一主题

[科技前沿] 华为韬定律芯片是如何降低功耗的?

[复制链接]
  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    跳转到指定楼层
    楼主
     楼主| 发表于 2026-9-11 07:00:51 | 只看该作者 |只看大图 回帖奖励 |倒序浏览 |阅读模式
    本帖最后由 可梦之 于 2026-9-11 07:35 编辑 7 L6 }9 w2 H' H" @

    ' W  i: Z" }+ l华为推出韬定律后,大家(包括我)最关心的一个疑问是:把两个芯片面对面放在一起,功耗和散热怎么办? # ^' j/ X' _0 Q$ k8 i* G: S( i& Q' P
    # R# u( G  [1 s! Q
    最近,何庭波发表了第二版韬定律的论文回应了这个问题。经过麒麟2026(内部名称,对外是麒麟9050 Pro)芯片验证,韬定律芯片不仅仅没变热,还变冷了。) q6 j: Z0 j; h- U3 S
    4 ?  S& i) S( v+ j/ z) |( x
    这个结论得到了广泛的媒体报道,但还是有点反直觉的。华为到底是怎么做到芯片功耗的1+1<1,抱着这样的疑问,我把论文原文拜读了一下(https://chinaxiv.org/abs/202609.00031)。  ?, Z! U" X6 ?, a

    . b5 s* y( K! u! Y: e论文报告芯片密度提升了55%,与此同时功耗降低了66%。非常亮眼的数据。
    4 ?, |8 M9 o8 v% J2 S! r
    - E9 Z$ J6 J6 w9 O主要的阐述逻辑是:功耗的大头不是计算,而是数据传输。韬定律,或者具体来说,逻辑折叠缩短了芯片连线,从而降低了功耗。- r) e, N, n4 D  t

    # t9 k, v& G; {2 R( `这是讲得通的,但我还是有疑问,逻辑折叠能把连线缩短多少,单靠这个能降低66%的功耗?细看之下,逻辑折叠平均降低了20%的金属走线长度,关键路径下能降低70%,在时钟网络上效果更好,平均降低28%,而且将clock buffer降低了一多半。数据非常炸裂,但是貌似不足以降低这么多功耗吧。
    , U2 M& |4 l  [/ Y+ U! n/ x
      [+ E& a9 ~/ M解开我困惑的是第四章,这里提出两个测试方法:等效性能模式(iso-performance)和满血模式(full throttle)。前者降低芯片电压,算力和前代的麒麟9030 Pro保持持平。而前文公式1可见功耗和电压的平方成正比。将电压降低一半,性能就能降低到四分之一。这个才应该是功耗降低的首席功臣。( }- o; ?3 ~/ d8 O

    ) W- b; b+ h) S# r) L文中图1信息量相当密集,让我们来仔细看一下。
    8 R8 ?5 I  v4 ~5 f  t7 d$ X) ]
    ( N9 k: s: B7 Z1 m3 {
    . y' E4 H$ }, l8 R6 ?3 x' ^/ P+ ~0 R. T2 h0 E
    首先,66%的数据是NPU在等效模式下的数据,其它部分数据为:GPU 58%,CPU:41%和23%(不同测试集),DSP:25%(2026)。满血版数据则为:NPU:+37%,GPU:+20%,CPU:+11%/+14%。选择最好的数据放是写论文的基操。# {' f" A8 s' ^  h' x
    0 J: o( l5 I4 c  [$ n9 r
    其次,看NPU是如何节省66%的。相比9030,芯片最高频率从1.2G降低到1.1G,满血电压从0.85降低到0.70,根据公式1,大致估算同样设计功耗降低到(0.7/0.85)^2*(1.1/1.2)=62%。等效模式下频率从1.2G降低到0.442G,电压从0.85降低到了0.55V,根据公式1估算功耗降低到(0.55/0.85)^2*(0.442/1.2)=15%。当然,公式1只是数据传输的功耗而非整体的功耗。但也可以看出电压对功耗的影响甚大。 & o- H, E0 r. G- c, }

    9 a' g' l4 V, J3 k+ m为什么等效模式下电压/频率能降低这么多?关键在于性能从29TOPS增加到70TOPS。在频率降低的情况下,这一性能提升基本是更多计算单元造成的。简单估算计算单元增加了70/29*1.2/1.1=2.63倍。如果工艺和晶体管密度类似,那么芯片面积也增加到2.63倍。逻辑折叠理想情况下能让面积减半(NPU中大量重复计算单元,还是比较容易均分到上下两个die的),这样面积增加到1.31倍。我们看图中数据,NPU的投影面积增加为1.27倍,这里应该是逻辑折叠起了作用,走线变短可以进一步提升密度,当然不排除工艺进步因素。
    5 Q- L: q$ d0 j* X( x' K. ~" q! R3 _/ x7 P) w. u
    在满血模式下,估算功耗是0.62*2.63=1.63,但实测数据是1.37,这个差距剔除模型误差因素,主要或部分应该是逻辑折叠带来的。在等效模型下,估算功耗是0.15*2.63=0.39,和文中0.34更接近些。( f0 |2 t  X" w+ @3 y2 V! f
    4 U" @/ R' H4 Y0 d3 u
    因为干活的多了,所以每个NPU计算单元可以算慢点。等效模式下可以慢1.2/0.442=2.71倍,和上面数据是吻合的。我猜另外一个降低频率的因素是时延,一般来说电压降低,时延会增加。时钟周期必须拉长,否则setup违例芯片就乱套了。但不好简单估算这个关系。/ E  d2 D, h' m  O) u5 J
    3 {4 @; v0 B+ p1 Q) x7 f
    散热更多考虑功耗密度,因为NPU投影面积增大为1.27倍,功耗密度相比更好更漂亮。等效模式下降低到27%,满血模式只增加7%。: ]) F8 @6 \2 @) g% f' Z
    + g0 M" [, F$ S# u& s
    其它模块例如GPU、CPU可以类似分析。GPU性能从61提升到86.9,芯片面积降低到96%;CPU性能从1700/1854到2005/2084,面积降低到78%。CPU不好折叠,最差情况下功耗密度增加46%。DSP面积降低到60%,功耗密度增加24%,但麒麟2027会降低到97%。; p5 S7 w6 B" S
      s4 E% t+ N( J$ y
    芯片散热要考虑最差的满血模式。论文指出,这里功耗密度是上下两层die的数据,每一层的功耗密度会更低。而让芯片不工作的是晶体管的温度,所以问题不大。另外他们设计的时候特意将发热单元放在更容易散热的地方。另外逻辑折叠让走线变短,芯片面积减小,也腾出更多空间用于散热。下层的die可能会比上层的高个几度,但下面也更容易散热还好。
    : h' d0 n& R' |, J% `, r2 g& |; ^7 O2 ?* O% z
    至此,我的问题得到了答案:逻辑折叠使得可以制造更多的计算单元,在等性能模式下,降低计算单元的电压可以大幅度降低功耗,逻辑折叠缩短了走线进一步降低功耗。综合因素使得麒麟2026变得更凉了。这一策略在NPU/GPU等并发好的模块效果非常明显,在GPU/DSP等上面则稍微逊色一些。
    1 X+ i5 {6 c3 r6 }
    * T( b4 B/ w- ?& s! Y- u通过降低电压降低功耗不是逻辑折叠的专属,过去几十年我们把电压从几伏降低到现在零点几伏,否则芯片早把自己烧坏了。但阈值电压是有极限的,不确定还能挖出多少潜力。但是逻辑折叠,使得工艺密度不增加的情况下能够制造更多的计算单元,殊途同归,也是非常惊艳的。$ ~  U& ^: J  w7 R: d/ G
    . J0 c7 a/ q7 L* p$ R
    5 O" r9 W" d" r* x6 d
    最后说一下,逻辑折叠的潜能还远远没有挖掘出来。华为把Hybrid Bonding数量提升到五千万,并计划进一步提升到两个亿。但是只用到了10-15%传输信号(其它用于冗余还是power之类的?)。文中也提到了现在设计还是很依赖工程师手动做优化。后续要挖掘更多潜能,对EDA的需求会更加急迫。有了得力的工具,逻辑折叠的潜能才能完全释放出来,让华为下一代芯片变得更凉,更酷。
    * J$ k: {$ C4 s. D/ f' e, d& R* _8 d
    我辈当自强!
    * N- t1 R* g. v( T% d0 A$ M2 T$ i6 N3 ^9 A& F8 l' k
    ) W2 Y: z+ d7 y$ I, z8 l
    ' ?/ q$ N" s2 V5 H$ l8 d
    ! {1 V3 _9 n5 f1 \
    2 ]$ W0 i: s: I1 C3 c' ]" X* @; F

    ( R1 ]% J' u$ \; w- J' f

    tau_fig1.jpg (207.37 KB, 下载次数: 66)

    tau_fig1.jpg

    评分

    参与人数 9爱元 +84 收起 理由
    helloworld + 10
    雷达 + 10 谢谢分享
    黑洞的颜色 + 10
    testjhy + 10
    唐家山 + 4

    查看全部评分

  • TA的每日心情
    开心
    2016-2-18 04:19
  • 签到天数: 1 天

    [LV.1]炼气

    沙发
    发表于 2026-9-11 12:02:22 | 只看该作者
    今天偶然让AI对比了一下骁龙8E5与麒麟9030,才发现其实麒麟芯片落后很多的。! H" j2 j9 h8 e& V+ j
    但愿9050pro能赶上来。

    评分

    参与人数 1爱元 +10 收起 理由
    helloworld + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    板凳
     楼主| 发表于 2026-9-11 12:26:57 | 只看该作者
    隧道 发表于 2026-9-11 12:02
    8 E$ K+ r1 [$ g  R" L1 @9 B9 Q今天偶然让AI对比了一下骁龙8E5与麒麟9030,才发现其实麒麟芯片落后很多的。0 ^) c; w/ I# ^
    但愿9050pro能赶上来。 ...
    0 y5 w: i( `' d& i; g
    制造差距摆着呢。一个台积电3nm,一个可能是中芯国际的N+3,大概介于台积电的7nm到5nm之间。

    评分

    参与人数 1爱元 +10 收起 理由
    helloworld + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    地板
    发表于 2026-9-11 15:05:04 | 只看该作者
    好文!还在消化中。$ D' b# J' `* D6 P0 s  ~7 [, b6 S9 S
    ! i0 x  t& h; X  j2 G, K
    可以“盗版”到观网风闻吗?会著名“原作者可梦之”。  {, Y+ T) h# A" i0 S$ o4 x
    & r5 D; E! k- K+ w
    对了,第一个图转不出来。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    5#
     楼主| 发表于 2026-9-11 15:37:39 | 只看该作者
    晨枫 发表于 2026-9-11 15:052 {3 o. Z! F; Q# |5 l; Z
    好文!还在消化中。/ Q9 }! a9 z9 ~* F
    9 ?0 C6 H7 [/ n- p# y
    可以“盗版”到观网风闻吗?会著名“原作者可梦之”。
    + c, L. D% J! m6 H
    可以,多谢。( e, G6 Y9 K# I; `; ~
    4 V0 G1 s" s( o  w6 Q
    图片网址是% B% p2 \' i5 M
    https://pic.imgdd.cc/i/034MdXQk6oElQ3UA3eJ7oQ.jpg) o8 E3 W9 o# m1 Y8 Q

    0 a" n8 E' Y' U, S5 e+ d* z) k如果还是不行,就是论文中的图1,我也是从论文上截下来的。

    点评

    多谢授权!  发表于 2026-9-12 03:12
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    6#
    发表于 2026-9-11 23:48:10 | 只看该作者
    “刚看到新闻报道,感觉就是不靠谱的营销。业界一致都在优化各个层级的时延。几十年前大家就意识到这个问题,我导师20年前就发表论文,讨论基于计算免费,优化数据移动模型下的软件算法。华为不过是把这些打包,起了个好听的名字营销罢了。”$ b' ~. M1 `. E* K! t( t! x0 |
    " }5 E& z2 k6 X7 H
    老弟想不想根据新信息对你上篇“营销罢了”的文章做一个回溯?你这样真正的业内人士对这个事情从“字研”不认可,到可能真是“自研”做出来东西了,的变化对很多不了解底层详细技术但是选择相信华为的“晨大,掌柜等”是一个很好的背景补充。
    ! O: W! _) ]& O# n8 \; C  a
    - l3 J4 Y5 I. ]; F% r9 O期待。。。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2016-2-18 04:19
  • 签到天数: 1 天

    [LV.1]炼气

    7#
    发表于 2026-9-12 14:09:28 | 只看该作者
    可梦之 发表于 2026-9-11 12:260 G6 l" r- j! K
    制造差距摆着呢。一个台积电3nm,一个可能是中芯国际的N+3,大概介于台积电的7nm到5nm之间。 ...

    1 m+ O  Z% k% \$ w9050pro能赶上8E5吗?8E6不敢想。
    / T. O0 i5 P; b: u4 u# J我在麒麟980买完手机之后就用到现在,不再关心芯片了。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    8#
     楼主| 发表于 2026-9-13 01:20:14 | 只看该作者
    隧道 发表于 2026-9-12 14:09
    : E; A. s% R, R7 E1 h9050pro能赶上8E5吗?8E6不敢想。
    7 P, h* a! O8 C7 N& H+ F  l我在麒麟980买完手机之后就用到现在,不再关心芯片了。 ...

    % k! D' J  \3 R) t: k' x7 U( S这个可以找一些测评视频看看吧。芯片性能不等于手机使用体验。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2016-2-18 04:19
  • 签到天数: 1 天

    [LV.1]炼气

    9#
    发表于 2026-9-13 21:52:56 | 只看该作者
    可梦之 发表于 2026-9-13 01:20
    1 {' K* D$ B8 H5 P" b这个可以找一些测评视频看看吧。芯片性能不等于手机使用体验。
    , y) p9 M) z1 ?) o
    今天评测出来了,日常相当于8E3,普通游戏相当于8E4

    点评

    给力: 5.0
    给力: 5
      发表于 2026-9-14 09:45

    评分

    参与人数 1爱元 +10 收起 理由
    helloworld + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-10-2 16:04 , Processed in 0.071801 second(s), 23 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表