TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
! D* }. r5 q; O$ G& w R* m: c. L2 { J( |% T7 U+ L9 ?: H
一、总体分析框架与核心结论
& A# v K: V; h9 x. j' e+ N1.1 分析框架概览
( C u& v) T; ?* Z; Z! q拆分维度3 K$ Q& @; W6 b2 ~" p
' z6 i3 l0 x7 G6 o. R8 ?7 H. x& Z
阶段:, n: c2 f- G; m+ H# ]
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施% m1 h' Z ^( k" `4 U
运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等1 y; L) Y E) |# o# m9 Z% D+ `
区域:# _; L" S9 y9 u3 e7 q2 \/ E9 _4 `
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
& V5 E' g6 Q( ^& c5 n: T% A, s6 H技术方案:1 s: T5 K c* |# Z
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)# b7 i+ R- S! h9 D7 }3 \4 K0 _
Google TPU(v5e/v5p/Trillium 等)
/ \2 L" K! E" X3 v中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU), M! P+ `4 o. Y" ]/ j+ p
算例基准/ C7 f( U3 ~1 j! S7 K# P
, t8 \2 l$ Q7 |' Z p5 G9 x
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
' m4 T( Q$ K/ ]其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
8 t9 D! z v0 w4 p/ N( \5 m0 hPUE 假设约 1.11(高效液冷场景)[1][29]' q! k" ~ v1 `" \
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
6 O9 v4 N3 t) x4 j0 b1 u关键指标5 e* R2 B* v$ \9 O
: C1 Q5 f# {/ H( e% Y6 D$/MW 建设成本(含/不含 IT 硬件)* Z, Y- c5 ]$ }7 ~7 ^$ i5 _
$/kWh 电力成本、L/kWh 水耗
: i* X8 a% F, }( C$/token 或 $/百万 token 的综合成本
3 }) s2 W' Q( U9 ] jToken-per-watt / Joule-per-token 作为能效基准[17][18][26]3 r& H4 l( u& c. o4 Q2 R* r
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)! w. t# C) h, Z0 G) |
1.2 高层结论(供决策快速参考)8 t: Z5 x4 k2 q* w5 i
建设成本:AI 数据中心相对传统云数据中心成本翻倍3 o& f' P9 C3 X) `: p) q
, Q" k) @) \( s: }" w' ^7 J3 h0 a+ C
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
: h! X% N* Z$ ^ X5 v3 M* H5 NAI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。% B6 \: Y6 {+ |( `- f5 E5 h1 s: p
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
, }4 ?, d3 T# m X6 y5 M* h0 s区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区 y! N5 d5 z( v: _. z
0 s7 W9 C% w' {( f2 i/ B7 r
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
8 `% J& ?0 O- y8 P v1 D' w" [美国:$8–12M/MW,400 MW 约 $4.0B[1]
; r1 q" Q' T. h2 G3 M2 p9 G- |欧洲:接近全球平均 $10.7–11.3M/MW[2][41]1 X2 \+ ~7 H0 l9 q& X# S4 [. M7 M8 }
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
+ Q9 N/ \: h3 d& A结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
& I) t4 ?" T d' ~& |0 sOPEX:电价与人工决定区域优势
1 ?8 L) k" T! |/ x; e0 I# s7 m
7 r' I h r6 n% U* U! ?电价(2025–2026 工商业大致区间):- I" q J" ]9 X8 k, T1 H. `* ?0 N8 D
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
8 ]# m7 p7 I" k$ H( L; r美国:工业用电约 $0.085–0.09/kWh[44]- L/ j. k- O3 ]; g
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]- z5 O! \, \: Z
中东/UAE:工业用户 $0.07–0.13/kWh[47]( |3 S: T( D6 \8 ~, l
人工:
# M1 v T. a2 M中国数据中心运维:约 $22k/人/年$ w' {. g$ m( T8 C
美国数据中心运维:约 $120k/人/年[1]9 ?* R0 z" `: T# ~( q) r; j7 X
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
3 j& N1 U9 D+ e; T2 b/ r能耗与每 token 能源成本:能效差异远大于电价差异5 B2 x+ Q& w/ i7 g, K. F
% [' K* m/ b6 D1 h; a' g$ Z1 G
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
( y6 ?3 c- \! q* n4 }大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
( J; ^8 F1 J2 I% i将 token 能耗约化为统一口径:9 F0 J) X+ T* }) G
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:9 F/ n/ e; x' N7 S) m1 @% G
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
6 B9 T# D5 k5 Q; x0 Y0 F" @2 e美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
4 ]' E. N( `# a对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。3 h0 X' h7 T" z" }8 Y4 L
不同芯片方案的核心差异/ `. a9 C) D0 T% x: l3 _
8 `4 g2 m) y2 j! ~NVIDIA Blackwell/B200 & GB200 NVL72:* p6 X6 L9 e# l- H/ ~* M
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。
" K" ]0 {, k3 J2 |2 YGB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。' x; U9 x; C6 b' O1 S
Google TPU v5e/v5p/Trillium:, S1 C0 T5 r9 k4 P, V6 A+ l
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
6 a" Y* Q9 o7 H C" r& b8 s o1 @# b+ `Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
9 \* }' B7 H$ T L) q: |; L. X+ ]华为昇腾 910B:! a7 O! w! \6 H2 V, \. T: d/ M
FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。; o8 T$ I* D2 o" w
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
0 P9 I6 U5 E2 L* p阿里平头哥真武 810E(Zhenwu PPU):3 z2 u* \* @! }$ i/ m9 m
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。# i' K9 P$ I' s" h; X5 e7 `3 ^
结论:
0 o- n% D0 s, h0 M3 o2 {& _! Z4 C% `: x能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。- I) \' v# D+ {7 i2 x
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
( C* @! z) z% J2 l8 n% [对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。7 j- w0 s" D+ _# A; E! M# x
自建 vs 云租的 TCO 与 token 成本
8 y9 K, T: @" m1 g5 X. u- i+ ]. {. [$ K/ c8 |0 L6 f: j
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:- Y5 E" i# R! \. p7 a- z7 p
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
. A' @. Z- Y; ?/ N3 O6 I4 r等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。5 b3 T, \7 N9 v! o& p$ v: M
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
% \3 X- y: n/ |" TToken 成本对比示例(LenovoPress 场景)[28]:( ] M$ |" Z( A# B& Q O: R- p
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token/ T" Z/ @# ]! ?# p6 v* Y' m
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
& f" r" f# M |6 Z0 ]4 `$ T同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
; K9 c: Q! Q2 M& W* sLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
, b0 B! D% A* O结论:2 k" V( J- {6 l, q) k, r
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。, i7 ]" o& L6 q
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
1 ~! U! U. g% ], I# s9 G+ Q. S二、建设期成本分布:区域对比' I8 E9 q' ^% l w, ^) e. C4 i
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
7 e/ T" e. p% P/ v) z [; v9 {1 x, W& u2 ~
2.1 全球/通用结构(以 1 MW 为单位)+ Y# u% u5 X/ D
综合 JLL、ConstructElements 等[2][41][40]:% W9 m! k+ h& D" g4 w# X1 O
2 M1 D! I6 ~, a( L壳体+机电(Shell & Core)& E1 [. H& _) ?, i
" O( ~5 _5 j: K' Q. c
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]6 q& L1 X; b9 ~4 l
其中按成本构成[40]:
/ b( {! s. N% G9 ?8 ]; C" V电力系统(变电、配电、UPS、母线等):40–50%$ W- A2 ^* s) G& h! V( S8 V
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%1 C: R [) ?4 X7 l/ [' h( I
建筑与土地、结构:约 15–20%
& D" A5 b% Y0 e; N其他(消防、安防、楼宇管理等):约 10–15%4 o1 u; O8 L! c* D
IT 内装与 AI 基础设施(不含芯片)1 f2 t5 V3 ^$ w+ C
7 Y- h F4 @! @8 V& f9 C+ p4 u高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。& q4 p% U3 O4 o* G7 X5 |
GPU/加速卡硬件 CAPEX
5 c2 _ C, L- i7 B5 Z
6 D- W) B& e* }% g. O, ^" g; D多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。9 N2 S1 \+ C1 E7 t! w- B
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX* B! S) P* F4 _3 I+ @" Y
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):
5 X8 M' v' d; b- Z* K
( b: U! p0 `/ j+ A! v" \区域 典型建设成本(壳体+机电,$M/MW) 备注6 n9 m/ o0 @4 H0 T* l5 e6 V- u
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
, a( [; c" w, F美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]( H* D# S% j" s5 P) X
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]2 I0 o: z3 R$ m. d% v j
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]2 u: o! `2 `# F# x% L$ s1 D; B
结论:; t3 G+ n% t0 x
* d8 p% x/ n# K% d$ M) `+ v7 z6 Z( }单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。( N+ k9 F! ~, N# a
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。- v# T' j9 W3 {4 d" V8 t
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
* C" x1 b4 ?8 q9 ^) X5 z: ?1 `( V以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
; T! [/ o1 O7 ?4 f: ?7 w3 r
, d# S, W% m6 o( j0 Y假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
) c9 j% m8 }. T9 I9 x/ ZGPU 配置:+ N/ k; Z5 q5 J% \& `2 M6 `
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);3 e0 W& d; |" T
每 rack 成本 ≈ $3.0–3.35M[34][69];8 [- u$ o$ a2 U! [, ~; A2 S
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
7 y! n1 l2 o$ G- z' m/ o' y与不同区域壳体+机电组合:
[6 E9 ]( o. V9 V+ O! L
& Y* ~( c; |" i$ p( X+ o6 [3 Q以中值估算:
h3 p) L) n; n: h) K" n# O
) X; X+ Y3 c0 q# n& C中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B8 p) }7 d1 V5 `0 P# a/ P5 p1 J2 i
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
' L& _ \/ s7 z# M2 ]) N: K欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B3 r; k1 F# K6 J, p
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
5 c& T5 [2 f6 w可见:
4 u E. _9 \% Z$ q; F/ b
1 [$ H) o4 O. E5 |0 |GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
' H8 H% N- v3 n" c( C相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。) B+ o# E( ]6 j
三、运营期成本结构与区域对比* j* `1 B9 A, {. x4 [4 r
3.1 通用 OPEX 结构(高密 AI DC)! Z; D7 p, C l+ o+ Y, Z% o0 ^
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
$ L9 w* ~( ^& w% A! n+ C8 G6 g- T9 S- b5 ?8 x! { p/ q; Z
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。5 B- ~, N1 [9 @, x6 F
冷却与水资源:
" L/ ^' U. \8 I% d9 }能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
7 F9 @; x# J) n# |) Z& k水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
% V- E# A0 ]: }8 T; ~人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。: F& |& [5 X% g. O7 l
托管/物业与维护:( A% f3 W: X' F' D
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];9 A: N6 j1 S5 I- s6 `9 ?) ]
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。9 `+ e. |! O: ~1 a0 @, k. ^& j
3.2 区域差异(以 400MW / 3 年期为例)( k5 ~! }7 v* J: k
使用 ChinaTalk 的电费与人工估算[1]:1 [$ o3 Y: y* h9 [- H) p0 k
& d, L1 I, N8 q. }8 m, U电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:2 Y, ~- @: g) P# U9 L. z7 u' |! C ~
中国:约 $0.06/kWh → 3 年电费 ≈ $350M0 l, ?; o* J! l C# a3 g5 E1 |' o6 y
美国:约 $0.09/kWh → 3 年电费 ≈ $600M
# p I# z9 ]1 x1 ]1 L0 u# ]* Z中东:约 $0.07–0.10/kWh → $400–550M& g3 T# ~5 j6 ^7 i r
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
! P" ^+ P& l' \! Q5 {水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:
* K% M2 J& I4 \# K5 z美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
) u2 q7 t$ e" B% h' Z( ~三年水费级别:
9 \& P9 X4 K8 R5 \: m4 D; Q美国:$40k+
5 _0 |! e/ j! c# L5 K% Y6 x中国:$20k+
2 q. l! o6 D' P% v" j8 j/ P% c u8 c结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
) Y6 U5 y5 C( N5 w/ @人员成本(3 年) – 假设 500 名全职运维:9 I k; P& l- k7 M1 _" O
美国:500 × $120k × 3 = $180M+
( n) N/ T2 |+ r9 z6 A中国:500 × $22k × 3 = $33M+7 Z% Q. r- K$ \9 v2 R0 Y$ x
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
) A5 r' m- l) i整体 OPEX 粗算(3 年) – 400MW 场景下:
' l8 R- S( Z* K+ N7 C: k3 [ ?1 Q, A! M. |7 ^
项目 中国 美国! I9 i r2 k A; v* l7 V, I$ Z! e3 e
电费 $350M $600M" R5 C8 }) L+ v
水费 <$0.05M <$0.05M
4 u0 W. H6 w7 ]人员 $33M $184M) }) v& `; P# c3 W; L, S0 ]
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 1 \ o8 q' q# M) \ T
结论:
0 y, e9 O6 B% o6 U$ e; N8 L# _5 c7 K& d* r# V. `* m! S
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。- Y# ^/ v9 B, C* [1 p% q% u
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
- j7 `7 g/ p: P; A& {四、基于 token 的成本与利润推演8 O+ v' x$ F1 n
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)- }# Y) x. a3 d) u
统一假设:
2 J1 L& D! f/ l" q7 K9 t! V: N# Q$ t+ `' q
典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
; h; \2 K6 h3 U- y2 [& j8 `% Y1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
" \2 {* t% q3 A7 U% T1 百万 token:278 Wh = 0.278 kWh
; Y/ D& b* t [* O7 J9 g' i场景 A:美国电价 $0.30/kWh
& S9 Y3 _$ }, V8 g3 d* N" u电费/百万 token = 0.278 kWh × $0.30/kWh3 g5 m* y" R* U% O& c- D8 E
≈ $0.0834 / 百万 token) @3 B& j% Z5 l; f* o- L4 B# k6 j x
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
: E, T, ^. F& E5 m0 A n电费/百万 token = 0.278 kWh × $0.042
% g# l0 m m" l1 k" i4 G6 [: b, c≈ $0.0117 / 百万 token
$ m/ z6 l! v' ^" L对比当前 API 价格(OpenAI 2026Q1)[62]
! j, n& a* u7 \! o& A以输出侧为主(成本最敏感): ^& e6 f `( q. X
- m8 B: J% b0 B模型 输出价 ($/百万 token)
/ Z2 D' {8 {% m! sGPT‑5.2 $14
3 k d% {* ?" ]8 k0 j+ {GPT‑5.2 Pro $168
# t5 U; R3 H* ?2 t# Y1 nGPT‑4.1 $82 Q+ G" Z* u$ T0 x" R) g
GPT‑4o $10; M! d4 _- o6 S. F# p
GPT‑4o mini $0.60' l( u" c. v. K+ w% ?" K' T
则:
2 V1 F8 Q. R. \7 N1 A' A7 T8 m' \. K U# w% m
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。4 G8 n5 S4 I2 L# C& s, P7 J) N; a
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
3 a1 x( T# d6 A; I8 K相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
! n; L7 z# X- @7 |" h7 l2 C结论:( }6 R4 ^* G, y
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。; R$ b, a e& z/ t
1 r+ ~; _" ?1 }2 z, N
4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
x d& ?7 v8 i5 h以 LenovoPress 的 8×H100 Config A 为例[28]:$ H7 n4 \% Q9 Q- Y( I" b( y2 T" n
2 l* V) t0 V, w% u O& \- J/ H% C3 y5 年摊销下,8×H100 本地推理 70B 模型:
; ^0 S! d0 j( }' r9 d1 J! b小时综合成本(CapEx摊销+Opex):$12.08/h1 h% g- D4 `- I0 A0 R: T; A
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens5 i R( }) t0 k+ O
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
" M0 B. K5 M# e7 Z4 y电费在其中的占比:. ?/ F# I# z2 q1 ]' E9 K$ v
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]
2 Y# U# ]7 w; S, S) p. d电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token0 i' C& o, L/ ^% ^( z x6 t
电费占 总 token 成本 ~7% 左右。
, @' [& t: W' j若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
; l3 Y$ |$ ?% K* j5 f若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。
, X/ W R4 O+ r) E4 F5 |" ]& g2 i) X
因此:
& C) {7 v3 r s1 S% ?: ]$ x
( x3 P# ^+ w) C在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
1 A( ?. S) p3 }* d; t在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。- |& S5 N4 T. ?6 F! F% q# N2 c& L
五、不同芯片方案的建设与运营成本对比
% @9 D+ F9 U3 }) U# c2 I/ }! M, S5.1 NVIDIA 方案(H100/H200/B200/GB200), j( C5 L6 i* ?
CAPEX:
+ u) p4 E& b5 Z+ Y7 v6 Y2 ]" w2 J( Q9 f Q- b& s
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。7 t3 B# R A- f1 ]- Y7 S8 G
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。5 y% j8 f; l7 {" |
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。5 C5 N) ?2 M# g2 x6 Z# I0 n) p
GB200 NVL72:; L; g, c; ?) F0 h( K# a; G
每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
8 w5 S) u9 s; E- P冷却系统每 rack 额外 $50–56k[35]。) K) D- J4 @( J4 ?
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
1 ]% P4 M$ k0 d0 x; [( n/ |OPEX & 能效:
( k) g8 K! A( @$ k# V* C9 e9 c* w9 K" ^2 N a6 R! b4 D
单 GPU 功耗: n: Q5 P$ m% L6 L0 }, r
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。. K- s _3 b$ ^1 I. I% i& g7 S1 e3 S
H200:功耗类似或稍高,但性能/W 提升[9][10]。( A4 Y+ {( o/ a4 f! G; g
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。7 r6 O& h5 \) {" }% k
Token 性能:9 J) V W: b+ x# ?
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。0 y4 d% R9 d( u' Q; A
NVIDIA 的优势:0 q' Z) `7 y1 _
" @( c$ z5 {; I8 I( ` y6 n, _
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。7 t( s4 ]5 @1 h
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
0 @; i5 V6 j/ @3 N- @0 c7 D5.2 Google TPU 方案
5 G" e: `7 d4 k% ^CAPEX:" J4 i0 o3 }& _% s* y5 V4 w
5 n/ J) l" |6 B0 Q' E单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
7 f' ?/ m+ e- @0 iGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
; e( x! G8 p7 F8 t) z. H3 o i+ l8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。2 p& ]+ _, P5 ~4 V
能效:
! q O# c" S) V V
$ p# _0 U* F- M8 H# g- ZTPU v5e vs H100:
3 K( `( ?7 U8 o- O2 `7 g同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
6 h# J" p! X. o4 a测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。( {) X) h5 I3 C$ `: f
新一代 Trillium/TPU v7:& q1 w( g9 C. K# C; I" a; K9 ?& c
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。: }. G: @1 O. ]0 S4 f; u- B' G
Google 方案的特点:. g o9 l% S0 z) g
; B( Y- ?( a# n. m+ _6 w! ^自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;2 v. U6 @. u* {( a- k
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
) H0 C/ k# T$ t/ G4 T/ B" i5.3 华为昇腾 910B / 910C 方案/ j% m& {) V2 U0 Q8 X; r' j( D$ _
CAPEX:; U& i1 j! `8 y ]& C8 C# l7 H
! L4 w" P& U" Q3 O% W/ x5 X单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。1 Z3 i( U+ j$ k6 q* x" B
与 A100 对比: T6 ?3 f% O* ?$ n/ o+ ^
FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
: u- L+ [8 H+ b' a0 H5 E市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
7 n1 D' ^. c. q6 Z7 r使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
, q* ^$ Z) Z, u G9 T1 V# TOPEX & 能效:
2 f* f* l* j& `* i4 t! h$ m' X2 y+ h; Q; J/ ^! T
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
1 I" Z6 ^. W6 M/ F2 f部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。( S1 b; b8 \' x) j: w; O& E+ O; @
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
# e8 Z! \. O4 [1 s. i. w" ]5.4 平头哥真武 810E(PPU)方案6 b4 u1 i, J# o4 @
CAPEX:: o7 E& n1 v d+ f
( Z1 ~+ t L, Z$ d, `技术参数:/ o' B1 p6 V _2 ]5 a. m
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
$ u( r, p- y- d7 l" Y, u性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
) z& n1 p: |5 e" x价格:- K% T4 \' r9 _/ O* b
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
/ T$ ?' B, T9 _5 a3 U结合国内报道:
2 {& n/ Z& ]7 q4 [$ c7 l2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
) t9 P6 W- H. \数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
- D( m& f$ [4 d+ L2 \ DOPEX & 能效:/ U+ `* }" {: h/ g' `
$ ^3 J$ J7 s) B: F1 N
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
( U0 F2 L; p* E n4 e在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
; l0 U) j" d2 o% q9 E! `. P. K六、综合比较与策略建议
4 s% h. O* F- V9 h3 r5 B" r' v/ M6.1 区域维度:在哪里建 AI 数据中心?
! f4 V% c3 S; K/ k2 |; Q6 ?1 n, m0 u% G纯经济性(TCO/tokens)排序(假设无政策/合规约束):' R9 H8 ~& W6 s, w( w
2 v6 D$ o9 F5 H8 d3 G7 H6 ~3 j4 N6 T+ P中国西部/北部(电价低、人力低、建设成本低)
( s( x, C0 w. N( L中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持). |% `% F3 z! l% T, E+ d$ A- h
美国电价低但人工高;东海岸/加州电价上涨压力大
, S. v! g0 ~; O; K1 k2 U! g欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
+ s: C+ d) ^: P5 z若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
8 ^6 K+ r4 N( a# z
! H$ i7 n, k0 u5 i0 q V5 C纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;/ `- f# _& y' R. L4 z1 { Z4 t
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;/ w% A/ `. y3 C- M; c
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。; K; ]" v' o- X0 {5 C! h
6.2 技术栈维度:选哪家芯片/云栈?
, m; |! |$ X, i& e若目标是全球最优 tokens/$ 且不受出口管制:6 G6 `' i3 b" A F
2 b' ?9 a+ A8 s9 ^
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
3 H' C) S7 s7 W# u v) D9 F若在美国/欧洲,能自由采购 NVIDIA:
/ X4 s3 T1 y* K
) R7 B# C# k9 j# _短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
3 W$ ] ] l7 O2 {4 W) ~- L5 |成熟的软件栈与生态,极高的 tokens/s/GPU;' ^6 }' ^) z- p# m( _
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;6 M% x' \) k- ?2 n; y
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
" T. O- k: H! [- D3 {* g若在中国或存在出口管制约束:
. W1 a' ~$ N" H$ T
8 d6 Z0 J ~( U2 I4 H4 O昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
/ E# M9 y- u' M& f8 ~性能上已能覆盖大部分 GPT‑4 类推理需求;% s8 x) W& r( H+ f( l
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;$ b2 ~+ A- P& G: j6 e$ O- j
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;3 C7 W9 e+ I7 g7 e
建议配合:+ v0 K' i' b2 W, T$ b2 I8 }3 z- F! H# N
高效液冷(PUE~1.1)、3 @, t' `+ t0 A# Y, B& Q; r! a
大 batch、路由(浅层任务走小模型/低成本芯片)、
9 N [# R9 t/ B1 c6 i. m/ [7 i强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
- g; I: z+ u$ }5 {长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
& _$ h4 b# O" U3 e5 N# i& \7 t! @3 p: \
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
; `' P: |- \% a& r1 [# R) n这意味着:
; m6 U9 o- x; i7 a2 C优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);) F1 R O1 C0 N$ }. [5 f
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。' P2 k7 K( x$ w- D) t% F' C$ L1 c
6.3 针对你关心的具体问题的简要回答
. A h6 l; l& u8 J2 L/ t: o5 ^AI 数据中心建设 vs 运营成本的大体比例?' c; r; D; R5 H
) u0 O5 @6 ]. [, E4 N6 U
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。9 T' o3 Z1 C8 ^4 e6 _* \4 D
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。6 v8 [8 w1 n9 t$ `$ h" T* o5 B/ Z
中国、美国、欧洲、中东的成本结构区别? W% d7 p! E: |2 }) V9 [0 k
( t: @) L6 f1 A' x3 _- ^1 x7 v
建设期:
; E+ ?7 Y" [( Y i6 ?) s" O中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。! n1 u+ k5 I9 g. q& n" W: q& i. o
运营期:
$ @0 o+ W9 G! }9 W* {' ]1 c7 L电价:中东 ≈ 中国西部 < 美国平均 < 欧洲4 D; y" p7 O1 V* N7 J
人工:中 国 ≪ 美 欧,中东居中。
( x l6 d% a P+ q% A7 [$ g# B- ]在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?6 c4 ^5 e/ _7 J" z( l' q0 ~9 Y
2 J t3 U6 V$ H4 M) u! s: R对于典型 1 J/token 推理负载:. D4 j- Z9 W3 H' s
美国 $0.30/kWh:电费约 $0.083/M token* W4 U% h' M1 l$ q1 G# U, r" o
中国 0.3 元/kWh:电费约 $0.012/M token
0 R/ H3 Q& W" h/ v; d对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。4 \" z: s4 _8 }/ v" I7 C! A+ N
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?# q* |. y7 f8 `+ Z% @( Q* c
& B% [, a4 M, F4 f
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;4 U4 U! }6 E C1 k5 e
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
@3 a+ A; q$ d, L( r7 M中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|