TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:+ U& _# N0 \( a9 W
! B a% V: H7 y( K3 \一、总体分析框架与核心结论: t9 O2 g0 w Q& w& o3 Z
1.1 分析框架概览% F. m h2 T! |
拆分维度: h) R* y( ^ a& n4 m
: N0 a) R9 }( K) |3 X
阶段:& F7 Q/ D6 d" H g& X# o: z# `8 t
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
0 ^# H; k! j+ I B. |运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等
% W/ k/ f% P- S& c区域:- X/ S: Q9 Q8 U9 c: I/ m' H
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)3 k1 y7 C7 @ \" p7 O- E7 j
技术方案:
/ U) A3 Q9 I: s. K- y) Z7 eNVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
}5 E5 B; p; C0 X/ S. kGoogle TPU(v5e/v5p/Trillium 等)6 c8 j1 |9 E$ @! X5 ?
中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
! w# y% o; {3 X0 t8 l( J. u" T8 z算例基准
& g$ H$ k& v+ F% p# |% l. j- v
b' U7 U- Q$ P, h以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:+ K2 `: \( s$ X0 y' y( J
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
2 M3 V5 t4 o8 G' d) p6 ^$ ZPUE 假设约 1.11(高效液冷场景)[1][29]
% d6 i0 I# k, p' G7 n时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
/ c2 w. m/ F+ p3 P! Q+ r. b' ^关键指标" {& P m B+ i$ X, P
* v3 u) Z# \! G! Z3 T. A$/MW 建设成本(含/不含 IT 硬件)
1 T) L7 G, A1 M Y5 N; G$/kWh 电力成本、L/kWh 水耗- A$ c7 X# o: {! }9 ^* s" j
$/token 或 $/百万 token 的综合成本4 }+ ~0 C, a+ }7 w% ^ y. P
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]/ k- }- V' |9 `& ~7 N# ~
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)1 C( v) ?8 W+ l+ F
1.2 高层结论(供决策快速参考)2 u$ N( W3 `1 H' {8 s- L- E1 ?: L
建设成本:AI 数据中心相对传统云数据中心成本翻倍
9 |& ?4 O% @" j5 O7 z$ A% g
: B( U; Y' e4 E# q/ G' ?传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
7 |( t/ c7 [" I0 i# U5 U4 _AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。 h, _. f! @6 i: l' \
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。4 t! j# R E, H8 {8 ^
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区& u& o. w2 R2 c" F3 b7 G, f
7 W' ?) k. F6 [
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
6 ?. s7 I! Z' ^' B美国:$8–12M/MW,400 MW 约 $4.0B[1]0 a! o/ m( D* H$ h/ ^
欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
& b8 v, ]+ q( i! i5 M中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]/ a- N* B2 g! S& d) j
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
( n3 s" D& d% K- ?; R5 AOPEX:电价与人工决定区域优势+ C" [9 w9 \7 R+ @! k) u7 v
0 j$ _: I- P; f% g" [/ i电价(2025–2026 工商业大致区间):
, p& x T1 C& h7 z. w! ]2 ]中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
# ]2 c6 d( `5 M4 Y! L4 }美国:工业用电约 $0.085–0.09/kWh[44]
& E T- P2 i( @4 B' p# R欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
9 d/ G- Y% a% m! T8 i8 p中东/UAE:工业用户 $0.07–0.13/kWh[47]
$ u. b) z( M$ l3 \人工:
. D% S) I' ]7 B中国数据中心运维:约 $22k/人/年7 Y7 W7 U; t+ d! R3 E8 V4 |
美国数据中心运维:约 $120k/人/年[1], g+ C% u7 u7 z; D5 K9 W: N
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
1 b7 P2 E% z+ q, [( O9 Q/ C能耗与每 token 能源成本:能效差异远大于电价差异9 u ~9 E" m4 u. y% s. _! Y( K9 r+ n6 k+ ]
' U2 r. ^; y& s& y" `6 ]/ }$ A
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。8 ^3 B1 Z) i7 Y& ^& f2 [, w* V- K" O
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
2 A! }% `) `7 o将 token 能耗约化为统一口径:* F+ t# ^+ T: N2 o y( J
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
8 Q0 O3 E; t7 Y6 X中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token7 ]+ @" Y3 r3 r
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
* `0 ^. b+ Q. D0 x/ }对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。' e3 \2 m2 I8 B) _
不同芯片方案的核心差异 V% C! [: \' Q+ Z
9 n( v# j \2 U" A+ m* [
NVIDIA Blackwell/B200 & GB200 NVL72:
& q& F" {0 N6 q3 f. V3 q# h单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。0 m9 Q6 R% v# O
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。- p9 a5 [8 C' s1 C" \* @5 |
Google TPU v5e/v5p/Trillium:- h2 n8 M; W+ u
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
& P( g9 k# N! u9 {, K" vGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。+ @0 N& ?7 C, ~0 p4 Y( n
华为昇腾 910B:
( O! K7 l. ]6 y6 H1 V4 OFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
7 K+ k/ }- R. @9 x" k" j单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。: e8 M8 D( M- N4 {$ P( ~& u% }
阿里平头哥真武 810E(Zhenwu PPU):
1 _/ x( c% s: ], w+ k' e7 o' t96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。! U6 w8 z- K* v0 o
结论:9 ]- P: I7 b. u5 L/ | T9 g
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。/ t. c( V# e3 n* b; e( H1 d+ a; q
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。$ ~* ?% D0 S6 S1 @8 I4 H
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
& c8 b' ~. w S a) G自建 vs 云租的 TCO 与 token 成本
4 b& H* ^1 u, T5 f9 f% n
' Q6 c! E5 g- Q, BLenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
8 R- X6 v! N; Z) e9 M8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
& d# W! N: y) {等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。& ^) o: u5 j( D2 V
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
% g% O; N+ U/ xToken 成本对比示例(LenovoPress 场景)[28]:- }. ^5 v1 i( K( ~9 m. N$ h) M
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token
3 _+ h3 t9 f3 D: j4 x' @vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。* d( l6 }: F" G. r9 X
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
. L9 ?; F$ F& `. ^+ RLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。 O7 ]5 T# i. O( P) ^
结论:1 B7 I) W3 l5 {
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。
7 @) `" s/ w4 N+ T' h* uToken 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
: ?7 X1 H( t+ e+ }- S2 ^二、建设期成本分布:区域对比
. ^9 j' Z8 i3 i以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
; Y2 m8 _; u) v$ s$ Y
2 I/ u3 m: q+ E; X: j- n% I2.1 全球/通用结构(以 1 MW 为单位)' H2 c4 y% K$ k% j
综合 JLL、ConstructElements 等[2][41][40]:
. d; s7 S4 v1 q0 K' D
( {) C: B9 U/ j7 O壳体+机电(Shell & Core)
1 S! }0 B' L2 U$ t( l
9 q# j; A; T1 V- D( @/ d全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
" Q& o! P7 i+ g; d其中按成本构成[40]:; S/ [9 W% x; A
电力系统(变电、配电、UPS、母线等):40–50%
" d5 a" A8 B& H- l9 D# R" X3 i4 {6 g机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%/ E; h1 h# M$ Q% g7 Y' l- v0 c
建筑与土地、结构:约 15–20%7 j4 r+ ?0 i+ `) c
其他(消防、安防、楼宇管理等):约 10–15%/ W* t3 F: g Y' i- C5 U
IT 内装与 AI 基础设施(不含芯片)
8 n5 ?9 c) N; j7 v6 u1 d2 X/ O7 K: R5 H6 X. O. A$ E
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
6 E; V8 m; i0 l! }/ ?7 K3 aGPU/加速卡硬件 CAPEX
/ k- I" h8 C2 j2 w2 ]8 S) w6 q% j/ ?) V$ s' a' k0 n9 s9 Q
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
7 B( \7 H P. s% ]; D; j2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX6 j/ Z4 b# X" f% [
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):9 M$ Q5 S7 x* `' o5 ?4 e
( s3 U4 x @; q' e7 {区域 典型建设成本(壳体+机电,$M/MW) 备注
$ Q1 D( V. v0 t0 w中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
6 R1 ]$ P1 ^$ m! }) C7 k4 ~美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
% ?1 b* q7 m' K o3 M4 ?* F% N欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
4 s* V# P0 w. n" h中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
% { k. g" k1 F4 e结论:
& D: B% j5 C( ^; Q' e
* K, b0 y8 c4 E+ ~3 @/ c4 }7 d+ {/ C单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。2 C/ v( R6 I0 h5 j- m
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。9 q" G+ D2 R+ w; G# @
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
8 V' G3 z% m" G以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
$ p6 y X' }9 I/ A, y! {" |
' e; _ z8 ^+ V假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
1 n" }! ?/ c cGPU 配置:
9 O9 N! C6 v. `/ F/ {有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
8 U3 f& k& x7 j4 n+ n每 rack 成本 ≈ $3.0–3.35M[34][69];0 K( j9 G' x0 j& s* g3 Y: g
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
# n/ G! W: c$ R. R7 ]7 G与不同区域壳体+机电组合:# N& h* x; r. x1 `3 f
* @1 v* F( ~& Q' l
以中值估算:
$ g, m1 m( `2 W. y
( y% T* v* N+ W7 B/ b5 I4 ]4 W( T中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
+ x+ m# N- u/ c. n美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B, j3 ?6 h2 _3 d1 {3 g
欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
4 j! m' m b5 l% x. h* X; j' v中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B; T3 J4 z% h( o# {, p
可见:8 S8 q" y2 t+ }8 \
8 _6 \0 n2 x% K- k$ N' l
GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。8 A: w' ]+ Z& F! O# | d' y( Q h
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。' \8 r" \$ n1 r: D
三、运营期成本结构与区域对比) e9 ]0 a2 e0 v% q0 `" K1 F
3.1 通用 OPEX 结构(高密 AI DC): }# z. M* S& F9 k! k/ `
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
% m6 d7 p- H; b y$ m5 [5 k+ d
( E# `; c! E5 i4 t! I, f电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。
+ h; Y! ^7 D! G5 w4 Y冷却与水资源:0 a. |$ P! w' G
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
$ J- ?4 r8 m5 k b. I) o# R! K水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。- T1 q; |$ a: t2 R; ~
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。) g( k% [- ^7 c; ^- n
托管/物业与维护:) E- w. D" Z3 ~
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
9 m, C i9 b- ^, `/ m2 N硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
5 {4 r) o7 J+ V# P, [3.2 区域差异(以 400MW / 3 年期为例)4 k! h8 W E" ^6 P7 x
使用 ChinaTalk 的电费与人工估算[1]:
% C6 K% C3 l- H5 c8 M9 a/ T% S
8 Q2 A9 b% S x8 b! @8 M2 s0 V电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
# K! K* B c! l9 p中国:约 $0.06/kWh → 3 年电费 ≈ $350M
4 c/ a8 q, u% _# L% S美国:约 $0.09/kWh → 3 年电费 ≈ $600M
' I7 w' O3 F$ q0 X中东:约 $0.07–0.10/kWh → $400–550M% n. Q2 l, J& M% @% X
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势). W/ E' O& B/ M: r5 A5 A: B/ ^
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:" z+ o6 i/ \! m T
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
6 n* f. D7 C. y; ?* R8 |) ^- o三年水费级别:
O' Z6 Q( ^/ a3 z, u" F% m! ~( x美国:$40k+
2 Q* F7 ]; E+ x$ Q) v8 {中国:$20k+
4 d( V2 H$ c2 k/ _7 J结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
1 C& `8 f7 l- Z3 s人员成本(3 年) – 假设 500 名全职运维:
+ ^* m( a4 `" W3 _美国:500 × $120k × 3 = $180M+3 K% I$ Z, Y e- Z$ m1 \
中国:500 × $22k × 3 = $33M+
" P& D7 u, |5 C- ?0 R差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。7 W$ s1 i# l0 |& z0 f
整体 OPEX 粗算(3 年) – 400MW 场景下:
+ `8 F) V# A. w: k7 F8 h: O9 B
1 {* z# ?- q4 m# r项目 中国 美国
2 [( a) _5 U4 v电费 $350M $600M+ ?. U& t2 h0 E" g
水费 <$0.05M <$0.05M; a! k5 ?& X8 D2 q3 K3 Z
人员 $33M $184M
1 {; A# w# [' \! a- i其他维护/托管 同比例估算,地区差异主要体现在人工与地价 2 F1 p4 D1 z+ f9 h* P
结论:
5 u1 N& e! W- C: ~& _# I3 \5 d5 g, h( A# ~* e( A! t
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。/ H6 \! B1 n+ y, j# D1 H
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
* C8 K. i2 l( u3 I! U- L5 _四、基于 token 的成本与利润推演
2 A4 Z" N5 p8 ^: B" F4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
* u, M0 G' v; j5 S统一假设:& A3 b' p. x. ~
8 c' |7 v1 z2 _0 k$ ~典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
) U7 D& a! T8 h* N9 f% z+ m1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
& J6 x& I- ~' F; t8 C4 s3 h1 百万 token:278 Wh = 0.278 kWh
& _( U) N/ U+ Z% {' O9 o: M场景 A:美国电价 $0.30/kWh2 H1 v7 m# }: Y! C
电费/百万 token = 0.278 kWh × $0.30/kWh
* t; j& O) h) S≈ $0.0834 / 百万 token
3 g7 m1 z1 f- |6 d4 r场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh U) \' f! ~/ k9 @( V( Y" W
电费/百万 token = 0.278 kWh × $0.042
. V( u `7 u; w M: L* Z, z≈ $0.0117 / 百万 token
; C! k- y5 j7 U$ p对比当前 API 价格(OpenAI 2026Q1)[62]# q0 G3 e0 w8 q5 M9 B2 K0 t) d
以输出侧为主(成本最敏感):
1 M1 _4 L$ ]3 ^% P, g
; Q9 Q. e% R% j& I e模型 输出价 ($/百万 token)% z, \+ I( u+ Y. a) ^8 E
GPT‑5.2 $14
9 X* _0 a3 q5 N3 ?% `GPT‑5.2 Pro $168
8 N$ m k/ O1 n' W. J; P& U( I8 @5 uGPT‑4.1 $8
2 n- X% ]& E/ DGPT‑4o $10- K1 K7 C Q' r$ {
GPT‑4o mini $0.60
" [- M/ `5 k+ `3 e/ M. o6 j则:# y0 n, Z8 ^7 }' A8 K3 j0 i6 ?
5 @2 ?% x6 ]. {: J
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。* _9 H8 D8 j! r4 I! \& S' j
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
: f& l; y: |$ m/ z6 [, B) Z相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。3 Q# D4 S% ^! f* L, R* s- o
结论:
; w( E0 [" i+ U8 Q) b0 n) y即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。. M* L- I* H& [1 Z) A, M
+ a7 L% |1 |# B3 | ?# i- w. ^4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO). U6 Q4 r. C w, m
以 LenovoPress 的 8×H100 Config A 为例[28]:7 g) H" @# ]- r% V. x4 o
! s4 M: z2 M0 ^- G; M# M5 年摊销下,8×H100 本地推理 70B 模型:
: N- R( M9 R% j* S* M/ _1 X小时综合成本(CapEx摊销+Opex):$12.08/h
$ p! i {) S1 f$ y+ ?吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens
1 D% J6 ?9 y( b- a, u成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
4 ?1 v! u: e: }9 Y电费在其中的占比:
+ p% G5 l3 L3 }6 a7 o" UOpex 6.37$/h 中电力+冷却约 $0.87/h[28]
. y7 c1 b8 K; [% y0 d! A7 Y4 T电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token: o7 I: Y5 f5 p( j% ?
电费占 总 token 成本 ~7% 左右。
7 M7 T+ L/ W+ L2 h2 E若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。+ j1 L% \+ j0 h4 Q4 Z. D
若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。0 O. A: V/ k) O' ~
$ p2 O- ?; t0 ?1 N6 @( X
因此:7 Q. M9 y C% v; v. B% n9 y
" v' B; K3 I9 S2 P+ O0 R- c在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
# \& U4 D9 Q- _! E; e6 K) F在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
. L4 G# Z% S" u0 O. T$ ?1 \- y五、不同芯片方案的建设与运营成本对比5 q& v5 a* \' Z5 w- P. i
5.1 NVIDIA 方案(H100/H200/B200/GB200)
' } S4 C5 M- T K- \CAPEX:1 P9 D+ y. a# B6 E @4 {( i9 I
0 h2 z6 l3 n4 ]H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。0 d: N$ L! ~5 }
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。/ ~; l) K& ?! k" }$ e. M
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。2 B* g2 _* O3 s$ o o
GB200 NVL72:+ T, S4 g: i, W" J
每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
# x5 o; s1 A- T4 ~2 o2 z冷却系统每 rack 额外 $50–56k[35]。
n4 |3 O+ V5 L/ x8 P在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
+ V1 U9 ~/ J1 W V1 \OPEX & 能效:
2 ~4 z. O9 h9 D$ l, v/ U# ^
; Z" E: m" k' q单 GPU 功耗:( r& |* w+ V% I/ M1 U0 f/ \
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。/ G! X9 \) l2 w) e& A
H200:功耗类似或稍高,但性能/W 提升[9][10]。( O8 q3 \' G! U7 Z6 H$ E/ d
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
/ F. ]$ Q3 V6 Y: VToken 性能:( V8 ^7 }. q& W4 E0 s7 a8 s- p' s4 o8 P
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。2 N) U$ Q* S7 a) }. y
NVIDIA 的优势:% _) m& A! D0 Y( {5 {5 Z H; P# q
6 L' r0 U K! Z) R/ z, @9 F软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
+ }1 w! g# F- W: |但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
* D3 Z* f! p' R3 J0 o# d! _" \5.2 Google TPU 方案
; M9 F% X# b6 DCAPEX:
3 P1 O3 E# p+ _6 U
* \ [& ~3 i+ r3 a) K单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
' ~5 J1 A. F1 l+ e0 g! H+ v" ^GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
* }! e- `" N* L; d6 [6 ^: `8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。3 M. q. V' |3 l t* q' I' Y( W v
能效:: W4 o3 U8 T7 F4 V3 j. a5 { {' o
- f7 O! ~, b) ?# G" M$ a
TPU v5e vs H100:
0 W6 j$ {& t* o8 d& \, Z2 J同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
+ w% }$ ~8 A& p: w测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
7 ]. V, g+ T5 T! p* J# R! R# r新一代 Trillium/TPU v7:
* |1 c( T" L( V5 `# H* }能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。. @6 t! v4 V8 I/ D% b% w
Google 方案的特点:- @. B# W( W; `3 Z
' q# H) r5 M) A2 G2 l J1 t
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
* u, X9 h7 o5 g对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
r' p8 I5 t; K. _, d/ E5.3 华为昇腾 910B / 910C 方案9 k2 X$ Z( w) j, ]5 a
CAPEX:" S6 J J' l: V) R7 t! c; D+ Z
# g& F4 G# m6 k# T2 C单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。; d! i9 Z; Q9 [8 Y+ S" V
与 A100 对比:
; Z- f$ j% k* U# P# ?! g$ IFP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。1 [1 f8 s( `% f- m5 d' W" w! a- H
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。# p" e; {6 r7 F+ _
使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
6 F0 i Q, Q( u$ R" ?OPEX & 能效:" P; q9 j. t9 m O s0 \
( \/ L- F4 l- @5 l
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
3 W7 N) q1 R& ?9 F3 w% P4 A( {部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
: p5 g* ?7 x' A( b' D. W在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
( r3 ^2 b" R' C3 H0 h) R! j5.4 平头哥真武 810E(PPU)方案
7 h% o8 ?# R q& FCAPEX:2 k, V0 [1 u q/ U9 A
3 `/ ]2 k* i- z7 f& q9 S技术参数:! }, @' A- N! L3 H+ ~1 o3 @
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。* ?5 y' L" ]; t2 d" E k
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。+ F( F6 b) r$ r5 D. R1 _/ ~ ?( {
价格:
/ Z% I/ v, v& e$ h( }& J5 H未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
Q: m% _( X* S* T6 x8 m结合国内报道:. W' O5 \/ i3 Z
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
4 C5 Z* O! l6 D) Q% ]9 z数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。% A' G/ e- V" S2 f$ x& g, }
OPEX & 能效:
( h1 ]' V8 o+ K. _( |) @. A3 {; o# k
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;- ]8 F+ [0 v, [6 E" {$ a
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。- V7 ~! x8 l- M! ~8 f# ~* l
六、综合比较与策略建议& z# i# G& ]' I9 Y, o: {1 D( q" e
6.1 区域维度:在哪里建 AI 数据中心?7 a+ Z- n R7 u' n
纯经济性(TCO/tokens)排序(假设无政策/合规约束):/ s! l$ W! g) B! O& \6 W" p) E0 {
+ |% A3 ^$ ?, D6 e5 J中国西部/北部(电价低、人力低、建设成本低)
% \7 V3 n; ~+ m5 g4 j5 I中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)5 N1 b$ M3 `! v( Y
美国电价低但人工高;东海岸/加州电价上涨压力大 ~( K( v: d, u
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求# n1 C' p* I5 f. z
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:" g0 c- z6 s% x0 N7 P- c* U
$ t0 b9 v3 ]% P2 k5 Z$ q纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;' ]$ x2 `. a/ S* d
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;8 P) x0 d: Z! P" q" {9 G* W1 S
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。 J# w5 C6 Q9 q8 X3 x
6.2 技术栈维度:选哪家芯片/云栈?7 i7 A6 x) e! y! I' ~$ l: F
若目标是全球最优 tokens/$ 且不受出口管制:% s+ J/ A, l9 B( j
; p3 y4 @3 |& f* k" W3 _Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。& F% R) ?3 w; V5 q
若在美国/欧洲,能自由采购 NVIDIA:* }! q7 t- z/ {' ?
. W7 z5 @0 w6 v8 O5 a短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
8 N: }: B! b: Y5 n成熟的软件栈与生态,极高的 tokens/s/GPU;
$ R H, S2 v0 H3 x在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
1 L) X _% |6 J$ X但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
! N5 G' p+ g" H% t1 T4 v. E6 R( [若在中国或存在出口管制约束:
! Z- \ j2 t. I* C& [. ]6 n8 d' x! Z2 q' u; y
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
2 `2 d* Q) X$ ^9 j! |性能上已能覆盖大部分 GPT‑4 类推理需求;
$ ^1 j( a. m; j" y) j. q单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;( i- D5 w5 ?$ o5 ]. r
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;$ [1 t; v- K/ A: W
建议配合:) d% w. O6 U- ^, A, y
高效液冷(PUE~1.1)、
( p' Q# [- ]* G) w2 I; F大 batch、路由(浅层任务走小模型/低成本芯片)、& s; P+ [; a! ~ F
强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
" x# ~ Q2 H7 G6 y7 x. k! |长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:! z' b1 S, L( h* a5 `8 M. |
% u! k. k) |& T# v
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];" K8 W! S, V# @# j. m
这意味着:% c/ }; X4 K. ^" ]4 ~: s: O
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
) j$ E; G1 A" I7 j: `8 u精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
) y$ ?# M8 S9 @3 ~8 @7 f6.3 针对你关心的具体问题的简要回答
6 v3 [0 W8 N& d# [( S' j4 PAI 数据中心建设 vs 运营成本的大体比例?/ D4 u9 A0 o$ c5 p3 `9 ]
# H6 n2 q4 z2 b' J0 {" Q
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
' n. C5 F7 l5 w其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
) K8 c% U; _# F$ z5 g中国、美国、欧洲、中东的成本结构区别?8 M( u2 e! \0 Y1 x8 M
9 O- E' S& m5 d& i5 Q+ x建设期:8 C& ^+ O( P4 z5 i4 f- Q
中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
% Z: h3 H" Q5 L* e- t/ |' K$ P运营期:
. f+ i: d- v" D3 L- X电价:中东 ≈ 中国西部 < 美国平均 < 欧洲- `- W+ ~9 F2 Y, w: V
人工:中 国 ≪ 美 欧,中东居中。+ U4 S' r- W/ {& R4 D. O* ~
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?4 z& g; S+ U2 s! w6 U7 F$ J
: E; f6 V& c5 |8 E" {对于典型 1 J/token 推理负载:; C% K/ T' p! n7 z( Z( ?! R4 K
美国 $0.30/kWh:电费约 $0.083/M token9 ~4 T) |5 k$ A, n
中国 0.3 元/kWh:电费约 $0.012/M token. k0 N; D% N; M' S
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。, O0 x/ m* K6 h' o4 M8 G
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
& G& o+ u* n1 }0 J8 Y! e1 I
, Y# y) K0 l! k o* S4 ]在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优; j0 b) \& d3 y& {; N
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;% s2 W0 l3 o3 Z1 H0 r m- u) N
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|