TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
4 {* k% i" s- d( n- y, I! p7 L
2 c( ?2 I. d) f& r9 G Z# t6 j一、总体分析框架与核心结论
; N+ r7 T. ^. u+ L7 l" h1.1 分析框架概览! Z0 }! m0 ?5 z) e( a9 [
拆分维度% ~+ c. [- ?; V/ c
( I8 P7 B0 q& L, W7 i. }2 ^5 i阶段:
3 q+ N1 T, R9 B+ k* W建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
1 e8 }) F H8 J2 T& x/ U, J: \运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等) |# v2 T0 S, M, s8 |6 K) j7 c
区域:4 Z1 g _* ?* v& w+ y6 K* S$ N
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
, p+ x) ?, z4 E0 z c! H技术方案:6 L$ D2 o( M/ y; b8 G
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)+ m7 [+ ]3 g% c9 l' o7 N: s
Google TPU(v5e/v5p/Trillium 等)
- u) P9 r" Q+ d中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)* C1 E0 K. S' D
算例基准) X& s( a# B0 f5 n- ^) I2 S
3 `& E) |& ~: S! l5 _& e以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:, @- b7 F7 K4 d/ ^+ ^) o! I. ~' [
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW9 Z" O7 Z( u. ~: j) g7 Y$ {
PUE 假设约 1.11(高效液冷场景)[1][29]
0 H, }3 Z, S4 [* f* V" \时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
' v* O$ \4 ^6 y& Y& @关键指标
7 B& @& w7 M: L. o1 C% k* {% J
1 M4 ^: S5 }' ?& l. h) e6 N" r$/MW 建设成本(含/不含 IT 硬件)* Q% r4 A, o% u' m
$/kWh 电力成本、L/kWh 水耗
0 p# W% C/ G# a, `$/token 或 $/百万 token 的综合成本5 h) f/ g6 @; Q
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]8 P8 I1 P2 K0 B0 R
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)7 w! b6 S, H9 K! D3 G
1.2 高层结论(供决策快速参考)
- G9 J3 S! U9 @% ~2 P9 E( @3 v建设成本:AI 数据中心相对传统云数据中心成本翻倍# V3 T5 C. r5 r3 T3 a% @: T
) c/ ?+ F( ~1 g- c6 Z& ]* W g% @
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。- B- f: g/ R2 _! a0 l2 b
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
7 X6 p" d ]( x, Q+ d1 x按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。- R& O o5 k2 s. ~; {3 n
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区, L3 |* Z" ~/ S/ N8 ?
' d. _- V7 Z. L: P' i8 ~* d: D, x中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
8 x! a: J% s! Z' I美国:$8–12M/MW,400 MW 约 $4.0B[1]
; i5 g* W8 {0 h6 l欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
% O9 d0 B& r" U, ^中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]- a D. \. M2 d
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。: E0 |( N4 Y6 w6 d4 C6 H
OPEX:电价与人工决定区域优势7 d3 b' l! J2 ?: W2 Y& \4 ^
3 g( _$ o- z3 ` E2 C: G' l
电价(2025–2026 工商业大致区间):. J" ?+ D2 D# k7 w: K5 Q
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]- G1 X+ V+ l" D; ?5 O. l1 w- { h2 |4 a
美国:工业用电约 $0.085–0.09/kWh[44]9 f+ e( I3 X" J& m) G% v3 p
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]/ g, l N! E7 Q' B: M; r
中东/UAE:工业用户 $0.07–0.13/kWh[47]
, } `! M! H0 I6 S' s/ s) }# }# W' h人工:
, s* E: ]+ z% g% f2 o中国数据中心运维:约 $22k/人/年4 r9 |7 v' `% g! v$ ^6 C7 Z4 Z
美国数据中心运维:约 $120k/人/年[1]: D$ q. X7 |- ?, S$ f7 L
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。; c L9 S; i& b* B
能耗与每 token 能源成本:能效差异远大于电价差异
, ^8 @! \* }( `( |& g0 y5 D5 a6 E; R* ~7 R
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
' g4 ~1 t( k& `5 q3 V大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
% F1 m% J) `: Q9 f' l将 token 能耗约化为统一口径:
3 o3 p- y! `+ r0 P3 L5 m粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:9 ?+ c/ x8 q# Y" P
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
, P( Z. M% @: \4 X3 |美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token2 g; K8 v r4 ]! }7 G
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。7 h: c5 W6 T, v( m
不同芯片方案的核心差异0 ]1 r: `% H& r) G
( U4 s$ e. ]7 q: O2 QNVIDIA Blackwell/B200 & GB200 NVL72:
& k4 r9 K( Q/ U+ q9 r单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。, G, T# |4 S% r ]6 s+ a
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。8 b1 S9 |5 q9 x) J
Google TPU v5e/v5p/Trillium:
% V. [: t; x# H; xTPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。! Y0 c8 S' }: [9 {( F
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。/ U5 ~. q+ ]1 V2 H9 O
华为昇腾 910B:
" i+ j, ] X; ?+ Z" B8 m0 Z7 _0 d5 T4 WFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。8 ~% p" l) P# H+ ?' r! K5 s; x4 h7 t0 h
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
, l% b+ o0 }" n/ g& s阿里平头哥真武 810E(Zhenwu PPU):
8 f5 g0 J. t' `8 ?8 a3 d$ e/ t96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
- l/ W- M" M2 j6 l' S结论: y- _; |) Y" U! N
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。
& u, B( L# J2 ?* h# ]单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
1 V/ c1 @: |4 ?' B/ c# W对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。2 L2 M- T/ L2 J$ W
自建 vs 云租的 TCO 与 token 成本
" I" T. v# |1 `2 j2 \; c0 E7 b% [. P3 i1 N5 u4 o
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:: J& h- q) f, Q- h: d2 j- e
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
0 D$ _8 h0 J) w( u, ^: G等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。1 G* {8 o& a. o- ~( X
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
) `' B, V- X3 ]5 `1 kToken 成本对比示例(LenovoPress 场景)[28]:
( t! d8 R; H- v. J) t. h6 H9 v8 q# WLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token
6 }. m! \( e" O) M- {, @; ^; P; n8 Rvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
( f! U8 n' y! Z( F- H+ h" t同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。7 w% _9 n/ k# z( y* ~% z; w. Y
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
+ B0 b( n" z) D: s结论:7 j" a. N# ^" i2 w# E- H
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。6 @1 n% x/ G- _2 {( h9 B) P
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。" S; |: _% m" O, b9 v
二、建设期成本分布:区域对比
: F; s$ x, S! R" U( x; N" U, V以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
0 R. O$ f0 G% C" n
- Z0 ]" Q. F+ _& Y/ T2.1 全球/通用结构(以 1 MW 为单位)2 G$ S0 ? O4 u0 Y5 a: v
综合 JLL、ConstructElements 等[2][41][40]:$ K) b! I$ k% V0 h. Z9 e7 S, h( m
& j& @& S8 @* k# D6 Q! G. P; K. e
壳体+机电(Shell & Core)8 F5 _2 q- U; m6 z0 x0 b9 ]
. D5 Q% |: _0 O0 O( c2 b( x- W! z9 w3 s全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]+ i) M) V/ I/ F
其中按成本构成[40]:
3 J8 p( E z9 \2 K# s/ T电力系统(变电、配电、UPS、母线等):40–50%: H0 j8 N/ g8 f9 |
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
6 _( m' \" F6 a" |0 I建筑与土地、结构:约 15–20%. L# y# P1 }1 {# |! O% _; L
其他(消防、安防、楼宇管理等):约 10–15%
: {% N& p, ^1 w1 }' W8 p% k3 m, aIT 内装与 AI 基础设施(不含芯片)
8 t) U1 `$ g# @$ |) \0 `
+ ]7 W Z3 w) g* t4 A; R高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
: u" g, K: V3 N* QGPU/加速卡硬件 CAPEX
8 y( O$ i3 m- M' D7 U7 {' t( s& n: b3 U
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
- n P' E6 y Q) [2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
% b: d% n' I' W5 O4 @5 x7 `结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):4 m {6 [; l0 d& Y
7 \9 c5 Y" k0 z& \区域 典型建设成本(壳体+机电,$M/MW) 备注' _% I( T4 P) a; t
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
" ?4 k. e0 r# W* a# w美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
; a, y/ T, C4 n* o+ |# w9 D欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]/ I4 r* \/ j l: v- Q; y6 F
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
" u$ F$ S* o7 i/ J B( L1 x结论:9 [- J) z: z1 w! {/ S5 s
$ f* \9 ^7 T3 K
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。$ [: c4 N- f+ _- P% Q
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。/ m5 V! e' z. J0 b, z
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)0 k/ C( w# a* e1 \; T- T2 p
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:4 k; N, D# Y2 @* b% r
2 M- t& w7 u/ C3 n7 L. @& ^假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;' l" @% M& C, ^1 g
GPU 配置: h6 P9 v c) }3 y
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);0 }# y- V, r* C+ L$ h# ]# M
每 rack 成本 ≈ $3.0–3.35M[34][69];
5 _$ B. H" m! u1 ~GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
' p5 r: Z5 E) J9 m* @与不同区域壳体+机电组合:4 ?. j" w/ C0 [ l7 o Z1 E
: q" t3 Z1 Y9 C# R0 O5 e9 E% J以中值估算:% d( L. F* m7 f
2 h: s: D i8 a' E% x1 y Q( W, b中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
8 Q7 b) Z! c5 r( k7 u9 O" v1 C美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B* @3 R8 }8 [% I$ w
欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B! @3 y/ q$ i X5 _ ?. u
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
6 q& O$ S8 |# \5 o可见:
7 v$ f1 Y& l; W% b% e! k6 s
1 ^+ G; `8 o& i& _GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。# y- o, ~: Q4 v8 _
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
5 D. H- v) k$ {" ?2 d7 V三、运营期成本结构与区域对比& W( x5 q: K1 T5 d
3.1 通用 OPEX 结构(高密 AI DC)8 t; m& w& t8 Q6 j. F7 ^
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
8 V$ E+ K9 K) g* | h+ D* D" S* V
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。1 O# F" t, W, H7 T$ j
冷却与水资源:
+ h* k5 |9 P/ {. }能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。 f9 z- v# c6 P _0 ^1 g
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。! B# x7 ~; L3 j# X) \
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。% j* F, W! v$ m+ i
托管/物业与维护:. t7 |" \. V$ @% P# O3 u
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
( [( C; W2 g+ {( g硬件维护:LenovoPress 模型中按设备价 12%/年[28]。3 T5 r' C3 T- Q! f- x
3.2 区域差异(以 400MW / 3 年期为例)9 o1 r( Q" S, L1 S& \) D8 q- A+ f
使用 ChinaTalk 的电费与人工估算[1]:/ i4 `9 H6 s* P# u8 i
6 u4 x, f: z2 m& n7 m
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:1 Y. U& K3 H* W R. _
中国:约 $0.06/kWh → 3 年电费 ≈ $350M4 {# p3 ^; J, o8 M# Z3 ~+ j
美国:约 $0.09/kWh → 3 年电费 ≈ $600M+ i: N6 Q% b4 R- X
中东:约 $0.07–0.10/kWh → $400–550M, r, d! N u2 H; A! n1 C
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)) ?3 f! E" J5 ~9 c4 P
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:- K3 e& j5 i7 @; z& |
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
- Y5 Y! f- I+ ~7 I三年水费级别:
( y+ f; Z2 C" {# X3 G! @美国:$40k+6 r7 \1 ^: k% O$ X2 _ {. d
中国:$20k+# R4 x, `# t0 [8 O' r
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。+ I! e6 Z- n& H \/ t3 Q
人员成本(3 年) – 假设 500 名全职运维:6 A' S# m+ x$ s! \
美国:500 × $120k × 3 = $180M+1 h$ @4 R6 ]& s% m
中国:500 × $22k × 3 = $33M+
9 Q0 |" l) V- r$ t# R3 J8 n差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。. Z6 P5 {" E/ T8 }$ }$ B4 N2 b
整体 OPEX 粗算(3 年) – 400MW 场景下:3 u2 W( W# q4 V7 |+ D5 I- Z
6 x7 G8 j6 f) L项目 中国 美国
, B r+ _6 R' E6 L2 r4 F. ]9 p电费 $350M $600M0 n- |; I: v+ [$ p
水费 <$0.05M <$0.05M2 h/ E. b0 }4 ]4 G+ {: t2 H: {
人员 $33M $184M! T9 E8 J2 T, S! f9 M
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 : T' H/ H5 t' v+ L! a( u
结论:
' u% Q9 s) I# s L8 H( R+ y$ g4 S/ Q3 w3 }8 c
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。8 b: {! b6 C" ^& w
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。: H- V0 x( \0 t7 D6 ]6 }. N0 _
四、基于 token 的成本与利润推演- ^, X3 q9 f- B( D' z, [6 y8 d* z
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)$ _" U! a3 a) D
统一假设:2 E6 _* C" ]% t: B x4 o+ z
, d% I9 j, V( Y) M' e: ^1 i典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])1 D: Q% s$ |$ V9 X+ O1 d
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh- e6 y. g" ~" d# ~
1 百万 token:278 Wh = 0.278 kWh
, L2 o0 x0 u) l" {2 h场景 A:美国电价 $0.30/kWh( m; f& r2 C) k2 Z5 a8 p
电费/百万 token = 0.278 kWh × $0.30/kWh0 Q9 T$ }4 P3 I8 V. o7 `' m
≈ $0.0834 / 百万 token8 n& E7 }6 J' D' e
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh7 f. X6 N7 p+ A) s% f2 `7 O+ M4 U
电费/百万 token = 0.278 kWh × $0.042( L6 Q7 Z0 B8 ?) S5 u
≈ $0.0117 / 百万 token
& \7 C. ?- A1 n" S对比当前 API 价格(OpenAI 2026Q1)[62]' s& c( N0 e0 P3 O
以输出侧为主(成本最敏感):
2 l6 m! l$ j! m- G( o! g$ s9 D. w8 a! C: _6 Q. E5 ~9 q% m4 \ B; R8 Y2 t
模型 输出价 ($/百万 token)5 B! V' q) Y F/ p
GPT‑5.2 $14, t9 b% t* s3 }; d* I5 p) R
GPT‑5.2 Pro $168
O1 Y7 ]+ w/ J- dGPT‑4.1 $8
9 T1 q0 {0 j2 l, `3 l. O% bGPT‑4o $10- F$ \, @( _; R9 V: l- C
GPT‑4o mini $0.603 G- R" w1 `. s1 H0 g
则:
# m2 t0 n8 L7 w* M7 b/ T% }9 `1 P7 f8 a8 j ?
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
7 k, [- S2 W, b( a在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
7 b/ I5 ^" ^1 \相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
4 q( K1 W7 ~6 z3 o. J( [- N2 _7 g结论:' U* Q" o2 c5 A' E1 I+ n
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。7 _( Z* R' o% U: n# U
3 t. A- S- p2 e$ i8 l7 C
4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)7 ?0 V6 U5 Y/ B
以 LenovoPress 的 8×H100 Config A 为例[28]:
- Z: A( M7 ^0 U1 B% O {& A# \3 v5 L8 h" E
5 年摊销下,8×H100 本地推理 70B 模型:) |, ~' r+ U0 Q
小时综合成本(CapEx摊销+Opex):$12.08/h! S% `' b8 w& F% t4 }" d' g
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens% n. K5 ^" A: U3 d, Z8 a
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token5 @5 |/ s9 A8 g5 Y9 e, [- |/ w
电费在其中的占比:
" ~1 V- l. W6 o1 R6 c- w2 jOpex 6.37$/h 中电力+冷却约 $0.87/h[28]
$ y7 O3 x" f5 q0 \( Y3 m& t4 `! t7 y! o) F电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
2 c6 X1 g- N- q0 j9 E" b* i5 L电费占 总 token 成本 ~7% 左右。. l* k0 U: [ h4 T4 n$ L0 H
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
1 \6 f/ F' E! L; e/ I. V+ x2 Z若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。4 I7 V9 I* x% p+ h7 s/ r
/ H: R: s+ b9 m" n5 ^* o
因此:9 u+ r5 p9 M, ]5 Q1 h
+ j* z0 }* @/ J; n! b在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
: p, h6 \9 h2 k( |0 |在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
2 f) S% X6 |) g4 c1 b7 I五、不同芯片方案的建设与运营成本对比: [& v% |# C( v0 g
5.1 NVIDIA 方案(H100/H200/B200/GB200)* T+ C4 ~0 @5 c/ g) r% ]
CAPEX:( ]( R( ~( |# c/ h, A' _& s
) n H& T4 \7 ^) f" J0 y+ {H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。0 ^/ g: A7 p+ x+ s" E, k) m
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。& a; P8 R- @' q+ D0 \1 z9 T" P
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
6 c; V) t7 R( H& AGB200 NVL72:
9 z4 k v9 ?0 J0 D每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。$ F D; R% E( i' V5 @! @
冷却系统每 rack 额外 $50–56k[35]。
7 ], m3 P( P0 Q9 ~在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
) F, m/ d6 q4 J5 o5 K XOPEX & 能效:
# `+ F4 p/ L2 i3 C: |8 o A0 _* [$ x; w& |4 B; T% n
单 GPU 功耗:4 T5 O, C( U& w
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
3 N. P6 I3 S) W6 g" aH200:功耗类似或稍高,但性能/W 提升[9][10]。, y: U" Q2 M3 ?+ p; N7 K! b/ i
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。$ M- j& o5 o V! C5 @9 B
Token 性能:
/ C. V# I6 G9 s6 W6 SB200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。: _# j0 _; Z2 O8 \% k
NVIDIA 的优势:5 d4 c2 t9 C, N! ~& p$ ^
* A, M. O+ N' T! }2 T软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。+ m* A: {/ P2 C* L" ~0 V W1 `
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。' L9 e- n' h6 }2 k5 M! `& O% o1 T h
5.2 Google TPU 方案9 u* v6 Y% e7 N2 k7 T) ^. t. F! }1 `
CAPEX:
) u+ }$ d( r. E. v. n; h" H9 ?# o! w3 W" ]5 P' ~6 c
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。! u& b/ u2 i0 Q, @' E( o
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
* z3 h) b1 D5 y9 ^) n6 B; j+ S8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。& A3 n2 Q G& v( E0 [6 Q3 S
能效: ]$ R* H& V0 A1 [" h7 X; v5 z
8 N8 T% c0 e8 I- H, ETPU v5e vs H100:7 a, p5 H1 c. G( P
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。' ]5 _ ?$ ?; {6 @: S8 i: V( } |
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。. v! `3 W0 e* v" a0 e% O3 T
新一代 Trillium/TPU v7:: j6 f0 E0 x' W8 c
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
( T2 Y5 J8 n- d! r+ U, A) pGoogle 方案的特点:
U0 S$ T6 b: s F9 s* b% l% G6 m
: f! f) X, `- ^9 l |自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;0 j3 d7 w' @5 Q
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
( c2 |# r/ e4 a/ j0 ~/ r" A5.3 华为昇腾 910B / 910C 方案4 o( ^- w; Y4 M/ G" ^, w0 w3 B
CAPEX:
, W& [ ]$ M# ~. M" A6 F2 |) ~
& c4 r# y0 C9 b' a$ v) w3 _+ P; h: r4 _单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。
: z: g' n j2 t0 K3 B与 A100 对比:
% N) l, q) K }+ AFP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
& w: J0 b) B$ _- g9 ]市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。) y, N3 c+ B1 }( ^1 w/ }
使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。1 t* X5 Y6 F5 k" X0 p+ z2 N& J5 H
OPEX & 能效:
6 O) b( E- f$ x8 W8 o( `* ~+ N+ k( X) M$ _
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
2 R" X% W& O; l% g5 n+ u部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。6 ~1 N# N0 Z6 C3 t, O
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
8 ^( B; b9 H9 M$ a0 y5.4 平头哥真武 810E(PPU)方案' B1 Z$ W1 n; A
CAPEX:
8 w) i- Z3 O9 Q8 t3 g# c( b7 \; T% k6 g5 i/ \* M7 h$ d# N
技术参数:# m+ v8 K, v q- D6 k
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
' G0 c' Z G6 C& J' t3 ~7 s8 N性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
^9 e/ O/ L# o5 u& D. d/ `价格:
& W& i, ~' s2 X% ~未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。; ~* P9 q( ~) o) Q: A, L' r: ]' Y; y
结合国内报道:) f: O+ F- s1 |' Y
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
1 g) R8 D6 Y( @( V6 j数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。: a6 b* O, `3 n8 a% h( \4 P) W
OPEX & 能效:- @4 x' ^) A: S2 h+ Q9 [
6 m9 b4 G% _; g7 W: o$ u) q8 ]400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
. v! O( A7 _; ]# p; O G在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。. A* h3 R" Z8 _3 x
六、综合比较与策略建议9 z: D1 E Q( L, i2 P' A9 @
6.1 区域维度:在哪里建 AI 数据中心?
6 i2 F" d" w7 o& E9 f+ ^纯经济性(TCO/tokens)排序(假设无政策/合规约束):
" R4 V" H# D- D& H
2 C* v j: n' [) [中国西部/北部(电价低、人力低、建设成本低)
A, U) u5 t0 X8 N5 E中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)6 t8 A# c9 Y, o# o" s, T9 [" i
美国电价低但人工高;东海岸/加州电价上涨压力大6 Q9 z3 ]9 ~" u1 H3 B. L/ R% w
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
% ~. x: u1 Z) h6 s若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
2 t9 i& K1 n, E* s" S+ N
! ?$ c% Z* M& ^' x `# B" a, x1 o, k纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
3 m$ c- ^; r- k: K0 ^对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
$ @( I, ~; p+ I7 g但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。. U& k2 T: a! g6 U7 [7 C2 N
6.2 技术栈维度:选哪家芯片/云栈?
. N N- V1 G8 s" y8 Z若目标是全球最优 tokens/$ 且不受出口管制:
" Q( F2 P5 c z+ N- f7 A. i
% T8 H! I- G) d$ [& KGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。* @2 J2 E. B( |+ j7 k( o. j
若在美国/欧洲,能自由采购 NVIDIA:
/ I8 j' T" y& `2 |9 @- x1 h
7 d# L) V- q2 R+ h短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:; [* B9 X( [0 x `" W6 u
成熟的软件栈与生态,极高的 tokens/s/GPU;' \" T8 t: R7 ^9 I
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;. m, \" S9 h- o3 ^* x- T+ I* U$ Y
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
! d. `2 x; D1 A# V0 ?若在中国或存在出口管制约束:) m9 g! z: s% W, C, Q
9 {3 w: R. ~3 F$ L' O% b
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:, @2 r, b9 G' w) q
性能上已能覆盖大部分 GPT‑4 类推理需求;
, e+ |7 E% Q# L+ D, Z3 S- x单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
9 w" H! [& y" P& D8 h( M- M软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
7 q' Y" N3 [' k' D8 D8 }; X建议配合:. O* [' _0 F- b3 r8 T1 W
高效液冷(PUE~1.1)、
' ^$ `+ t. T1 d& J. `) p, y大 batch、路由(浅层任务走小模型/低成本芯片)、
4 t( W9 h- u0 M8 A强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。% [' c8 |4 ^2 a! q8 D( d9 n$ H
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:, C6 C) D% b X" ^) m
5 G& N! Y9 m: B" R8 t
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];3 K4 Z/ R+ s# U" c+ p6 r, u
这意味着:
/ y) l- p4 t# m3 G& i+ \优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);* W* c! U) n% G' v6 k
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
' z2 Q. B6 v- _7 f0 C3 O. l2 J& I6.3 针对你关心的具体问题的简要回答
6 L5 a9 p) C9 U5 ?" v. C: CAI 数据中心建设 vs 运营成本的大体比例?
8 E% ~" c9 {$ h* T+ {2 k' j- P3 d
3 Q4 A$ O2 b0 Z在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
1 A, F. j, G* T ]2 U2 e9 ~9 C, I其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
, e% x7 W( n, K/ c中国、美国、欧洲、中东的成本结构区别?
0 m$ R# V7 Q. H' s8 i! N, ?, r, Z. L9 i" v+ t1 Y
建设期:* v4 H6 R, k5 [ d
中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
, }* C# ~/ O# Y5 `" I G' k运营期:
' a3 o0 {4 f% S" e% t电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
# V8 u2 k% C, W8 H7 a4 g人工:中 国 ≪ 美 欧,中东居中。! j7 P. N1 M5 S8 o e7 L
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
, |+ R$ Z6 p4 H4 H B( o) b7 G0 a$ }5 w1 P. @1 d9 n
对于典型 1 J/token 推理负载:
H, K% C7 _* r# O0 F美国 $0.30/kWh:电费约 $0.083/M token( A# {0 p$ I8 C5 g- ~, @
中国 0.3 元/kWh:电费约 $0.012/M token
2 w0 P: ]( V- W对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。5 G' j/ Y+ s, M, T$ U+ B( G
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?$ x$ D, f" G1 |* v+ ]8 v9 a
* T( [8 W+ @) R& z* M6 i
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;& \, @% Q; `1 ]! l& O& x6 [7 d- y
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
) L4 ~5 A3 S2 G3 A中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|