TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
0 j7 W0 i- @2 E% |
8 h$ [& ^& B4 z' A/ E1 t一、总体分析框架与核心结论
# a3 S5 U4 C4 G. j u1 X1.1 分析框架概览% {8 t9 a6 C7 l B2 {6 Q
拆分维度
* | n; e I# M
/ d2 c9 y2 Y* ], s: ?' }阶段:
+ o1 |$ K( O0 w% I! u建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
5 d1 p" A% Z' @. G. k运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等
+ P0 O' o/ n; D) A' P区域:) ^+ r) g, }4 B" \
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)/ T+ G" o) ~8 M$ h3 k: ]+ @
技术方案:- t9 k* U" c( [
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)' x/ w) x/ A7 |4 X7 o4 p; }
Google TPU(v5e/v5p/Trillium 等)
1 Q( g4 s* `: B7 P' j3 J# _中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)7 z1 `/ k: _, h$ G0 d
算例基准
) ~4 T" C1 l! M/ p" X. x+ \* a
6 I& N& C+ j3 W, x+ T以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
) Z# K& }8 w* }2 _其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
6 B: M8 y0 D& J% |5 ~5 CPUE 假设约 1.11(高效液冷场景)[1][29]6 t' Q3 F/ V, T5 ?
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
, Q# a6 }6 i, C关键指标
- U+ j2 y1 C& M- j1 ]% [" w
2 P- _3 A! E# o* O G3 t! ^$/MW 建设成本(含/不含 IT 硬件)5 P' k0 s$ W/ Y% s3 E
$/kWh 电力成本、L/kWh 水耗
4 {& [; `( M0 T, X* t* |$/token 或 $/百万 token 的综合成本6 j7 Y$ j) @, s7 s) i
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]/ m; T" H# \' S0 C2 v3 {
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)7 k [, I% _' ^0 f" N
1.2 高层结论(供决策快速参考)( W0 V0 ^( w8 _3 G& a+ X8 F
建设成本:AI 数据中心相对传统云数据中心成本翻倍
: g' ~7 g" w0 s$ U. A3 o/ s. ^: p1 L( L( @! E q
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。' K8 ]3 J5 Y. J4 L) j% N) b/ F
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
/ _) z3 b2 T- ~- \) Z: }6 H3 C按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
' b1 W" q, K; J( y3 a4 s区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
) D, B3 U% L3 R" s+ ]0 r
$ s; b; P h* y, h4 F6 l: o中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
d$ W5 i. o/ \$ _美国:$8–12M/MW,400 MW 约 $4.0B[1], p' o/ ^! X; V- O. x/ j* V
欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
4 ~5 O3 O* f) l* H1 }6 l中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
: }/ x. Q# y a. N结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。0 _' Y# f. ]! r4 G4 ?
OPEX:电价与人工决定区域优势
' ^" n% e6 h& f( m# ^( N& \: w) U/ A: `" R3 Y6 ^1 {
电价(2025–2026 工商业大致区间):
) p9 \8 J! c P* J3 n1 `中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]: C" h2 G* F! R. g0 {
美国:工业用电约 $0.085–0.09/kWh[44]
6 y5 {. W, B2 Q9 E W+ O5 N- |5 h欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]8 a+ L" f" h5 |
中东/UAE:工业用户 $0.07–0.13/kWh[47]6 ]( k; w8 u& |. E/ X6 T4 y9 X7 [
人工:; X: C8 J/ x+ ]; ?, w
中国数据中心运维:约 $22k/人/年9 p& R9 _/ w4 u5 X+ v7 H
美国数据中心运维:约 $120k/人/年[1]& d' A9 K) N/ R5 d" a4 V
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
0 W+ f- N% \$ q/ O4 @8 t能耗与每 token 能源成本:能效差异远大于电价差异
. s9 ?% L. f) i; x2 W
9 q0 U, @& m/ b6 b: g% s' L3 WIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。/ @$ b5 e- x H
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。& M5 n; w( L8 k9 ?- j5 p
将 token 能耗约化为统一口径:
2 r" A$ ]9 m: C2 k; t粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
3 W# f% r7 v& y1 k) d9 b1 ~中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token, j4 ]! ~! [* J' d
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
4 U+ B7 q2 L! T* v `# R' E4 o4 R对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
+ _0 b: ?5 S! P ^: z: L不同芯片方案的核心差异/ ?5 H7 P8 _4 I: G; e9 I
: G% m- M1 D+ ?7 {NVIDIA Blackwell/B200 & GB200 NVL72:; Y/ f4 [. v, P
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。* E' C* |/ R6 K( {
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。2 r z" @$ t4 D) B. j) O$ C
Google TPU v5e/v5p/Trillium:
3 o8 Z+ R5 d0 B: c: d& U0 U) ?TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。" H6 g! z8 _$ f8 E# e" D b( P7 N
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。* g) q; L. i" D& O2 u3 y9 m
华为昇腾 910B:
" L$ S# I) ~% C7 I" `/ g8 X+ \" T5 ?! oFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
7 t( A: ]% W! a9 y* r0 B单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。& j4 q9 S ~2 W% O5 @+ O
阿里平头哥真武 810E(Zhenwu PPU):
8 i9 a: } [3 H6 h0 Z, Y96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。# {, U h0 x3 m( M# u, x
结论:% ?% z8 H. j# Z# E- Q3 L. Q* _" w
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。7 Q8 x2 d0 [% p/ c! J3 n
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
7 F7 [) y7 }+ v对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。- s7 W; I) I Z7 H. Q
自建 vs 云租的 TCO 与 token 成本
+ Q% t9 F5 V# B5 {# F3 l
6 I% C2 Z) n( `( dLenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
4 V; O D5 b1 j% X3 K/ j) M8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
) p( e; Y1 a4 |* v1 }3 O; l等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。; b) z2 I7 P5 ?1 U7 `7 V# H
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。2 x; E7 ~+ d, ?2 r, I5 ^
Token 成本对比示例(LenovoPress 场景)[28]:7 f- I& {% @# B+ n) G5 j
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token
' n( P, q2 k) Q: dvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。# E1 _* Q; S, Y9 q3 o
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。' i- v: S: o# M$ X7 _! e' X& Y) f
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。/ i- C: e8 \; s7 h7 F0 z
结论:
: v1 ~% Y3 f. o% `. I; A高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。) Q% R& B6 h, _/ L1 m& K
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
; r3 }: h% h6 h: f. ~% u二、建设期成本分布:区域对比
1 @9 u x8 K4 N: L& i+ s以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
: Z) `2 A& |1 k/ t* b' H1 k% W7 m7 ~
2.1 全球/通用结构(以 1 MW 为单位)
2 X5 v9 H0 g1 G5 {6 E综合 JLL、ConstructElements 等[2][41][40]:
$ Z+ l: J' U- R. n. z/ j; L" d9 `: `! M
壳体+机电(Shell & Core)
# X" V* T: ~" L* R! X$ M# e, U+ `- }- Q1 T0 @5 ?8 ~( J+ ?% |
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
, W7 J( n Q4 V/ C) }其中按成本构成[40]:
6 w, a1 o& P9 h8 E电力系统(变电、配电、UPS、母线等):40–50%
) c9 N, R9 Y! z& u机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
4 |+ r2 E* Z2 k" `) h* `建筑与土地、结构:约 15–20% A* B: R' A' ]
其他(消防、安防、楼宇管理等):约 10–15%
$ z7 b# X4 a0 mIT 内装与 AI 基础设施(不含芯片)' v9 V7 N/ T% f' q3 E* J
+ e b% j9 O: p. z% g, t9 T9 H2 h- O
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。) R; T2 c9 z; J% v E
GPU/加速卡硬件 CAPEX% T- N% }4 l# c' ~$ L' A1 B
' K5 a/ E- w) t1 L4 C! |多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
. I, l0 \/ g, x& h2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
_$ X2 p7 k0 `3 F: y结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):9 F$ ]; a, k$ E
5 a3 t4 T+ Z3 _6 n4 v5 f1 {( w- A {2 H区域 典型建设成本(壳体+机电,$M/MW) 备注# p) Z8 ~7 d1 G+ m' z# \
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]9 T. x0 O# w+ }. z
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]0 n1 d) e! Q0 V7 J
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
4 m. F5 ^( f* T+ a2 A4 p) Y中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]- B& U- K! w& i$ D
结论:
2 `( |, O" {( w5 j; U
2 T+ ~6 ~1 \7 k9 Z k0 S单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。% g6 F/ C) w; _. H0 R1 m, i
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
& a7 m) m( B' Q" K2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)9 _4 ` Q) k" c$ {/ E
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:. P7 s1 F, s% D( r. V' b' y
/ A; ~; a" n$ ?. v7 Z3 Q假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
/ K) J/ T2 m$ e& S9 ?GPU 配置:
5 p' }- J, L! O5 M* K有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
& G3 e1 X+ `0 d" j; J7 k' y每 rack 成本 ≈ $3.0–3.35M[34][69];
# ] P3 z( q" I7 _+ ]" \9 TGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
- k1 f G. F: w与不同区域壳体+机电组合:
+ [7 a' _' |8 D j) M) w
. n- [! Z3 D& {; U/ D- T以中值估算:
2 ]) N( g4 X) _+ F0 s. Y, U! O- \6 J& @5 W* S- [* V. k& g) e$ b
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B" w7 \: S& v) J% I
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
7 E$ e# H, K5 G' B欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B. H' H, r3 W0 k6 z8 k ^ h
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B9 k9 Y! |+ H4 L# X: p! U
可见:
) |* S: p! ]- y( T6 {
7 f: O( s8 a% YGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。+ ?' J1 k: J1 b X/ _) A( h8 K. B
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
9 R6 q! G$ w9 V" x% G+ z d/ i( d* I三、运营期成本结构与区域对比
4 {8 r" f9 T8 @& T# M& W3.1 通用 OPEX 结构(高密 AI DC)4 O3 ^2 m+ J2 ^( t0 w. P0 S- F
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:6 r0 [" j( v X( z
: S) \# R' o, p# E+ E9 J电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。
9 F4 B1 e8 u3 n冷却与水资源:
: Y' `4 j, X2 y3 V( }能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
! K. L. e g. E6 G& _+ \7 G水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。; ^0 X- p' f! `( b2 A" @
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。7 P6 o2 Z ^1 k$ \2 f
托管/物业与维护:# t0 u0 ^+ P# O! V! l
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];: p$ Q8 b6 M3 d" O8 y+ G) G
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。 q& [2 ~( _ W0 I2 V! \* J
3.2 区域差异(以 400MW / 3 年期为例)0 ~8 L3 f% K+ c
使用 ChinaTalk 的电费与人工估算[1]:( `! x* ~( J q: n6 x+ y( l; O
4 U4 Q7 d, ~0 y" q- F
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
# \! e7 |7 U G) r中国:约 $0.06/kWh → 3 年电费 ≈ $350M: u- l' x. A- m7 m
美国:约 $0.09/kWh → 3 年电费 ≈ $600M1 Z$ l6 R. Q+ }7 g8 W
中东:约 $0.07–0.10/kWh → $400–550M
$ ^* r2 \/ F1 V- _( ^4 t' r欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势), N, z$ } r( k5 N/ O
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:" D# m6 R( N; z) Z6 ?: ]$ I
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]+ K' @. D, V: q: t
三年水费级别:
0 t: W0 h+ f$ c! w( `0 l美国:$40k+
5 A+ a' Z/ g; {& y' {/ H9 G t/ y1 Y中国:$20k+
% q( F! d$ n; H( P* i& ~9 h* W结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
# P; w2 U- @5 v; y, s' e人员成本(3 年) – 假设 500 名全职运维:! I$ p7 y* a3 R5 h- l
美国:500 × $120k × 3 = $180M+6 O# g$ x1 p$ Q. }" ~
中国:500 × $22k × 3 = $33M+4 ?5 T. X' a* ~
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。' H) \* @4 h; v8 ~% p
整体 OPEX 粗算(3 年) – 400MW 场景下:. U, j& }) F' w4 @& u3 u
( \7 G' r+ ]9 ?项目 中国 美国/ q- V8 |& n% ~3 v
电费 $350M $600M
2 a6 ^+ {) O# e m/ x7 Q2 H% j水费 <$0.05M <$0.05M
& R9 _- g7 z. d, \9 M, O人员 $33M $184M& b& Y- l4 G/ P- r& ^2 z7 k4 A
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 ! ?: }3 _. i; \4 {2 v+ H* z% w0 N, o3 f
结论:& P* T/ \3 L& f5 ~1 J7 Q( x
0 r+ y; D& w# H" L8 P2 c1 f就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。
, ^" J% E& o( J p5 K3 D! |对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。* v6 r5 }1 L& I9 R5 ]" U/ m
四、基于 token 的成本与利润推演
9 N' J, K5 t1 o) S! z. F3 \4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
' C/ z4 j! ~; W6 E( h$ i6 C$ {5 V. y统一假设:
# _8 X U: T: {0 P0 p% j: f
! T4 r9 u8 `+ w1 M9 M3 v2 Q5 h典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])2 n& A; e$ u! N. M
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh- x) d/ E+ m. S# ~3 Y) M
1 百万 token:278 Wh = 0.278 kWh4 ]* y0 B7 O. N
场景 A:美国电价 $0.30/kWh
6 G6 l2 f, n+ | T电费/百万 token = 0.278 kWh × $0.30/kWh
6 T$ z' e: ] L≈ $0.0834 / 百万 token6 d- h( z# r6 e* U
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
4 L5 S4 Z5 z2 w/ u- [电费/百万 token = 0.278 kWh × $0.0420 e' H4 C) d b4 T
≈ $0.0117 / 百万 token
, m+ ~& z% v8 k2 o% E/ c对比当前 API 价格(OpenAI 2026Q1)[62]
& e/ z, `+ h2 x+ G以输出侧为主(成本最敏感):
7 L7 b) F, P. A$ \8 ~ m' a' |/ I, a4 |9 z1 {+ z; ^2 w! q0 I: G/ l
模型 输出价 ($/百万 token)( A' j9 i; @: D3 S' [2 v7 @4 }
GPT‑5.2 $14
: b6 H! H: F+ B) s: L$ l+ jGPT‑5.2 Pro $168
+ \& _8 a4 R9 b8 YGPT‑4.1 $8
8 Q0 c. G! l: `$ [; H5 R& k3 \GPT‑4o $10' ?3 v8 K3 x: @( q
GPT‑4o mini $0.60
% e( ?) r& N' {2 j则:
N" j. M, t' L- z- I! X9 v0 a- Y) v+ B7 V
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。6 i! h+ d! `, y8 Z3 a
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
( C3 m1 ]4 P! ~& W相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。3 j, j9 Q# ^+ F2 { ^
结论:1 ~2 c C# T7 j% Q+ n
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
7 d1 W; d2 V- e0 B& z' J
) |1 x7 o/ ~# N6 s4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)/ T* M: D. i$ @" w
以 LenovoPress 的 8×H100 Config A 为例[28]:7 o& }2 V1 i. H1 q a
# Q( S' f( c/ P% `5 年摊销下,8×H100 本地推理 70B 模型:
/ |% K6 m Q, x/ `小时综合成本(CapEx摊销+Opex):$12.08/h
0 Y& w7 Q5 u) G* S$ Z7 a. F3 n吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens
" `2 u4 Q" d& j! f8 B成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token: T6 ]- e- A' I
电费在其中的占比:% Y8 ?) |# ]+ s# e: s
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]
# F8 w4 B' ^1 v+ B8 ]电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
( Y0 b8 H/ H3 j, `0 j$ e+ T电费占 总 token 成本 ~7% 左右。
# M' }1 C) i+ Y) |2 G* ^$ {0 A若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
$ p+ s1 H) p! D) x' r0 Y- \' `若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。% ~8 \" u- a( R) G
& x! p6 f2 B: r' d因此:1 D0 L0 g- o. h( w" T& U
9 h6 z; P. t7 _1 o' z在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。% ~: S# o: Z& \
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。9 ~/ z1 p. A! V& h. M* Y6 v
五、不同芯片方案的建设与运营成本对比
* P* \) r2 s1 ]7 K- S5.1 NVIDIA 方案(H100/H200/B200/GB200)) H* r/ i o' D! q( ?+ R' x
CAPEX:
+ j2 B E9 D* a( ^" f- ]: X, K: ^. P
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
# U8 f" r/ M( X7 AH200:显存提升,单卡价更高,8 卡节点约 $280k[28]。- \- a. I+ C0 A- `0 b* v. I- r
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
- t5 m$ ?" C; ?" ~: c4 j" T$ G2 {GB200 NVL72:
) N/ E3 y' Z q: v1 X( d# D每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
: X# }, @$ H+ J( ~% Z$ _, T冷却系统每 rack 额外 $50–56k[35]。
& C* P, m& c$ X& V1 S0 s在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。; u8 [+ z( I4 Q7 k
OPEX & 能效:
. j/ h/ [! r7 O7 ^8 v/ |5 I: m; L- X5 Y5 e% M" v+ w1 y! N
单 GPU 功耗:; ~7 L$ M' m4 w$ | V! y5 w
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
4 e1 z0 L2 J: D/ MH200:功耗类似或稍高,但性能/W 提升[9][10]。/ _2 V. E* a. Z [( K/ A; _: E: |
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
+ C( v- p$ n0 P3 R/ U- S( J% BToken 性能:2 H3 ^) @3 @7 S- N" _- g
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。' _* X9 r9 @ n% J" Q q' B
NVIDIA 的优势:
( f1 q+ I' D4 b% V& I
2 e. q. {& {( |2 T x% O0 t+ ?软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。! i$ g5 h4 q4 m9 }1 k
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。0 ~) a1 \2 X4 N2 {/ [
5.2 Google TPU 方案0 R: ~% f+ \. J0 }$ t
CAPEX:
! e7 ]* C* P A: G: e2 ^' P' `) }; E I( h" ^6 Y
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。9 i" N( J4 D8 e7 W5 c
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。- ?$ E/ z+ o/ H; O% F6 v$ D) `3 D. o! M2 n
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
8 D9 `. @: m: n$ L1 c1 j* s. `6 M能效:/ t c. H% `1 |9 x6 _& \ v
Q) J- l9 ?3 _- \3 P4 X% hTPU v5e vs H100:' _7 r R+ H4 v# _! k
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。4 |8 y3 A+ a. t2 W3 M% r
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。. U2 F! z% V/ ^! F2 C
新一代 Trillium/TPU v7:7 A9 Y4 J) @ C$ T; X) k
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。' P3 J/ y7 P: S$ B' A' F3 ]: {4 X! `
Google 方案的特点:3 s7 M/ M* {9 f
& W) ]" n& E7 W# P& ?5 s
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
1 S* D! \- ]" Z! f# Y对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
3 ~# i( i! C1 n! m8 p4 ~) h" R! j+ x5.3 华为昇腾 910B / 910C 方案' H/ v- [7 C& O; j. K8 I) n
CAPEX:" n# f' n5 p3 V3 p+ o
1 C& L' r' X" E. V/ \ Y9 U' a, n单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。7 F5 r1 U! B8 s! b3 W8 A9 d
与 A100 对比:
! e: Q0 }6 P9 M$ @7 h& g0 {FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。& b4 b5 w$ |5 g7 t' |
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
; i$ ^) N4 F# J3 y使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。5 u. }; Z$ \; ` p. Y7 Y' y
OPEX & 能效:
6 Q# j+ h7 a4 k9 j6 }8 G3 u
0 o! m! b& i$ g6 F" y; q- {910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。. }4 i* t: a9 d# C1 ^
部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
9 J& h+ x, n; m9 q! z9 y: p6 E8 U在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。" y5 q+ {1 _+ v- U3 _- k
5.4 平头哥真武 810E(PPU)方案) T, N3 H8 k4 @5 P
CAPEX:) O: j3 z W# \0 _5 ], f, y; Q
* a% \' e* d9 h$ j: r技术参数:7 G+ N C. T' d1 m; V4 ] i# n9 C
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
/ `, Z k) ?3 y1 ^& U( z性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。' I' A& s* I: R* }, a) v# Y
价格:
5 N7 K6 o; K! e; H" k未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。* |+ y' c9 k7 n1 w
结合国内报道:
/ {- w) R8 {# L6 ~& |: O2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
7 L- P2 I0 B9 {. x L- C& O/ _# P数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
5 n% {; g* p- r TOPEX & 能效:
" i2 H8 @4 Z9 Q* Y6 O5 Z8 Q* t: e5 d( Q9 N- E
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
. j$ t* _( M8 x7 \6 c |0 s5 S在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
' \: |+ H8 ], p$ X% k六、综合比较与策略建议% h9 v* r0 ^( \. t) D7 ]
6.1 区域维度:在哪里建 AI 数据中心?
* R4 `, K0 D/ s' O ] X* ?纯经济性(TCO/tokens)排序(假设无政策/合规约束):
- t5 l M! d/ y3 _& n. Z( }# I$ v P' } V' u+ V) h
中国西部/北部(电价低、人力低、建设成本低)
* A7 s8 y8 y8 B o8 A7 f, K中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
' G$ P6 H4 n t: U美国电价低但人工高;东海岸/加州电价上涨压力大( v# v2 W4 b2 X! o3 a" p
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求+ S: D5 O$ {; l- D. n* p3 c
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:$ R# C9 I: U* n1 M
1 c) w8 V! n, Y+ Q% D
纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;; u) d+ K7 }& I+ f2 \' q
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
+ T" b( D& u; M' R但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。- `) k1 E9 E7 w- O
6.2 技术栈维度:选哪家芯片/云栈?
, ~+ \0 u0 `5 x3 N若目标是全球最优 tokens/$ 且不受出口管制:- p5 N% k6 n Y2 z
+ S* N3 v7 |8 X% M! g7 ]- zGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。1 I: E( }* Y1 R- z, j
若在美国/欧洲,能自由采购 NVIDIA:5 [8 Q; u3 y/ s+ L# b; w5 W, o
! i- n/ ]' U4 `" L短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
8 U3 a6 A; L- F/ p成熟的软件栈与生态,极高的 tokens/s/GPU;- @% k8 C) B; m9 c
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
8 v0 ]& P2 d! d6 x6 s+ X但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。! M( C4 c& f" B, [
若在中国或存在出口管制约束:
( w$ r$ w) }+ T( O7 [; C3 ]! r0 y4 ?# l+ |: U
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:% r, D/ b) V$ J- [
性能上已能覆盖大部分 GPT‑4 类推理需求;
4 V" P6 P9 o: N7 [6 A单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;' U9 H% c/ F& q# s8 H
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险; \% }- m! T* W/ n; ?* ?9 h( w" Z
建议配合:
$ x& q$ w% i5 k6 K高效液冷(PUE~1.1)、
# z+ C2 V' C# m8 ], G大 batch、路由(浅层任务走小模型/低成本芯片)、
5 {" g K9 s' ~强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
1 H4 r. @ g9 }9 u. z( r. N/ n% P长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:3 L( _+ g. l2 j0 ]
; ]0 i7 o9 B! i6 Q9 B) p
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
* X/ ^+ U( ?" P; h这意味着:: t! t" p+ }" R
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
3 ~( t' [! V3 h. [精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。/ J6 s1 D ^2 v) U3 o& ^1 _
6.3 针对你关心的具体问题的简要回答
0 y! \; D8 X& r9 M0 n4 R2 MAI 数据中心建设 vs 运营成本的大体比例?
# B1 H2 P2 x7 A' A ]' [0 N1 b" ]) n
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。$ u4 i( x% B, J/ I
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。7 h4 n: A! {6 i) I% y* ^
中国、美国、欧洲、中东的成本结构区别?
/ r1 J- F H n O
+ D3 l: e5 I/ k9 S G建设期:
9 Z4 G! A4 n8 Q5 I" ?, H8 A9 M9 ^中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
& d% t8 Z* V( y F$ s# F运营期:# k. {6 @2 f, Y
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲 ~ g& a3 |8 \
人工:中 国 ≪ 美 欧,中东居中。' G/ ^& |0 a$ }
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
, m: }, {0 F1 B |
p5 c/ n; S( F2 h* y& {- ^对于典型 1 J/token 推理负载:
2 s$ c1 @- D$ _2 N. _美国 $0.30/kWh:电费约 $0.083/M token. C5 v- D+ m1 c5 I7 \
中国 0.3 元/kWh:电费约 $0.012/M token
/ G# @! L Y7 f3 q6 Y# B a对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
; t2 ^4 G3 l& Y, c2 l不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?) i0 y% t$ t$ t1 d& g
% u F% c6 Z ]0 ~/ U在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;
3 t; O. ~7 \6 s; `3 f全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
1 M2 b. c u: E( G# |% |3 \3 y9 a中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|