TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
. d- d0 w0 o% J/ k3 E' e2 G
% Q6 s" K: a6 C一、总体分析框架与核心结论
) Y% O' q: k, G6 I/ k* K1.1 分析框架概览/ ?4 j. O5 K! I
拆分维度' y. i& Z, g3 `* b0 W+ ^& |# W
+ F2 @9 Y; H/ e
阶段:. E( j! z0 Q9 R- L' K) r& P
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
/ R5 [+ l7 c3 S4 k( J& z. J运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等4 ?4 J& l9 v( G: r
区域:
& g6 g; j9 ?2 H! b9 X" v中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
! P2 d$ R# ^9 V) v, x0 | f2 o技术方案:, L5 E( }% \) M
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
4 s) P' y, h: W& H9 K: xGoogle TPU(v5e/v5p/Trillium 等)3 \- X# n0 N/ b9 C
中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)$ Z1 I5 S) x3 ^" ?$ L" a4 {
算例基准 m! I! b, S* A: N& O3 B
( x7 H7 Z7 R( l
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:& m8 E2 ^% g( P* o9 S- |! l7 p
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
2 |9 s5 w1 }$ Y, fPUE 假设约 1.11(高效液冷场景)[1][29]' {7 `1 r; S/ l
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
0 u* w1 d; P- L' v, Z关键指标
& {# V! d& [0 _6 o5 z" {+ _& C) W: e
$/MW 建设成本(含/不含 IT 硬件)
5 J/ Z$ d# C# X$/kWh 电力成本、L/kWh 水耗0 U3 b$ i/ U! Z1 ?5 s4 c& }
$/token 或 $/百万 token 的综合成本
; q: d' D+ k4 x# C6 {Token-per-watt / Joule-per-token 作为能效基准[17][18][26]
/ U8 Z. P( g7 Q2 s- l; z项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)4 d7 E4 V9 _4 }3 N* Y
1.2 高层结论(供决策快速参考)# o4 m4 V- t0 Z) B
建设成本:AI 数据中心相对传统云数据中心成本翻倍% ^1 p1 G+ t& {
0 V! u( u. q1 S, L7 n传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。2 A9 J7 [6 ^" x9 H0 `5 t$ x7 |
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。; P" H( Y: O" p3 W7 S1 t8 [* B$ z
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
; N& s( n* [: l/ A" u区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区' T1 n. ?$ R$ ?4 ~- |
1 ?! b4 |# z( Q5 p5 T' A% |. l2 M中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
) M6 R4 c# r4 l美国:$8–12M/MW,400 MW 约 $4.0B[1]) `& T' Q: S& a E$ A8 x% C4 l# \
欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
; b& k9 e _* C中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
0 `; u F2 U- A" ~结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。4 i3 z" L' L& x, F( y$ @" X# a- M
OPEX:电价与人工决定区域优势 R( Z% H' `9 \% ^: J: l
, n8 \. N1 G( I! E
电价(2025–2026 工商业大致区间):3 N9 C$ Y( M/ M! u
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]1 V5 P3 f1 E3 O q0 v2 |
美国:工业用电约 $0.085–0.09/kWh[44]
$ h; U2 M4 `* Q( \# D+ C欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]) ?8 W3 @. n F- M! g
中东/UAE:工业用户 $0.07–0.13/kWh[47]
1 b* p8 F" b# M; z, f人工:1 Z! a3 y3 ~ W) w
中国数据中心运维:约 $22k/人/年$ b3 s: V" f p' }" B6 r1 A
美国数据中心运维:约 $120k/人/年[1]( F& B, H7 Y" Z( `
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
1 e0 K) I' B" W9 [' ?能耗与每 token 能源成本:能效差异远大于电价差异
; Y* u' i% i2 f7 y% @* j1 [+ }& {. f1 e
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
; H7 t( k* z' X5 K大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。+ R- { o# o0 r: m# y2 I
将 token 能耗约化为统一口径:
: ~8 {9 k" X- @ T9 C粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
6 `5 B8 H0 o6 [& F5 Y: o中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token" m& Y( q d) [; E( c
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token: W% O! J& @' m+ D, U: e9 i& j) u
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
2 @! B& K0 v2 l. R5 W不同芯片方案的核心差异
* p+ _; T( G% x& E- X/ C
, g( `# v1 F9 t7 |NVIDIA Blackwell/B200 & GB200 NVL72:& O1 V2 R2 e6 P; [/ B
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。5 w/ d' s% o2 X1 z: M1 Q' j
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。9 R# l9 b) H% b, J; n. z
Google TPU v5e/v5p/Trillium:
; I( j8 U9 R e% R; h. _# @TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。. @; B' f6 M2 I( f- k# I
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
$ j2 _; j9 ^5 o% S* X5 T+ D2 q( a华为昇腾 910B:4 }8 f/ k' z0 T5 H. g" r
FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。+ ~6 p4 L1 [- H! @3 t+ |2 [
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
# e" D; ]: T- u" d, }阿里平头哥真武 810E(Zhenwu PPU):
0 B: \5 W$ a0 w2 J96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
' H G5 e1 g0 q" c5 ~2 {" [结论:
$ Y6 T! H8 r( N1 ]& y: T9 l+ ~+ ~; k能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。! P9 h5 q$ Y' ~! ^
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。 N( ~! K, W/ W! q! Z
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。3 v- a. k& r8 S8 T5 t
自建 vs 云租的 TCO 与 token 成本
7 I. b/ N- q1 y
D4 _% f0 d; J/ ULenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:2 C6 }4 |/ x' g5 S% l& l: Y
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
, ^5 L4 t! r- }' v" M$ ?+ t等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。7 L5 q' k% a p6 y$ D# {
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。* B* f! m$ T$ g; A/ S- Q- e
Token 成本对比示例(LenovoPress 场景)[28]:
/ o1 Y# `& [7 Y5 Q* @ d. Z* RLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token& a' a0 F, @3 w1 A9 _
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。. t/ i! R( o6 `- x
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
% A1 R0 Y! ]' X5 p7 c$ Z5 t3 ~, h+ KLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
3 J$ ]! B4 D+ y- o' e" V结论:
* [. [4 d/ y1 x( [高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。2 h/ C4 h& o2 G! ?) i5 [
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。5 a" T3 f4 V, r. S8 o
二、建设期成本分布:区域对比/ \4 M/ S0 k: c
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
3 M) u. C( `) ]: Q/ w0 }
" |9 y% g$ Z) g, u( R2.1 全球/通用结构(以 1 MW 为单位)7 C9 m! j* W4 N: ]9 l, \* x
综合 JLL、ConstructElements 等[2][41][40]:
) ~. h& O- H. f& x5 ]7 {
( z/ ~5 j5 P5 n壳体+机电(Shell & Core)+ o6 j0 z F t- p I
# M4 z" k* }8 m$ e+ a- P全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]' S& q$ U# @0 C2 G5 W' }' D$ W
其中按成本构成[40]:
( |% ]: @3 Z j+ Y) J. b( e% @电力系统(变电、配电、UPS、母线等):40–50%2 B3 _) L7 U5 o6 t# }
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
. l# M1 f/ G' D0 m/ d建筑与土地、结构:约 15–20%2 @: y: y/ [2 @' z- k
其他(消防、安防、楼宇管理等):约 10–15%% k8 ~- j4 Z% w6 l; E) L: s
IT 内装与 AI 基础设施(不含芯片)
/ v3 g3 P- u$ o8 L0 ?/ C+ Z' O' s' ^7 s
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。9 f! A& Q2 ^5 I; o
GPU/加速卡硬件 CAPEX6 c7 D# V& v7 \! R( M0 X
+ n. G$ M! ^# | v1 n7 Y4 f
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。: N9 C" L; s' k9 K# |0 c
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX% R' x* t" P: z9 g3 H$ m: t- J
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):
) B3 x# q# c" z6 F' d9 x$ j& }$ {( E, v- G" z
区域 典型建设成本(壳体+机电,$M/MW) 备注
$ j" B B$ n% t; a# H中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]3 ]/ _6 O- R/ O
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]9 } D! I: g/ z( u# u" A1 ]
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
1 k+ ~7 e9 f! g( D' t+ I' G4 G中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
1 Z( U0 R: x* R/ b结论:- W; l! R+ W S3 K( Q4 b0 l
2 `* J; Y% v) g5 }5 ?, K9 y" B
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。" ?( Q D/ F, @) j
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。$ x# l+ z0 m- ^( w6 N& C9 ?# p
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)/ h4 @& H5 z" \- ^$ W" u7 }+ V
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:$ s2 c: `5 D' M3 t8 A1 ^+ r
8 K$ ?2 z* ~' a% K) G5 U. ~( {假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
- r' g" a! x' Y/ qGPU 配置:
4 @3 q1 c% w2 |9 ^有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
0 U: \7 v" r/ h& \. U8 V3 N; b: W9 n每 rack 成本 ≈ $3.0–3.35M[34][69];0 ^( h* F4 k7 W6 Q& d2 V1 T' C
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
: g5 ]0 }$ ? ]/ F! O1 z" k与不同区域壳体+机电组合:4 O7 B {8 Z" h
! ]1 G i. j1 V& i p" ]' S0 w$ O以中值估算:" L, C; U- b* u* R
6 }% ^5 \ {, \. p4 p
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B3 U9 O5 p; ~& ?4 S7 W
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
& \* E% j* U. x+ p( u/ N! J欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B7 T7 {& X/ @. _" a7 C
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B% a4 j! d: _+ r+ Y4 Y
可见:
8 S% a' e& g4 u) |
; I/ H/ ^2 `4 n% f) TGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
/ V& }. H" d* g相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。% J9 S( e# s3 O9 Z
三、运营期成本结构与区域对比+ e! ^1 W) e3 E6 e8 y/ q5 A
3.1 通用 OPEX 结构(高密 AI DC)
2 y% V( z( v. {结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]: }# ] F7 Z8 {; p) U
: r$ R9 _6 j- S9 ]
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。+ p1 B- |1 ?: _9 O
冷却与水资源:( w/ }# b2 B. S5 r
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
3 y5 F' x' B; {! U* \. z水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
Y! M& c' [+ Q4 f* `6 n7 x M人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
" p Z8 C; f+ m9 ^; A托管/物业与维护:
, j! }+ ~. R! G: Q0 ?托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
- D, H# |" b, T* A$ h硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
0 x1 ~7 v0 z5 P3 W: e/ j$ @# Q+ a9 Y3.2 区域差异(以 400MW / 3 年期为例)
; ^# h: _: |' T, Q' Z* `使用 ChinaTalk 的电费与人工估算[1]:
, Q2 {0 e& H$ S8 S- Q7 ^( t9 M% A& B4 x( n4 F8 I7 e; t
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
7 R4 l: X% ^1 H2 Q7 p; o中国:约 $0.06/kWh → 3 年电费 ≈ $350M
8 H: Q& B* R8 c: H美国:约 $0.09/kWh → 3 年电费 ≈ $600M( L$ x$ W/ U1 |' _) f
中东:约 $0.07–0.10/kWh → $400–550M) x. X2 Y5 k$ R* b" N% }: M
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
8 L( ^, n4 N1 L0 r+ |水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:
$ |3 @, Y2 T% z% L1 \. _9 H美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
1 T t. u* S$ Q* j0 r三年水费级别:1 c6 @2 j( U8 G
美国:$40k+" O2 @2 X, G9 D' U) `
中国:$20k+* E4 k' _! k9 ~! }9 f! ~
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。) r) [& ?4 N; o9 `
人员成本(3 年) – 假设 500 名全职运维:
3 Z! Z% E% v2 |( z& L; I% _美国:500 × $120k × 3 = $180M+' X; N0 K, M ~% X, {% I
中国:500 × $22k × 3 = $33M+8 S+ l. w% ?9 Y% g% @0 K4 K1 t
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
0 p+ ~! t9 v% f* H/ D v! d整体 OPEX 粗算(3 年) – 400MW 场景下:
# q6 S) {6 F% s+ Y
6 }' R3 r6 _' D( }6 L6 E7 ]$ J, R项目 中国 美国
0 {) Y7 F0 `, m/ a5 L/ u1 ^电费 $350M $600M
; t* m, }& K9 @: F1 J水费 <$0.05M <$0.05M
( L) p" Q3 Q. }5 k E. F2 C人员 $33M $184M, U \, l8 N& I
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 6 A7 l8 c9 \# i7 q7 m# a
结论:
8 o9 F) G5 g3 W9 h% n0 T! f" w$ v0 W8 u9 l
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。
2 s! y# t* n7 M0 Y. v" j% a% _, V对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。3 r+ f& x0 ~& ^
四、基于 token 的成本与利润推演, K8 C2 `, Y# T. r- O
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
9 l& r' ?% T# a% k9 @0 `: Q统一假设:' e- f! @5 z! S' L; @# Q0 Q; d- C
5 [ G& g& F3 ~8 U9 T& N典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
8 p0 S6 b& z# t1 `; P7 ]# T7 y$ i1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
- ]' u' ?) T0 `8 c1 百万 token:278 Wh = 0.278 kWh$ |+ g: m6 L: i. |0 C* i4 |
场景 A:美国电价 $0.30/kWh
" o8 l, |8 l Y+ d电费/百万 token = 0.278 kWh × $0.30/kWh
9 j; \4 v4 I/ @4 H* l! d% k≈ $0.0834 / 百万 token
- i4 X9 N0 R) d: p- g2 n, T场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
' O) o, A; s- y8 ]/ Z电费/百万 token = 0.278 kWh × $0.0424 p4 J- \; |# {3 o7 F$ ~
≈ $0.0117 / 百万 token
8 X8 z% G+ Q2 y$ q% C) l* B( F对比当前 API 价格(OpenAI 2026Q1)[62]: }8 b' M% a1 c, o) V W# [
以输出侧为主(成本最敏感):6 L% U9 r. j0 u5 l, L+ u
+ ^. I. t+ X* G
模型 输出价 ($/百万 token)0 J! u0 u, I' g; V6 s- }4 D
GPT‑5.2 $14- c) C, O- X0 b( P$ y
GPT‑5.2 Pro $168
% Q7 T8 R4 y1 u2 JGPT‑4.1 $8
) @4 Z6 I4 Z# L& D* z+ f. K. o: ^1 Y, nGPT‑4o $105 ~+ H1 U. F$ q( Z5 }( C
GPT‑4o mini $0.609 q9 V# @& N+ [& t3 A% R" T1 D
则:, V* F ? n" |
6 g. g ~: n, U& a! a! E在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。/ q4 L: k2 r( ?+ X, Y i
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。+ g% P( l( N: m% I" f
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
5 G# J. C0 h+ F( z! }& j结论:, u4 `3 T. R0 a- `
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
0 w) q9 F n4 T5 F7 U e7 P t, V" x# P$ `7 h
4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
9 `2 e/ I* E" c% d4 m( W" C: x0 p以 LenovoPress 的 8×H100 Config A 为例[28]:% p/ j& u/ I$ i( j
- o: [% A1 C: W7 H+ f0 ^0 b# Z5 年摊销下,8×H100 本地推理 70B 模型:
0 T' w/ M, l& \) g1 W5 V; W小时综合成本(CapEx摊销+Opex):$12.08/h5 A& p! [ o" c2 P) M, u) S: ?! N
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens
0 v! I" m" N; V5 G* f成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
. T/ P( M/ }8 N' m( K# ]1 w电费在其中的占比:
* S3 H! f; Z. v8 F* J) BOpex 6.37$/h 中电力+冷却约 $0.87/h[28]
/ h8 ^6 o5 o0 T) p2 q电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token1 `& y$ W* ?3 b6 d- x
电费占 总 token 成本 ~7% 左右。
3 [8 z5 ~/ v$ _$ S若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
8 n$ T6 z0 c& \. W3 b) P若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。! Q# |4 Q+ j, P4 w
6 ]- Z/ V4 r) f5 P9 a' k- @
因此:
* ~) u& v' a! j
* p8 @+ h0 a$ N, i c在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
+ j8 K- s0 B+ g+ x在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。, K9 l3 y0 J# G- e# h) s5 d
五、不同芯片方案的建设与运营成本对比
2 m5 t9 f5 I7 W' _$ l" u5.1 NVIDIA 方案(H100/H200/B200/GB200)1 j/ C, B" d/ r0 K+ m6 k
CAPEX:1 U8 K; n. d- f1 G9 l# G; T
$ e9 x" W% C3 F: J. ^
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。* H% R) Q/ l: |6 |( R: m' P
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
$ g4 A$ G1 Y! I- x! u8 }4 e- [$ DB200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
4 f, { D9 U' y6 lGB200 NVL72:* B) d3 ~3 W$ e; G2 a3 d
每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。 L( }) ?* G/ J' G5 {! {
冷却系统每 rack 额外 $50–56k[35]。, g+ H0 p3 \. Z7 s
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
. h; j5 G4 ?. X r' wOPEX & 能效:
& _+ i& g" D& B" }3 o& Q5 C) q4 Z) g8 R% `( j( Q6 t% F
单 GPU 功耗:$ i8 j0 o u9 m
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
; X! Q- K1 N9 H, [3 l8 QH200:功耗类似或稍高,但性能/W 提升[9][10]。
5 l E' |" P9 w! YB200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
% Y) \: U) { _# d6 b7 O0 S. ]Token 性能:! t' S! L# a# d( Y) l/ e: B, p( a
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
! j, i; S' l# N0 aNVIDIA 的优势:
3 R- W; u& c3 I, W# {+ T6 }! _9 e. o5 o( j( U
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。, q5 V- C% w/ Z
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。$ c- P2 I5 \) r x# Y
5.2 Google TPU 方案
+ y0 w5 I* I# g! u1 e9 w9 QCAPEX:: A5 ^7 i. M7 x: y; Q# S1 z; X
2 o6 Y; R2 p3 K) i5 e' b
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
' _# j/ D; B6 {* q5 TGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
# E( Y/ b P4 O+ K) [& J$ ^$ @! `8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。 t: P0 S. ], q' P
能效:
0 u, y; i. h, @' U5 I) @# _/ X% D% [1 u" r1 S
TPU v5e vs H100:0 s8 z* L, U, P/ w& Y6 ~0 a
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
3 G0 {7 z( Z# `: W `* {测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
4 S5 j9 b4 \0 n8 e新一代 Trillium/TPU v7:$ t- j/ R. ~5 |" X6 ^5 {4 M
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。8 w1 D* i1 c1 `' O4 K" i: v
Google 方案的特点:
. q" s9 A) l' }* E- C1 ]# l- x+ a+ }# ^; s' a' w& @
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
6 |* c, y d- W3 u; B0 u0 c0 s+ h对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
! g- G: b2 U ~3 b" x5 K! j+ Q5.3 华为昇腾 910B / 910C 方案, H& ~" I, e* k" T3 b
CAPEX:
5 t- T- P+ i4 v" ?( `
0 \" A+ u$ i) B0 f% D& C' h单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。
+ g0 k# }# t; J4 s f7 `) ^与 A100 对比:
a( b/ I0 T8 b8 ]FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。5 q8 \4 f" B8 d6 E" n/ `
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。; U) R, W# z* x& z
使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
* F C+ G) N( B* b3 _OPEX & 能效:
2 ^5 g g! A: K: x; T! ~3 Y! Y0 @; [8 f) [+ J' @! \" { ~
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。9 R3 h7 q5 x, L# \
部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
, {" K: X" b# t) R在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。: u* ?6 A- D; r& e# I) L' F
5.4 平头哥真武 810E(PPU)方案
- J3 a" L8 y" P4 HCAPEX:
* s1 N7 P/ c4 T$ |; z) \# g
8 n5 _1 l( o" b5 ^技术参数:
. H* f; s7 a" J' c) ~/ U, k96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。2 m" L; Q$ h; L* M' C7 Z0 l
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。' ]( `/ s% S/ I" D1 x& B! k& f! S
价格:0 |8 N- I3 S1 c5 E5 g
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
( Z: T2 B" A5 l. }! f结合国内报道:
$ H! K: d0 W ~* [. a" h; @5 p2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
* \7 m. F1 h- P6 k: G& F6 o, L( y数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。6 ?6 g6 W+ s, e4 c4 C# Z
OPEX & 能效:- Z/ n! C J; e1 d5 N* q/ C
) A' X n6 W( v- j- s- |% z
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;( o6 T6 o' r* P
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
0 l5 r" z: @6 Z: \" c6 A4 [六、综合比较与策略建议
! M* x/ O. t8 k- |! Y2 \6.1 区域维度:在哪里建 AI 数据中心?' {/ m+ w5 V2 B' Z
纯经济性(TCO/tokens)排序(假设无政策/合规约束):
8 D3 ^* T$ v8 z |1 W: f9 m5 X) B1 w3 r
中国西部/北部(电价低、人力低、建设成本低)* S" Y5 Q! Y+ k, D8 P! l, X8 Q
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
& W) I7 d% Y; _- m美国电价低但人工高;东海岸/加州电价上涨压力大6 X4 C0 k& n$ T
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求9 E; ~! x) T* A0 w# m) w' o& Y
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
9 d( z1 q; z9 K+ a, G( p! F- c
$ {; X' t# h* F: R$ B" R+ T纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
$ y2 }. [& D! I" J对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;* {5 B$ e: N( r$ E0 [. ]5 d: f
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
! f7 v |! T% Q0 w' f6.2 技术栈维度:选哪家芯片/云栈?
% ^; z6 M* u% V$ k# y若目标是全球最优 tokens/$ 且不受出口管制:
0 K- Z: Y$ i7 o; f* H, b9 U# a2 n! ^ b5 _- Z# O( `
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
) u& U2 G% W. E- e$ v若在美国/欧洲,能自由采购 NVIDIA:9 V* Z2 m6 A6 r$ f
' S% R; z. s. j" p短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
, d! O3 ^3 l0 t成熟的软件栈与生态,极高的 tokens/s/GPU;* S3 [+ ~* {7 H" A( K
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
! w& l6 M9 S! T+ c" i但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。, G4 b! c$ r' F
若在中国或存在出口管制约束:) \$ N7 a' U+ X' `5 Z5 j% K; }
. M6 R0 L! r) _, ~* ]# q; d
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合: ?/ R, W( K( c0 h ]; L; F
性能上已能覆盖大部分 GPT‑4 类推理需求;
O" ]: S ?0 t1 j: [ C+ w单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;/ U6 X0 `. s4 C% T, g" k( O5 L/ R9 ?
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
/ h1 w7 r& `$ O7 F7 l6 L$ w建议配合:
# f# G" r. v6 W# T5 K高效液冷(PUE~1.1)、
) j- @/ N$ |$ a9 Q大 batch、路由(浅层任务走小模型/低成本芯片)、% {8 c. }. o4 v8 L1 t6 w/ c
强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。# G3 ~5 p6 @4 f/ ~6 d* x4 Q Y
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
4 O; {0 m" a" G' f2 d% G3 \' c6 Y9 \) U2 U
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
' d: K6 _! I9 ?5 x% h8 a5 k这意味着:
" G, F9 v' Q6 b2 Y- R2 \" y8 d- {优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
) S' ^ c5 `2 _3 Q7 t* k精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。3 o7 @, i# T1 L+ p
6.3 针对你关心的具体问题的简要回答
- U% ?+ G% Q) jAI 数据中心建设 vs 运营成本的大体比例?3 G/ ?- N; C; q$ [+ K8 e
* e+ F! ]: k& Q" K0 A* E. h' s在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。* o8 c. Y7 c+ F" `
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。 ?% R0 b$ s, L2 C1 S
中国、美国、欧洲、中东的成本结构区别?( f) Q: P# ~8 a. f5 [* n* z" p
4 |9 F. X8 ^) y" W7 c, r$ c2 n
建设期:
1 B9 P/ n P$ M0 s$ Z; j0 Y中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。! m1 q" ^+ M! r4 Z
运营期:6 U8 {$ E1 q. O" ~7 _. U
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲1 F. A1 O: V* _4 V
人工:中 国 ≪ 美 欧,中东居中。
( Q% [5 a5 G# }; r在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
1 i8 M4 j$ ?; A" {1 }* Y Q$ T. I3 ^0 `; j) Y4 I& i2 l* L: r
对于典型 1 J/token 推理负载:/ J$ N8 ^' y$ F) @0 e- {
美国 $0.30/kWh:电费约 $0.083/M token
1 _ g: y M; T6 e& C中国 0.3 元/kWh:电费约 $0.012/M token" K- X* `, E0 a. P, D1 |
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
" f6 V! M6 F) q- w1 O6 J! P7 r不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
3 F5 J6 _) e s) X. l
" m: N) I- ]: s4 I) @' J& x Y在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优; ~5 B% L' s8 I( g* W
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;+ |# T. U, X5 q9 l6 c4 H
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|