TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
1 z$ l" a5 J; M" j7 Y; Q: }
8 {7 h/ p; L: @$ H$ i {; z4 t: g一、总体分析框架与核心结论 d: N: b% b* Z. b, @$ g' @
1.1 分析框架概览
2 d! F \& Z r拆分维度( N9 c: p8 j6 Y# u* }5 ]/ K: D* R% m
& D- ?. Q g6 o阶段:% V: g: W: h% V4 u& F$ ~7 Q
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施4 P3 M/ ~6 ]4 G, @, c$ a
运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等6 X3 V. g. w( q3 |- a5 m6 `
区域:
3 w0 c' T: k* N3 u. W中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
! M) Y7 X, U& U. T6 u' J1 D技术方案:
" N7 Z, ]# Q( B4 P! k) R+ v4 T9 c7 P3 G8 \NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)/ d) |+ m0 o [6 N% w1 V. K8 m
Google TPU(v5e/v5p/Trillium 等)/ H1 \$ z" I9 ^" F( V+ S
中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)* ? v8 i( `1 G& A5 l( B/ U
算例基准2 j3 {: v! Y* k* j
: o) g% n1 I! K) L8 ~- j4 L; P以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
5 Z# n7 A3 ?$ \# I其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW; M3 N# E( a* q }# g
PUE 假设约 1.11(高效液冷场景)[1][29]
7 M6 ?. ]3 g( u1 f- x: L时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]1 P% q' f- u1 s
关键指标# c4 e, U0 A8 ?. x+ ]. ~
9 z9 `" s" f" R6 H& b$/MW 建设成本(含/不含 IT 硬件)
: c* m) v6 O% o$/kWh 电力成本、L/kWh 水耗5 w2 ]+ s3 s5 M6 u2 D, T* J
$/token 或 $/百万 token 的综合成本; c5 x( t; q0 U; e. w
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]; j& u/ y: r. R
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)0 c9 Y; w( @: D# ?7 x. A
1.2 高层结论(供决策快速参考)
6 k m. B3 o. n% D, N# ~0 Z建设成本:AI 数据中心相对传统云数据中心成本翻倍
9 I. U2 u/ {( F) j
) l7 h- }1 \2 d4 \& x6 K$ a( ?传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
( ?3 W& m) ^- p1 }AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
) D6 F: {- s7 C! P) y按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
% F& x) v$ D. b; o0 p; M3 e区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
$ v% V, c& ]- E# y. G/ j) G0 M2 {& c% s- h) a2 |
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
# _" J% d& X, G. p6 h美国:$8–12M/MW,400 MW 约 $4.0B[1]
2 Y4 t% O# v' o+ S/ b欧洲:接近全球平均 $10.7–11.3M/MW[2][41]# u2 E5 V+ d e& t1 U5 a& R9 l
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
1 l& E1 o8 F; z! v. f6 T- V$ x结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。2 [/ W4 B4 z) G# R, w1 M+ v
OPEX:电价与人工决定区域优势0 h+ y% D k+ U! n9 {
$ g: r8 ~9 }2 y; \
电价(2025–2026 工商业大致区间):. y8 w, y" ^9 K) x8 R6 {' F! y
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]% \- g5 h# N5 d; w) O i5 Y) d4 l% A
美国:工业用电约 $0.085–0.09/kWh[44]
. b4 i" j$ V' K1 L d0 t" \2 S+ q欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
; ?( A* z4 S6 _* I' P* r中东/UAE:工业用户 $0.07–0.13/kWh[47]# R7 Z" P9 n9 _0 K; C0 d' j
人工:9 p! z) M/ ]" @' |: m, S
中国数据中心运维:约 $22k/人/年
9 q$ @! H/ A( I# e6 z美国数据中心运维:约 $120k/人/年[1]$ ?8 Z+ O2 n! B; \4 W/ m/ E
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
2 U* N! c1 T4 v' L( j能耗与每 token 能源成本:能效差异远大于电价差异9 ~/ w0 V* e; d! X& d" F
- Q# I; n: x Y; j1 n& u" TIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。3 A/ N+ q8 c+ R, E/ E
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。8 R1 [ f+ V) L! H" ?: U' }
将 token 能耗约化为统一口径:; D: \. T- I; {) ]0 y
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:' G; o8 _% S# b u2 q
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
9 V+ n; z% B: g, y' Q, g美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
% c9 B' j/ c' [ Y" v* O4 Q对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。( {# I2 A( x6 R4 Q4 L! l, ~" U
不同芯片方案的核心差异
! G- b `* }4 w+ C" m! @ }3 K* D
8 Z5 V; F: N2 J& T+ oNVIDIA Blackwell/B200 & GB200 NVL72:8 f) d7 ^$ \- e/ h" j
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。6 ]! S+ A+ r l/ Z3 F
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
4 m: i" y- M( p/ a5 d, AGoogle TPU v5e/v5p/Trillium:3 X% t1 g1 }1 _* A) C) L/ j" s; M
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。: m# K3 ~: f. u% B" c
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
7 `. d1 B3 V0 _! l, c华为昇腾 910B:5 N/ c; o7 E, a* M
FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
4 l$ k+ A1 @3 V" P0 N( h- b单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。5 o5 Q- M! [: x. ?' ~& q
阿里平头哥真武 810E(Zhenwu PPU):
7 x7 f6 b: n9 M3 E96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
. z* B- J( H8 H k5 i3 V, k# z结论:) j1 t+ D( `# H& L. a
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。
* Y& h# y1 c% x* r单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
. ?5 Z+ Z% K7 U8 _( s6 O对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
O+ F7 z$ n0 }( t" g自建 vs 云租的 TCO 与 token 成本6 o" S8 |0 C5 Z2 F; ?- n% ?' }# s
* @6 K3 U5 _+ P% P4 Y3 q) |LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:( h7 r) D" b& ?1 W; k" ?
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
# w2 P, [2 H$ S; u* t4 V9 N! x9 m等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
& ]. R- s* n- |5 [) k# m: u' c, ~8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
/ C t& @/ x; D9 R) eToken 成本对比示例(LenovoPress 场景)[28]:
# q5 }$ O J+ C' p9 H/ ]Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token; q2 V- [) B- z: C; ^% n; `4 ]9 q: j+ O
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。, k8 [, P* v: `
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。! W+ H2 w/ C: e% v
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。4 ~( C' p W/ s% x, A; O
结论:
! c- z& ^; o6 g% J4 \! w: n2 h高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。
) Q* ?1 `8 v& |% w% ?% O8 i% w+ g! AToken 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
+ f. E. d6 c5 u3 l) w1 I3 q二、建设期成本分布:区域对比" D, z& E, k; Q: b& e" A/ k# _0 @
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。. H5 j, q5 `% w2 Y
. N- r- S' _2 X+ @: f2 E2.1 全球/通用结构(以 1 MW 为单位)
* K8 U% x9 E3 x) h, K, k5 w综合 JLL、ConstructElements 等[2][41][40]:. d2 S& U1 @ O: Q, r
A( g! G6 O% Q: Y5 ~+ d
壳体+机电(Shell & Core), g3 X' t( P! _' ^/ N3 P
. Y3 A: O3 k7 h% E* r
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
% D4 n( H6 J) i- h: f6 K' _( v其中按成本构成[40]:
6 m: Z2 m* q& ~电力系统(变电、配电、UPS、母线等):40–50%
+ c1 Z, W7 I/ X4 d b6 x机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
' T$ r0 j. Y" l3 X7 }% }3 `建筑与土地、结构:约 15–20%
8 M2 W9 y8 f# q6 A1 D) T( K" s& [其他(消防、安防、楼宇管理等):约 10–15%
' c; }% G+ p8 g3 t7 [& \* ?IT 内装与 AI 基础设施(不含芯片)
* E/ C% r" E6 y+ R
3 H4 T6 C4 d0 n) s* ~高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。1 K' M* I7 y7 W. l: h3 ?& d1 D
GPU/加速卡硬件 CAPEX8 h$ I" I% E* Y* Z3 y
) t8 m" B8 ^3 I- ~/ l) |9 O多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
( ]( [ Y' k0 t; H r4 i2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
$ b$ s5 }: X8 {$ H结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):5 U. M! ~# K/ N9 M- L
9 J9 E! k: [( `3 B8 x区域 典型建设成本(壳体+机电,$M/MW) 备注- X+ f) a4 o0 \1 w
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
B0 w1 W6 j# `5 f美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
, R- ?6 c! Y4 _% X2 n; H欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
2 ^/ z* Z% u5 `; e" f& F o7 |中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]8 v( ]5 @' W m5 y. q( v' a% m8 {) V
结论:
8 n+ ]& D" O' Y- P% e7 z: o3 s: }) T4 Y
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
, O" j4 b0 y5 @. T( D( Z# H5 B. i! K若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
9 H, R) T. ?; \' w1 u5 }, r2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
+ {6 [. p# Q! a4 }7 l5 ^+ g9 D以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
0 a8 Y# n0 I1 r$ N7 X2 T' u" z6 \/ W' A# R7 e5 F8 E, C
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;, S5 Q; s6 z n" k% p# ?
GPU 配置:! u; ?3 _4 E% W+ R: n4 N
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
1 j) J6 M: o. K4 C! q2 j6 I, ^每 rack 成本 ≈ $3.0–3.35M[34][69];
' ^7 B4 N7 Y0 I! B7 S/ f! RGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
7 i) H% r6 M. {) {. M" j+ v' }与不同区域壳体+机电组合:
" _/ v) d" h+ Z
; J( O8 L4 _1 b8 v0 i ?% `9 `以中值估算:7 S9 x' y5 E: Y
# J- U8 f, j8 f8 a5 Y& e
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B1 v# G$ V$ s' o& F+ ~! P
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B# A" r9 D6 B' S' ]: p
欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B8 H$ [0 b( \- Z8 _ ~3 t K
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B$ W0 Y9 o$ Q$ c/ w- _' F/ P
可见:
7 g! l) [. A# F* L
% e- T5 m$ s& V9 k4 n* XGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
' P7 c* n3 [4 z" s1 C相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
! w: Q: A2 u# }- ~7 f三、运营期成本结构与区域对比
5 j. [# b& r" q+ x; p+ O3.1 通用 OPEX 结构(高密 AI DC)' B* o+ L1 V* x7 y2 G" v _
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:1 k# b: q) _0 d. {
, u8 D" }8 h/ r0 _6 O$ w电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。$ ~. P G4 s; b5 C0 _
冷却与水资源:' b' Q) y4 l! y! a1 ?8 s9 |! a
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。/ g# |# y" x* k6 n* U8 @$ f- ?
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
/ G* f6 I7 h4 w/ Z* C人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。2 F9 @& L- D4 @5 Y5 n5 T
托管/物业与维护:
6 n: O+ |& {+ s. r: m托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
$ K4 N' `% K+ c6 q% `+ I( s. ?硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
: K7 ~- {5 l* k+ W. b3.2 区域差异(以 400MW / 3 年期为例)
- T) g8 ^& ~4 Z使用 ChinaTalk 的电费与人工估算[1]:
( I. w) d: d% Y ]) h! C7 b8 |; f: p- z* h- d
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:% c7 Y0 ?: @* f$ A3 G
中国:约 $0.06/kWh → 3 年电费 ≈ $350M
# }$ R; o( j/ F& U美国:约 $0.09/kWh → 3 年电费 ≈ $600M
5 }( x& ^) h/ |9 R9 H6 p5 H中东:约 $0.07–0.10/kWh → $400–550M
- C9 `+ z7 E ]$ ^9 N! Z+ d欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
3 n/ w, B7 S' Q$ S+ \$ o1 D8 G( `% i水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:0 w8 r, W& K( `+ Y! M
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]5 ~6 Y9 j: f% S- `9 I; X% W5 l! s- p
三年水费级别:
& n5 R4 x$ }- W/ j4 V- h美国:$40k+
) t4 F. a* P* o% e中国:$20k+' W, n$ H% k, d/ v9 h
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
6 T9 C3 W: O. h+ b, h人员成本(3 年) – 假设 500 名全职运维:* b- g6 H; t9 G" T* t
美国:500 × $120k × 3 = $180M+
7 y2 a6 v9 j# ]8 m中国:500 × $22k × 3 = $33M+
0 r' \1 h! u) ]5 r8 [. Q, }9 @差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。/ Y y1 N& R& d U. z) a
整体 OPEX 粗算(3 年) – 400MW 场景下:. @* I+ ]. S# ~; s- x+ ^" }7 v2 h
! v+ V& ]2 c* O. n# D4 K/ U, B- c
项目 中国 美国
% T. l. g6 o5 K* K) ~' S/ z, Y电费 $350M $600M
2 }3 }; k6 }3 `0 g8 t$ H水费 <$0.05M <$0.05M# [* d% p: U3 X) X
人员 $33M $184M
4 T' k9 e1 J3 S& n' t6 D( J3 \其他维护/托管 同比例估算,地区差异主要体现在人工与地价 " d4 [1 t9 y" O C* _" s o8 P
结论:% m M; Z- E0 T
- T5 T+ O' D7 `1 f6 |8 F
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。$ e) A$ Z* Y# j1 F3 A% [. k( c
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。0 p) k9 u* U; T9 \
四、基于 token 的成本与利润推演! ]4 Y" u/ s2 U3 D, {1 w6 q# r1 l
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)" z9 ^1 l5 C/ J& K
统一假设:
, K5 _1 y; {. e7 @0 R6 s; k3 }2 h S b* X: r
典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])8 A9 I! d; M2 p0 I0 L" a
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh% b: n- B3 ]7 Q' t6 F* w
1 百万 token:278 Wh = 0.278 kWh
& F7 d W$ F& h2 u4 h场景 A:美国电价 $0.30/kWh0 i2 V( B; X; w
电费/百万 token = 0.278 kWh × $0.30/kWh. I) e/ z0 d! Z* |. B5 X5 s( f) y
≈ $0.0834 / 百万 token# \" g" @+ n# s0 Y+ t% L0 b. _
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh$ N8 H* p6 Q. g4 x+ `) E
电费/百万 token = 0.278 kWh × $0.042
, d. d* J( h& x% P≈ $0.0117 / 百万 token
; N2 i. N) H% {' g对比当前 API 价格(OpenAI 2026Q1)[62]
& {5 S+ S, T5 c# Q3 {以输出侧为主(成本最敏感):
d4 X( _0 z7 N" S& |, M2 D0 r4 b- d7 ^6 f- L" K
模型 输出价 ($/百万 token)6 x% d9 L+ C, l" a
GPT‑5.2 $144 i: E T# ?7 b4 N( \0 h. ~) K' Y7 N
GPT‑5.2 Pro $168
1 S0 H; c% \& L1 a; Z5 m2 UGPT‑4.1 $8
" m" T1 U. S0 g3 ^: @2 HGPT‑4o $10
" T5 s" A; V$ B6 n3 ?% b4 ~: tGPT‑4o mini $0.60
" D2 ~3 ^4 k \则:
- z! R: M; y& \, r
3 i0 C% m% V0 B$ h- Q在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。$ c1 J# V9 H N* c( e6 R; k
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。0 y {6 L! ` f4 _3 \& b% W! G
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。/ c; d. \6 Q" O0 H& f* P
结论:
. p* R: s8 G# O" O+ d- \ P即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
9 a q5 m9 x k# |/ y$ `4 O- [9 K f8 d: I2 h" I! b
4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)5 _8 s4 ~8 G! @7 y. z6 z+ E2 a
以 LenovoPress 的 8×H100 Config A 为例[28]:& v! m+ j, y" J8 e* g, e3 n) P0 T
* Z- s/ {" {: j' q
5 年摊销下,8×H100 本地推理 70B 模型:
( e' T, z7 t# L0 T小时综合成本(CapEx摊销+Opex):$12.08/h
( }3 u: A' [8 m# a吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens
$ l6 F' W3 \ E* d! v7 \" H$ F成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token9 B9 N" K& M" V* m( V' L( Y
电费在其中的占比: v4 A* o" d- c
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]
5 r2 [9 a- U7 N& s; q- u电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token) k1 E2 v; y) k7 a! {& W
电费占 总 token 成本 ~7% 左右。8 X- G' ^% s1 a7 f+ Q8 Z
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
9 \4 T6 @! }, M6 o8 [- w' F若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。& R3 F( \2 b0 C7 k: M
6 y. A8 B9 Y4 E r' H' x
因此:
+ X: `2 Q' U2 R9 D: k+ V; ]+ s6 N2 n
在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
4 \* P) H& A8 n2 a$ g- N在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。" f' E/ K5 I2 x( v2 V
五、不同芯片方案的建设与运营成本对比
/ H( o7 {8 e0 X) R# q5.1 NVIDIA 方案(H100/H200/B200/GB200)5 A5 A6 j& `% g7 _+ q
CAPEX:
; h, |4 r; k, T2 c; n# V1 t9 k. u" Y( B/ A8 C
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
4 C; n# s5 C6 Q; d5 s% Q% zH200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
$ j7 O* F" G+ o0 U0 _; E, DB200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。5 N6 B" e# m, p. S# b0 S% i: V
GB200 NVL72:
2 Y* f" w; _7 M7 Y; ]每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。" b% D0 g4 Q) c" L/ u
冷却系统每 rack 额外 $50–56k[35]。
E5 D. V3 Q0 u5 ~ W( X% D) J在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
" @) J# ?. D6 X' B, J7 XOPEX & 能效:
; K' p+ c7 `( W5 q) E: F6 S$ ~
q' D3 }; |2 V0 L* x6 L单 GPU 功耗:
, O+ E0 A( V0 s+ \H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
. q! ?( k- [+ ] d4 x& m. `H200:功耗类似或稍高,但性能/W 提升[9][10]。" s6 @4 `. E" Q7 C& u6 L, g- K
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
0 }% v* |, A6 N5 YToken 性能:
* i6 F* i, C4 B& k, I4 yB200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
, A; j# E* e) F$ L7 \# N+ \NVIDIA 的优势:
& K2 ]" R/ M; w
/ E! A+ [* ?3 L软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
; S- f0 B; Q6 D& P& J j; y但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。; v2 F9 v, t. \' X/ y: A
5.2 Google TPU 方案
6 N7 B% z) L' D5 O8 e1 a; V0 DCAPEX:
& ^- R, s% B" n: ]* N1 r$ w+ [; ~1 a7 v
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
3 |: [" C, I' n4 GGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
7 A, }, `* y. K/ M# A8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。. G' X% |, P g" f# h" R- w/ V; b: v
能效:
6 D" p! Z3 T2 e$ v
5 d7 F" d) a5 } p. v& D3 oTPU v5e vs H100:
1 V6 _8 Y5 b7 U) W! @同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。; x1 Q9 X/ U+ D, ]
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
' E6 Z8 i/ E4 s- t新一代 Trillium/TPU v7:
* K- S, x% l6 L `; N. x能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
- b" `$ ]1 S$ @! V. ?; Z+ q$ c* pGoogle 方案的特点:/ M7 F2 F5 }5 x
/ B! n9 d8 s) Y, F# g0 W/ A- Q4 \
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;. u' {2 M- d# y$ h+ p
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
1 c& p6 v$ [6 Q" u5.3 华为昇腾 910B / 910C 方案
, p! S* ~+ O% q2 KCAPEX:- S5 u7 S* j% ~! y1 W" T7 O
. S3 n4 _& x/ p单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。1 K0 D/ m1 Z3 }) J; u8 [9 j
与 A100 对比:
9 P4 Y) D! ]- K0 E; }, [# jFP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。( C7 P% A3 K+ E/ H. x+ \/ j; _$ R
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
8 h8 F+ m; R4 s" u( @% I7 n使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。; F* R6 C% {, E) e- m
OPEX & 能效:+ w; Y! s$ i1 c; L
I8 W! G! ?* z- B1 O. y
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
: z/ p# f" |$ ?! C* S部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
" a6 F* b" z2 T' j1 ]& x在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
9 X7 c! M1 L* b( ?1 q; l9 L5.4 平头哥真武 810E(PPU)方案0 F1 T- {3 j9 ^7 Y3 x
CAPEX:; s8 b2 R0 E$ m1 V" G4 O
' B( D# v$ ]2 e5 Q7 I6 r
技术参数:
' j- N+ F- h/ u6 y" d2 A+ A96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。5 t* C: u! k5 t3 Q
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。: }/ I& h& T w$ e
价格:
* @0 S6 u% z7 D未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。+ r+ E5 c! o' I$ E+ F$ ~
结合国内报道:' H5 p& U/ g8 F9 e4 ?
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
; z5 T1 y* r5 z0 ^+ {- A# }数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
8 f8 Q3 l1 H) X% ~2 i+ U% dOPEX & 能效:
. K% g2 }" @4 X7 I4 D0 w% `
9 F' Z5 m; E* ` o; `0 }400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;9 r& e4 x8 ~% _0 z4 B
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
! Y! V. I$ F. ~+ p' J% O p$ `六、综合比较与策略建议
8 ^2 `6 o* v3 b9 J) P# y3 u; p6.1 区域维度:在哪里建 AI 数据中心?! x- U* e1 F7 n, z9 a
纯经济性(TCO/tokens)排序(假设无政策/合规约束):( [; S+ `5 S* l& ?4 T
. i; n% V" i% i8 p, _中国西部/北部(电价低、人力低、建设成本低)
3 S) V$ {" `' E. I( v% D中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)3 o9 E6 A& V# s" Q) k
美国电价低但人工高;东海岸/加州电价上涨压力大
4 i" |5 U; E& @欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
, o9 q# [7 N7 f0 F若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:7 `% s) }7 m$ ^' T
: P, q2 s! T$ w* Q/ v! _纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;2 d' b3 j* F3 v: A! f: ]
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
) D( M. e0 h. ~* \1 {' u y但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。" ^2 \6 ~* ]) n
6.2 技术栈维度:选哪家芯片/云栈?
, c( c# f3 J; H- c若目标是全球最优 tokens/$ 且不受出口管制:( c9 W [+ s# {- x I1 x' O
7 c3 [! N6 z1 J
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。9 Y; N, c- c% {7 T7 v8 ]! L
若在美国/欧洲,能自由采购 NVIDIA:% _" o$ b" \2 } E: j3 e( P6 B
, |9 h1 O! B9 w: F
短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:* Y5 b7 g3 U1 O) \! q& C( f8 q/ V% f
成熟的软件栈与生态,极高的 tokens/s/GPU;
- ?. p9 `- C4 t- V在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;% R% c" R0 g; x
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
7 Q. v, a# l! X( g8 i若在中国或存在出口管制约束:
- n3 z! ~- v1 ?7 ?8 M5 ] c* n
0 W* d2 }, q/ ~& A% @4 W' ?% x昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:5 I4 f& x) _+ Z
性能上已能覆盖大部分 GPT‑4 类推理需求;# t. x$ h" ?2 l/ S8 W5 N4 D
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;2 G1 ]( P0 G( D% U2 Q5 `
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;$ |% n, `7 f* c& T0 w2 J1 T
建议配合:
. V! E5 F) z* |: `9 h* u3 W+ m高效液冷(PUE~1.1)、
5 ] j! i! o" Z3 g8 w大 batch、路由(浅层任务走小模型/低成本芯片)、
! k( ^2 I6 M, u% a强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
; U6 b- _# S8 g7 b x* G i长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
" A+ S- z- U/ M3 ~
& M4 S. \' A% w# ^数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];. i1 I! X: W* K
这意味着:/ o+ U8 v) a: `8 _/ w6 p8 ]- u/ i
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);* H" O; w/ t4 T. W3 c/ m
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
% B: L1 A$ }' w0 l6.3 针对你关心的具体问题的简要回答" Y! ^9 `" v, P2 k9 y% v# N
AI 数据中心建设 vs 运营成本的大体比例?$ R/ O; n0 j$ G3 w4 J
& M( Y+ y. [$ q/ n) _/ G
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。8 R# l/ u8 c. m% w" Q
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
, y2 `' l8 F) m$ @$ v2 A中国、美国、欧洲、中东的成本结构区别?
2 o. w. w% n9 m& B) O' P; s
+ H/ v0 L3 c; o3 m: [' `2 n建设期:( |* n/ m4 n8 U1 |
中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
$ n8 ?( A [/ X, D运营期:3 e' W: M9 l y: I( p
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲7 P! [/ V% R8 b7 U# y, U. U; j
人工:中 国 ≪ 美 欧,中东居中。
# {5 i( q! D( f9 M& K. m3 |1 E0 c在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
( t; f1 z% z: a" q* ^9 R+ G
" t- r$ W& e7 u) C对于典型 1 J/token 推理负载:% X- W3 R9 f( P, M7 N
美国 $0.30/kWh:电费约 $0.083/M token$ L v: a9 ~" b7 B% C- j
中国 0.3 元/kWh:电费约 $0.012/M token: g# _1 n) [1 d) s v5 M
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。0 [7 Q, C+ p9 [- S
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?/ A* N i% ^" @' Q# v* s. X
# y* i) R s8 Z# A
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;
! h5 G+ T/ p Y9 F8 r2 n8 W6 c全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
3 L" [9 J; L+ X( k. f中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|