TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:# J% n4 l: b6 T) `. \
# z( ]+ Q T+ |1 x
一、总体分析框架与核心结论6 ?1 g/ g( O2 z& w. o: F2 W9 w
1.1 分析框架概览; R$ l, \" p! V% c
拆分维度
3 [2 }. I. Z9 B- s8 p+ t6 L. O8 a3 y! n6 S% ]
阶段:/ m/ B. Y7 h$ [ y7 C. s
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
4 R) f- w- j b3 S- i+ M& |1 _ g j运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等) S0 P1 }) }5 z
区域:' [- [/ |9 w, B* l0 [
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)7 }# S/ _& Q. p/ N9 P+ T
技术方案:
5 }7 f: v# @2 v, C' y0 ]NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
+ q7 h; ~/ v, i1 C, \3 K. w/ D, aGoogle TPU(v5e/v5p/Trillium 等)
% L* U; s. G0 u* Q6 j# @中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU). D# v. n* P: }5 R4 B
算例基准: a4 ?! u+ O# \6 `" X3 z' d4 A% ^+ ^6 S
( P9 ~8 z5 a* O8 W
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:% m2 O: f4 F, f! q( }! ^
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW( w8 l* s0 b* K0 Q" T) n0 E9 p
PUE 假设约 1.11(高效液冷场景)[1][29]
O4 B7 q) a" x9 x& `) m# ?+ ?. v* }时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
6 t3 D2 J }& n5 ]关键指标& ]3 q$ q+ W/ o* b; g$ h
& y* d* |2 m; p! Y3 O" r) _8 b3 q# r
$/MW 建设成本(含/不含 IT 硬件)
' C; R& C6 m& W! T1 b% t$/kWh 电力成本、L/kWh 水耗
; o1 L+ X! ^0 x+ ^' l* H% L$/token 或 $/百万 token 的综合成本
7 ~2 J+ H- k0 r; ]' f) d+ h' TToken-per-watt / Joule-per-token 作为能效基准[17][18][26]
- F2 ~& s4 g/ ?% X* p项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)' A+ H5 Q4 L7 V+ B: L
1.2 高层结论(供决策快速参考)7 r$ D1 l6 V2 [" Y5 A$ n Z
建设成本:AI 数据中心相对传统云数据中心成本翻倍
. ?6 E$ Z' M! X/ F: M* K& t# I( F
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。. ]; b" ]. R- Y/ w0 N. v# m0 z
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。5 S Y: [- a# P! |
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。! a4 N# }6 u* }4 c7 c* P* v4 N6 l
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区/ h6 v' Q! r# g1 E8 f& o0 ~
2 p6 N9 j- g6 u$ z% R1 o* F- M中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]1 d: d5 L8 n, b" P" }+ i! ?
美国:$8–12M/MW,400 MW 约 $4.0B[1]6 `+ |! ~; i( M
欧洲:接近全球平均 $10.7–11.3M/MW[2][41]6 V- O# ?% A. \+ J ~
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]+ e& n1 r8 K$ L$ ^2 d, \
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。( m' }! h% d( }; ?5 d: Q+ ]
OPEX:电价与人工决定区域优势$ h$ b; M: L: l* J6 [5 K' E2 C7 U
% f7 K, Y2 a/ G% T1 k; Y4 }电价(2025–2026 工商业大致区间):5 v# d) X, k8 h: a! J
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]; d; u: Z* R3 U8 K7 |
美国:工业用电约 $0.085–0.09/kWh[44]
5 _* ?' D7 Y; Y* n0 D! H" p欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
) T Z2 J) K0 X0 n% b4 s中东/UAE:工业用户 $0.07–0.13/kWh[47]% K5 u, [+ m7 y5 X6 \
人工:
4 }* c0 D) N7 S2 R中国数据中心运维:约 $22k/人/年
7 j) ]5 q( h; W X9 C美国数据中心运维:约 $120k/人/年[1]: `+ B) e$ k e& ~" G- T, C0 F: X( z
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
: b7 h9 Z* U [" D7 l9 J能耗与每 token 能源成本:能效差异远大于电价差异
5 K, Y3 ]. E$ |* n3 M/ U) x( s w
) D0 p( L7 q) M3 w5 oIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
1 A H% L9 Y! s6 L Q5 q大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。6 n, v) q, T2 g5 z1 W
将 token 能耗约化为统一口径:
0 C/ t5 q5 j7 h" l! k. q5 h# r粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
: X. b- p. B) Y0 m/ f0 S, U. Z中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token- _( n3 v O& E' u
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
' d& J$ F& E5 m对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。4 y2 @, O* |, C3 n, y3 C$ W
不同芯片方案的核心差异# @) I4 K- P! | s$ I
3 Z+ Y& }' Y0 \1 lNVIDIA Blackwell/B200 & GB200 NVL72:" s6 P* f9 g7 ?/ v+ W1 a% j' l6 Q" C
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。
) s% C! ?# _8 c9 ^: G" kGB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。% ?8 r7 M/ r8 r& o$ c3 ?
Google TPU v5e/v5p/Trillium:7 c/ e3 Z- b) [0 N
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
w9 b9 {3 Y) t! X* {4 @0 fGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
' i# M/ ]. L. L$ g/ m华为昇腾 910B:
0 b8 V) U: y! R9 O, T9 x8 {FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
+ e3 z9 j0 H/ Q* E单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。" c! H( ~0 X" _/ Q* h& N
阿里平头哥真武 810E(Zhenwu PPU):9 W3 P% B( n5 D4 R0 \0 U, {
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。+ n9 L: v7 x8 \/ N+ j5 S6 A. i
结论:
% k: g/ m: M& w- z* |) p* F能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。$ J+ v& D5 F! q8 A1 j$ ]/ Q
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。6 K" U" @1 l0 J9 q) b2 Z; A
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
\; a4 z# a. o7 P7 h, V/ P% B4 _1 z自建 vs 云租的 TCO 与 token 成本
) q! V2 |; @' a, l) b' Y' H6 e% O8 n7 Y! N4 _
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:3 ^) P" c) S0 C
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
5 ]/ Z: N$ ^: b: R等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
4 q* n9 n" B4 @+ _2 V* r8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。' r+ J' {; i/ r# [. N* t e
Token 成本对比示例(LenovoPress 场景)[28]:3 W* B+ w2 b0 l2 d
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token
" r3 @+ G# h) r- uvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。+ L* p5 T2 ^; O3 q& z
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
( T% r/ ]- w" T3 ~Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
/ i, h8 C, _$ H( i# b' D0 O结论:2 D' A9 r q, G. C1 C7 ?# J6 L
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。% W! `/ \+ l* p
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
( i; A% m. \/ b二、建设期成本分布:区域对比
8 E) g& P2 F7 S% p2 Z以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。/ a4 d+ u" y7 ]9 u
* K8 l, o2 L# B: J) A
2.1 全球/通用结构(以 1 MW 为单位)
# t0 F& l8 K5 N) B综合 JLL、ConstructElements 等[2][41][40]:
/ x" X8 ^5 \5 P6 w; b7 @" r: i5 k. M, }8 T1 {$ A
壳体+机电(Shell & Core)6 Y& S0 b' y# Q% X
+ w4 F2 k% {" E$ \全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]! m9 l5 J* F7 N
其中按成本构成[40]:
3 J! ~; k- `$ k9 x u. l电力系统(变电、配电、UPS、母线等):40–50%" X4 {2 ^5 h r2 P) r/ i; Q
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%$ X& I7 T- Q; E( T$ z
建筑与土地、结构:约 15–20%
2 C& F2 e' `7 U( T" O其他(消防、安防、楼宇管理等):约 10–15%- R9 H. s0 M3 u8 N! p
IT 内装与 AI 基础设施(不含芯片)
0 B; c: J$ ^+ X. D V
( \: [ Z9 _1 Q高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
4 h% v# C F4 X3 m- J) \9 MGPU/加速卡硬件 CAPEX
( x6 Z5 k2 _1 K8 q: R6 y6 Q
X% {* P# z; \! Z1 u* k! f多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
; Z4 \# ]( R( r* K2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
) n4 \; o/ c- ?. c' ?7 m; J$ C结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):9 B+ B$ Y$ _7 j+ x: x3 `
! h {/ m9 D. L& `2 v区域 典型建设成本(壳体+机电,$M/MW) 备注
2 t' Q5 n5 f1 H$ }中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]) @. L: | x8 l o1 _ J
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]7 |- J/ {' Y3 z& V" U
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41], o5 ?6 o3 O+ J3 F/ x; K
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]! J& E- G! q; B9 b* O& c0 C
结论:% `: T- K9 U" u$ Z; Q/ k
7 I( k6 j7 l+ M0 u. Y$ W- H( }# _9 A单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。" G; T1 ^6 j! \8 {3 w/ y# P5 @
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。$ T. n9 f. K/ F. L; x$ ^, k
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)' y( q+ o- V( s/ N
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:1 M. T [/ t& g, }0 R
. M; ^( N g: @& Q0 e; Z6 P, @! ]
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
) u$ }# ^0 z5 z" DGPU 配置:
( J4 }' g* Z* ]# k有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
" t5 }1 ^! V! u, H3 o6 r6 i每 rack 成本 ≈ $3.0–3.35M[34][69];% N/ k8 H3 g. n# K; H) ~# i" |" g
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。0 P# N( N& B0 E( b
与不同区域壳体+机电组合:
5 P. i( ?" s* n5 E$ N: Q2 Q6 n) q, Z* s; O# R! y# R
以中值估算:
7 {7 B+ I. B8 e: R; c C1 J B' S5 m5 h0 G `0 ~% K
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B( F, l. p% ~6 U
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B& j( Z, F$ u0 G( M0 @; h+ G; [
欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B/ Y: P/ ~) ^2 G2 l% n8 p5 \
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
. F( b& N0 |) G) J( S' w可见:1 h! _. l! F2 e, _
* K2 L; o' B8 w* @8 i0 [8 g( A/ R' UGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
/ d4 u, x7 b! v' Q: j9 n2 f相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。( L9 w6 U7 S0 o. a" v1 {) {6 J
三、运营期成本结构与区域对比9 M& |% ~) `1 |, h8 j
3.1 通用 OPEX 结构(高密 AI DC)
1 \, B8 J1 ?6 n结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
5 ?. I* U& G) z: c' q9 {" X$ h6 Z) B
$ y. |2 b# @- {* O5 Z. v电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。, K* b7 Q0 q$ v5 I: x
冷却与水资源:
! q" S0 N% a- D能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
. s2 N- a* X: ?! _& S7 x4 F水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。* W6 C, L/ s0 k/ W' ^8 D3 ~4 v
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
$ q" e7 }& m+ [/ M, F) ~托管/物业与维护:
# x2 s+ x; }2 h' T. P: U3 k托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
! n: E: t$ N2 l, R2 r; U7 r硬件维护:LenovoPress 模型中按设备价 12%/年[28]。; ?0 h/ L1 b# O* v$ U0 M/ Q
3.2 区域差异(以 400MW / 3 年期为例)
: J8 {; m5 [1 {使用 ChinaTalk 的电费与人工估算[1]:
) i! v L9 M* b9 ^* [# T
' C1 O" W3 q" L; C+ i电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
, z9 G4 _$ d0 A) n& G7 \4 z中国:约 $0.06/kWh → 3 年电费 ≈ $350M4 U1 x* p5 l; x
美国:约 $0.09/kWh → 3 年电费 ≈ $600M: _1 `6 b# X; |: I% v) W! \& |
中东:约 $0.07–0.10/kWh → $400–550M
3 z$ e1 e, h! M欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势); f! ^4 s* M! B4 F5 l# V8 d. }
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:) P' k0 h& l! u- s7 x( L! {$ e
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]1 C) F& D! U6 r. g5 Q7 H1 g
三年水费级别:! l3 J! D# u) a2 H) k
美国:$40k+$ ?& O+ w& f& q
中国:$20k+' m' E, \0 Q [- R
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
* K" e' S! D+ w人员成本(3 年) – 假设 500 名全职运维:2 u. W3 p5 S8 f! d
美国:500 × $120k × 3 = $180M+
% M8 d7 b6 s& u: ~' V, T4 K; a0 l. Z3 g中国:500 × $22k × 3 = $33M+
: _5 c% \) E0 {& A# s! q' b差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
/ G; I+ @" `/ f整体 OPEX 粗算(3 年) – 400MW 场景下:, Q7 |5 i/ f- l$ C1 ^ _
. v: ?) g# A6 d5 O- v
项目 中国 美国$ W, @ O: f+ `* X3 f. k
电费 $350M $600M- W4 ^' V; u8 {
水费 <$0.05M <$0.05M1 Q1 R! s. Z% ]
人员 $33M $184M, F% Z8 |4 X% x2 h7 w* `. E
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 ' N/ f- n3 O; T* w! E% u- ~
结论:, F1 Y3 e- E6 p( e6 |4 M' @
# Z$ |: t$ W& s- u
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。
% f$ y9 |$ k S( N# J对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。$ \( z% L$ A5 s6 z/ u
四、基于 token 的成本与利润推演
, s3 d) K0 y) m4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)8 M0 ]: s" \- v6 J, @- ~
统一假设:
) P5 W6 p" [( ^; H" x% V) C( U$ z/ \$ A
典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])% Y3 s$ [2 K# i3 v9 o: f
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh3 v3 r* L$ N& X( @! \. {0 @
1 百万 token:278 Wh = 0.278 kWh& C/ ^+ i9 Z# i% B% f& o* O
场景 A:美国电价 $0.30/kWh
" J! } j: ]( x8 H电费/百万 token = 0.278 kWh × $0.30/kWh/ W' Q7 Z, p" s0 f+ L- V; I! n
≈ $0.0834 / 百万 token
+ x* [$ K, R$ e5 a! C8 ^场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh) [+ T7 m# J$ V ]. ?* T, G
电费/百万 token = 0.278 kWh × $0.042& F: ?# _6 X# m9 P& p3 x! W8 A
≈ $0.0117 / 百万 token& {- L2 t H9 _, t1 {
对比当前 API 价格(OpenAI 2026Q1)[62]
$ l( _# d6 |2 D% M) e以输出侧为主(成本最敏感):9 L; i4 b1 l& [/ i* b8 W9 J
1 ?' B$ D1 s n' | Y
模型 输出价 ($/百万 token)7 i. y2 @% ^" ~
GPT‑5.2 $14
' t8 s" m; k) M' u! P) TGPT‑5.2 Pro $168
' Q$ H6 l6 e8 PGPT‑4.1 $88 W5 E/ T) r* V/ ~; L) i
GPT‑4o $10
9 s2 c4 r% Z! [! x4 b& _& I M! Z/ VGPT‑4o mini $0.60
0 `6 H3 ?$ t0 n则:: ~* z' g+ m' C d, y
1 v% w c. L( M3 @$ u/ V9 ~
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
+ `( \" h# G. \1 M在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
0 V7 a+ w8 \3 {' y相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
) C: c& z: j% [ z; A结论:
# O y+ M- q5 V$ R* k7 ^2 A即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。/ k) ]. W/ D z7 }9 Z
: D$ `0 w$ E9 V8 `; @" q% R- j4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
0 e/ C0 `9 y; y% H. A5 w以 LenovoPress 的 8×H100 Config A 为例[28]:
- a; |& S4 N4 K+ H: x# T, e# y2 L3 J/ C8 f
5 年摊销下,8×H100 本地推理 70B 模型:
7 }$ }) d) m; u1 l小时综合成本(CapEx摊销+Opex):$12.08/h5 J; D7 b6 b0 f; K+ p; K% t1 [
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens2 W/ q7 |& ?% t, o' H
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token* ]1 }, G7 X# a# { e/ P0 |
电费在其中的占比:+ O. Z r2 `6 k0 u6 U7 T
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]6 B* o" W5 |( V& W1 C! H! C9 e5 W
电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
0 F5 l) o: |' r; N4 j# F+ {$ L4 s电费占 总 token 成本 ~7% 左右。/ L: F) O2 ~2 D! j5 H; P
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。2 k1 d7 q( H$ y0 |, G
若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。
6 Q. M- _6 k& }4 X$ R, s3 ?0 [+ @; X U! G( e/ z% q# t+ `7 ^* X* F" x$ \1 F
因此:
1 k* Y- [ F% v$ A6 F6 }! }: n0 W* b/ m1 m. l
在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。4 }+ m6 R: I# m
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。1 w" A6 U0 J, n) F" x+ e ^2 }: Q
五、不同芯片方案的建设与运营成本对比) } u: @/ P6 y! o' |% @1 H; {: q
5.1 NVIDIA 方案(H100/H200/B200/GB200)& k3 }1 i0 B" d, O% I) O3 r
CAPEX:
$ Z! B5 z! _ \' y: a; K: R/ J
, j1 h5 S6 ]; VH100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
$ Q+ S6 I: C/ K. BH200:显存提升,单卡价更高,8 卡节点约 $280k[28]。& m$ u, ]' R3 o* b- O* z% |
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
4 A! J% j# b9 U" E) I. XGB200 NVL72:2 {% x- c' d8 G+ v1 J: j- s
每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
* m0 H4 X% H" l$ }9 N冷却系统每 rack 额外 $50–56k[35]。( |7 _' A4 h: B3 Y, t
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
- _1 _7 _' B, G. ~& ]8 OOPEX & 能效:
% m4 |# D* X5 P* D& w% V& y4 A& ]8 q' ]8 P
单 GPU 功耗:
) q4 ^- x- r8 _1 @0 q/ P& zH100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
e0 Z$ I/ N2 b/ E' {6 MH200:功耗类似或稍高,但性能/W 提升[9][10]。$ s A* E* z+ m$ _. B+ V0 ^9 k. p
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
) w: v* K; y! QToken 性能:
4 U. N( Z) v5 S, \* HB200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。* \" w. v3 T, x0 _+ B
NVIDIA 的优势:
9 L! L2 T& B M @0 ^2 N' \ A6 f/ f+ ^! a9 W; N' W' a/ G) z
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。8 f% j' D6 f4 X
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
: {: {# T5 F; K) }- y- A5.2 Google TPU 方案
# B9 ~% Y2 b- ^: pCAPEX:
8 x9 _. F! z! v0 n9 Q6 W d1 v$ ]
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。" O( i( ~6 |4 a3 w. d
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
; @/ w: x" k3 c3 V% Q" m- e" a6 z8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
8 p) B. u9 h4 d. L能效:& o9 I+ C; T/ G/ m
7 g7 ^9 B" L- [; T* P! f! {
TPU v5e vs H100:
; _) ~+ m1 y2 G! G: B3 S同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
1 _2 K" b& @& J4 P8 N测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
+ X8 H S3 K8 p. I$ O5 P/ I新一代 Trillium/TPU v7:
& _+ k. [7 l$ ^! G" ^ L能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。, f) r# s+ s! v( G( _
Google 方案的特点:
2 f9 A; {% m0 l3 W# O9 d/ ^) v
* P! f2 L, k% Z9 q1 m/ @自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
7 p3 L V4 S" A) _% W2 `6 M) @, @2 W对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。% V7 S" w6 W2 o0 s9 z% n
5.3 华为昇腾 910B / 910C 方案
$ o& ?/ t U) o4 h5 K9 XCAPEX:
0 k9 w$ R1 d! b! Y
! V6 A N& A: G# G8 a/ }单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。2 Z1 D; G* b4 b8 k! w& u
与 A100 对比:
( v. ~3 t; U# x3 z2 V' {FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
* v7 `- B9 h1 n市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
) D/ w4 L& f! u9 F- @ L9 I使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
8 }- ~: }$ m! [/ ?+ sOPEX & 能效:
8 y- w" `1 u: T# @8 t- v4 f6 q- Y+ d5 M( q
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
/ M* @+ i! R) h部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。% S/ A3 s0 \4 Q. {
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。( T' @& U! X: g3 I
5.4 平头哥真武 810E(PPU)方案2 g* `. D) {' N7 k
CAPEX:
7 N. I2 O8 q, j7 o" \& X9 m; C' j; K/ [
技术参数:9 N- b3 Z4 O: q1 I- \1 t/ s0 v
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
0 t* {* _ s% E% Q9 r, @$ M! j3 k0 X' `性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
; c% B9 E% s8 F X! X1 H7 u价格:
* z/ o1 m) i- ^5 w) f" C未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
6 {' B( u" t( W& U% t* T/ ^, C3 i! H结合国内报道:% \! _; d9 y3 n6 _" l3 r
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
7 q6 B, p7 c$ O数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
4 P9 T+ f/ D( G- m+ mOPEX & 能效:
' |5 ]8 j6 D9 }
0 ]6 T0 a% G; Q8 t. z400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;" Q* [; j0 w: N" v; O4 z
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。8 C& h8 Y! o1 M }% k; m7 }* N) ]9 U) @
六、综合比较与策略建议( L) z* z$ g. v( e7 q
6.1 区域维度:在哪里建 AI 数据中心?) g, y+ v2 |# }' Z: |
纯经济性(TCO/tokens)排序(假设无政策/合规约束):
/ [1 @" z3 ^6 [& C' u" ~: u6 A, Y5 P) T0 P( F/ q. E5 q8 Z
中国西部/北部(电价低、人力低、建设成本低)$ p3 C" U$ L" g R* H* w4 V% F
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
@+ |& E5 l6 {, g$ v. {美国电价低但人工高;东海岸/加州电价上涨压力大: V5 h: Q( C5 ^" o$ X( A& U( c
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
2 @% i$ X; e3 ]$ a% u$ ?0 U3 I% N若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:4 Z4 ?, o! f5 {1 L: X# ]
. i) z' s- H6 J+ c( [% z1 l2 m: s: @纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;+ u$ }: s. c2 _1 @
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;" S+ W* j7 R3 o# R
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。( V8 p) Q0 o4 c6 g- C4 t: A7 a1 t
6.2 技术栈维度:选哪家芯片/云栈?
% x9 k, G$ {! C6 z若目标是全球最优 tokens/$ 且不受出口管制:
1 b3 B/ J4 q( ^- ]- \+ W8 ]
& t% c: m# m- t4 N5 Q# BGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。 V$ |9 z& V) \) p
若在美国/欧洲,能自由采购 NVIDIA:7 c8 q6 ?8 W1 }9 [ [
, j, w+ f* x1 f7 ^( h' \* W短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:, \7 Q! Z5 ^, t+ z) o
成熟的软件栈与生态,极高的 tokens/s/GPU;) [1 ~. F6 e! B. z( b1 T* ^7 \
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
9 ~* N9 V( o7 Q" r但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
4 Z) q9 C6 M, Z! S若在中国或存在出口管制约束:
* A- x( l6 {( p& R0 k6 y$ s6 C! z( _) T3 L
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
. ]9 ]' ?5 r* h6 X6 m8 H' ^性能上已能覆盖大部分 GPT‑4 类推理需求;% D% H, A2 ~2 Q9 n* t0 I; s- `
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;; ^- w) q" d) G' R- X- ?/ B
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;7 Z" h* ~) m$ P/ a7 d) k N1 A
建议配合:
) I9 d$ k( u3 D; \4 L9 n7 ]高效液冷(PUE~1.1)、
& W# i2 q9 b- ^# ^/ X8 P$ ]8 P" j大 batch、路由(浅层任务走小模型/低成本芯片)、
2 ~$ ^& ]4 U- U! Q) r, O' f强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
, h0 r2 c' `$ P2 t长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
& V7 ^: l9 e8 [ I' ]' f! f
& X1 u: g0 H2 K* y7 V5 t数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
) L9 i m6 R. e# E这意味着:
# w! u1 M, ]3 @) q6 P% ?8 v1 R# p优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);4 w& d8 }6 o5 j, U! l
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。 n8 Y1 [+ ~; }( k1 l3 }$ p* V: Y
6.3 针对你关心的具体问题的简要回答
0 w7 j5 J' I( C4 a0 SAI 数据中心建设 vs 运营成本的大体比例?% J! I$ v9 {; c) N/ r5 I4 v: S
( Y/ }4 E' ~. Q D在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。. H+ u) h0 N7 f: Z
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
! C% D+ J+ c4 W' a* C中国、美国、欧洲、中东的成本结构区别?
; L o6 f) X" q" v( e6 k& r- O9 X: Z
2 y, X7 _! P; {! f+ h5 g: c& \建设期:/ Q0 M; x3 I; Z& W( K
中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。" E) f6 O* s0 x" {3 q t
运营期:# ?! n9 D" S4 A. K+ H7 c9 ?( o
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲0 {% z$ @$ G$ b, ^' }5 m7 b9 A
人工:中 国 ≪ 美 欧,中东居中。
3 z) c* |% f# M; b在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?( ]& q, V+ v) j: E% c
' Y1 W" O! W( ?' L. a对于典型 1 J/token 推理负载:
$ `" e* M; _3 A# T% o6 N% J美国 $0.30/kWh:电费约 $0.083/M token% ~5 ?: j% t4 I" Z {8 z+ b
中国 0.3 元/kWh:电费约 $0.012/M token
, E7 u2 |! a: b6 X& `7 u对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。- _0 U2 a' o2 K E, E; h
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?& ^/ G4 F1 R5 @9 m9 G- S
5 }6 m* x: [6 Z% l. N7 k
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;! x# u6 Z) q/ G
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;% i7 e+ S8 h0 x* ?$ j
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|