TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
3 {" x+ s) Y' a( I& J; Z" Z% `+ \2 C
) k7 D- v# M; v# M7 g9 t8 U& W1 W) J! x一、总体分析框架与核心结论
6 A. K1 r) w5 P+ Z7 ]6 k2 r1.1 分析框架概览
, W$ Y- a+ Z5 ~9 q8 Z拆分维度: R; S+ s$ |( ?: N" k% G
2 k( k" l3 p3 ~% ?) G阶段:7 B5 N5 i+ S$ x1 ?
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施2 `9 m0 `4 ]" M1 F1 r, M2 q- @( Q
运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等
0 _* z# _1 `# H B1 D区域:
6 v1 M m+ T9 z3 m: @中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
q$ I# |" X. J* z% X% k. o) T技术方案:* H+ R3 E! }! V8 v+ q4 [! S
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)0 b: @" B1 b4 ?2 g% |$ i8 @* Z
Google TPU(v5e/v5p/Trillium 等)
0 @! B3 T* `0 S7 d9 u! O# \中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)" t$ P" h% J- O
算例基准
; j: A0 V0 k& A6 Z& N# y |4 g! T( [1 J7 O. D6 ?: p
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
N( x$ k* N! p$ b6 L其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
- R+ u' A) K) P! } @PUE 假设约 1.11(高效液冷场景)[1][29]# Y7 f) U) {* s& Z+ f
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]) i( Y" o1 Q. {, \2 N
关键指标4 I- Y' x% ^5 H
7 p( k7 k* a9 c% S
$/MW 建设成本(含/不含 IT 硬件)6 Y" L4 W2 |" C+ s8 ]1 }+ B! x: o
$/kWh 电力成本、L/kWh 水耗. H- A8 M9 ?4 ~$ X: u+ Q [
$/token 或 $/百万 token 的综合成本: E2 o" W; x- X0 _9 c+ I
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]
; P1 S8 ~) L5 ~/ B, U! m5 y: z e项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)4 {, D3 z) d3 c# F. m& A$ M8 e
1.2 高层结论(供决策快速参考)
& N) r8 v" z) c建设成本:AI 数据中心相对传统云数据中心成本翻倍2 K( v' Q" ?8 {5 l/ k% s
i3 l5 k2 p& \3 B5 L
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
. R& ?9 e5 y% y# a; ^) TAI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。+ {* b2 b! D, [! u. Q! ]
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
3 ]0 V. C- b5 z* Z" L2 ]区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区0 _5 x: C4 {* h
- P5 g$ k0 {" q9 [
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
% F+ S! d! T) Z" M( s美国:$8–12M/MW,400 MW 约 $4.0B[1]
' a8 N% U$ }9 }* J1 Y2 Z6 t) _- J欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
% r7 x1 J+ J1 {: X* M6 W中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20] i* g* h+ T6 T, J9 j8 m( Z1 J
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
|- Q: U2 j' i% g$ _OPEX:电价与人工决定区域优势
( [: g$ p" j' k( S' N6 l; v, u9 @% V5 N; p; U9 ~0 Y5 R7 u, K7 n
电价(2025–2026 工商业大致区间):
4 i6 Z* }+ V2 J! f6 \中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
8 U; {" O i; ]- b8 r美国:工业用电约 $0.085–0.09/kWh[44]
: u) @4 O! K# ?" @5 Q欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]7 {# z& a8 c/ `' a
中东/UAE:工业用户 $0.07–0.13/kWh[47]7 F" |* m5 I; w ^( Q- x
人工:8 Z& G& l5 z& S- O+ e" I
中国数据中心运维:约 $22k/人/年& p4 W& m- ]5 X8 v$ i
美国数据中心运维:约 $120k/人/年[1]- q# y2 ~- {% D. Y) E$ u$ _) r
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。0 v+ D w+ {+ G3 c) U, V
能耗与每 token 能源成本:能效差异远大于电价差异
6 ~, {, I- L, b3 K9 M9 d- Q/ \) V, J' F
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。* D, P& Z# N/ G
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
* o; {7 ^4 C/ h/ a1 M3 t将 token 能耗约化为统一口径:! I; c# a2 j4 W' ?" n
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:1 E" l* U% c, v0 H$ \& ^& W
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token# W+ k3 G h7 J( K
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token! {1 a& @- F! X# k4 Z
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
$ Y* m2 L4 R- g8 ]7 W3 W不同芯片方案的核心差异
) ]' C+ v c8 Z0 M# w9 c$ O, J/ @* {
. b6 o: T6 D7 a# GNVIDIA Blackwell/B200 & GB200 NVL72:5 a y2 F8 s' c- B
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。+ l, h' i: R' N
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
' z2 O: j! V' N* ?Google TPU v5e/v5p/Trillium:- }/ M6 p0 s# h s
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。5 ]0 K& Q/ G4 V; G: q. ~, A1 [
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
9 H5 P8 y/ a3 [& C华为昇腾 910B:
- c' m! d& L1 Y9 T8 L* T, QFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。$ j# x* L% n6 _! I) F2 C& h5 ?
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。" v# w; P, f$ v( t! V
阿里平头哥真武 810E(Zhenwu PPU):8 k9 W W( _ S+ |( q
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。0 h* N* y( }' H" s' `) C3 A$ J
结论:
+ _! C( H, N' t/ u1 _9 ~& d! i能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。- e" O0 N, w' n1 Z$ v6 ]
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。7 k+ x2 _% `$ c/ x
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
[% a- S* G7 k) g' q# Z自建 vs 云租的 TCO 与 token 成本$ S! G7 q$ @/ l% k
Q4 X9 c0 U) x; j9 @. H( DLenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:+ V" n( f) r0 v
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;6 l T1 r$ h. o0 H& R# M
等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
( Q, _) T' H2 r( |/ h8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。9 N z9 t- y" k; W, _- G4 G/ r' N
Token 成本对比示例(LenovoPress 场景)[28]:. H1 e2 B& m2 Z- I0 e
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token! I) l" k. }3 T h6 J3 G7 `, p
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
! j: j' j* }7 v* s9 h9 T- h; e* }同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
* R- C9 P8 V& e% ~( q, V6 u" ~; W) X0 lLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。* v5 v8 T" O! R2 ^* D
结论:# k# d* k0 c5 B
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。. s/ L' N, _: ^
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。! C- m! J3 y' f5 [. S$ r5 k! z
二、建设期成本分布:区域对比0 W% h/ C* j6 C% x) O4 D [. y
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。# x8 D: R) _6 w, U o& [ T. m
2 v8 z3 I% @. m" ^3 z; u1 Y
2.1 全球/通用结构(以 1 MW 为单位) M1 s% g; G! I" G9 H- \1 N
综合 JLL、ConstructElements 等[2][41][40]:
) e* b2 g0 `6 c/ M, ^' F! B
5 [7 U: k; N7 x6 O壳体+机电(Shell & Core)
7 S+ U" y% z! F/ o# p
7 p C1 r# g( [ h0 e; ~4 n全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
0 Z$ o/ x# j# v3 X4 t( Y其中按成本构成[40]:5 u* F0 D# k! ? K" B
电力系统(变电、配电、UPS、母线等):40–50%
B( S4 S( Z" [9 e: X机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%, Q( ?, b: F8 i: U3 T
建筑与土地、结构:约 15–20%
+ X7 _7 [# K n! O* `; o其他(消防、安防、楼宇管理等):约 10–15%0 G+ [4 n+ X% D5 k: z
IT 内装与 AI 基础设施(不含芯片)
4 U$ y3 W0 ^( E* \) Q* j9 X5 A1 ~& [6 J' y( e2 M% \
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
) p- s8 P' ~5 m0 j/ V5 RGPU/加速卡硬件 CAPEX1 ?% K3 ?1 e: M5 U$ L/ w2 M
9 t. z. z; z, @
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
3 j; P. H" ?( `0 _7 J/ g# l2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
$ }/ e' m0 }' h) e4 B4 k结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):$ ` a$ A6 C" I2 { F( ]
! N/ ^# W3 b! G" p( Z) ?* G
区域 典型建设成本(壳体+机电,$M/MW) 备注. U- o; X3 C* w; n- f5 Y/ }
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]0 G. b% ]5 \8 K9 V4 R
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]/ B1 R8 M7 h& P
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
1 {5 [4 B. p' \/ G0 E/ Z中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
`; _. i# l, n5 T; G: A9 A结论:$ ]1 w. y, f, c; U6 L d4 t
4 ~; f* x* r$ U" m* n
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
+ ^' r' D% O9 N' H S4 z3 M若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。/ t* |$ x: m5 i+ P! C6 Q/ F
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
- x% i' f1 `# ^% x5 x以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:; C4 q" G' k+ f) O3 ]! o
8 h5 O: Y( A- Y* r& }/ m
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
4 U T) B) y$ H. n# EGPU 配置:5 c5 E/ p0 O# b5 ?1 m3 Q" ?# j* R
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);/ P" i- C0 x/ Q" z" W; `% |) t% E
每 rack 成本 ≈ $3.0–3.35M[34][69];
: \; ?7 I( V% ]! n ^" u( UGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。% s2 v# \1 m3 T. G: H
与不同区域壳体+机电组合:
' w1 J( d' e1 Z/ F2 B; U
# Q0 E- U" z% v. B4 E以中值估算:6 D& i$ @6 l; V8 P2 s" D. q
. `+ ` }5 d" ~% U中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B3 M3 W# A s0 X' M5 {* P/ w
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B) b; s% \! C4 n
欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B) S" [. P" K1 |
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B! N& K; B5 N( n p
可见:9 Q% Z+ z/ P* c* D: y4 C# \8 L
7 b" Z+ H; m1 q
GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
; m: K! M9 L" m% g8 X! s2 |$ l相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
4 r$ t1 W7 X! N$ ?三、运营期成本结构与区域对比
$ t6 X5 ?1 ^! a. `3.1 通用 OPEX 结构(高密 AI DC). z6 u& y+ V1 o& \" |& _" a4 X/ p
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:0 Z/ g( c- @; ?% k) R# V( L, J1 t
& f4 b. N0 \% s9 t6 d
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。- E4 B3 r7 R/ H- p
冷却与水资源:. q3 u" N/ G$ ?1 S9 B4 S; B
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
$ ?. Y9 d' i; a水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。3 u% H# T+ z; P% ]+ @# s6 t
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。% f8 m7 W0 f" w6 d8 r( h
托管/物业与维护:! Q( S7 g. Y7 e9 E2 e: l4 h0 {/ f
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28]; K& `* q( C" [ H; ?9 o
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
4 a/ z- o7 J. E+ b6 t3.2 区域差异(以 400MW / 3 年期为例)
1 l/ D, y+ E3 q: ^) d; v8 F使用 ChinaTalk 的电费与人工估算[1]:; X( G# c0 g9 C( @5 i$ L, C: |5 T$ e% N
& b& ]/ o1 Z3 o9 o; T
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
) A2 _' k, w: B. M* S. h' E中国:约 $0.06/kWh → 3 年电费 ≈ $350M3 R1 V4 l7 g0 ~/ q! f6 p" V
美国:约 $0.09/kWh → 3 年电费 ≈ $600M( O4 e: t8 _! y! G6 V% q; n, `
中东:约 $0.07–0.10/kWh → $400–550M
5 C( G% C5 B+ _6 @0 I欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)$ |0 @* I9 A" Q! z* E6 r/ I* p3 o' j: n
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:
2 y- z& E# d4 i, ?; R美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1], U" l6 K6 @5 y1 N4 {) T& l2 H
三年水费级别:
' J* U; X8 F3 h' ~) i, B9 Y美国:$40k+
5 @ h+ I! ~; Q5 G; T% ~中国:$20k+
& Z& l5 H: a7 e% v6 z$ T5 s结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。; ]" }- L3 \% A8 a6 ]: c% K5 y0 y
人员成本(3 年) – 假设 500 名全职运维:
5 _% ^% K( R/ G美国:500 × $120k × 3 = $180M+
7 h' B* h- b" v$ L, @" ~中国:500 × $22k × 3 = $33M+
$ I D' N: }$ H; J3 B. l差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
+ X7 O- d+ q3 A& M整体 OPEX 粗算(3 年) – 400MW 场景下:8 j5 H. k2 J$ e _! r7 y' K
) B- d. v% _" {' |
项目 中国 美国. A3 z/ e: G" j8 |$ t
电费 $350M $600M
# D/ K& _4 j$ L& r6 b3 A水费 <$0.05M <$0.05M7 O9 ]3 S4 y- P% ?$ v; V- k) }
人员 $33M $184M
$ l3 y4 K) H! F ]6 J, x其他维护/托管 同比例估算,地区差异主要体现在人工与地价 2 |8 h; m4 \4 P6 `) D
结论:
9 i F7 m/ H) }: S8 r b$ T$ j7 I( W2 _( m
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。6 m) b) {0 a7 U5 c' @. `
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
. U; f$ [' a4 A1 S四、基于 token 的成本与利润推演! j6 i6 G3 p" a) }" |+ I6 b. C/ c
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)/ d+ D* D L* X) n; S5 E
统一假设:
M3 L) u( c. F
8 }* z; T6 I$ r7 v* O8 s典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])# ?( B9 ~/ N' I, @3 A4 H
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
" h3 s, O% ~: ]1 百万 token:278 Wh = 0.278 kWh" J# F0 q; C4 F8 Y
场景 A:美国电价 $0.30/kWh( O U# R# M# K! c
电费/百万 token = 0.278 kWh × $0.30/kWh- R0 u5 K; S- ~5 R$ `( t Z
≈ $0.0834 / 百万 token g6 @# v! ]8 |4 c9 x
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
$ K" E8 x2 U, H* r5 k电费/百万 token = 0.278 kWh × $0.0423 ? c% o% f6 `. A; p# h
≈ $0.0117 / 百万 token/ f- N8 o3 N" P4 G6 r, I* Y- u
对比当前 API 价格(OpenAI 2026Q1)[62]
9 S* V9 A6 Z; m. S) I以输出侧为主(成本最敏感):
2 _& V% q# X7 j& f6 d
7 Y0 {: ^8 p7 D. g. Y# U, d& ^模型 输出价 ($/百万 token)
5 ~7 r- l2 \# r8 @GPT‑5.2 $14
2 E2 m2 w# a& q3 w' N Q9 nGPT‑5.2 Pro $168+ [7 G5 v2 I" u$ e [8 T; p b
GPT‑4.1 $8
" {- e* s* r- q4 VGPT‑4o $10" p. }* S( P3 n: D9 p. W6 D
GPT‑4o mini $0.60
+ s1 K( }; p5 M9 C5 R. D则:4 a) O* w) J3 a E( j
- M$ c; k; i* k在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
( R( r8 {; s8 i! |在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。' X; s1 k# A, B! a
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。2 z% v1 b% s, `, X
结论:
5 p5 I9 f- t* }9 q) Q$ ]7 u即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
' N+ @2 W0 O% w4 O" ?
2 j7 X2 [. S2 R2 y; y) K4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
( N" Z0 ?" e% `7 l0 N以 LenovoPress 的 8×H100 Config A 为例[28]:
1 g0 ~5 G4 n0 }: ~# a7 Q U7 ^
$ B# Y8 X5 R$ k0 N( o5 S! p5 年摊销下,8×H100 本地推理 70B 模型:
; K* X9 _6 I7 R2 D* ~3 I" a# i2 c0 ]+ \小时综合成本(CapEx摊销+Opex):$12.08/h
- w+ a- M$ u! t3 T# m. d吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens5 `# Q2 V' E1 L$ f8 \( E! T6 q
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token' D7 y7 |4 b7 T& s$ Z0 l) U
电费在其中的占比:
& D! D: k% p4 E& j" B( Q$ N3 NOpex 6.37$/h 中电力+冷却约 $0.87/h[28]
! O. u3 t0 V: J% _( k% n8 D电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token9 {' S' g5 j/ Z. P9 O/ X& `3 R1 k
电费占 总 token 成本 ~7% 左右。
9 g' `5 {$ p6 g6 z- F若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
5 Q2 w3 W" c: m1 j6 J) _5 _, Q若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。
% x: F$ A, P) k# W/ A) v& @1 D* |8 t/ b) ~; Q) Z
因此:
; w/ g0 D5 m& l* {* j: G2 F7 D8 [
9 f. J" V( X0 N; n8 e在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。% b: v3 R) G0 i- Q* W4 C
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
' |: ^6 L# l: T6 z( u! f- P: ^五、不同芯片方案的建设与运营成本对比
% c. a3 j5 {1 J! o0 X+ e5.1 NVIDIA 方案(H100/H200/B200/GB200)1 W" H$ _2 y7 c8 P+ R* e+ }# a
CAPEX:9 V+ p7 R* V! t& ^. `. I
& \, n0 [5 q/ ~
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
( a6 ^1 P& e7 U4 j! SH200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
% z. G' ]6 m" m" D3 o2 |* a r$ IB200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。7 H$ O3 E7 o+ U
GB200 NVL72:
- d' h8 G% L9 L1 P* A每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。9 ]5 z" s7 S1 F0 p
冷却系统每 rack 额外 $50–56k[35]。
" R7 ^$ {6 I6 b& p在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
4 E# g; _" Z3 S0 ~: x1 }OPEX & 能效:
" N2 g5 t4 I9 W# q' S2 ]8 b8 [5 v
" j! T2 j- q8 r/ A$ j5 J. x5 h# T单 GPU 功耗: a4 b8 S/ _; m! L
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
6 p8 k' j" ^* p9 t: r5 m/ I: GH200:功耗类似或稍高,但性能/W 提升[9][10]。
. _9 n0 i, z b# u; }) w- xB200:标称 1,000W TDP,但实测约 600W 左右[68][69]。* g3 I% o0 ~3 W" @5 @* z9 I( d) W
Token 性能:
5 c4 l( b G; S! e8 r/ oB200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。, Q J+ J G9 ?0 G/ a
NVIDIA 的优势:/ V5 ~. I/ f/ B" Z& H
2 \/ y( B, A( L1 b
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
, X# u, [- U6 H" r/ ^/ q* G但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
5 M& y# O( c8 ]5.2 Google TPU 方案" h0 J5 }: ]( B# H8 S" Q( S5 R1 O) x/ @
CAPEX:8 s0 \* ]. ?8 E
0 u7 h0 r' Q$ h$ u6 ]# w. u
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。8 M( {1 {' {" g: E/ k) @" G2 j
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。5 `6 P8 J' i, F. P2 K6 _+ R Q
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
" b: J7 n1 E6 y% N: \ N能效:& T$ q/ K8 A+ t5 F
. ]8 ^$ J. \! }1 M9 u* LTPU v5e vs H100:
; _% R' K1 |1 I0 b同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
' q) K5 c- \( \测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
3 o2 O0 t( x$ J% A新一代 Trillium/TPU v7:
! i0 ~) s" s" J; p2 ~" o能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。2 O+ c3 R ^; M* x
Google 方案的特点:* i: l! L3 O w3 {2 O
, n+ k# \) f0 L自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;; W( p8 ?2 z6 n& @* p1 E- N
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。( j2 y# t2 b$ W9 h, A9 J
5.3 华为昇腾 910B / 910C 方案( X0 {. g0 x) t7 ^
CAPEX:: D/ V/ T$ y8 ]! r/ V7 i' X. C
6 z# ], h( Y' s( Z8 L
单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。) H5 r! A6 o- Z1 @( W4 j
与 A100 对比:
/ R! f6 v' I2 M: o$ ?FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。6 A# s1 |% F( W# M( {! U
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
1 \+ B0 w! | `. E" l# [+ _' O使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
! d' p: h; H& kOPEX & 能效:" r9 W6 x* q# d
, \: G/ d/ j2 M8 }8 Q7 V7 J910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
6 @3 b7 f+ Z1 {9 [8 U$ C! B部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。, V- y/ y& W9 v Q0 s) L
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。( G# ]/ o" U& y! P$ D' S U" A5 s2 W
5.4 平头哥真武 810E(PPU)方案0 W! @( L2 \4 ]2 C! C2 Z x. X
CAPEX:8 w7 E! O2 {2 b: J/ X& o R6 D
0 H& C/ J& @; w( A技术参数:3 v1 u J: a3 G1 ^2 y
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。" Q+ g; a& ]3 X) m( O& V
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。) }) d8 t% h8 V0 D6 u* @! H
价格:4 @9 O- ?+ f/ Y' o! c
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。) n5 J+ g; ?% o$ h' i
结合国内报道:
# t6 h! n g; C3 w; Q2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
A: i; [8 [' e4 ]5 Y& |3 f9 y数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
4 [. @6 s: ]/ H8 Z, g: |( _5 w% `OPEX & 能效:
1 w. w0 _* n, x# d* i0 N" g9 ?7 T
$ T/ ?4 g$ r9 P: F. K9 \400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;# A6 U0 Q; X1 X
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。& o9 X& }5 A* `( W
六、综合比较与策略建议2 I3 Z9 }/ M; @' v9 u0 W$ m
6.1 区域维度:在哪里建 AI 数据中心?1 N/ _+ p: \2 c6 T$ v: T! l. X) H
纯经济性(TCO/tokens)排序(假设无政策/合规约束):
, Z [9 h% [( _ Y) w3 C1 p( R
4 T* a0 W6 T/ y+ g+ V' B1 y* b' H中国西部/北部(电价低、人力低、建设成本低)
% d+ k& C/ i/ @! M- Q$ r" @中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)% E4 d _/ |& e9 F" {/ h
美国电价低但人工高;东海岸/加州电价上涨压力大
; t6 {8 N+ F. l5 l- ^欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
3 A+ B q x: \. d! n4 F若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
# A" Q- E; z& q
8 _& T$ s1 S5 [( E# {/ Z纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
7 Z1 z" T$ m6 c Q2 w对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;8 S+ t( M: K6 Q- x9 D8 l# h
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。; l1 n3 G- g) Z) t7 W: G
6.2 技术栈维度:选哪家芯片/云栈?
" \! J: b% ]( H! [; C若目标是全球最优 tokens/$ 且不受出口管制:
5 z& E# U+ n% t# l& f( ^4 n8 b' |+ S7 H
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。4 T% l! h1 Q: I
若在美国/欧洲,能自由采购 NVIDIA:- V+ n$ a8 |- }* M$ f. f
' G2 s" r" {; c
短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:9 p# N1 ^7 b$ A$ a7 P/ a7 d
成熟的软件栈与生态,极高的 tokens/s/GPU;
% O! b' U0 m$ b: E+ D在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
. O* N& V4 R: t9 H$ ]" k4 E% T! ^+ o但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
9 h; D' y% a' |- b- V4 e3 T% f5 s若在中国或存在出口管制约束:4 B* ~6 ?$ ^& o; d8 B f
* e# v' W }' L- t; @ N3 K昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合: |1 V. n1 \; ] ?. Z( d
性能上已能覆盖大部分 GPT‑4 类推理需求;
; w, j2 a; h$ G2 r5 t* P, g* O单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
7 y8 l! w: c* {. M1 M/ c/ T. r软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;" |( ^4 q9 \0 W
建议配合:
4 T' ?! ?' z* f4 \高效液冷(PUE~1.1)、4 o4 x4 X& U5 D" D
大 batch、路由(浅层任务走小模型/低成本芯片)、, A! P- s, _: Q
强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。1 }% H( R' [) P T8 \4 z: Z
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:% s3 N; N: \2 G5 K* n `
$ E- f: a; [2 r! T+ }$ l- I
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
. _9 a9 D: \0 Q' L( D8 S& U这意味着:
! B) ^* h$ ]( g5 _3 K& g; |优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);- c) T- J1 g$ s% X3 P
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
; q+ E! Y# U, f6.3 针对你关心的具体问题的简要回答
* V8 U0 m ?+ UAI 数据中心建设 vs 运营成本的大体比例?! o8 L8 {- p& E/ i
- N7 f3 ?& G4 N1 b3 X
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。/ S& I# w3 K) i5 T; s" d
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。$ z- t) y4 U5 {8 s4 F* u
中国、美国、欧洲、中东的成本结构区别?
& h6 U$ I7 g T, z& g& N6 ~
4 n5 O8 o& b. m, R建设期:
" K; r8 r! n2 q中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
' ?8 X( Q$ L' t运营期:' h7 b2 `& B' R
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
8 F0 [; W' U: x: P' g人工:中 国 ≪ 美 欧,中东居中。2 w2 i6 D+ L, B3 V, p
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?% ]; U! I- k2 a- ^* _1 R$ W
1 _" P# v# ]- Y" s2 o) `对于典型 1 J/token 推理负载:& O* r( C/ M# C, Q, q- A6 Y
美国 $0.30/kWh:电费约 $0.083/M token4 s- ?) x9 F6 v6 j: W
中国 0.3 元/kWh:电费约 $0.012/M token3 Q, W, ~" q% K& G
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
2 G ]" ~$ w8 ~7 _, H5 Y不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?: F8 o4 w4 C, @9 m5 J: L2 p9 }
4 `8 N1 F4 v$ F5 {$ [2 I! K在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;
: s: D5 F% l6 X9 Q# L. H全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
0 X; X7 ]1 D# o& o" h中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|