TA的每日心情 | 开心 2020-4-8 10:45 |
|---|
签到天数: 227 天 [LV.7]分神
|
玻璃之翼降临——Glasswing计划与Claude的Mythos Preview
0 a( k, P7 L: v" J5 L+ j8 Z$ u0 K- r [4 A# b4 w6 R& n
: U @- Y! ~6 c4 v: e一个预览版的AI大模型刚刚挖出了一个尘封27年的漏洞,然后11家科技巨头都坐不住了……7 [( q6 Z! L8 l+ N ~7 m
S" O2 v; O/ ^6 S6 k# W故事是这样的。, Q4 ^* s! m U5 [6 i
& ^) {. y9 g5 x0 ^, I* a- v6 F我今天看到这个新闻,看完之后愣了好几秒。) W" f H) t: d7 n
) a! p3 E: j% I- C- ^) K2 w一家叫OpenBSD的公司——做操作系统的,算是安全领域的老前辈——他们有一个漏洞,在代码里躺了整整27年。1998年写进去的,没人发现。5 K$ r4 s1 m' g4 g4 D# U
; c, k3 i" @$ N" K/ G( M6 ?/ v
结果被一个AI模型给挖出来了。3 W* X$ J" f8 q1 v8 V
2 N+ {: X, B- S/ [& _' j4 o" j
这肯定不是那种"我们用AI扫了一下代码库发现了问题"的挖出来。而是那种"这个漏洞藏在最核心的地方,所有传统工具都扫过5百万次,一次都没报过警"的条件下挖出来。# z2 J+ y) C# m. ~; E7 b3 T, {
/ ?& t. v5 l9 E6 A然后,这个AI模型,顺手还把FFmpeg里一个16年的漏洞也给挖了。
% K/ L8 t( y9 O
0 e' D) b5 d) T7 XFFmpeg,音视频处理领域最最最核心的基础设施。全世界的视频播放器、浏览器、直播平台,有几个不是建立在FFmpeg之上的?这个漏洞在里面藏了16年。5百万次自动化测试,没一次报过警。
$ r) K( a$ t+ ]" O7 m! u$ G9 a ~0 `7 O3 ?" Q7 [7 d! H" W
然后呢?/ ? J4 `$ Q$ T* f+ m( P
" _5 t( Q) k% z" l( Q0 w% Z% r/ K# y! [
然后,11家全球最大的科技公司——Google、Microsoft、Apple、NVIDIA、CrowdStrike、JPMorganChase、Google等等——坐下来,说了一句话:我们一起出钱,让这个AI模型,能被全世界的安全研究员用上。/ r- N: I/ ?8 r5 S0 I" a7 S3 B! L, m
4 z) D) F. E; G这个项目,叫Glasswing。
3 E' n) D$ l$ A+ f S* d. g- r7 f& V# B' J& B5 k
glasswing5 V8 d) ~4 y( G m, w
1 K( V7 ?( U( Y/ N9 K+ z
T8 e7 n3 P; N$ b' [先说清楚Glasswing是什么。
L) M/ \% i, ^2 Y3 |' T4 J( h3 h
: M9 w! t6 m$ T+ Z$ C. A简单说,它是一个AI安全联盟。发起方是Anthropic,加入方是一堆哪怕是不关注技术领域也叫得出名字的科技巨头。它的核心,是一个叫Claude Mythos Preview的模型——注意是Preview(预览版),就是还没正式发布的那个版本——专门训练来挖漏洞的。
" f# l6 h0 H4 B! Z) a' ~3 i2 r: H' [- E" y
有多强呢?
7 \' {# g; L5 e" k8 v6 ~: `* m! ~& s
CyberGym基准测试,83.1%。作为对比,Claude Opus 4.6,得分是66.6%。不是Claude Opus 4.5,是Claude Opus 4.6,Anthropic目前最强模型。
- ^3 y/ {$ d/ \& {& Q: Z% R5 U$ r; W
SWE-bench Verified,93.9%。还是SWE-bench Verified,不是那个容易一点的版本。Claude Opus 4.6是80.8%。
, v1 }) {' l& D0 n
! q( Z9 ?" h% N差了13个百分点。0 s( s3 M4 m8 x. ^$ y
! ]( @; x7 G8 [ E& K你说这13个百分点意味着什么?; w7 `/ [& z3 V" X/ ]* r# U
0 G5 J9 y8 d. b0 Q! d; S
意味着,传统扫描工具漏掉的那些最刁钻的漏洞——那些藏在层层调用关系里、藏在异常分支里、藏在并发边界条件里的漏洞——Mythos Preview能找到。
, j7 W0 V, A6 N8 ^3 A, x$ A, |
4 _$ @0 i( g5 r& X/ s7 I# p意味着,27年的OpenBSD,16年的FFmpeg,以后可能不会再有了。4 i5 v# \3 W+ g8 C
0 L$ c# w$ K: P# [) ^或者说,这种级别的漏洞发现速度,会比以前快几个数量级。' j7 P8 p) a' F0 v/ R
) X5 r' C: T B& U* ~6 v$ }. s# Z# r. H说到这个OpenBSD的漏洞,我必须展开讲一下,因为这个例子太有意思了。4 C8 a" U% ^- i" K8 C% I6 C! `+ k. H' f
' L+ r4 i9 V/ ^! w
OpenBSD是个什么存在?- x$ B0 W9 x5 R5 F0 V
1 C6 F! T* t* I; \9 H
它是BSD操作系统的一个分支,最核心的设计哲学就是安全。代码审计之严格,在整个开源社区都是有名的。很多安全研究员的信仰级操作系统。
! f" m% C" n8 F+ w
( C! d9 A: }$ O# H这样的项目,代码审计了多少年了?二十多年。
0 Y& [) \) j4 F5 _& z
% N/ T/ h& K# r* d' c! m然后,一个漏洞,在里面躺了27年。( d4 b- H* V( S- O
3 |: h% h- P4 g
这说明什么?
0 u$ L! G+ B& _" i* y8 J" n! ]# x( Q q5 I3 x* |8 m$ V Y
不是OpenBSD的人不行,是传统的审计方式有盲区。任何人工审计,只要时间足够长、人足够累、代码足够复杂,就一定会有漏洞漏过去。这是人性的边界,不是能力的边界。, C4 H9 Z' `- a! n& h
* u9 M+ n# e7 f4 X
但AI不一样。AI不会累。AI不会因为审了三个月之后注意力下降。AI可以在几个小时之内,把整个代码库的所有调用路径、所有边界条件全部穷举一遍。
. y1 n" I/ ~5 F1 P3 K. n' s
( C* R- N( b! [- z1 d1 HMythos Preview发现的那个OpenBSD漏洞,是一个本地权限提升漏洞。攻击者如果已经拿到了一点点访问权限,可以利用这个漏洞进一步提升到root权限。8 U9 k$ z" D4 j, y p) ~
4 E8 z3 ]) P" c* M. o
这种漏洞可怕在哪?
O* `2 e$ m) R' R# S& G
# t) E/ q, y8 s; ~0 r9 p( C它不显眼。它不是那种"输入框里填个单引号就弹shell"的漏洞。它需要你对系统有相当深的理解,才能构造出触发条件。( n( B! v$ q! X3 h7 s- i; N
' i9 J8 O% T) |. x x3 h3 e9 [8 S传统扫描工具扫不出来,是因为它的payload模式不在规则库里。AI不一样,AI学的是语义理解,它不是匹配特征,它是理解代码在"想什么"。
! F+ w& I) I9 f: r/ [& B8 E( E
# V3 H) o0 b0 B' S, L8 LFFmpeg那个例子更让我震撼。/ v( X! W0 ^; v# j( \' k. G1 n
9 x# P2 `' J- G3 e6 r
16年。$ V" W7 v: f0 l" E' X& |: r
1 I8 \! I5 o& {0 L+ ?, K" j
FFmpeg上一次发现这种级别的漏洞是什么时候?2009年。0 o; `' N& B) W- S, `5 Y
) O3 V! L; D: K# y16年都没有人发现。然后Mythos Preview扫了一下,找到了。
# t1 X1 v/ Z' E, b0 a) G r
* E% w4 L- B& `+ ? g/ w& H注意这个"扫了一下"的背景。SWE-bench测试集里,有大量是真实世界里的bug修复历史。FFmpeg这个bug在历史上真实存在过,是某次修复的时候被记录下来的。这意味着,Mythos Preview不仅能做代码审计,它能做的是:从海量代码里,识别出"这个写法有问题,即使目前还没有人报告过"。- w8 u$ r& \( @# [( w. W
$ D) K8 S% U( `1 b7 b这是主动防御,不是被动响应。" Z3 U4 B7 @/ J2 W: m
% ~. ~5 c) z4 {6 o传统安全的方式是:出了事 → 分析样本 → 提取特征 → 更新规则库 → 下次能识别。2 W' q2 _/ ~" g1 A9 f
- W- w3 o0 X6 @# |6 _
AI安全的方式是:不需要样本。直接读代码,告诉你这里有个洞。
% J0 N* _* R7 [8 M# z# ?% b& [4 ?" U
这两者之间的差距,大概就是"等贼来了再装防盗门"和"在盖楼的时候看着图纸就告诉你这堵墙扛不住地震"的差距。
9 h- _- W0 j5 I0 n/ X
. r$ x. i7 E) t# u' b; q, P现在说说大家最关心的问题:谁能用到,怎么用,花多少钱。
8 \8 t5 V c" |$ x
]' S4 O- |" E% j0 DGlasswing的AI能力,现在跑在三个平台上:Amazon Bedrock、Google Vertex AI、Microsoft Foundry。
3 X$ I7 Y6 v* q" Z! r0 M" k A, A
这三个平台,恰好是AWS、Google Cloud、Azure。全球三大云服务商。, ~% `( }7 D3 b: t; J8 }
6 r7 h7 R5 X- D1 J# D你在任何一个上面,都能调用Mythos Preview的漏洞检测能力。
- i- F0 Q0 q i( [: I, U
* Z# P t- e* _ C+ s- P: Z; w价格呢?过了初始的credits之后,每百万token输入25美元,每百万token输出125美元。
- H2 S9 S: u: V" a
8 g- P% r8 b5 }9 j这个价格贵不贵?2 C2 N% A+ i7 N; N, A% b' W
7 k6 w/ E) V7 G6 P. Y% e0 E对比一下就知道了。现在市面上做代码安全扫描的工具,像Snyk、Veracode这一类,商业扫描工具的报价大概是每个开发者每个月几十到几百美元不等。而且它们扫的是规则匹配,不是语义理解。
& ?$ m0 P9 y& [3 y3 K) l4 w
6 n* Z/ }* n1 c0 H; E3 r& h/ rMythos Preview能发现那些工具发现不了的漏洞。; f7 d7 ?* i0 l6 q" }3 Q: _% D0 e4 d
1 q% q3 @$ D, U, D$ p2 F+ ], j这不是贵不贵的问题了,这是"有没有意识到你以前省的那些钱其实在交更多的学费"的问题。+ m3 }7 r {9 j) i" g
! w# \+ X# ~' B' j" k4 e
另外,Anthropic自己掏了1个亿美元的使用额度,分给联盟成员和开源社区。还额外捐了400万,250万给Alpha-Omega/OpenSSF,150万给Apache软件基金会。( b" W3 Q" c/ c
$ M# w) D* ]6 s' P
这些钱是用来干什么的?让那些没有商业利益驱动的开源项目,也能用上最好的漏洞检测能力。# ]4 U; [! u2 P$ o
3 C, S& B, w- L! W5 c4 `FFmpeg就是开源的。OpenBSD也是开源的。这些项目没人给他们钱做安全审计,但他们的代码,运行在全球几十亿台设备上。2 {1 J( v6 ?: K( N. p0 a- U9 X
2 ]- E% C: j9 w还有一个细节,我觉得特别有意思。
2 L8 u, O6 a; \6 M$ G
$ e6 t' `; g5 J+ J/ g漏洞发现之后,公开披露的时间是90天。& C. f9 v& x1 S3 }% W$ p
0 h; v' f- t# r
90天是什么概念?
& }% s1 b* s1 d$ Z% D ~! s7 d8 [( [: o9 _7 J* e; }+ l8 g4 T
行业标准的漏洞披露窗口是90天。这个时间足够让厂商评估漏洞、制定修复方案、推送更新,但又不至于让漏洞在黑市上流通太久。, U8 ~6 A+ [1 `2 ^' s; R
; E+ u2 T7 d8 Y" S. ]; E
但这里有一个问题:90天是针对"有人发现了漏洞"这个前提来说的。
: E D9 M- X0 K( a+ i' \3 k; ^# c0 n& Y
Mythos Preview现在能以前所未有的速度挖出漏洞。它一天挖出来的漏洞,可能比以前整个安全社区一个月挖的还多。! q+ ?/ f/ b- V/ O. ~
! I4 C3 |! ?4 K' E
这意味着,漏洞披露的节奏,整个就变了。1 S% q5 H" ?. `. \, Z# B
( M% @) P0 [, U; [7 `9 \2 R8 ^
以前是"挖到一个,披露一个"。现在是"AI在持续不断地挖,每90天披露一批"。
$ \2 q& l' }% K3 P4 v; Y9 u
' x0 d: J( O1 ^! p. F/ k7 {/ `厂商的补丁开发速度,能不能跟上AI的发现速度?: Z/ M1 H; n2 z% Z. J
/ r E- @8 J9 c: H8 K, l0 y
这个,我说实话,不知道。但我觉得,这是整个Glasswing项目最值得观察的地方之一。5 R: }$ `$ C( F( g- I
+ X* d7 U- `. M5 n5 f写到这儿,我突然想到了一个更大的问题。
8 r5 n! e2 K# A# P, Q' S' H6 S l
' ^5 H$ }" P! f- T% O8 I& `Glasswing这个名字,本身就是一只蝴蝶的名字。玻璃翼蝴蝶。它的翅膀是透明的,像玻璃一样。
- d0 |/ ~8 z; N0 |" C
4 B* w) p$ R/ P* V0 `透明,意味着隐藏的东西变可见了。3 @0 F9 x% [/ H6 N
' Q% e- ~5 p+ r8 L: g, |, P
一只蝴蝶的翅膀是透明的,它就隐藏不了任何东西了。它在哪里,飞向哪里,所有捕食者都看得清清楚楚。% a! k* X2 k8 n! B9 O
! W9 V- U& o, b A
这个意象,放在漏洞挖掘上,太精准了。* T/ g$ u/ H9 O- h! r: ]" Y
; V, P+ G- O/ ^代码里那些隐藏了几十年都没人发现的漏洞,在AI的"眼睛"之下,突然就透明了。, j+ M4 z6 k0 X" U. i
( z& | [: v! F, r以前我们说"security through obscurity"——通过隐藏来保证安全。你的代码不公开,漏洞藏在暗处,攻击者找不到。' E5 Q! W) V0 P0 {5 V6 r9 q
. f% ^% ~( J- [1 f) ]4 y但现在,只要代码存在,AI就能读。Mythos Preview不需要你的代码是开源的,它只需要能接触到代码——不管是源码、还是编译后的二进制、还是运行时的行为轨迹。
7 V6 H$ E7 g, w" \3 N9 W8 `4 P- a3 j6 V* p% s
代码越来越难藏了。或者说,代码里的漏洞越来越难藏了。
" |! q3 N- C$ G, `( V `) p/ a) J, }5 [; _2 U
这是一件好事吗?! C7 C+ w7 Y* f P# N/ w: f
3 t& G, V; ~% `' r: v* {4 s
我觉得,短期内,这是一件非常非常好的事。
# n* h3 Q" F% M( F& @8 { M k* h
全球互联网基础设施里,有多少代码是10年、20年、30年前写的?没人敢审计、没人敢动、出了问题就打补丁接着跑的,有多少?( A! q# _' m3 H' n3 P9 Y: x7 k
! s" E0 X9 a4 g, v这些代码就像一颗颗定时炸弹,埋在整个数字世界的基础里。
1 u) V& ^4 T& P* z7 P; r3 I, ?' M0 D4 \6 J4 Z. e [
AI能做的是,帮我们把这些炸弹找出来,一颗一颗地拆除。+ P4 [/ I6 x( I, W0 r! n) S# \3 M
/ d" c8 W9 d! @% i但长期呢?# Z- e, a, n/ T' X6 r& O
+ I& F D" V' K# V
当所有可见的漏洞都被AI清除干净之后,剩下的,是什么样的世界?0 k/ `4 ?, \, Q8 {1 Y9 V
* a/ v1 V! d- \/ l* U E0 O
是代码质量极高、安全性极强的一个世界?还是所有攻击者也在用同样的AI,攻击的速度和防守的速度同步提升的一个世界?8 ^& P9 r6 _3 h. S/ c4 A: B
5 l. @* b% K! M我也不知道。
, o: u' r4 x; [! \* i9 q/ ~
; Q F& o+ k- N o但有一件事我特别想强调。
@! R/ M; X F& L( i8 A3 A; z7 C; @3 d: a% t
这次Glasswing联盟里,有JPMorganChase,有CrowdStrike,有Palo Alto Networks。这些公司,是真正的安全重度用户。, h" Q% j) G, B; w8 p! C, d
1 C& L4 k, _3 {$ V9 M7 w他们自己有能力挖漏洞吗?当然有。JPMorganChase的安全团队在全球排前列。CrowdStrike就是做安全的。
2 i; _ o3 p A; l& y* \9 ]
; ?7 H% | U9 C0 s- P他们为什么还要加入这个联盟,用别人的AI?
$ H t* j. Q. y% S" y9 q9 F, H) Z' E& `1 ?, b+ A; W
我大胆猜测一下:因为挖漏洞这件事,规模太大了。
8 Y; {$ y9 a% R# F+ X( R; `, d4 \* D: t
全球代码量太大了。每一家公司,即使安全团队再强,也只能覆盖自己的代码库。但外面的供应链、开源组件、合作伙伴的代码,你根本管不到。
! C) z% G, U' y3 H7 |
( F( N- I! X: k; c7 V, t- GMythos Preview的价值,不在于它比你的安全团队强。而在于它能同时扫所有地方。
) ?+ o: H% l& q9 ^' t
3 a9 o% T2 f' J0 I# u& Q0 U9 E这是规模效应。1 V0 }0 I$ Y* e4 n' \6 _7 z* m
+ |2 G: v+ N& c& j* h; d
就像打补丁。手工打补丁,你只能打你知道的那些机器。自动化打补丁,你能打你所有的机器。AI扫漏洞,相当于在每一个代码提交的时候,就自动扫一遍。
/ L# {3 `8 S+ n, S1 @8 T8 Q7 f
! f$ ]6 W+ y* M这个规模,是人类团队根本无法覆盖的。
4 O! H2 d8 R, m* E
( K- g% x1 @) m/ u c8 j$ LGlasswing这个项目,还有可能往一个方向发展——成为一个独立的第三方机构。# q( I% I3 ~4 ^+ L* y0 _! X3 B, W
% l' c6 m6 x; E5 A1 }
什么意思?+ e7 X* x) S* p/ F; X8 z: A
. E! `+ M: U, V6 l4 c7 t
现在它还是Anthropic牵头、11家公司参与的联盟。但未来,它可能变成一个真正独立于任何商业公司的安全机构。它的评估结果,有公信力;它的漏洞报告,有权威性;它给出的安全评级,整个行业认。
* |1 ^( G1 b2 K! ^& b7 Y+ X1 c; ]. E; t
类似现在的ISO认证,但针对的是代码安全。
$ G4 ]$ N3 m1 C3 G
# \) `5 j) Y4 h% p$ e( Y想想这个画面。未来的软件采购,合同里可能不只要写"符合SOC2",还要写"通过Glasswing认证,漏洞数为0"。& j/ u0 \. K! P. ~) |9 X
% m& C! p/ v% l( o( _" d8 ?0 ^/ F
这不是不可能的。) p" ^1 \# e" N+ J/ J, K
$ h0 k: l' Y$ D9 u/ O& {当然,路还很长。现在还只是第一步。但方向是对的。
% I9 [1 c$ E* n6 e
8 S# v: ?1 c( j: Y1 L好了,写了这么多,让我最后说几句掏心窝的话。7 U6 X9 e* z) z3 C# j
4 w( ~- ~, ]; o: q9 }4 }. R' a9 V C2 j我这次看到Glasswing的新闻,第一个反应是兴奋,第二个反应是有点怕。
, L) ?$ M6 O( F& `6 b( m+ G/ c
7 N) ]9 T1 G, t' c2 m+ Z6 a, ]兴奋是因为,我真的觉得,这是AI在安全领域做的最有价值的一件事。以前我们聊AI安全,大家想的都是"AI能不能被攻击"——对抗样本、数据投毒、模型劫持。这些很重要,但离普通开发者很远。
3 y6 j+ {1 |& @# _6 o: F% `
5 K4 O7 l9 ^) \- k这次不一样。这次是AI在帮我们发现自己的脆弱点。' U0 d/ W. D' R( B1 L
) B% E6 \6 c. M; \( e$ _: T这种脆弱点,我们以前不知道,或者知道但没有能力发现。AI把它们挖出来,摆在阳光下,告诉你这里需要修。
1 o) C1 R# U0 d: m
4 m$ s: T/ ~. K1 N3 Y1 U) L% m/ C这是AI在补人类的短板。不是在超越人类,是在帮助人类补上人类自己够不到的地方。
" q0 M7 V% Z$ s) f6 Y+ I& h1 U/ ?' Y9 I6 s
我怕的是什么呢? z ^ B" C1 d4 N9 U# Y
/ K) }* d; {+ C我怕的是,这个工具,只有大公司用得起。0 G3 h! `) @3 M0 B
2 Z2 X" f2 P0 a; ?, F8 J1 E: [" FAWS、Google、Microsoft,Bedrock、Vertex AI、Foundry。这些平台,都是商业平台。Cloudflare这种中型公司,可能用起来没问题。但那些真正需要安全检测的——初创公司、开源项目、十几人的小团队——他们能用到吗?+ ?) T6 E, J$ P3 j7 C8 Y2 j5 O
% W& N. K9 Q* a9 s' M# y, {" R
Anthropic捐的那1亿美元额度够用多久?分到全世界的开源项目上,每个项目能分到多少?
( T% T* F0 g6 j* T" A* C
* j( G# C: d# R9 z0 B这些问题,现在还没有答案。1 C7 ~) B. F" p
, `7 `$ G+ F" ~/ A
但有一点我特别想强调。
; \2 n9 C; u& x+ J: \ f) W ]: g. Y2 b" s6 \* ?. B* R, l4 u
Glasswing这个项目,让安全这件事,第一次真正有了一种"基础设施"的可能性。! {% I7 j( M+ m$ v$ E
9 G/ [! Y X% I3 i1 [以前的安全,是奢侈品。你要么雇得起安全团队,要么买得起企业级扫描工具,要么你就裸奔。
1 z8 s- ~' S' q/ Q0 ?& A
7 H4 }2 }& P/ g% ]6 w/ p* |# e/ |AI改变了这个等式。Mythos Preview能发现那些企业级工具发现不了的漏洞,但它的调用成本,并没有比那些工具贵多少。: c6 ]6 Z; ?) X1 a) z
3 s; E. `# S2 t1 i
当漏洞挖掘的成本持续下降,当AI扫描变成每一个代码仓库的标配,我们或许真的会迎来一个更安全的互联网。( p+ L! S* j0 B. I5 E
" d. A7 u, l/ }$ t
这一天什么时候来?我不知道。可能5年,可能10年。( i0 y& r+ P" S) t$ @
3 T5 A7 T' q$ ^! E7 ?4 F
但Glasswing,让我第一次觉得,这件事不是痴人说梦了。1 P( L, H1 }( k: ^% c& g
|
评分
-
查看全部评分
|