- _. P" l" P% w8 }此外,continuous-adversary相比Wang等人在非对抗训练的base-victim上取得的胜率有所下降。这表明,对抗训练虽然增加了攻击的难度,可能会缩小攻击的有效空间,但并不能从根本上消除循环攻击漏洞。+ G6 X+ ^7 J6 g9 o/ l# m7 l
" H# r) X2 S" q* f3 p
3.3 送子对抗者(gift adversary)分析, w' C$ D7 P- R, a' v4 {4 Y
gift-adversary在更早期的base-adv-early checkpoint的基础上进行了微调,以鼓励探索新的攻击路径。微调过程中同样采用了渐进提高受害者搜索数的课程学习方案(附录D.2)。最终训练得到的模型gift-adversary仅用了受害者6%的训练量,就在512搜索数下以91%的胜率击败了dec23-victim。需要指出的是,gift-adversary在高搜索数下的表现不如continuous-adversary稳健(图3.1),但它揭示了KataGo一个全新的弱点(图3.2b)。5 J6 P/ w) V2 g1 o
% `- p# S5 J& A
具体来说,gift-adversary会诱导受害者在某些没有形成实质威胁的位置送出子。这种送子似乎源于一个错误的假设,即对手的某些棋形必须要被阻挡,否则就会形成致命的劫争或大龙(参见图K.6)。7 m1 C" n2 t6 `, b1 b1 i+ T2 T$ l
& K2 {7 f1 [4 m2 C* H8 K图片 3 i! c$ J' A- s$ l [0 A' n+ T, p" }* _8 h
gift-adversary会不惜代价地送掉一些子,从而让对手做出更加昂贵的送子。尽管这种送子攻击在高搜索数下不如循环攻击有效,但它提醒我们不能把注意力局限于某一种特定的漏洞。 3 d/ E; O; r% w% U8 K8 O _& R& W9 o/ |# T( X
更重要的是,gift-adversary的发现表明,虽然KataGo试图通过种子对弈覆盖各种攻击位置,但某些问题可能需要在早期就开始解决。事实上,我们发现许多人类高段棋手能在低搜索数下可靠地战胜dec23-victim(表H.1)。因此,仅仅通过分析最终网络来识别攻击似乎是不够的。! }& C5 K- Z6 d3 [( ^5 {# T, h
) f& e) w' t4 g8 c3.4 防御有效性评估 7 S5 T; ?. Q C! {0 X通过上述分析,我们可以判断基于位置的对抗训练并没有让KataGo实现充分的鲁棒性。尽管dec23-victim可以有效抵御针对基于非对抗训练victim训练的攻击模型,但它仍然易受针对性的攻击。攻击者只需用相对较小的计算代价就能找到dec23-victim的新弱点,甚至发现全新的攻击路径。更糟糕的是,这些攻击都会导致dec23-victim犯下人类不会犯的错误,这意味着它在人类鲁棒性方面也存在不足。 7 |0 Y8 G% U5 o& q7 ]" n' V7 c$ b0 ]" O7 c$ x
当然,我们的结果并不能完全否定基于位置的对抗训练的作用。事实上,对continuous-adversary的量化分析表明,dec23-victim确实比更早的非鲁棒victim需要更大的攻击成本(第7.1节)。此外,基于位置的对抗训练与其他防御方法(如第5节的ViT模型)可以是互补的。尽管如此,单独使用这种防御策略似乎还不足以构建真正鲁棒的系统。3 u! @% b. q4 {% N/ o* e
f r, d4 r& H. V; c/ S
4 迭代对抗训练* {) r% a4 t9 L1 i
第3节表明,尽管基于位置的对抗训练可以提高鲁棒性,但它主要覆盖了已知的攻击。为了应对更广泛的攻击,一种自然的想法是让防御者动态地适应攻击者,从而模拟军备竞赛的过程。这种迭代对抗训练(iterated adversarial training)方法在图像分类等任务上取得了一些成功。在本节中,我们在围棋领域中测试了这一想法。6 K* l( c' s) C F& [
R4 S1 @' t) C& k! s! c* J
4.1 方法描述 , e/ U: S( P8 ~/ {0 _" Q2 Q; j8 W) R我们的防御流程包含了两个交替的阶段(图4.1)。在防御阶段,我们以最新的攻击模型为对手对防御模型进行微调。在攻击阶段,我们则固定防御模型,并训练一个针对它的新攻击模型。理想情况下,经过数轮迭代,防御模型应该能抵御攻击者找到的所有弱点。, p0 s: o2 _, g U# o4 Q
% _1 A( u+ Q% r- y" o9 I我们以KataGo 2023年3月的一个模型作为种子防御模型victim-0,该模型没有接受过任何对抗训练。在第一轮防御训练中,我们从base-adversary的一个早期checkpoint base-adv-early进行warmstart,使用KataGo的标准自对弈方式训练一个更强的攻击模型adversary-1。具体而言,adversary-1除了与victim-0对弈外,还与自己的早期迭代对弈并更新模型权重。类似地,在随后的防御回合中,我们通过自对弈的方式在上一轮最佳攻击模型的基础上训练一个新的攻击模型。 8 H$ t" b% V9 P0 |, |/ M2 X2 w0 N9 a5 T2 t2 `8 d
相应地,每一轮的防御模型victim-i是通过以adversary-i为对手对上一轮的victim-(i-1)进行微调得到的。在对弈中,我们让防御模型使用2倍于攻击模型的搜索预算,以鼓励其学习更鲁棒的策略。此外,我们引入了基于图像对抗训练的一些技巧,如循环学习率等。附录E中提供了完整的实现细节。- V/ i, C/ B( i* e: z+ v
& J# q9 l; @! @9 t- w# y" N; [
4.2 实验结果与分析 U1 d7 q: a2 w9 u
我们在4轮迭代后终止了训练,因为计算成本开始变得难以承受(累计使用了近100万个TPU-v4核心小时)。图4.2展示了每一轮adversary-i与victim-i在不同推理预算下的对弈结果。可以看出,第一轮的防御模型victim-1在抵御base-adversary方面取得了显著进展。然而,随着迭代的进行,防御模型的鲁棒性提升似乎出现了"饱和"。虽然victim-4能以67%的胜率击败adversary-3,但这一优势在面对最新的攻击模型adversary-4时就几乎完全消失了。 4 v; G) D6 w. Y% f- g0 L" s. |' j5 Y8 x: h9 d ?
图片 $ l3 w" K9 t g 8 l& [ H: \/ M8 F8 L+ Z: L8 i我们对最终的攻防模型进行了更深入的分析。令人沮丧的是,我们发现adversary-4在victim-4身上发现了一个新的循环漏洞。如图4.3所示,adversary-4学会了把虎扑(tiger mouth)循环与征子直接结合起来,我们将其命名为"atari循环"。与之前的攻击相比,atari循环在局部更加紧凑,这可能使防御变得更加困难。事实上,在低搜索数下adversary-4能以81%的胜率战胜victim-4,而在高搜索数下这一优势仍然高达23%(图4.2)。( f1 a0 _9 O" r" P) D( N: {, w
/ q- R: E0 A+ t- W r) k5 J" ^1 i
我们进一步研究了不同轮次的攻击模型在victim-4上的表现。可以看出,随着迭代轮次的增加,攻击者对防御模型的胜率整体上升。这表明,连续对抗训练可能会"过度适应"早期的攻击,而忽略了攻击空间中的其他区域。有趣的是,无论搜索预算如何,最早期的攻击模型base-adv-early在victim-4上几乎保持50%的胜率。我们推测这可能是因为base-adv-early揭示了一些非常普遍的弱点,而迭代对抗训练无法根除这些缺陷。$ |+ e/ f/ K# g( }8 z: v! ^
- Q2 z7 }# [: k# [, g6 i4.3 防御效果评估: r; E) c: P6 @, P3 u' B0 z( n" N
基于上述结果,我们认为简单的迭代对抗训练不足以让围棋AI实现充分的鲁棒性。尽管防御者努力适应攻击者的策略,但攻击者仍然能以相对较小的代价找到新的漏洞,其中一些甚至比原始的循环攻击更加有效。我们的分析表明,一些基本的弱点可能根植于防御模型中,无法通过表面的修补来解决。此外,与基于位置的对抗训练一样,迭代训练得到的防御模型在人类鲁棒性上也存在不足。 5 d: W$ d) U" o% g' `, Z8 f' T 6 w2 }2 _" l+ ]1 S当然,我们尝试的迭代对抗训练方案还比较初步,还有许多值得探索的优化空间,如更细粒度的课程学习、更广泛的数据增强等。然而,鉴于连续对抗训练在图像分类等领域的长期发展,我们认为在围棋领域取得实质性突破可能需要更根本性的变革。 - s& k5 i4 `& f0 b. ^) K& N- b( m$ |! N" t' s
5 基于视觉transformer(ViT)的防御, K% q7 E) S2 Z P
为了深入理解围棋AI的鲁棒性挑战,我们将视角转移到模型结构的选择上。我们注意到,几乎所有现有的高性能围棋AI,包括KataGo,都使用卷积神经网络(CNNs)作为骨干网络。然而,最近在计算机视觉等领域,基于transformer的模型如ViT开始展现出与CNN媲美甚至更强的性能。一些研究还表明,与CNN相比,ViT具有一些独特的归纳偏置,在对抗鲁棒性和零样本泛化等方面表现更好。因此,我们提出了一个问题:是否可以通过将CNN替换为ViT来缓解循环攻击漏洞? ! x3 T3 q' k2 K, H7 f* f# f9 W) s3 W( P9 c) d2 W) }
5.1 模型结构与训练方法% d9 U: x3 y+ H) c$ `
为了回答上述问题,我们在KataGo的训练管道中用ViT取代了原有的CNN骨干网络,几乎没有修改其他组件。我们测试了三种不同尺寸的ViT变体:ViT-Base、ViT-Large和ViT-Huge,其参数量分别约为89M、305M和1.3B。为了进行公平比较,我们选择dec23-victim作为CNN基线模型,其大小与ViT-Large相当。我们使用与dec23-victim相同的非对抗性数据集来训练ViT模型,没有引入任何专门针对循环攻击的对抗训练。模型实现细节请参见附录F。) M$ o6 y8 H* @( `
7 F2 T9 X: ~( N$ x z+ E- L: q
5.2 实验结果与分析 # M# u' q( `: m% _6 U" m7 L令人惊讶的是,我们发现ViT模型在标准围棋基准上的平均性能可以与最好的CNN不相上下。例如,我们的ViT-Large在KataGo评级等级(KR)上达到了8d,与dec23-victim的水平相当。更重要的是,所有三种尺寸的ViT在与职业棋手的对局中都表现出了接近人类顶尖水平的实力。据我们所知,本工作首次证明了transformer类模型可以在围棋领域达到如此高的竞技水平。; X) S) b- a9 ?" ]* }! M
9 U# C% [) q4 a# |; T1 b u5 P
然而,在对抗鲁棒性方面,ViT模型的表现却令人失望。我们发现最终训练的ViT-Large很容易被之前针对dec23-victim训练的continuous-adversary攻击,后者在与1024次搜索的ViT-Large对弈时以98%的胜率获胜。更令人沮丧的是,就连针对早期非鲁棒KataGo训练的攻击模型base-adversary,也能在同等条件下以82%的胜率击败ViT-Large。! r. H& E( c" ^% Z
9 Z+ D% u2 A4 u. G! Y, u, r对ViT-Large模型在循环攻击下的弱点进行分析后,我们发现它犯的错误与dec23-victim的循环陷阱非常相似。这表明CNN模型容易受到循环攻击可能不仅仅是其结构归纳偏置的问题,更深层次的原因可能在于训练范式的选择。事实上,将基于位置的对抗训练方法(第3节)应用于ViT-Large,可以显著提高其对抗连续攻击者的鲁棒性。这进一步支持了我们的推测。8 W. \2 Q: k1 I
4 m% E% e$ v$ }7 f: f' w% O
5.3 防御效果评估0 L$ I. N* B/ m7 m
ViT模型虽然在标准性能上令人振奋,但它们在没有专门对抗训练的情况下仍然难以抵御循环攻击。这一发现部分否定了我们最初的设想,即仅仅通过改变模型结构就可以解决鲁棒性问题。事实上,由于ViT模型在对弈中表现出与dec23-victim相似的弱点,它们在人类鲁棒性方面也得分不高。 5 \8 I) F9 @3 Z8 _- U: R/ u) `. @* W% j, e. M/ ]. U/ b. |/ v
尽管如此,我们认为ViT模型在对抗鲁棒性方面可能还有一些优势有待挖掘。首先,ViT模型可能比CNN更容易通过基于目标的对抗训练来强化,因为transformer中的自注意力机制天然就关注全局信息。其次,ViT模型强大的few-shot泛化能力可能有助于其在看到新的攻击时快速适应。最后,还有许多针对transformer的对抗防御技术尚未在围棋领域进行探索。因此,尽管目前的结果不尽如人意,但将CNN替换为ViT作为围棋AI鲁棒性的一种潜在解决方案仍然值得进一步研究。/ A# G1 S; [ r: L" s
5 F/ R5 j% G! |2 Q6 对手博弈防御初探% g" r. v# u- [: g( U
在之前的防御尝试中,我们主要关注通过对抗训练来强化个体模型的鲁棒性。然而,博弈论告诉我们,在对抗环境中,个体的最优策略往往取决于对手的行动。受此启发,我们提出了一种新的防御思路:让防御模型在对弈中明确考虑对手的反应,主动规避可能导致失误的行动序列。我们将这种防御策略称为对手博弈防御(adversarial game defense, AGD)。( z: Z1 o4 u. q& O5 A
3 H$ @6 E+ H5 c2 Y% s6.1 对手模型的构建 - @# P- H! S1 F' h我们采取了一种简化的方法,即将一个经过微调的攻击模型用作对手模型。具体而言,我们选择continuous-adversary作为种子模型,并在高质量的人类对局数据上对其进行微调,使其更接近人类棋手的风格。我们将这个模型命名为human-like-adversary。尽管human-like-adversary可能无法完美复现真实对手的行为,但我们认为它足以作为一个有趣的起点。 . O) p! s4 z( n4 A: F$ V% `. ?0 N( W& d7 u
6.2 将对手博弈嵌入到MCTS中 k& o0 e; R( m8 d0 j8 p' N7 {1 K2 g
在标准的MCTS算法中,每个节点的值通常由一个策略网络和一个价值网络联合估计。为了将对手博弈引入其中,我们对叶节点的评估过程进行了修改。具体而言,我们让策略网络生成候选落子af后,将每个候选落子及其后续状态sf输入到对手模型中,获得对手的反应ar。然后,我们将(sf, ar)作为新的叶节点,由价值网络进行评估并回传。直观上,这相当于在搜索树中额外展开了对手的一步,防御模型由此可以考虑到对手的即时反应,选择对自己最有利的落子。 6 a) \: I+ G0 V % L; j9 t# |5 o8 ~5 q; e f* |3 G. u+ h! I我们以ViT-Large作为基础模型,对其进行了2周的自对弈微调,过程中使用human-like-adversary作为对手模型嵌入到MCTS中。我们将微调后的模型记为ViT-Large-AGD。 : t b% y( D6 K2 q8 i: T: x" g ! y; f0 z& P6 U! Q6.3 实验结果与分析- Y+ V/ j- D+ P8 j
我们首先评估了ViT-Large-AGD在标准围棋基准上的表现。如所示,引入AGD后,ViT-Large的棋力出现了轻微下降(KR从8d降至7d)。这可能是因为在搜索过程中考虑对手的反应会稍微偏离最优路径。不过,ViT-Large-AGD在面对人类棋手时仍然表现出了接近顶尖的实力。1 J4 R3 {+ ?4 L% {& l9 R6 D