中美AI安全治理说不定真是思路级的脱钩
本帖最后由 晨枫 于 2026-9-21 13:17 编辑AI安全治理是何立峰-贝森特周末“最后一分钟”会谈的一个主题,会后贝森特提到,美方提议建立一个AI事故通报机制。如果出现上升到国家安全层面的AI事故,中美可互相通报。这项建议将交由9月24日的中美峰会上讨论。
近来,美国一些科技领袖主张让AI赛道慢下来,中国则倾向于一边加快发展,一边做好安全监管。换句话说,美国担心“车开太快会失控”,中国强调“装好刹车,让车开得更稳更快”。
Anthropic的CEO阿莫代伊高调警告,AI能力发展速度可能快过安全制约,因此主张放慢前沿AI的研发,并加强第三方安全评估;他也支持收紧对华的先进芯片出口限制,限制中国通过蒸馏美国模型,以扩大美方的领先优势。硅谷的主流叙事是把焦点放在超级AI上:谁先实现突破,谁就可能获得决定性优势;但这种智能却可能强大到人类无法驾驭。
中国则是把AI看作和电力、蒸汽机等一样的通用技术,重点是用它来改造产业、推动经济升级。按这样的思路,要确保安全就像汽车有制动器那样,不是为了不让车跑,而是为了让人在开车时能更放心地加速。
在这方面,互联网可能是有用的先例,尤其是社交媒体对社会的作用。
在初期的欢呼后,谁都很快发现完全不受管制的社交媒体可能引起种种弊病,这不是一举“专制vs开放”就能解决的。
美国至今在受到网上极端言论和回音壁效应的影响,每次大选或者有重大社会性议题的时候,互联网成为放大分歧和制造极端化的地方,而不是交流、融合的地方。
中国有同样的问题,但用强有力的网络管理机制为社交媒体装上“刹车”。“刹车”不是永远完美,但也避免了额外的不安定因素。
中国对AI是有管理的。《人工智能安全治理框架3.0》指出,要警惕AI自我改进的速度和方向或许会超出人类掌控。2023年,中企曾在生成式AI管理规则定稿前推迟聊天机器人上线,直到规则生效后才允许推出产品,也是“不装好刹车不许上路”思维的体现。
中美会就AI安全治理进行对话,但体制差别可能使得这样的对话仅限于“你知我知、特事特办”,但还是较难形成统一、有强制性的管理机制。阿莫代伊提出的由第三方安全审议后才能发布的建议很可能是空谈,因为谁来定义“失控”、谁有资格作为独立的第三方、如何建立强制性的管制力都牵涉到主权,中美谁都不会退让。在“中国vs美欧”的现在,连国际组织都不行,他么的中立性声誉早就荡然无存了,中国信不过。
另外,如果AI安全标准主要由少数大型前沿实验室主导,其他相关方参与不足,就可能只保护现有科技巨头,而抬高中小型新兴企业入场的门槛。 不论哪个国家搞,有 AI 安全标准总比没有好,总比靠大公司大资本家的良心要好。资本家的良心是最靠不住的东西。
不过,不论哪个国家搞,AI安全标准归根到底还是主要由少数真正的专家和大型前沿实验室主导。无他,专业性太强。就像核能安全标准也不能让普通人来制定,必然要参考核物理学家和工程师的意见,甚至让他们作为技术主导。
至于保护现有科技巨头,而抬高中小型新兴企业入场的门槛,这几乎是必然的。AI 分为研究、运营和应用。研究、运营的成本极高,而且是重资产。因此除非入场早或者有大量投资,否则到了现在这个阶段几乎不可能再有新玩家入场了。但应用则不同,这可以是小成本依赖 AI 生态的。今后绝大多数的 AI 新兴企业都会是应用方面的。
互联网的发展历史已经给大家打了样子了。 这个不管思路脱钩与否,关于AI安全的会谈必然是不欢而散无疾而终。
这里关键不是要不要安全管制,而是谁来管制的问题。无法想象美国会允许中国机构来监督美国AI的安全性,也无法想象美国会允许中国AI只由中国监管机构来监管。同时中国也不会只让美国机构监管中国AI,而中国机构无法监管美国AI。。。所以,唯一可能的结果是中美各自监管。当然,各自都不会相信对方的监管。这个和没有监管,其实也差不多。其他国家必然跟随。无论怎样,美国都会让这个成为一个无法执行的国际监督机制。
结果就是,根本没人会踩刹车。大家都必须在下坡路上油门踩到底。。。。{:198:} 。。。欢迎来到这个疯狂的世界。。。 赫然 发表于 2026-9-22 04:19
这个不管思路脱钩与否,关于AI安全的会谈必然是不欢而散无疾而终。
这里关键不是要不要安全管制,而是谁来 ...
AI 的问题当然应当让 AI 来解决。所以俺问了狗屁通。下面是狗屁通提出的方案。基本模仿核武器与核设施的国际监管方案。看下来至少在纸面上是有可行性的。
你的推理抓住了一个非常关键的制度设计问题:**AI 安全的难点可能不是“有没有规则”,而是“谁有权验证规则被遵守”**。
而且这个问题正在从理论变成现实。就在今天披露的美中磋商中,美国提出了建立 AI 安全事件“通知机制”的设想,讨论的重点包括国家安全、透明度和重大 AI 事件通报;与此同时,中美安全专家近期甚至提出了类似核安全领域的“护栏”思路。 Reuters+2
但我会稍微修正你的结论:
> **问题并不是“各自监管 = 没有监管”,而是“各自监管 + 互不信任”会形成一个严重的监管套利和军备竞赛问题。**
这两个问题的解决方式其实完全不同。
## 一、真正需要解决的不是“谁监管”,而是“谁验证”
假设:
- 美国监管美国公司;
- 中国监管中国公司;
- 欧盟监管欧洲公司。
这本身并没有问题。
核工业、航空、金融、药品等领域,本来就大量采用**主权国家监管**,而不是让外国监管机构直接进入本国机构。
真正的问题是:
> **美国有没有办法知道中国监管机构说“中国这个模型安全”是真的?**
>
>**中国有没有办法知道美国监管机构说“美国这个模型安全”是真的?**
如果答案都是“不知道”,国际体系就会陷入你说的困境。
因此,千万不要把目标设计成:
**“建立一个世界 AI 政府,由一个国际机构监管所有 AI。”**
这几乎注定失败。
应该设计成:
**“各国继续拥有监管主权,但必须接受一套跨国可验证的安全标准。”**
这两个制度差别极大。
---
# 二、我认为真正可行的模型,是“核查而不是监管”
这里可以借鉴一个很重要的国际关系经验:
**国际社会往往无法建立一个大家都服从的世界政府,但可以建立一个大家都害怕退出的核查体系。**
换句话说:
> 不需要美国相信中国政府。
>
>不需要中国相信美国政府。
>
>只需要美国相信一套验证程序,中国也相信同一套验证程序。
这就是制度设计的核心。
例如建立一个国际 AI Safety Verification System。
它不拥有:
- 逮捕权;
- 执法权;
- 关闭美国公司的权力;
- 关闭中国公司的权力;
- 决定各国 AI 政策的权力。
它只做一件事:
> **验证一个 AI 系统是否满足共同定义的安全条件。**
这反而可能是中美都能够接受的。
---
# 三、关键是把“监管”拆成三层
我觉得这是整个问题最重要的地方。
### 第一层:国家监管
完全保留。
美国:
> 美国政府 → 美国 AI 公司
中国:
> 中国政府 → 中国 AI 公司
欧盟:
> 欧盟 → 欧洲 AI 公司
谁都不需要允许外国政府进入自己的监管体系。
---
### 第二层:国际标准
大家共同定义一些非常狭窄的东西,例如:
- 什么叫 frontier model;
- 什么能力达到危险阈值;
- 哪些能力必须进行独立测试;
- 哪些事故必须报告;
- 什么叫“重大 AI 安全事件”;
- 哪些模型必须进行 deployment review;
- 哪些模型必须保留审计记录;
- 什么测试结果达到什么风险等级。
注意:
**这里只规定“测什么”和“怎么测”,而不是规定“你这个国家应该怎么治理”。**
这会大幅降低主权冲突。
---
### 第三层:国际验证
这是最关键的一层。
不是让中国监管美国。
也不是让美国监管中国。
而是:
> **第三方机构验证“美国监管机构有没有按照共同标准完成测试”。**
例如:
美国说:
> “我们已经测试过 Model X,安全。”
国际验证机构不需要接管美国监管。
它只需要检查:
> 你测试了吗?
>
>测试方法符合标准吗?
>
>测试数据有没有造假?
>
>有没有遗漏规定的测试?
>
>测试结果有没有达到规定阈值?
中国同理。
于是就出现了一个非常漂亮的制度:
**国家拥有监管权,国际机构拥有验证权。**
---
# 四、甚至不需要相信“第三方”
这里还有一个更深的设计。
假设中美连第三方都不相信。
怎么办?
**让验证过程尽可能机器化。**
例如建立标准化的 AI Safety Evaluation Protocol。
一家中国公司提交模型以后,不需要把模型权重交给美国。
一家美国公司也不需要把权重交给中国。
双方只需要运行一组国际认可的测试:
```
Cybersecurity
Biosecurity
Autonomous replication
Deception
Persuasion
Model autonomy
Critical infrastructure attacks
Human-control loss
```
然后产生:
```
Test ID
Version
Result
Timestamp
Evaluator
Cryptographic signature
```
类似航空领域的适航证书、软件供应链签名、金融审计记录。
这样国际机制监督的不是:
> “你的模型内部到底是什么?”
而是:
> **“你是否完成了规定的测试,以及结果是否真实可验证?”**
这会比“外国监管机构进驻你的 AI 实验室”现实得多。
---
# 五、进一步可以采用“相互承认”制度
这可能是最现实的突破口。
例如:
美国说:
> 我不接受中国监管机构直接监管美国 AI。
中国说:
> 我也不接受美国监管机构直接监管中国 AI。
完全没关系。
那么双方签:
> **Mutual Recognition Agreement**
也就是:
**我承认你的监管体系满足某些共同最低标准。**
这在国际贸易、航空、药品、金融等领域其实并不陌生。
于是:
本帖最后由 孟词宗 于 2026-9-22 06:32 编辑
孟词宗 发表于 2026-9-22 06:11
AI 的问题当然应当让 AI 来解决。所以俺问了狗屁通。下面是狗屁通提出的方案。基本模仿核武器与核设施的 ...
# 五、进一步可以采用“相互承认”制度
这可能是最现实的突破口。
例如:
美国说:我不接受中国监管机构直接监管美国 AI。
中国说:我也不接受美国监管机构直接监管中国 AI。
完全没关系。
那么双方签:Mutual Recognition Agreement
也就是:我承认你的监管体系满足某些共同最低标准。
这在国际贸易、航空、药品、金融等领域其实并不陌生。
于是:美国监管机构 》按照国际标准测试 》 国际认证 》中国承认其结果
同时:中国监管机构 》按照同一标准测试 》国际认证 》美国承认其结果
注意这里的关键不是“互相信任”。
而是:互相不信任,但接受同一套程序。
这恰恰是国际制度能够运转的典型方式。
# 六、而且“国际监管机构”最好不要拥有“刹车权”
这点非常重要。
如果设计成:国际 AI 机构有权禁止美国公司发布模型。美国不会接受。
如果:国际 AI 机构有权禁止中国公司发布模型。中国也不会接受。
所以国际机构最初甚至不应该拥有这种权力。
它应该只有:检测 + 认证 + 报告 + 预警 四项功能。
例如:
Model X
Safety Level 3
Critical-risk test: PASS
Cyber autonomy test: PASS
Biological-risk test: PASS
Independent verification: YES
如果:
Safety Level: 5
Critical test: FAIL
国际机构只负责公布:FAIL
然后由美国政府决定怎么办。中国政府同理。
七、真正的“刹车”反而可以来自市场
这就产生了一个非常有意思的机制。
假设全球主要云计算公司、芯片公司、模型 API、政府采购部门约定:
没有国际安全认证的 frontier model,不允许进入关键基础设施。那么国际机构虽然没有执法权,却产生了巨大的实际约束力。
比如没有认证不能进入美国政府关键系统;不能进入中国关键基础设施;不能获得某些国际保险;不能进入大型云平台;不能获得某些国家采购;不能获得某些金融服务。
这实际上形成:Regulation by access 而不是:Regulation by force
这可能比建立一个“AI 联合国”现实得多。
八、但还有一个你指出的更大的问题:军用 AI
这里才是最难的。如果 AI 只是医疗、搜索、办公、广告,那么国际监管相对容易。
但如果 AI 可以发现网络漏洞 → 自动攻击 → 控制基础设施 → 协调无人系统
问题就完全变成了军备控制问题。
最近中美安全专家讨论的一个场景正是这个:如果 AI 系统介入核指挥网络或军事网络攻击,两国可能只有几分钟判断究竟是事故还是对方攻击。
这个问题不能用普通的“AI伦理监管”解决。
它需要的是:AI版的“核热线 + 事故通报 + 军控机制”
例如规定:如果发现 AI 导致国家级网络攻击异常,必须在 X 分钟内通知对方。
而不是:“我们相信对方不会攻击。”
这两个完全不同。
今天美国提出的 AI incident notification mechanism,其实已经有一点朝这个方向走了。
九、因此我会把整个体系设计成“五层”
如果让我从制度设计角度构造一个真正可能落地的框架,大概是:
Layer 1:国内监管
各国自己决定:谁监管、怎么监管、违法怎么办。完全主权化。
Layer 2:共同技术标准
中美欧等共同制定:测什么、怎么测、风险怎么定义。技术标准国际化。
Layer 3:独立验证
第三方验证:你是否按照标准测试。验证国际化。
Layer 4:事故通报
发生重大 AI 事故:强制通知其他国家。风险信息国际化。
Layer 5:军事 AI 热线
出现:AI 网络攻击、核系统异常、重大自主武器事故
立即:国家级 AI incident hotline 避免事故升级成战争。
十、这里还有一个特别重要的原则:不要一开始就管“AI”
这是很多 AI 治理方案容易犯的错误。“AI”太大。
你很难让中美就什么是安全 AI 达成一致。
但是可以先谈什么情况下 AI 可能导致核战争?
这个双方都有利益。
然后 什么情况下 AI 可能造成大规模网络攻击?
也有共同利益。
再然后什么情况下 AI 能自主复制、隐藏、攻击人类基础设施?
也有共同利益。
所以应该采用从最危险、最容易形成共同利益的风险开始。
而不是“我们建立一个全球 AI 政府,然后把所有 AI 都管起来。”
十一、你的“油门踩到底”比喻,其实对应一个非常经典的问题
经济学里叫:Prisoner's Dilemma 囚徒困境。
如果双方都认为“只要我刹车,对方就会超过我。”那么理性行为反而变成双方一起踩油门。这就是为什么单纯要求“大家为了人类未来负责一点。”没有用。
必须改变激励结构。
十二、所以真正的解决方案不是“让大家相信对方”
这是我认为最核心的一点。
国际制度从来不是建立在信任之上的。它建立在“即使我不信任你,我仍然有理由遵守规则。”这才是成熟的制度。
因此未来 AI 治理真正应该追求的不是“我相信中国不会突破红线。”或者反过来“我相信美国不会突破红线。”
而应该是 “我不知道中国是否善意,但我知道它如果突破红线,我会很快知道。”或者“我不知道美国是否善意,但我知道它如果突破红线,我也会很快知道。”而且对方知道我也能发现。
这就足以产生稳定性。
这其实就是国际军控体系最重要的思想之一:Stability does not require trust. It requires verifiability.
现实其实已经在往这个方向走,目前国际体系已经有一些部件:
2023 年《Bletchley Declaration》已经明确承认 AI 风险具有跨国性质,需要国际合作。
2024 年 Seoul Declaration 又进一步强调 AI safety institutes、可重复的安全测试以及国际合作。
目前全球已经形成越来越多 AI safety institutes,但协调程度仍然很有限;Atlantic Council 近期估计全球已有 114 个相关安全/安保机构,而正式协调的只有少数。
更值得注意的是,今天的讨论已经开始从“原则宣言”转向**事故通报机制、共同威胁识别、技术验证**。
所以我反而认为,真正值得观察的不是“中美能不能建立一个全球 AI 监管机构?” 这个目标很可能过高。而是“中美能不能先建立一个双方都不需要相信对方、但能够验证对方重大 AI 事故的机制?”
如果这一步能成功,下一步才可能是 事故通报 → 标准化测试 → 相互认证 → 风险阈值 → 军事热线 → 局部军控
要一步一步扩大。
最后,其实可以把整个问题压缩成一句话:
AI 全球治理不应该试图解决“谁来统治 AI”,而应该首先解决“在没有世界政府、彼此又互不信任的情况下,如何让每一方都能知道另一方有没有越过危险红线”。
如果能解决这个问题,“各自监管”就不再等于“没人监管”。
因为真正有效的国际制度,不一定要求一个共同的警察;它只需要让作弊变得可发现,让事故能够被通报,让关键行为能够被验证,并让突破红线的收益低于不突破红线的收益。
这可能才是中美 AI 安全合作唯一比较现实的起点。 孟词宗 发表于 2026-9-21 17:11
AI 的问题当然应当让 AI 来解决。所以俺问了狗屁通。下面是狗屁通提出的方案。基本模仿核武器与核设施的 ...
哈哈哈。。。我这个真算是抛砖引玉啦。。。孟兄弟的长篇很有道理。。
这种方案在以前往往是可行的。。。很多国际标准都是这个思路。。。不过,这次AI的情况比较特殊。以往的标准,测的是系统或者产品能做到什么。。。而这次AI要测的是系统是不是在撒谎。这就非常困难了。就像不会做菜的人很难伪装自己会做菜,而会做菜的人就很容易伪装自己不会做菜。对于一个会撒谎的AI而言,程序性的检查规范几乎是没有用的。如果AI的目标是通过测试,而不是按部就班做规范,AI的诚实性逃逸几乎是必然的。也就是说,AI对测试的回答其实对评价AI是没有意义的。这个对于内部检测和外部检测是一样的。就算美国对美国AI进行测试,而且通过了安全认证程序,这个AI可以是在撒谎,可能不安全。这是AI监察的难点。也就是说,任何一个国家对AI的检测,高概率不会被任何一方认可。 赫然 发表于 2026-9-21 14:19
这个不管思路脱钩与否,关于AI安全的会谈必然是不欢而散无疾而终。
这里关键不是要不要安全管制,而是谁来 ...
这个是赫然的真理。很实事求是。{:225:} 赫然 发表于 2026-9-22 07:48
哈哈哈。。。我这个真算是抛砖引玉啦。。。孟兄弟的长篇很有道理。。
这种方案在以前往往是可行的。。。 ...
这个其实就是如何监督 AI 了。既然 AI 是“智能”,那么就别指望它们的行为会像机器,而是会更像人。那么你怎么对付一个会撒谎的人?当然是监督啊。怎么监督?用另一个或几个 AI 来监督,分权和制衡。这俺在俺的《回路》里已经提过了。而最终监督者和仲裁者仍然是人类。
你不相信认证测试的结果,就好比你不相信北大的毕业生能干你要的活。那么怎么验证,当然是让北大生干活儿,然后监督他的行动和绩效啊。认证只是一时的,不断的监督才是有效的。就像文中说的,如果发现了攻击迹象,如果限定时段内对方不澄清,那么就是恶意行为。
而最重要的一点是,任何时候都不能让 AI 掌握军事指挥权和武器的发射权。命令只能由人来下,AI 最多只能是参谋,而且还不带长。{:190:} 孟词宗 发表于 2026-9-21 20:10
这个其实就是如何监督 AI 了。既然 AI 是“智能”,那么就别指望它们的行为会像机器,而是会更像人。那么 ...
这种形式的监督,作为内部监察是很可行的。不过,用来作为中美AI的核查机制,操作起来比较困难。还得想招儿。
所以,那个美国AI误判中国船只运送核部件几乎导致美军攻击中国货轮事件是美国人造出来吓唬中国的?
页:
[1]