这两天,AI 圈又热闹起来了。
Anthropic 发布了一份新的威胁情报报告,指控 DeepSeek、Moonshot、阿里、智谱、小米等中国 AI 公司,通过大规模账户、代理网络和“蒸馏”技术获取 Claude 的能力。
最刺激的部分当然不是“蒸馏”。 真正抓眼球的是:
“DeepSeek 和 Kimi 被指控把真实用户请求转给 Claude。”
于是新闻标题迅速变得非常漂亮:
“China's star AI labs routed user requests to Claude at least 35 million times in the summer: Anthropic。”(《商业内幕》)
“中国 AI 不够强,复杂问题还得交给 Claude。”
“DeepSeek、Kimi 被曝静默调用 Claude。”
甚至有报道把密码、政府信息、军事数据等关键词统统塞进标题(路透社)。
这就很有意思了。
因为如果把情绪先放一边,把 Anthropic 的报告、今年早些时候的旧指控、这次的新指控以及整个传播链条放在一起看,会发现一个相当微妙的变化:
Anthropic 其实没有发明一个全新的故事。 它做的其实是把“非法蒸馏”这个已经讲过一次的故事重新包装了一遍。
而这一次包装得更刺激。
上一次是“中国 AI 公司大量调用 Claude,偷学 Claude。”而这一次变成“中国 AI 公司不仅偷学 Claude,甚至连自己的用户都要交给 Claude 处理。”
故事一下就从“技术竞争”升级成了“数据安全”。 从“模型蒸馏”升级成了“无能”+“用户欺诈”。 从一个相对专业、普通用户根本不关心的模型训练问题,升级成了任何人都能理解的恐怖故事:
“你以为你在用中国 AI,其实背后是美国 AI 在替你干活。”
这就已经不只是技术报告了。它成了一场市场营销。
Anthropic 早就公开指控 DeepSeek、Moonshot 和 MiniMax 通过几万个虚假账户,对 Claude 发起超过 数千万次交互,以提取 Claude 的能力用于自身模型训练。
当时 Anthropic 的说法是“这些公司在进行工业化蒸馏(industrial-scale distillation)。” 也就是说“用强模型产生大量高质量输出,再拿这些输出训练自己的模型。”
这件事情本身并不神秘。 甚至“蒸馏”本身也不是邪术。 Anthropic 自己在以前的报告里都承认,蒸馏是一种广泛使用、合法的模型训练技术;真正有争议的是未经授权地大规模提取竞争对手模型能力。
而到了这个月,故事升级了。
Anthropic 说,这一次观察到了数亿次相关请求,并进一步声称 Moonshot、DeepSeek、智谱等中国公司有数千万次真实用户请求被转发到 Claude。
于是故事突然从“你在蒸馏我的模型。”变成了“你甚至把自己的用户真实请求,送到我的模型这里。”
这当然比“蒸馏”刺激多了。这暗示中国模型是如此的无能,竟然要Claude当枪手。
但也正因为刺激,我们更应该冷静下来问一句“到底有多少证据?”
我并不怀疑 Claude 看到了诸如 Kimi,GLM 或 DeepSeek 请求特征,但这不等于中国 AI 公司把用户送来了。
这是整件事情最容易被标题吃掉的部分。
假设 Anthropic 在自己的服务器上看到来自日本和新加坡服务器的大量DeepSeek/Kimi/GLM相关请求特征。
这能证明什么?
这可以证明 Anthropic 看到了一批与 DeepSeek/Kimi/GLM 生态高度相关的流量。
但它并不能自动证明 DeepSeek/Kimi/GLM 官方服务器决定把这些用户送到 Claude。
因为这些中国AI模型早就已经不是一个单纯的“在线服务”了。 这些都是公开模型权重。 任何公司或个人都可以下载部署。 日本公司可以下载, 新加坡公司可以下载,美国公司也可以下载。 API 聚合平台(例如 OpenRouter)可以下载,Agent(智能体 例如 OpenClaw)也可以下载。 他们完全可以自己搭一个类似下面的构架:
API
↓
自己的服务
↓
Model Router
├── DeepSeek
├── Claude
└── GPT
└── 其他 AI
如果这时候 Claude 服务器看到的是日本、新加坡的请求,并且请求行为像“中国 AI”,那么究竟是谁在路由?
是中国 AI 公司官方? 还是某个日本或美国公司? 还是新加坡 API 平台? 还是某个卖 API 的中间商?
这不是文字游戏。 这是最基本的问题。
Anthropic 在 早期的报告中说,它可以通过 IP 地址、请求 metadata、基础设施指标等进行高置信度归因,并称部分情况下还能通过行业合作伙伴获得交叉验证。
这当然比“看 IP 猜公司”强得多。
但对于公众来说,问题依然存在:Anthropic 到底公开了多少能够证明“官方产品路由”的证据?
目前我们看到的主要仍然是 Anthropic 自己的 telemetry 和 threat-intelligence attribution,而不是完整的后端 routing logs、双方 request ID 对应关系或者第三方部署商的完整交易记录。
这就意味着“有大规模异常流量”与“中国 AI 公司官方偷偷把用户交给 Claude”之间,仍然存在一个证据鸿沟。
而在开放权重时代,“模型名称”已经不能当成“公司身份证”。
这是这次报道中最容易被忽略、却可能是最重要的问题。
对于闭源模型来说,Claude = Anthropic。
所以 Claude API 出现大量异常请求,归因相对简单。
但开放权重模型不一样。
Open Source LLM 发布之后,模型权重可以进入完全不同的商业主体。
于是一个API请求中的 DeepSeek 既可能意味着 DeepSeek 公司本身,也可能意味着某台服务器上运行着 DeepSeek 权重,更可能意味着一个使用 DeepSeek 作为底座、但完全由第三方运营的 AI 产品。
打个比方,这就像 Linux。 你看到一台 Linux 服务器,但不能因此说“这是 Linux 公司在运行这台服务器。”
在开放模型时代,模型的出处和服务的所有者已经开始分离。 因此,未来 AI 安全调查会越来越难。
“DeepSeek traffic”,究竟是 DeepSeek 官方流量? 还是 DeepSeek 模型流量? 这根本是两回事。
还有一个更朴素的问题:这笔生意到底划不划算?
如果中国 AI 公司真把大量用户请求直接交给 Claude,那么还有一个非常俗气、但非常重要的问题:
怎么算钱?
中国 AI 模型现在最大的优势之一就是便宜。
便宜到什么程度?
便宜到可以让用户觉得根本没花钱。 对比美国的同等级 AI,中国 AI 每百万token的价格只有几分之一甚至几十分之一。
如果一个中国 AI 产品每百万token收用户 1 人民币, 然后把问题转给昂贵的美国AI前沿模型,交出几十倍的使用费。 最后自己还得承担中间商成本和网络成本。
那么这笔账怎么算?
如果只是极少量的重大问题,这或许还算当然合理。 但如果像Anthropic说的那样大规模发生,那就非常奇怪。
因为这等于自己辛辛苦苦做低成本模型,最后再花昂贵的美元去买竞争对手的 token。 如果只是为了给用户提供答案,这个商业模式是奔着快速破产的道路去的。
当然,蒸馏可以解释这笔账。公平地说,Anthropic 仍然有一个非常强的反驳。
如果目标不是“拿 Claude 给用户提供服务。” 而是“拿 Claude 产生训练数据。” 那么经济学完全不同。 花百倍的价格买 Claude 的高质量 reasoning,可能最终训练出一个可以替代 Claude 的模型。 用钱买能力,再把能力压缩进自己的模型。 从这个角度讲,蒸馏当然有经济价值。
问题在于为什么一定要用真实用户请求? 自己造 prompt 不行吗? 自己做 benchmark 不行吗? 自己生成 synthetic data 不行吗?
当然可以。
但真实用户问题有一个 synthetic data 很难完全替代的优势。
它是真实世界。
真实用户会问一些工程师想不到的问题。 会上传千奇百怪的请求。 会提供真实代码。 会问极其具体的业务问题。 会把一个模型推向各种奇怪的长尾场景。
所以,如果 Anthropic 所说的“真实用户请求被转发”确实成立,那么最严重的地方不是 “中国 AI 用了 Claude。” 而是 “真实用户的数据可能成为另一个模型的训练原料。”
这才是真正值得调查的问题。
可是同样的逻辑用“第三方行为”在商业上同样完全说得通。 这种解释更加现实。 比如 Agent 把简单问题交给自己部署的中国 AI。 复杂 coding 交给 Claude。 或者 Agent 在某个模型上未能得到答案于是转到 Claude。 这种情况下,用户甚至完全不知道这种 model routing。
这种构架本身没有什么神秘的。 大多数 Agent 产品本来就是这么设计的。 问题在于用户是否知道这件事。 如果没有告诉用户,那么这是隐私和透明度问题。 但它依然不能自动变成“中国 AI 公司偷偷把用户送给 Anthropic。”
更有意思的是,这种第三方服务完全可以把开源模型部署在日本、新加坡或者美国的云服务器上。
于是 Anthropic 最终看到的就是从日本 IP、 新加坡 IP甚至美国 IP 涌来的大量中国 AI 模型特征的请求。 如果直接把它翻译成 “中国 AI 公司把用户送给 Claude。” 跨度就大多了。
而这恰恰是这次新闻最有意思的地方
如果把 Anthropic 到目前为止的多次指控放在一起看,会发现一种非常漂亮的叙事升级。
之前是中国 AI 公司在偷学美国 AI。而到了9月 则成了中国 AI 公司不仅在偷学美国 AI,还把自己的用户送到美国 AI 那里。
前者证明 Claude 更先进。 后者进一步暗示中国 AI 公司不但无能还弄虚作假。遇到难题,都必须找 Claude。
这是一个非常高效的竞争叙事。 它甚至不需要证明“中国 AI 完全不行”。 只需要让消费者产生一个印象:中国 AI 便宜是便宜,但完全不管用,碰到真正难的问题,还是要用 Claude。
然后再进一步:中国 AI 所谓的能力,都是从 Claude 那里学来的。 于是整个故事形成完美无缺的逻辑闭环。 这就不只是关于网络安全或技术水平了。 这是一个非常完整的市场定位叙事。
这就是一场“营销”。 这里的“营销”不一定意味着 Anthropic 在撒谎。一个公司完全可以说一部分事实,同时做营销。 这是商业世界最正常的事情。
报告可能完全是真的,但只是一部分事实。 与此同时,它也非常希望消费者得出一个结论:“还是我们家的大模型最棒。”
Anthropic 当然有理由保护自己的模型。 它也当然有理由打击大规模未经授权的蒸馏。 更重要的是Anthropic 是一家商业公司。 Claude 越强,Anthropic 的商业价值越高。 Claude 越被认为是“不可替代的前沿模型”,这个品牌定位就越有价值。
如果市场形成这样的认知:中国 AI = 便宜 而 Claude = 真正高级能力。 那么这对 Anthropic 本身就是非常有利的市场结构。
最厉害的其实不是 Anthropic,而是新闻标题。 真正让我觉得有意思的,是新闻媒体如何处理这件事。
Anthropic 原始报告里的语言其实非常复杂。
里面有:
- account correlation;
- infrastructure indicators;
- request metadata;
- behavioral patterns;
- attribution;
- distillation;
- proxy services;
- transfer stations。
这些词普通读者看了大概三分钟就关页面。 于是媒体必须给它翻译。
然后我们就看到了:
“中国 AI 偷偷把用户数据送给美国!”
“DeepSeek 被曝将用户请求转给 Claude!”
“中国 AI 巨头大规模窃取美国模型能力!”
这就是传播机制。
复杂的技术归因,最终变成一句道德判断。 概率性的情报判断,最终变成一个确定性的新闻标题。 “我们观察到疑似……”最终变成“他们就是……” 而读者记住的,永远不是后面的限定条件。
读者只记住“中国 AI 不如美国 AI。” 故事完成。
于是一个市场定位就出现了,“Claude 已经成为一个足够有价值、足够值得被大规模蒸馏的能力源。”
换句话说,蒸馏行为本身既可以被描述成“中国 AI 偷美国技术。”也可以被描述成“Claude 的能力已经成为整个 AI 行业的重要训练资源。”
两种描述都可能基于同一批事实。 区别只是叙事角度。 而商业公司当然喜欢这样的定位。 因为这天然包含一个价值判断“我们是最棒的,别人都是模仿者。”
但这里与 Anthropic 所希望的不同,如果 DeepSeek、Kimi 等中国 AI 公司真的已经可以通过开放权重模型,以极低成本提供大量 AI 服务,那么这本身恰恰说明 AI 能力正在快速廉价化。 今天最昂贵的模型能力,明天可能进入开放权重。 后天可能被蒸馏。 再过一段时间可能成为廉价 API。 然后又被别人重新训练。
在传统软件时代,软件源代码是资产。 而在 AI 时代,模型权重是资产。 模型权重一旦开放,资产的边界就发生变化。 你可以禁止 API。 你可以封账号。 你可以识别代理。 你甚至可以限制某些国家访问。 但你无法轻易阻止模型被下载以后,在地球另一端重新出现。
所以,Anthropic 真正面对的可能并不是某一家中国公司的“盗窃” 而是一个更加宏观的问题“当模型能力可以被复制、压缩、蒸馏和重新部署以后,谁拥有 AI 能力这件事情本身正在变得越来越难定义。”
因此,我反而希望 Anthropic 给出更硬的证据。 我并不反对 Anthropic 打击未经授权的蒸馏。 也不反对调查真实用户数据是否被第三方偷偷转发。 恰恰相反,如果有人把用户的代码、密码、企业资料或者政府数据偷偷送到另一个模型,那么无论它来自中国、美国、日本还是欧洲,都应该被追究。 但正因为这个问题严重,所以证据标准也应该更高。
如果能够证明这条,那么没有什么好争论的。 如果证明不了,那么更严谨的说法应该是“Anthropic 发现大量与中国 AI 模型生态相关的第三方流量被送往 Claude,并将部分活动高置信度归因于 DeepSeek、Moonshot 等公司。”
这和 DeepSeek/Kimi 偷偷把用户交给 Claude 不是一个证据等级。
在 AI 竞争越来越激烈的今天,谁掌握模型,谁就掌握了一部分话语权;谁掌握模型,也越来越希望掌握关于“谁更强”的解释权。
Anthropic 的报告可能是真的。 中国 AI 的蒸馏行为也可能是真的。 第三方代理偷偷转发用户数据也可能是真的。 甚至 DeepSeek/Kimi 官方静默路由也可能最终被证明是真的。
但这些命题需要分别证明。 不能因为第一个成立,就自动让其他都成立。
我并不认为这次事件最值得讨论的问题是“中国 AI 有没有蒸馏 Claude?”
互相蒸馏事实上在业内是公开的秘密。 AI 行业没有哪一家真正生活在真空里。 甚至 Anthropic 自己都是靠蒸馏起家的。
真正值得讨论的是Anthropic 对“蒸馏”的指责究竟被包装成了什么?
之前它被包装成“中国 AI 正在偷学美国 AI。” 到了 9 月,它又被包装成“中国 AI 如此无能,连自己的用户都要交给美国 AI。”
而后一种说法显然更适合大众传播,更能给大众尤其是美国公众提供情绪价值。
“蒸馏”是技术名词。 “无能”+“找枪手”是能力问题也是道德问题。
前者需要读论文。 后者只需要一个标题。
一份本来关于模型安全、API 滥用和训练数据的技术报告,很容易被转换成一个更加简单、更加符合商业竞争需要的故事:
美国 AI 是原版。 中国 AI 是复制品。 中国 AI 遇到真正困难的问题,还得回头找美国 AI。
这套叙事对 Anthropic 来说当然很有价值。
而媒体也乐于传播,因为“工业规模蒸馏攻击”没有“DeepSeek 偷偷把你的秘密交给 Claude”好卖。
当 AI 公司开始争夺模型能力的时候,它们也正在争夺“谁有资格定义事实”的权力。
而在这场战争里,最便宜的东西可能恰恰是 token。 最贵的东西,是叙事。