注册 登录
爱吱声 返回首页

孟词宗的个人空间 http://aswetalk.net/bbs/?6812 [收藏] [复制] [分享] [RSS]

日志

从“蒸馏”到“偷送用户数据”:A店这次到底在卖什么

热度 14已有 200 次阅读2026-9-13 13:35

这两天,AI 圈又热闹起来了。

 Anthropic 发布了一份新的威胁情报报告,指控 DeepSeek、Moonshot、阿里、智谱、小米等中国 AI 公司,通过大规模账户、代理网络和“蒸馏”技术获取 Claude 的能力。

 最刺激的部分当然不是“蒸馏”。  真正抓眼球的是:

“DeepSeek 和 Kimi 被指控把真实用户请求转给 Claude。”

 于是新闻标题迅速变得非常漂亮:

 “China's star AI labs routed user requests to Claude at least 35 million times in the summer: Anthropic。”(《商业内幕》)

 “中国 AI 不够强,复杂问题还得交给 Claude。”

 “DeepSeek、Kimi 被曝静默调用 Claude。”

 甚至有报道把密码、政府信息、军事数据等关键词统统塞进标题(路透社)。

 这就很有意思了。

 因为如果把情绪先放一边,把 Anthropic 的报告、今年早些时候的旧指控、这次的新指控以及整个传播链条放在一起看,会发现一个相当微妙的变化:

 Anthropic 其实没有发明一个全新的故事。 它做的其实是把“非法蒸馏”这个已经讲过一次的故事重新包装了一遍。

 而这一次包装得更刺激。

 上一次是“中国 AI 公司大量调用 Claude,偷学 Claude。”而这一次变成“中国 AI 公司不仅偷学 Claude,甚至连自己的用户都要交给 Claude 处理。”

 故事一下就从“技术竞争”升级成了“数据安全”。 从“模型蒸馏”升级成了“无能”+“用户欺诈”。 从一个相对专业、普通用户根本不关心的模型训练问题,升级成了任何人都能理解的恐怖故事:

 “你以为你在用中国 AI,其实背后是美国 AI 在替你干活。”

 这就已经不只是技术报告了。它成了一场市场营销。

 Anthropic 早就公开指控 DeepSeek、Moonshot 和 MiniMax 通过几万个虚假账户,对 Claude 发起超过 数千万次交互,以提取 Claude 的能力用于自身模型训练。

 当时 Anthropic 的说法是“这些公司在进行工业化蒸馏(industrial-scale distillation)。” 也就是说“用强模型产生大量高质量输出,再拿这些输出训练自己的模型。”

 这件事情本身并不神秘。 甚至“蒸馏”本身也不是邪术。  Anthropic 自己在以前的报告里都承认,蒸馏是一种广泛使用、合法的模型训练技术;真正有争议的是未经授权地大规模提取竞争对手模型能力。 

 而到了这个月,故事升级了。

 Anthropic 说,这一次观察到了数亿次相关请求,并进一步声称 Moonshot、DeepSeek、智谱等中国公司有数千万次真实用户请求被转发到 Claude。

 于是故事突然从“你在蒸馏我的模型。”变成了“你甚至把自己的用户真实请求,送到我的模型这里。”

 这当然比“蒸馏”刺激多了。这暗示中国模型是如此的无能,竟然要Claude当枪手。

 但也正因为刺激,我们更应该冷静下来问一句“到底有多少证据?”

我并不怀疑 Claude 看到了诸如 Kimi,GLM 或 DeepSeek 请求特征,但这不等于中国 AI 公司把用户送来了。
 
 这是整件事情最容易被标题吃掉的部分。

 假设 Anthropic 在自己的服务器上看到来自日本和新加坡服务器的大量DeepSeek/Kimi/GLM相关请求特征。

 这能证明什么?

 这可以证明 Anthropic 看到了一批与 DeepSeek/Kimi/GLM 生态高度相关的流量。

 但它并不能自动证明 DeepSeek/Kimi/GLM 官方服务器决定把这些用户送到 Claude。

 因为这些中国AI模型早就已经不是一个单纯的“在线服务”了。 这些都是公开模型权重。 任何公司或个人都可以下载部署。  日本公司可以下载, 新加坡公司可以下载,美国公司也可以下载。  API 聚合平台(例如 OpenRouter)可以下载,Agent(智能体 例如 OpenClaw)也可以下载。  他们完全可以自己搭一个类似下面的构架:

API
   ↓
自己的服务
   ↓
Model Router
   ├── DeepSeek
   ├── Claude
   └── GPT
   └── 其他 AI

 如果这时候 Claude 服务器看到的是日本、新加坡的请求,并且请求行为像“中国 AI”,那么究竟是谁在路由?

 是中国 AI 公司官方? 还是某个日本或美国公司? 还是新加坡 API 平台? 还是某个卖 API 的中间商?

 这不是文字游戏。 这是最基本的问题。

 Anthropic 在 早期的报告中说,它可以通过 IP 地址、请求 metadata、基础设施指标等进行高置信度归因,并称部分情况下还能通过行业合作伙伴获得交叉验证。 

 这当然比“看 IP 猜公司”强得多。

 但对于公众来说,问题依然存在:Anthropic 到底公开了多少能够证明“官方产品路由”的证据?

 目前我们看到的主要仍然是 Anthropic 自己的 telemetry 和 threat-intelligence attribution,而不是完整的后端 routing logs、双方 request ID 对应关系或者第三方部署商的完整交易记录。

 这就意味着“有大规模异常流量”与“中国 AI 公司官方偷偷把用户交给 Claude”之间,仍然存在一个证据鸿沟。

而在开放权重时代,“模型名称”已经不能当成“公司身份证”。

 这是这次报道中最容易被忽略、却可能是最重要的问题。

 对于闭源模型来说,Claude = Anthropic。

 所以 Claude API 出现大量异常请求,归因相对简单。

 但开放权重模型不一样。

 Open Source LLM 发布之后,模型权重可以进入完全不同的商业主体。

 于是一个API请求中的 DeepSeek 既可能意味着 DeepSeek 公司本身,也可能意味着某台服务器上运行着 DeepSeek 权重,更可能意味着一个使用 DeepSeek 作为底座、但完全由第三方运营的 AI 产品。

 打个比方,这就像 Linux。 你看到一台 Linux 服务器,但不能因此说“这是 Linux 公司在运行这台服务器。”

 在开放模型时代,模型的出处和服务的所有者已经开始分离。 因此,未来 AI 安全调查会越来越难。

 “DeepSeek traffic”,究竟是 DeepSeek 官方流量? 还是 DeepSeek 模型流量? 这根本是两回事。

还有一个更朴素的问题:这笔生意到底划不划算?

 如果中国 AI 公司真把大量用户请求直接交给 Claude,那么还有一个非常俗气、但非常重要的问题:

 怎么算钱?

 中国 AI 模型现在最大的优势之一就是便宜。

 便宜到什么程度?

 便宜到可以让用户觉得根本没花钱。 对比美国的同等级 AI,中国 AI 每百万token的价格只有几分之一甚至几十分之一。

 如果一个中国 AI 产品每百万token收用户 1 人民币, 然后把问题转给昂贵的美国AI前沿模型,交出几十倍的使用费。 最后自己还得承担中间商成本和网络成本。

 那么这笔账怎么算?

 如果只是极少量的重大问题,这或许还算当然合理。  但如果像Anthropic说的那样大规模发生,那就非常奇怪。

 因为这等于自己辛辛苦苦做低成本模型,最后再花昂贵的美元去买竞争对手的 token。 如果只是为了给用户提供答案,这个商业模式是奔着快速破产的道路去的。

当然,蒸馏可以解释这笔账。公平地说,Anthropic 仍然有一个非常强的反驳。

 如果目标不是“拿 Claude 给用户提供服务。” 而是“拿 Claude 产生训练数据。” 那么经济学完全不同。 花百倍的价格买 Claude 的高质量 reasoning,可能最终训练出一个可以替代 Claude 的模型。 用钱买能力,再把能力压缩进自己的模型。 从这个角度讲,蒸馏当然有经济价值。

 问题在于为什么一定要用真实用户请求? 自己造 prompt 不行吗? 自己做 benchmark 不行吗? 自己生成 synthetic data 不行吗?

 当然可以。

 但真实用户问题有一个 synthetic data 很难完全替代的优势。
 
 它是真实世界。

 真实用户会问一些工程师想不到的问题。 会上传千奇百怪的请求。  会提供真实代码。  会问极其具体的业务问题。  会把一个模型推向各种奇怪的长尾场景。

 所以,如果 Anthropic 所说的“真实用户请求被转发”确实成立,那么最严重的地方不是 “中国 AI 用了 Claude。” 而是 “真实用户的数据可能成为另一个模型的训练原料。”

 这才是真正值得调查的问题。

可是同样的逻辑用“第三方行为”在商业上同样完全说得通。 这种解释更加现实。 比如 Agent 把简单问题交给自己部署的中国 AI。 复杂 coding 交给 Claude。 或者 Agent 在某个模型上未能得到答案于是转到 Claude。 这种情况下,用户甚至完全不知道这种 model routing。 

这种构架本身没有什么神秘的。 大多数 Agent 产品本来就是这么设计的。  问题在于用户是否知道这件事。 如果没有告诉用户,那么这是隐私和透明度问题。  但它依然不能自动变成“中国 AI 公司偷偷把用户送给 Anthropic。”

 更有意思的是,这种第三方服务完全可以把开源模型部署在日本、新加坡或者美国的云服务器上。

 于是 Anthropic 最终看到的就是从日本 IP、 新加坡 IP甚至美国 IP 涌来的大量中国 AI 模型特征的请求。 如果直接把它翻译成 “中国 AI 公司把用户送给 Claude。” 跨度就大多了。

而这恰恰是这次新闻最有意思的地方

 如果把 Anthropic 到目前为止的多次指控放在一起看,会发现一种非常漂亮的叙事升级。

 之前是中国 AI 公司在偷学美国 AI。而到了9月 则成了中国 AI 公司不仅在偷学美国 AI,还把自己的用户送到美国 AI 那里。

 前者证明 Claude 更先进。 后者进一步暗示中国 AI 公司不但无能还弄虚作假。遇到难题,都必须找 Claude。

 这是一个非常高效的竞争叙事。 它甚至不需要证明“中国 AI 完全不行”。  只需要让消费者产生一个印象:中国 AI 便宜是便宜,但完全不管用,碰到真正难的问题,还是要用 Claude。

 然后再进一步:中国 AI 所谓的能力,都是从 Claude 那里学来的。 于是整个故事形成完美无缺的逻辑闭环。 这就不只是关于网络安全或技术水平了。  这是一个非常完整的市场定位叙事。

这就是一场“营销”。 这里的“营销”不一定意味着 Anthropic 在撒谎。一个公司完全可以说一部分事实,同时做营销。 这是商业世界最正常的事情。

 报告可能完全是真的,但只是一部分事实。 与此同时,它也非常希望消费者得出一个结论:“还是我们家的大模型最棒。”

 Anthropic 当然有理由保护自己的模型。 它也当然有理由打击大规模未经授权的蒸馏。 更重要的是Anthropic 是一家商业公司。  Claude 越强,Anthropic 的商业价值越高。  Claude 越被认为是“不可替代的前沿模型”,这个品牌定位就越有价值。

 如果市场形成这样的认知:中国 AI = 便宜 而  Claude = 真正高级能力。 那么这对 Anthropic 本身就是非常有利的市场结构。

最厉害的其实不是 Anthropic,而是新闻标题。 真正让我觉得有意思的,是新闻媒体如何处理这件事。

 Anthropic 原始报告里的语言其实非常复杂。

 里面有:

 - account correlation;
- infrastructure indicators;
- request metadata;
- behavioral patterns;
- attribution;
- distillation;
- proxy services;
- transfer stations。

 这些词普通读者看了大概三分钟就关页面。  于是媒体必须给它翻译。

 然后我们就看到了:

 “中国 AI 偷偷把用户数据送给美国!”

 “DeepSeek 被曝将用户请求转给 Claude!”

 “中国 AI 巨头大规模窃取美国模型能力!”

 这就是传播机制。

 复杂的技术归因,最终变成一句道德判断。 概率性的情报判断,最终变成一个确定性的新闻标题。 “我们观察到疑似……”最终变成“他们就是……” 而读者记住的,永远不是后面的限定条件。

 读者只记住“中国 AI 不如美国 AI。” 故事完成。

于是一个市场定位就出现了,“Claude 已经成为一个足够有价值、足够值得被大规模蒸馏的能力源。”

 换句话说,蒸馏行为本身既可以被描述成“中国 AI 偷美国技术。”也可以被描述成“Claude 的能力已经成为整个 AI 行业的重要训练资源。”

 两种描述都可能基于同一批事实。  区别只是叙事角度。  而商业公司当然喜欢这样的定位。 因为这天然包含一个价值判断“我们是最棒的,别人都是模仿者。”

但这里与 Anthropic 所希望的不同,如果 DeepSeek、Kimi 等中国 AI 公司真的已经可以通过开放权重模型,以极低成本提供大量 AI 服务,那么这本身恰恰说明 AI 能力正在快速廉价化。 今天最昂贵的模型能力,明天可能进入开放权重。  后天可能被蒸馏。 再过一段时间可能成为廉价 API。 然后又被别人重新训练。

 在传统软件时代,软件源代码是资产。 而在 AI 时代,模型权重是资产。  模型权重一旦开放,资产的边界就发生变化。  你可以禁止 API。  你可以封账号。  你可以识别代理。  你甚至可以限制某些国家访问。  但你无法轻易阻止模型被下载以后,在地球另一端重新出现。

 所以,Anthropic 真正面对的可能并不是某一家中国公司的“盗窃” 而是一个更加宏观的问题“当模型能力可以被复制、压缩、蒸馏和重新部署以后,谁拥有 AI 能力这件事情本身正在变得越来越难定义。”

因此,我反而希望 Anthropic 给出更硬的证据。 我并不反对 Anthropic 打击未经授权的蒸馏。  也不反对调查真实用户数据是否被第三方偷偷转发。  恰恰相反,如果有人把用户的代码、密码、企业资料或者政府数据偷偷送到另一个模型,那么无论它来自中国、美国、日本还是欧洲,都应该被追究。  但正因为这个问题严重,所以证据标准也应该更高。

 如果能够证明这条,那么没有什么好争论的。  如果证明不了,那么更严谨的说法应该是“Anthropic 发现大量与中国 AI 模型生态相关的第三方流量被送往 Claude,并将部分活动高置信度归因于 DeepSeek、Moonshot 等公司。”

 这和 DeepSeek/Kimi 偷偷把用户交给 Claude 不是一个证据等级。

在 AI 竞争越来越激烈的今天,谁掌握模型,谁就掌握了一部分话语权;谁掌握模型,也越来越希望掌握关于“谁更强”的解释权。

 Anthropic 的报告可能是真的。 中国 AI 的蒸馏行为也可能是真的。 第三方代理偷偷转发用户数据也可能是真的。 甚至 DeepSeek/Kimi 官方静默路由也可能最终被证明是真的。

 但这些命题需要分别证明。 不能因为第一个成立,就自动让其他都成立。

 我并不认为这次事件最值得讨论的问题是“中国 AI 有没有蒸馏 Claude?”

 互相蒸馏事实上在业内是公开的秘密。  AI 行业没有哪一家真正生活在真空里。 甚至 Anthropic 自己都是靠蒸馏起家的。

 真正值得讨论的是Anthropic 对“蒸馏”的指责究竟被包装成了什么?
 
 之前它被包装成“中国 AI 正在偷学美国 AI。” 到了 9 月,它又被包装成“中国 AI 如此无能,连自己的用户都要交给美国 AI。”

 而后一种说法显然更适合大众传播,更能给大众尤其是美国公众提供情绪价值。

“蒸馏”是技术名词。 “无能”+“找枪手”是能力问题也是道德问题。

 前者需要读论文。 后者只需要一个标题。

一份本来关于模型安全、API 滥用和训练数据的技术报告,很容易被转换成一个更加简单、更加符合商业竞争需要的故事:

 美国 AI 是原版。 中国 AI 是复制品。 中国 AI 遇到真正困难的问题,还得回头找美国 AI。

 这套叙事对 Anthropic 来说当然很有价值。

 而媒体也乐于传播,因为“工业规模蒸馏攻击”没有“DeepSeek 偷偷把你的秘密交给 Claude”好卖。

 当 AI 公司开始争夺模型能力的时候,它们也正在争夺“谁有资格定义事实”的权力。

 而在这场战争里,最便宜的东西可能恰恰是 token。 最贵的东西,是叙事。


膜拜

鸡蛋
11

鲜花

路过
2

雷人

开心

感动

难过

刚表态过的朋友 (13 人)

发表评论 评论 (3 个评论)

回复 水风 2026-9-13 23:11
我觉得A店的本意是想说,中国AI性能不行阿,你看那些用了开源中国AI的,最后都把任务交给我了。而不是中国AI在偷偷的把客户的问题送交给我来解答。

但这种论调有一个前提,就是大家的性价比都差不多。而不是A店一直以来的逻辑,就是用户必须要为最高的10%的能力支付90%的溢价。

设想如果我是欧美的用户,用付给中国便宜AI 价格,享受A店昂贵的服务,何乐而不为?事实上,按照成本控制理论,能用便宜方法解决的问题,为啥我要傻乎乎的花大钱。所以,我猜,大部分送过来的,都是经过中国便宜AI解决完简单问题,或者跑了一遍,拿不下来才送过来的。

营销是需要的,但除非能把成本降低到中国对等水平AI的程度,吹出来的,早晚会被真金白银打回去。
回复 孟词宗 2026-9-14 00:51
水风: 我觉得A店的本意是想说,中国AI性能不行阿,你看那些用了开源中国AI的,最后都把任务交给我了。而不是中国AI在偷偷的把客户的问题送交给我来解答。

但这种论调 ...
正是如此。美国 AI 的竞争力最大的短板就是成本。

不过我相当怀疑这个高昂的成本到底有多少是真实的。毕竟DS并没有隐瞒他们是如何把训练成本降下来的。而DeepSeek Moment 到现在都快两年了。就算是傻子都学会这套训练方法了。

而所谓的硬件高成本,运行(电力)高成本等等都不算啥。毕竟亏本打价格战并非什么稀奇的事情。美国历史上不止一次发生。甚至微软当年还放任自家的OS在国外被随意盗版以占领外国市场呢。

现在美国 AI 的高昂价格实际是由于AI产业高度金融化,估值迅速膨胀,参与者的财富在短时间内火箭般飙升。而金融化的后果,它们就必须选择闭源,通过垄断和收费来构建商业闭环。这样才能维持住估值,进而维持住基于庞大估值而获得的金融化财富和资本。

即使如此,低价策略也是自由市场竞争下自然选择。但美国御三家没有一个搞低价的,基本上形成了价格同盟(实际上是违反美国反垄断法的)。而政府也默许其继续卖高价。归根到底,它们需要AI来救美股和美债。

美国现在产业空心化,AI 算是唯一还能拿得出手的产业,而且前期还是垄断的。那么靠 AI 叙事来托住美股和美债是必然的。但如果 AI 不赚钱或者利润不高,这套故事就讲不下去了。

美债已经超过40万亿了,现在通胀高企、收益率又降不下来,这种局面持续下去,结果就是利息无法承受,新债没人买,最后直接暴雷,把美元信用彻底带入大坑。

当美股、美债都火烧眉毛,又没有其他解决办法或者其他办法用了没达到满意效果,那大家能指望的,就只能是AI了。AI必须赚钱,而且必须赶紧赚钱。

这就是为何美国御三家必须坚持闭源路线,收取高额费用的根本原因。它们不是看不到开源低价路线的好处,但时不我待,等市场培育出来了,它们自己可能已经饿死了。
回复 大黑蚊子 2026-9-14 09:45
孟词宗: 正是如此。美国 AI 的竞争力最大的短板就是成本。

不过我相当怀疑这个高昂的成本到底有多少是真实的。毕竟DS并没有隐瞒他们是如何把训练成本降下来的。而DeepSe ...
富家子弟会拿LV当菜篮子
小户人家才会把沃尔玛塑料袋当垃圾袋废物利用
本质上还是资源多寡的问题
OAGMX这几家卡多的用不过来,当然没有人琢磨如何提质增效

facelist doodle 涂鸦板

您需要登录后才可以评论 登录 | 注册

手机版|小黑屋|Archiver|网站错误报告|爱吱声   

GMT+8, 2026-9-14 14:00 , Processed in 0.050967 second(s), 18 queries , Gzip On.

Powered by Discuz! X3.2

© 2001-2013 Comsenz Inc.

返回顶部