楼主:
sxy67230 (charlesgg)
2026-09-19 00:31:17※ 引述 《kls》 之铭言:
: Anthropic上周有出份报告,真的是完全在耻笑中国
阿肥外商码农阿肥啦!
刚好看到这篇就回复一下,如果有认真看报告的话,其实报告里面针对Qwen 有提到“可能
”这个字,也就是说Anthropic也不敢断定真的是拿来做SFT pipeline的训练轨迹。
然后另一项指控是说阿里拿来写RL的environment,这点算是比较有趣的。熟悉RL的小朋友
大概都知道做强化学习的时候其实很多时候是可以不需要模型知道正确答案去跟着正确答案
微调的,只需要奖励讯号即可。而这个奖励讯号可以从真机实操来判断(有报error一定错
),但很多时候开放式问题奖励其实很难评判,这个时候主流会考虑用另一个模型来评分。
然后RL中其实这个奖励模型是不直接参与学习过程的,从技术上来看RL中AI其实是自己学习
自己产生的数据,只是透过这个奖励模型来决定哪些自己产生的数据不要学而已。
然后报告其实没有提供这些调用类型的占比,但如果Qwen实验室是拿来做后者某种程度不能
算上严格意义的蒸馏,甚至连SFT都算不上。不过从数学上广义来看要把reverse KL算是蒸
馏也没什么话可以说,就是如果学生模型都是自产自销的话,算不算是人类语句中所说的抄
袭同义就很难说了。毕竟学生确实没抄教师答案,所有过程都是学生自己想的,只是有一个
老师在跟你说你哪个推理有问题而已。
最后就是kimi、DS反而没蒸馏指控,就是指控他们把服务转接到Claude 然后Anthropic指控
说用户带个资传东西过来被Anthropic看到了(依照报告说词很含糊推测就是少量含个资被
放大了)。
不过转接服务也算合理(就是很丑陋就是了),毕竟脖子GPU芯片都被美国卡死了,就是卡
不够的情况下转接过去,这东西法律上也没什么违法疑虑,不然一堆SaaS服务接别人API的
都违法了。
不过有趣的点就是报告其实是给美国商务部的,所以用意更多是为了推销政府Anthropic很
重视AI安全,就是重视安全到可以监听大家在问Claude什么问题就是了(API企业用户一样
也会监听)。