楼主:
sxy67230 (charlesgg)
2026-07-23 10:24:00饿死抬头,阿肥外商码农阿肥啦!
刚好今天早上有空就说一下,其实蒸馏就是美国一堆硅谷公司老板为了尽可能垄断市场的话
术。
如果真的在机器学习领域内,从数学上不管SFT (监督微调)、RL (强化学习)、KD (知识
蒸馏)本质上都是同一件事,目标就是分布逼近。手段有用Forward KL、Reversed KL,For
ward KL白话说就是填鸭式学习让模型死记目标数据,Reversed KL则是由模型自己演出目标
数据仅担任指导的角色告诉他们哪里有错。
Forward KL的代表范式就是SFT、经典的知识蒸馏,Reversed KL就是RL跟改良后知识蒸馏,
目标数据可以是人类数据或其他甚至是自己模型本身。如果你理解知识蒸馏的本质就知道用
抄袭来说嘴蒸馏是没什么意义不现实的事情,蒸馏其实本质跟经典的机器学习理论一样就是
压缩数据到模型的高维分布中,跟人类的学习模式没什么区别,只是机器的学习方式没人类
高效而已。
再来就是所谓的蒸馏有分为白盒的软式蒸馏跟黑盒的硬式蒸馏,所谓的白盒蒸馏通常数据效
率比黑盒要高,但他有一个前提是当前模型要能看到目标模型实际上的输出分布也就是要知
道目标模型是怎么思考的,这个如果是商业闭源模型想要调用根本不可能。
至于黑盒的硬式蒸馏要成功蒸馏商业闭源模型必须要有一个前提就是你要能够大量打对方的
API到瘫痪的等级去取得海量数据,从数学上来说就是无穷采样逼近母体才有可能蒸出来,
不然妄想几个点就可以画出完整曲面就是完全没常识的人才会觉得可行。黑盒蒸馏少量数据
基本上是蒸馏不出通用性跟泛化能力,顶多补齐模型在某些狭窄领域的知识跟讲话风格而已
,而且前提是这颗模型本身就已经足够强,就是在狭窄领域没那么好(分布上有缺一点东西
),这时候补齐几个点可以逼近人类领域知识才是正常的。
所以这边就带出一个Claude可能的回力镖就是当前英文模型对中文窄领域的缺失知识,有一
种可能就是他们拿了千问去当老师,然后在某些场合Claude唤醒了千问作为教师的指令就回
应了他是千问。
有人可能会说当老师算蒸馏吗?但从第一段回复就说了数学上其实不管是SFT、RL或是KD在
目标函数上其实都是一模一样的,数学上就能证明他是等价的东西。记住,人类可能会出于
意识形态骗人睁眼说瞎话(尤其是笨鸟),但数学不会,不会就是不会。
以上