
“蒸馏”一词再次成为舆论的关注焦点。这一次,站在聚光灯下的不是多次指控国产模型蒸馏的强硬派Anthropic,而是久未公开露面的张一鸣。
张一鸣在最近的字节全员会上罕见发话:字节宁愿忍受模型的落后,也不希望依赖蒸馏实现短时的智能爬坡。
当字节的Seed模型被认为落后,蒸馏已经成为模型公司竞赛的常用手段时,张一鸣的表达,让字节的技术身位显得非常独特。在媒体的报道中,Seed成立以来,内部动过三次大的蒸馏念头,但都被集团掐断了。
一个模型的好坏,涉及到架构、数据、infra和评估四部分。高质量的数据几乎成为模型好坏的关键。今年5月,梁文锋在和投资人交流中也提到,DeepSeek差不多有一半的研究员,都在标注数据。高质量的数据成本非常昂贵。
这也让蒸馏SOTA模型数据,变成了一条极具诱惑力的捷径。一位基础模型研究员也告诉我们,现在模型能力最容易被短期改善的变量就是数据。用更强的模型产生高质量数据,技术风险明显小于推翻原有架构、重新做大规模训练。而且成本也要小得多。
既然蒸馏好处很多,为什么还有人那么坚定反对蒸馏。蒸馏的代价是什么?
蒸馏本身是个中性技术,主要是让一个参数庞大、性能更强的模型,通过输出的概率分布,训练出一个轻量级的模型,在保持高性能的同时,大幅减少参数规模和推理成本。比如OpenAI用GPT-4o、o1等作为教师模型,训练GPT-4o mini等学生模型。
但这两年当其他模型未经允许,大幅蒸馏SOTA模型的数据进行训练时,蒸馏的情感色彩变得更复杂了。Anthropic、OpenAI、Google等多家模型公司都明确反对这种未经允许的蒸馏,甚至直指一些中国的模型公司。
这背后自然有他们的商业考量。OpenAI、Anthropic已经花费了数十亿美元,打造模型。竞争对手能用极低的成本,绕过自己数十亿美元的研发投入,快速复制模型能力,很可能打破它们原有的定价体系和商业策略。
本质上看,蒸馏真正触碰到的,是基础模型公司的投资回报逻辑。
通过压缩其他SOTA模型,复制竞争对手的能力,在国外也很有争议。今年5月,马斯克表示,AI公司一般都会蒸馏其他的模型,xAI就部分蒸馏了OpenAI来训练。
不过,同月Meta则在团队内部明确了使用外部模型工具的边界,要求工程师必须独立设计编程测试题目,依托自身专业技术能力构思方案,严禁直接采用AI生成的创意思路。为防止Claude模型生成内容流入Meta自身训练数据,部分团队还被要求暂停相关调用。
这说明,蒸馏并不是一个简单的“中国公司做、美国公司反对”的故事。
长期来看,随着SOTA模型的防守增强,过度依赖蒸馏会制约模型公司的自研能力。但不少公司仍然通过调用API的方式进行蒸馏,某种程度上,这甚至像开源一样成为一种趋势。
在具体实践中,蒸馏的代价或许还在于边界的模糊和人的惰性。
不少研发人员都提到蒸馏会“上瘾”。对许多面临竞赛压力的研究员来说,诱惑非常现实。因为相比自己从零开始寻找高质量数据、设计复杂的训练方案,SOTA模型蒸馏出来的高质量数据,无疑是一条更高效、成本更便宜的路径。
问题也在这里。蒸馏最大的诱惑是,让人可以暂时绕开那些最困难的事情。一旦模型竞赛方向发生变化,或者模型公司产生了依赖,它失去的不只是数据的原创性,还有自己发现数据、训练模型和解决问题的能力。
这或许也是张一鸣宁愿接受Seed暂时落后的真正原因,模型可以暂时落后,但不能失去追赶模型的能力。
围绕蒸馏的裨益和代价,我们和伦敦大学学院博士、布里斯托大学助理教授杨梦月做了一期对话,杨梦月主要研究强化学习,因果推理,世界模型。以下是对话实录:
01
大模型公司在蒸馏什么?
白鲸实验室:最近张一鸣对蒸馏的态度,又把“模型蒸馏”推到台前。今年2月Anthropic还发文指控几家国产模型蒸馏,大模型蒸馏到底在蒸什么?
杨梦月:取决于目标模型允许你获得什么。实际上最好的蒸馏,还是你能捕捉到它整个CoT(Chain of Thought,思维链)。
白鲸实验室:这是最好的方式?
杨梦月:能把推理链蒸馏出来,基本是最好的蒸馏方式。但也不一定,现在技术有很多种,比如说online distillation,就是用这个模型跟更好的模型提问,更好的模型给当前这个模型做指导,这也是一种蒸馏方式,现在也比较火。“自蒸馏”不在我们的讨论范围。
现在很多大模型厂商是有反蒸馏策略的,它不会直接把CoT显示出来。这就取决于能不能把对方的CoT想方设法解码出来。
白鲸实验室:大家都在力推编码、智能体等能力情况下,为什么推理链这么关键?
杨梦月:因为CoT揭示了模型背后的推理过程。编码能力不只是最后给出一段代码,更重要的是问题拆解、工具调用、验证和修正的轨迹。
CoT做得好,本质上是要靠后训练的RL。但RL训练是非常困难的,就像连Gemini都一直深受RL困扰。RL(强化学习)是一个非常困难的部分,大厂都会专门设立一个RL部门,专门做后训练提升CoT能力。
白鲸实验室:蒸馏推理轨迹,是不是低成本追赶的捷径?
杨梦月:是的,蒸馏CoT,其实相当于在后训练部分节省了时间、精力和成本。不需要做高成本的后训练,很大一部分通过蒸馏出来CoT,模仿它就好了。
白鲸实验室:这是说在强化学习上,并没有搞懂背后的架构设计,只是强行记住了别人的东西?
杨梦月:虽然记住了别人的东西,但如果数据量足够,也可能涌现智能。
白鲸实验室:这个“数据量足够”,现实吗?
杨梦月:也很难,在蒸馏的过程,是要向更好的模型提问。但是这个提问不能覆盖所有情况,没法完整capture到这个模型所有的决策逻辑或者推理逻辑,只能capture到一部分。
白鲸实验室:蒸馏一部分,加上自我研发,是不是更容易智能涌现?就像我们人类,学习都是先模仿,在模仿里不断顿悟和成长。
杨梦月:纯蒸馏通过数据复制已有能力,而蒸馏加自主研发,更容易产生智能涌现。蒸馏提供高质量先验和基础能力,自主研发则通过探索,试错突破已有知识边界。人类学习也类似,先模仿,再实践,最终在实践中形成自己的理解和创新。
白鲸实验室:除了知识和上面提到的CoT,还有哪些东西是蒸馏不出来的?
杨梦月:现在已经变成技术攻防战了,CoT也被加密了,不会全部显露。更重要的是,模型的具体架构、内部技巧、数据管线、信息组织方式、训练配方,以及为什么在某个阶段采用某种设计,这些是从输出中无法直接获得。
即使可以根据输出反推,但反推结果未必能映射到原模型的真实设计。
02
蒸馏的代价
白鲸实验室:你觉得字节为什么反复强调不要蒸馏?
杨梦月:从长远来看,如果一家企业没有把自研整套技术体系搭建好的话,蒸馏只能解决燃眉之急,最后还是要依靠自研的。
自研确实也非常难,但以后蒸馏也会变得难,只是自研这件事情是可持续的。
白鲸实验室:蒸馏的长期影响是什么?
杨梦月:为了蒸馏,挤压其他方面的预算,去买Claude的token,很有可能出现一个情况是,对于其他原创研发的支持度会下降。如果持续蒸馏,可能会过度依赖别的模型。别人出一个版本,蒸馏一个版本,最终会削弱模型架构、infra等层面的自研能力。
而模型的变化非常快,不仅模型自我迭代的速度加快,而且风口变化也快,今天是这个模型登上巅峰,下次可能换一个模型,每个模型蒸馏出来的数据,即使同一个模型不同迭代版本蒸馏出来的数据,对后续模型的研发也不会起到决定作用。
不蒸馏的话,短期看,从零自研RL前期效果有限,但长期训练会形成复利效应,迭代速度越来越快。
白鲸实验室:这是长远影响吗?
杨梦月:我觉得现在在海外SOTA模型开始加强防守的情况下,蒸馏这些模型,非常考验问题设计能力。在攻防战里,蒸馏的一方也不能说技术没有提升。
不管是说向别的模型提问,还是向整个开放世界提问,它很重要的能力是能不能设计出高质量问题,让这些问题覆盖新的尚未探索到的场景。
如果做得好,还可以成为自研里一个能力提升方向。比如说,agent在一个OS系统(操作系统)里面,要完成task,也要向系统提问。
白鲸实验室:今年2月Anthropic指控说,国产三家模型一共蒸馏了超过1600万次。这意味着什么?这是一个很大的蒸馏数据量吗?
杨梦月:我们也不清楚Anthropic是如何计算的,里面有没有夸大的成分。如果它的数据统计没有问题的话,这确实是个不小的数字。
当然我也觉得,国产模型虽然有蒸馏的部分,但肯定也有自研的架构、infra设计,这些不是蒸馏出来的。具体怎么把蒸馏的数据训进去,做后训练,都有自己的框架设计和创新。
白鲸实验室:既然蒸馏是个捷径,还要有自研能力,为什么不可以部分蒸馏的同时,也保留一定的自研体系?
杨梦月:理论上可以,现实中预算有限。大规模蒸馏需要购买大量token,并不便宜。如果资源明显向蒸馏倾斜,就可能挤压数据生产、预训练、后训练、评测、基础设施和人才投入,破坏一个Foundation Model项目应有的平衡。
白鲸实验室:这个蒸馏的边界是什么?
杨梦月:很难判断。蒸馏模型数据,比自己标数据便宜,速度还快,但蒸多了可能容易上瘾。有些模型公司面临生存压力,在高压下,很难能拒绝这么做。
白鲸实验室:纯自研就一定更好吗?
杨梦月:也不是。纯自研慢、昂贵,而且可能做不出来。纯依赖蒸馏则可能后劲不足。更现实的方向是,找到兼顾当下竞争力和长期可持续性的健康配比,这个比例没有统一答案,需要行业继续摸索。
03
硅谷的公司也蒸馏
白鲸实验室:从硅谷公司的角度看,它为什么对蒸馏反应那么强烈?
杨梦月:一家企业投入巨额资金做出顶尖模型,另一方可以蒸馏个七八成能力,可能用他十分之一左右的价格提供API,会直接冲击原公司的定价和护城河。高价模型尤其敏感,因为便宜的替代品会迫使它降价。
白鲸实验室:为什么Anthropic比OpenAI的态度更激烈?
杨梦月:这可能与公司文化、创始人风格、对开源趋势的态度有关,也可能因为它拥有很强且定价较高的编码模型,商业利益更直接。OpenAI同样会做反蒸馏,只是不同公司在公开表态上的激烈程度不一样。
白鲸实验室:硅谷对开源和蒸馏的态度一致吗?
杨梦月:不一致。开源已经获得相当广泛的支持,蒸馏仍有很大争议。
白鲸实验室:我有一个疑惑。如果一个模型是通过蒸馏获得的,同时又选择开源,似乎在道德层面更容易被理解。可如果一边通过蒸馏获取能力,一边又将模型闭源,甚至进行商业化,这种做法是不是反而更容易引发道德争议?
杨梦月:蒸馏与开源不应强绑定。一家公司可以蒸馏后开源,也可以闭源,这是技术选择问题。
白鲸实验室:马斯克有说过xAI部分用了ChatGPT模型来训练自家AI,硅谷其他公司也会蒸馏更强的模型?
杨梦月:肯定会有,因为它是一种数据获取的方式。数据获取不能光靠自己做,自己做是一部分,通过各种途径去获取也是一部分,这算是途径之一。
其实蒸馏这件事情本身有一点被妖魔化了。蒸馏这个词一开始发明时,就是中性的技术词汇。一开始只是大家讨论一个大模型到底有没有能力把它这个知识赋予到一个小模型里面。
现在蒸馏这个词,一方面Anthropic在说蒸馏攻击这件事,另一方面对蒸馏削弱自研的担忧,已经变成负面词汇。
白鲸实验室:“哪些知识可以学习,哪些能力不能学”会成为AI时代的新边界吗?
杨梦月:会。蒸馏与反蒸馏之争,本质上也在争夺行业边界和规则定义。但技术格局变化极快,没有哪家公司能永久占据最高位置。标准不太可能由单一公司轻易决定,最终仍要经过长期博弈形成共识。
文章来自于微信公众号 “白鲸实验室”,作者 “白鲸实验室”
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【免费】ffa.chat是一个完全免费的GPT-4o镜像站点,无需魔法付费,即可无限制使用GPT-4o等多个海外模型产品。
在线使用:https://ffa.chat/