DeepSeek 的蒸馏实践:为什么他们的蒸馏模型效果这么好?

DeepSeek-R1 发布后,最让我惊讶的不是它自己有多强,而是它蒸馏出来的 7B 小模型,在数学推理基准 AIME 2024 上,分数居然超过了 GPT-4o。一个 7B 的模型,打败了比它大几十倍的闭源巨头。这合理吗?

AI technology illustration

我第一时间下载了蒸馏版小模型,发现它解数学题时会自言自语:"嗯,这个题需要用到二项式定理,但直接展开太复杂,可以试试组合意义……" 一个小模型,居然会在推理时像人一样权衡。这让我对它背后的蒸馏方法产生了极大兴趣。

更奇怪的是,蒸馏(distillation)不是什么新东西。Hinton 在 2015 年就提出了知识蒸馏,学术界早就把它玩出花了。为什么 DeepSeek 的蒸馏效果这么好?我最初以为他们用了什么黑科技,后来读了技术报告才发现,答案简单得让人意外:他们蒸馏的不是答案,而是思考过程。

传统蒸馏教的是答案,DeepSeek 教的是怎么想

先回忆一下传统蒸馏。假设老师模型看到一个输入,输出一个概率分布:猫 0.7,狗 0.2,兔子 0.1。学生模型要学着让自己的输出分布接近这个分布。这样做的好处是,学生能学到类间的相似性——比如猫和狗比猫和兔子更接近。

这套方法在分类任务上很管用,但到了大语言模型上就尴尬了。语言模型的输出是一个一个 token,每个 token 都有一个概率分布。你让学生去拟合这些分布,它学会的是"哪个词更可能接着出现",而不是"为什么这样推理"。就好比学生抄了老师的答案,但没看到老师的草稿纸。

DeepSeek 的做法恰恰相反。他们用强化学习训练出了一个很强的推理教师模型(R1),然后让这个教师模型在回答问题时,把整个思考过程都写下来——包括尝试、失败、反思、修正。然后,他们把这些"草稿纸"直接作为训练数据,对 Qwen 和 Llama 等小模型做监督微调。

也就是说,学生看到的不只是答案,而是老师如何一步步思考、如何碰壁、如何拐弯。这比单纯抄答案有用太多了。

他们怎么把思维链变成数据的

数据生成听起来简单,但细节决定成败。根据技术报告,流程大致是这样的:

  1. 从数学、代码、逻辑等多个领域收集问题。
  2. 让教师模型 R1 生成答案,并保存完整的思维链。
  3. 过滤掉格式错误或最终答案错误的样本。
  4. 去除重复和低质量的推理轨迹。
  5. 用清洗后的数据对基础小模型做监督微调。

举个例子。面对一道几何题,R1 的思维链可能是这样的:"先用余弦定理算一下…… 等等,角度是 60 度,用余弦定理的话计算量太大。换个思路,建系用向量法…… 这样能得出结果。验证一下,答案合理。"

注意这里最关键的,不是最后那个正确答案,而是中间的"等等,换个思路"。正是这种自我修正,让学生模型学到了关键能力:不是一次算对,而是发现错误并改正。

DeepSeek-R1 技术报告里提到,蒸馏模型在 AIME 2024 等推理基准上表现优异,甚至超过了部分更大规模的模型。来源

一张表说清两种蒸馏的本质区别

维度 传统蒸馏 DeepSeek 蒸馏
迁移目标 输出概率分布 完整思维链
数据形式 输入 + 输出 输入 + 长推理过程 + 输出
训练方式 拟合分布(KL 散度) 监督微调(SFT)
学到的能力 类间相似性、语言风格 推理步骤、自我纠错
适用任务 分类、生成 数学、代码等复杂推理

为什么这样蒸馏特别有效

我琢磨了很久,最后觉得有几个原因。

第一,教师模型本身足够强。R1 是通过强化学习在大量推理任务上磨出来的,它的思维链质量非常高。如果教师自己都不会推理,生成一堆废话,学生学了也没用。这就像跟一个高手学下棋,他能告诉你他每一步在想什么;跟一个菜鸟学,他只能告诉你"我也就随便走走"。

第二,思维链数据特别适合小模型。小模型的知识储备其实不少,它们缺的是"如何组织推理"的策略。当它们看到成千上万个"先试一种方法,不行再换"的示例,它们就学会了这种推理模式。这让我想到一个类比:你给一个人一本答案书,他只能得到答案;你给他一本解题思路集,他就能举一反三。

第三,数据多样性。DeepSeek 没有只挑数学题,而是覆盖了代码、逻辑等多个领域。这样学生模型学到的是通用的推理框架,而不是死记硬背某类题的套路。

第四,训练时用了足够长的上下文。思维链可能长达几千 token,如果上下文窗口不够大,模型就只能看到被截断的推理过程。DeepSeek 的训练数据里保留了完整推理,这让学生模型能学到前后的因果联系。

这件事也改变了我对蒸馏的看法。我最早以为蒸馏就是把大模型的概率分布搬到小模型上,效果顶多接近大模型。但 DeepSeek 让我意识到,蒸馏的本质是迁移"知识的形式"。对于推理任务,知识的形式不是概率,而是推理轨迹。

但别神化蒸馏

DeepSeek 的蒸馏实践很成功,但它也有明显的边界。

  • 学生模型的上限受限于教师模型。你不可能让 7B 模型学会 671B 教师的所有能力。
  • 思维链数据的生成成本很高。调用一次 R1 生成完整推理,可能比直接训练一个普通模型还贵。
  • 蒸馏模型可能只是"模仿了推理的样子",而不是真正理解。遇到分布外的复杂问题,它可能会一本正经地胡说八道。
  • 长思维链会带来推理延迟。小模型生成 1000 个 token 的思考过程,速度和成本都不一定比大模型直接回答更有优势。

这意味着,蒸馏模型适合在资源受限的场景下,快速获得一个"看起来会推理"的模型。但如果你的任务需要深度泛化或海量知识,还是得靠大模型。

FAQ

为什么不用 Hinton 的 soft label 蒸馏? 因为 token 级别的概率分布不包含推理结构。你从"猫 0.7"里学不到"先看耳朵再看脸"的步骤。

蒸馏和微调有什么区别? 蒸馏的数据来自教师模型,微调的数据来自人类标注。DeepSeek 用的是蒸馏生成数据 + 微调训练方式。

蒸馏模型能自我改进吗? 它能模拟自我反思,但这不是真正的元认知。它不会因为"自己觉得错了"而改变参数。

这种蒸馏能用在其他领域吗? 可以,前提是你有一个足够强的教师模型,能生成高质量的"思考过程"。比如在编程、医疗诊断等领域,都能用类似思路。

我的最终判断

DeepSeek 的蒸馏实践告诉我们:在小模型时代,高质量的数据比模型架构更重要。他们用最朴素的方法——生成思维链、微调——就取得了惊人的效果,这说明推理能力在一定程度上是"可传授的"。

但不要忘了,这个路线依赖一个强大的教师。如果你没有 R1 这样的模型,你只能望洋兴叹。所以,与其说 DeepSeek 的蒸馏技术厉害,不如说他们的教师模型厉害。真正的护城河,还是那个会用强化学习训练推理模型的能力。下次看到有人吹嘘蒸馏技术时,你该问的第一个问题是:你的教师模型是谁?

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/196.html

(0)
上一篇 2026年8月20日
下一篇 2026年8月20日

相关推荐