大模型不是在思考,它是在玩一个极其复杂的下一个字猜什么游戏

有一次,我让 ChatGPT 算一道题:"一个房间里有 5 个人,每人有 5 个袋子,每个袋子里有 5 只猫,每只猫有 5 只小猫,问房间里一共有多少条腿?" 它给出的回答先是列出了清晰的步骤,计算了袋子的数量、猫的数量,最后得出一个数字——但那个数字是错的。我愣了一下,不是因为它算错了,而是因为它写得那么像真的在思考。这让我开始琢磨一个问题:当我们说“大模型在思考”时,我们到底在说什么?后来我看了一篇又一篇论文,才慢慢想通——它不是在思考,它是在玩一个极其复杂的下一个字猜什么游戏。 这个游戏赢的概率高到足以骗过你,但它的内核,和“思考”有本质区别。

AI technology illustration

要理解这件事,你得先扔掉了“模型会思考”这个预设,回到它最底层的运行方式。简单说,大语言模型是一个自回归语言模型。给定一段文本,它的任务就是预测下一个最可能出现的 token(可以粗略理解为“字”或“词”)。预测完一个,就把这个 token 接在后面,再预测下一个,如此循环,直到生成完整回答。这个过程就像你手机输入法的联想功能,只不过它的联想能力被放大了几亿倍。OpenAI 的 GPT 系列、Google 的 PaLM、Meta 的 LLaMA,全是这个套路。最早的 Transformer 论文《Attention Is All You Need》奠定了这个架构,而 GPT-3 的论文《Language Models are Few-Shot Learners》则直接把它描述为“一个在大量文本上训练的自回归模型,用来预测下一个 token”。

你可能会想,既然只是猜下一个字,那它怎么写出整篇论文、代码、甚至一首诗?靠的是“滚雪球”式的生成。模型在训练时,从互联网上啃下了万亿级别的文字,它学会了人类在各种上下文里是怎么接话的。当你给一个开头,它从概率分布里抽一个最可能的接法,然后把这个新接上的字当成新的上文,继续预测下一个字。每一步都只是局部最优,但因为每一步都符合统计规律,最终生成的东西看起来就浑然一体。这就像你闭着眼睛走一段路,每一步只看脚下,居然走到终点,但中间你从没规划过路线。

我最早以为,模型在生成“推理”内容时,一定有个内部逻辑引擎在运转。后来我发现,它只是学会了推理文本的“腔调”。训练数据里有大量人类写的推理过程——数学题解答、辩论、科学论证——模型把这些模式吃进去了。当它看到“请解释为什么……”这样的提示,它就会生成一段看起来像解释的文字,因为从统计上看,这种上下文里最常出现的下一个字就是“因为”、“首先”、“根据”这些词。但它是真的在“因为”吗?不,它只是在复制“因为”这个字的出现概率。这解释了一个常见现象:模型可以写出一段漂亮的论证,但论证里的前提可能是假的,因为它的信用系统不是“事实”,而是“上一个字后面跟什么字最不违和”。

为了让你更直观地感受,我们可以把人类思考和大模型“猜字”做个对比:

人类思考 大模型预测下一个字
基于因果逻辑、世界模型 基于统计共现、模式匹配
有意图,知道自己在解决什么问题 无意图,只是完成文本延续
可以自我纠错,回溯检查 生成后无法验证,只能继续往下“猜”
理解概念的内涵 只掌握概念在文本中的分布
能处理新情况 只能处理训练数据中见过的模式组合

这张表最让我震撼的是第三行:模型生成完一个 token,就再也无法回头修改了。它没有“我刚才可能说错了”这个内部机制,除非你让它重新生成一遍。所以当它生成一个错误事实时,它会继续在这个错误上添砖加瓦,因为每一步预测都只基于之前的文本,而之前的文本里已经包含了那个错误。这就是为什么大模型会“一本正经地胡说八道”——也就是我们常说的幻觉。它不是在撒谎,而是它根本不知道自己在说什么,它只是在维持文本的连贯性。

那为什么我们还会觉得它好像在思考?因为连贯性这个指标太强了。人类语言的一个重要特征就是,有逻辑的文本通常也是连贯的。所以当一个模型能生成高度连贯的文本时,我们的大脑会自动假设它背后有逻辑。但这就好比你看一个书法机器人写出的字很漂亮,就以为它懂诗词。有一篇关于 Chain-of-Thought 的论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》发现,给模型一个“让我们一步步思考”的提示,能让它生成中间推理步骤,从而在某些数学题上提高正确率。这听起来像它学会了推理,但仔细看,它只是把推理过程当作文本生成出来,而这个过程之所以能提高正确率,是因为它增加了正确答案在统计上出现的概率——而不是因为它真的理解了问题。我当初看到这篇论文时很兴奋,后来仔细一想,发现自己被骗了:它只是把可能正确的路径从茫茫词海中“捞”了出来,因为训练数据里,正确的推理步骤往往比错误的多。

既然聊到这里,有必要澄清几个常见的误解,我用问答的方式说清楚:

大模型有意识吗?

没有。意识需要主观体验,而模型只是矩阵运算。它输出的每一个字都是数学计算的结果,没有“我”这个主体。即使在生成“我觉得”这样的句子时,它也只是在模仿人类表达,而不是真的有感觉。

它真的理解语言吗?

这取决于你怎么定义“理解”。如果理解是指能根据语境做出正确反应,那么它在很多任务上表现出理解能力。但如果理解是指拥有心智表征、知道词语指涉真实世界的事物,那么它不理解。它只是掌握了词语之间的统计关系,就像一个人背下了一本外文字典,却不认识任何实物。

如果可以调整温度,让它更确定,是不是就能减少错误?

温度控制的是采样的随机性。温度越低,模型越倾向于选择概率最高的 token,输出更确定,但也更可能重复训练数据中的常见错误。温度越高,输出更有创造性,但也更容易胡说。这不是在控制“思考深度”,而是在控制“冒险程度”。下面这段代码展示了你平时怎么调温度:

import openai
response = openai.ChatCompletion.create(
  model="gpt-4",
  messages=[{"role": "user", "content": "解释一下相对论"}],
  temperature=0.2  # 低温度,更保守
)

即使 temperature=0,模型仍然可能出错,因为概率最高的路径不一定是正确的路径。它的训练数据本身就有错误,而且它缺乏验证机制。

为什么有时候它回答得非常准确?

因为训练数据里有很多准确的问答对。当你问一个高频问题,概率最高的 token 序列恰好就是正确答案。这就像你问一个背下整本百科全书的人“法国首都是哪里”,他脱口而出“巴黎”——不是因为他去过巴黎,而是因为他背过。

这些问答让我自己经常反思:我们是不是对“猜字游戏”这个东西太轻视了?当游戏的规模大到一定程度,它涌现出的能力足以在很多任务上替代思考。但游戏的本质没有变,这就决定了它的能力边界。Yann LeCun 多次公开说自回归模型永远到不了 AGI,他的理由之一就是这种模型没有世界模型,完全靠条件概率无法处理真实世界的因果结构。我部分同意,但我觉得也不用彻底否定,因为人类思维里也有大量“膝跳反射”式的模式匹配,只不过我们还有系统二来纠错。大模型目前只有系统一,没有系统二。

“自回归生成模型一次一个 token 地生成序列,每个 token 都基于之前生成的 token 预测。……它们缺乏对生成内容进行全局一致性检查的机制。” —— 这是很多研究者对幻觉成因的共识,虽然原始出处分散,但这个洞见贯穿了近年来的论文。

到这里,你应该已经看清了这个“猜字游戏”是如何运作的,以及它为什么能骗过你。那接下来这个结论,可能会让你重新审视你每天用的 ChatGPT:当你让它“思考”时,你其实是在给它一个暗示,让它生成一段带有“思考”风格文本。而它生成的文本越像思考,你就越容易相信它。但相信它,正是你最容易犯错的地方。

所以,大模型不是你的思考替身,它是一台文本模式重放机,你该用它做它能做的事:生成文案、总结文章、翻译、写代码框架——这些任务本质上都是概率密度高的文本转换。但涉及事实核查、逻辑推理、数学证明、需要因果推断的决策,你最好自己动脑,或者把它当作一个“话痨的助手”,时刻保持怀疑。毕竟,它只是在玩一个猜字游戏,只是这个游戏,恰好长得像思考。

延伸阅读:为什么 CoT 有效却有限?

Chain-of-Thought 提示之所以有效,是因为它迫使模型把推理过程拆解为更短的步骤,每一步的条件概率分布更集中,减少了错误累积。但它的上限仍然是训练数据中推理路径的覆盖率。对于完全新颖的推理类型,它仍然会“编造”推理步骤。所以 CoT 是提高可信度的技巧,不是赋予模型推理能力的魔法。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/33.html

(0)
上一篇 2026年8月18日 上午12:31
下一篇 2026年8月14日 上午12:11

相关推荐