如何跟普通人讲大模型的原理
大模型很强大,但原理朴素得令人失望——它做的事情就是「文字接龙」。它怎么知道下一个字该接什么?怎么学的?为什么这么强?下面用最朴素的方式,把这三个问题讲清楚。
一句话讲清楚:大模型是什么?
大模型(LLM)的本质是一个超级「文字接龙」高手。
你给它「今天天气真」,它接「好」;给它「苹果的颜色是」,它接「红色」。它的工作就是预测下一个字。
听起来很弱——「这不就是输入法联想吗?」区别在于「大」:输入法只学了常用词组合,大模型学了人类几乎所有的书、文章、对话,掌握的是「人类语言的统计规律」。
它是怎么「学会」的?
最有效的类比是「海量阅读的小学生」——从出生起每天读书 16 小时,不间断 20 年,读完整个图书馆。没人教他「这是什么」,只让他看「下一句接什么」。
他掌握的不是「世界的真相」,而是「什么词后面跟什么词最像人话」。这就是大模型的训练——给它海量文字,让它一遍遍猜「下一个字」,猜错了就调内部参数(相当于大脑的神经连接强度),猜对了就强化。重复几十亿次。
答案是文字本身。「今天天气真好」藏起「好」让模型猜,「好」就是答案——这就是大模型能用几万亿字语料训练的原因:「答案」免费。
举个例子:「人工智能将深刻影响未来的教育、医疗和交通」
训练时,模型要一字一字猜:
- 看「人工智能」→ 猜「将」
- 看「人工智能将」→ 猜「深刻」
- 看「人工智能将深刻」→ 猜「影响」
- ……一直到最后
每一步,原文里的下一个字就是正确答案。
模型不是只学会了句子的结尾——它学会了每一个位置「前文是什么,下一个字最可能是什么」。这才是「下一个字预测」的真正含义。
光一句不够。训练语料里还有「人工智能将改变……」「人工智能正在重塑……」等无数类似句式。模型见多了,就学会了「人工智能将深刻影响 X」这种 pattern。
关键能力:训练时模型从未见过「人工智能将深刻影响量子计算」这种具体组合,但看到「人工智能将深刻影响___」时,会按学过的 pattern 输出一个合理的领域——这就是它「像百科全书」的来源。
它为什么能「举一反三」?
「下一个字预测」听起来很机械——它怎么就变成了「推理」「写作」「翻译」这些看似智能的能力?
秘密在于:当训练数据足够大、模型足够深,它在无数句子上学到的不只是「下一个字是什么」,而是一整套潜在的「语言 + 知识 + 推理」的统计规律。
模型没有「推理模块」,但它在海量文本中学到「如果 A 是 B,B 是 C,那么 A 是 C」这种 pattern 出现过无数次。这种 pattern 被编码进了参数里,使用时只要触发类似上下文,就会浮现类似输出。智能不是被设计出来的,是从海量数据里「长」出来的。
为什么规模越大越聪明?
GPT-3 有 1750 亿参数,GPT-4 可能有数万亿。为什么参数越多效果越好?
好类比是「涌现」。
想象 100 万只蚂蚁协同:它们能建造复杂蚁巢、抵御洪水、找到最远食物。没有任何一只蚂蚁懂得「建巢」,但整个蚁群懂得。
大模型也是这样——当参数多到一定程度,它自己「涌现」出了推理能力,没人教它。
它为什么会「胡编」?
理解了上面这些,就能解释大模型最著名的缺陷:幻觉(hallucination)。
模型学到的是「什么词后面接什么词最像人话」,不是「什么事实是真的」。所以当它不知道答案时,它不会沉默,而是按 pattern 输出「听起来对」的话——这就是「一本正经地胡说八道」。
比如你问它冷门历史事件的细节,它可能编造一个听起来合理的人物、日期、地点。它不是在骗你,它只是不知道「我不知道」。
写在最后
讲到这里,你已经比绝大多数人都懂大模型了。
下次有人问「大模型是啥」,三句话讲完:
- 它是干啥的:一个字一个字续写,预测「下一个字是什么」
- 它怎么学的:读了人类几乎所有的书,学到「什么词后面接什么最像人话」
- 它的局限:不知道什么是真什么是假,所以会编、会错、不会真思考
这三句话,从工程师到出租车司机都能听懂。