大语言模型是怎么"读懂"你的:Transformer 与预训练通俗版

你问 ChatGPT"今天天气适合跑步吗",它能接上话。它不是查了天气预报,而是根据"你这句话最可能接什么"算出来的。这一篇就拆开这个"算"字。

一、预训练:先读遍整个互联网

模型第一步是"预训练"。工程师把海量文本(书籍、网页、代码)喂给它,任务是:给前半句,猜后半句

比如看到"床前明月光,疑是地___",它要学会填"上霜"。重复几百亿次之后,模型就内化了语法、常识、甚至一点"世界观"。这一步不需要人标答案,互联网本身就是答案——这叫自监督学习

代价是巨大的:一次训练可能烧掉几百万美元电费。所以你用的模型,背后都是大厂先砸钱"养"出来的。

二、Transformer:抓重点的注意力

早期模型像"近视眼",看完后面忘前面。2017 年 Google 提出 Transformer,核心是"自注意力机制"——一句话里每个词都能直接"看"到其他词,并判断谁和谁关系大。

举例:“猫追了狗,因为它跑得快”——“它"指谁?模型会给"猫"和"狗"打分,根据上下文判断"跑得快"的是狗,所以"它"指狗。这种"全局关联"能力,是今天 AI 能连续对话的根基。

三、推理:一个词一个词地"吐”

你提问后,模型做的事是:根据上文,算出"下一个词"的概率分布,挑一个(或按温度随机选),把它 appended 回去,再算下一个,直到说完。

所以它不是在"想",而是在"接龙"。这也是为什么它会一本正经胡说八道——概率最高的接龙不一定是对的,这叫"幻觉"。

四、为什么你要懂这些

  • 知道它靠"预测"工作,你就不会盲信它给的数字、引用、法条。
  • 知道它"记不住长文",你就懂得把问题拆小、给上下文。
  • 知道训练贵,你就明白为什么好模型多收费——不是割韭菜,是真烧钱。

下一篇讲怎么"问"才能让它答得好:提示词工程实战。