一句话定义
大语言模型(LLM)是一个被训练来预测下一个 token 的巨大神经网络。训练数据是整个互联网规模的文本。当这个任务做得足够好时,模型看起来就像理解了语言、知识和推理。
它本质上是一个条件概率函数:给定前面的所有 token,输出下一个 token 的概率分布。
为什么重要
这是通用性的来源。以往每个任务都要训一个专用模型;LLM 用同一个模型,靠**改变输入(上下文)**就能完成翻译、写作、编程、总结、分类。
于是出现了全新的分工方式:
- 能力来自预训练:这是昂贵的、一次性的、少数公司才能做的事。
- 行为来自上下文:这是廉价的、每个人都能做的、决定实际效果的事。
今天大部分 AI 应用工程,都发生在第二条上。这就是 Context Engineering 比「提示词技巧」更值得研究的原因。
训练的三个阶段
- 预训练:用海量无标注文本学习预测下一个词,获得语言与世界知识。
- 指令微调:用「指令—回答」数据训练它遵循要求,而不是只会续写。
- 对齐 / 强化学习:用人类偏好或可验证奖励,让它更有用、更少有害输出、更会推理。
三个阶段成本依次递减,但对「用起来是否顺手」的影响却依次递增。
能力与局限是同一件事的两面
| 性质 | 好处 | 代价 |
|---|---|---|
| 概率生成 | 流畅、灵活、能泛化 | 会产生幻觉 |
| 知识来自参数 | 无需检索即可回答 | 有知识截止时间,无法自动更新 |
| 上下文驱动 | 无需重训即可切换任务 | 效果对输入组织方式高度敏感 |
| 无状态 | 可水平扩展、成本可控 | 不天然记忆,需外部记忆层 |
常见误解
- 「它知道自己是错的」:它没有独立的事实核查通道,流畅度和正确性来自同一个机制。
- 「模型越大越好」:许多生产场景里,小模型 + 良好上下文 > 大模型 + 模糊指令。
- 「它可以从对话中学习」:默认不会。对话内的信息只存在于当次上下文,除非你写到外部存储里。
延伸阅读
- Transformer:让它成立的架构
- Context Engineering:决定实际效果的关键变量
- LLM API:如何把它接进你的程序