一句话定义
Transformer 是一种神经网络结构,核心是注意力机制(Attention):让序列中的每个 token 直接与所有其他 token 交互,按相关性加权聚合信息。
它取代了此前主流的循环网络(RNN),带来两个决定性优势:可以并行训练,以及任意两个位置之间的距离都是 1。
为什么重要
2017 年的论文《Attention Is All You Need》之后,几乎整个 AI 领域都收敛到了这一个架构上。
它之所以能赢,不是因为更「聪明」,而是因为更适合硬件。RNN 必须按顺序一个词一个词算,无法充分利用 GPU 的并行能力;Transformer 可以一次性处理整个序列,让训练规模扩大几个数量级变成可能。规模上去了,能力才涌现出来。
核心概念
- Token:文本被切分后的最小单位。中文一个字通常是 1–2 个 token,英文一个单词约 1–2 个 token。
- Embedding:每个 token 被映射成一个向量。
- 注意力:每个 token 生成 query、key、value 三个向量,用它与其他 token 的匹配度决定「该看谁、看多重」。
- 多头注意力:同时用多组注意力去捕捉不同类型的关系(语法、指代、语义)。
- 位置编码:注意力本身不区分顺序,需要额外注入位置信息。
- 上下文窗口:一次能处理的 token 上限,由架构和显存共同决定。
编码器与解码器
原始 Transformer 分两部分。今天绝大多数大语言模型使用的是解码器专用结构(decoder-only),配合因果掩码——每个位置只能看到它左边的内容。这正是「预测下一个词」这个训练目标所需要的。
这带来一个常被忽略的性质:模型天然只能看过去。 它不是一个检索系统,只是在续写。
常见误解
- 「注意力等于理解」:注意力是加权平均,不是因果推理。
- 「上下文窗口越大越好」:能放进去不等于能用好。中间位置的信息经常被忽略,这就是所谓的 lost in the middle。
- 「Transformer 会一直被用下去」:它很可能不是终点,只是目前性价比最高的选择。
延伸阅读
- Large Language Model:Transformer 最大的应用
- Embeddings:把语义变成向量的技术
- Context Engineering:如何喂给它正确的 token