AINotes 101
菜单
Learn / 01 理解 AI / Transformer

Transformer

Transformer 架构

用注意力机制并行处理整个序列的神经网络结构,是今天所有大模型的地基。

UNDERSTAND #architecture#core

一句话定义

Transformer 是一种神经网络结构,核心是注意力机制(Attention):让序列中的每个 token 直接与所有其他 token 交互,按相关性加权聚合信息。

它取代了此前主流的循环网络(RNN),带来两个决定性优势:可以并行训练,以及任意两个位置之间的距离都是 1

为什么重要

2017 年的论文《Attention Is All You Need》之后,几乎整个 AI 领域都收敛到了这一个架构上。

它之所以能赢,不是因为更「聪明」,而是因为更适合硬件。RNN 必须按顺序一个词一个词算,无法充分利用 GPU 的并行能力;Transformer 可以一次性处理整个序列,让训练规模扩大几个数量级变成可能。规模上去了,能力才涌现出来。

核心概念

  • Token:文本被切分后的最小单位。中文一个字通常是 1–2 个 token,英文一个单词约 1–2 个 token。
  • Embedding:每个 token 被映射成一个向量。
  • 注意力:每个 token 生成 query、key、value 三个向量,用它与其他 token 的匹配度决定「该看谁、看多重」。
  • 多头注意力:同时用多组注意力去捕捉不同类型的关系(语法、指代、语义)。
  • 位置编码:注意力本身不区分顺序,需要额外注入位置信息。
  • 上下文窗口:一次能处理的 token 上限,由架构和显存共同决定。

编码器与解码器

原始 Transformer 分两部分。今天绝大多数大语言模型使用的是解码器专用结构(decoder-only),配合因果掩码——每个位置只能看到它左边的内容。这正是「预测下一个词」这个训练目标所需要的。

这带来一个常被忽略的性质:模型天然只能看过去。 它不是一个检索系统,只是在续写。

常见误解

  • 「注意力等于理解」:注意力是加权平均,不是因果推理。
  • 「上下文窗口越大越好」:能放进去不等于能用好。中间位置的信息经常被忽略,这就是所谓的 lost in the middle。
  • 「Transformer 会一直被用下去」:它很可能不是终点,只是目前性价比最高的选择。

延伸阅读

继续阅读

与 Transformer 同属一个层级,或在本条目中被显式引用。