AINotes 101
菜单
Learn / 01 理解 AI / Large Language Model

Large Language Model

大语言模型

在海量文本上训练、以预测下一个 token 为目标的模型,是当前 AI 能力的通用底座。

UNDERSTAND #core#llm

一句话定义

大语言模型(LLM)是一个被训练来预测下一个 token 的巨大神经网络。训练数据是整个互联网规模的文本。当这个任务做得足够好时,模型看起来就像理解了语言、知识和推理。

它本质上是一个条件概率函数:给定前面的所有 token,输出下一个 token 的概率分布。

为什么重要

这是通用性的来源。以往每个任务都要训一个专用模型;LLM 用同一个模型,靠**改变输入(上下文)**就能完成翻译、写作、编程、总结、分类。

于是出现了全新的分工方式:

  • 能力来自预训练:这是昂贵的、一次性的、少数公司才能做的事。
  • 行为来自上下文:这是廉价的、每个人都能做的、决定实际效果的事。

今天大部分 AI 应用工程,都发生在第二条上。这就是 Context Engineering 比「提示词技巧」更值得研究的原因。

训练的三个阶段

  1. 预训练:用海量无标注文本学习预测下一个词,获得语言与世界知识。
  2. 指令微调:用「指令—回答」数据训练它遵循要求,而不是只会续写。
  3. 对齐 / 强化学习:用人类偏好或可验证奖励,让它更有用、更少有害输出、更会推理。

三个阶段成本依次递减,但对「用起来是否顺手」的影响却依次递增。

能力与局限是同一件事的两面

性质 好处 代价
概率生成 流畅、灵活、能泛化 会产生幻觉
知识来自参数 无需检索即可回答 有知识截止时间,无法自动更新
上下文驱动 无需重训即可切换任务 效果对输入组织方式高度敏感
无状态 可水平扩展、成本可控 不天然记忆,需外部记忆层

常见误解

  • 「它知道自己是错的」:它没有独立的事实核查通道,流畅度和正确性来自同一个机制。
  • 「模型越大越好」:许多生产场景里,小模型 + 良好上下文 > 大模型 + 模糊指令。
  • 「它可以从对话中学习」:默认不会。对话内的信息只存在于当次上下文,除非你写到外部存储里。

延伸阅读

继续阅读

与 Large Language Model 同属一个层级,或在本条目中被显式引用。