AINotes 101
菜单
Learn / 01 理解 AI / Machine Learning

Machine Learning

机器学习

不写规则,而是给机器大量例子,让它自己总结出输入到输出的映射。

UNDERSTAND #foundation#training

一句话定义

机器学习(Machine Learning)是一种编程范式:你不再编写「如果……就……」的规则,而是提供大量输入和正确答案,让程序自己找出一套能复用的映射关系。

传统程序是 规则 + 数据 → 答案。机器学习是 数据 + 答案 → 规则

为什么重要

这是过去二十年 AI 进步的根本原因。

很多任务人类根本写不出规则——如何判断一张图里有没有猫?你无法用 if 语句描述猫。但你可以给机器看一百万张标注过的图片。

机器学习的核心假设是:如果模型在足够多的例子上表现正确,它就有可能在没见过的例子上也正确。 这个假设叫泛化,它成立的时候,AI 才有实用价值。

三种主要范式

  • 监督学习:数据带标签。给图片和「猫/狗」标签,学分类。工业界最常用。
  • 无监督学习:数据不带标签。让模型自己发现结构,比如聚类、降维。
  • 强化学习:不给标准答案,只给奖励信号。模型通过试错去最大化长期回报。

大语言模型的训练是这三者的组合:预训练接近无监督(预测下一个词),指令微调是监督学习,而近年的推理能力提升大量依赖强化学习。

决定效果的三件事

  1. 数据:数量、质量、覆盖范围。垃圾数据会稳定地产生垃圾模型。
  2. 模型:能表达多复杂的映射。
  3. 目标函数:你让它优化的指标是什么。你优化什么,就得到什么——这是机器学习里最容易被忽视的一句话。

常见误解

  • 「机器学习就是记住答案」:如果只是记忆,它在训练集之外会立刻失效。真正的价值在泛化。
  • 「数据越多越好」:低质量、有偏的数据变多,只会让错误更稳定。
  • 「模型会自己理解因果关系」:它学到的通常只是相关性。相关性在分布变化时会失效。

延伸阅读

继续阅读

与 Machine Learning 同属一个层级,或在本条目中被显式引用。