一句话定义
机器学习(Machine Learning)是一种编程范式:你不再编写「如果……就……」的规则,而是提供大量输入和正确答案,让程序自己找出一套能复用的映射关系。
传统程序是 规则 + 数据 → 答案。机器学习是 数据 + 答案 → 规则。
为什么重要
这是过去二十年 AI 进步的根本原因。
很多任务人类根本写不出规则——如何判断一张图里有没有猫?你无法用 if 语句描述猫。但你可以给机器看一百万张标注过的图片。
机器学习的核心假设是:如果模型在足够多的例子上表现正确,它就有可能在没见过的例子上也正确。 这个假设叫泛化,它成立的时候,AI 才有实用价值。
三种主要范式
- 监督学习:数据带标签。给图片和「猫/狗」标签,学分类。工业界最常用。
- 无监督学习:数据不带标签。让模型自己发现结构,比如聚类、降维。
- 强化学习:不给标准答案,只给奖励信号。模型通过试错去最大化长期回报。
大语言模型的训练是这三者的组合:预训练接近无监督(预测下一个词),指令微调是监督学习,而近年的推理能力提升大量依赖强化学习。
决定效果的三件事
- 数据:数量、质量、覆盖范围。垃圾数据会稳定地产生垃圾模型。
- 模型:能表达多复杂的映射。
- 目标函数:你让它优化的指标是什么。你优化什么,就得到什么——这是机器学习里最容易被忽视的一句话。
常见误解
- 「机器学习就是记住答案」:如果只是记忆,它在训练集之外会立刻失效。真正的价值在泛化。
- 「数据越多越好」:低质量、有偏的数据变多,只会让错误更稳定。
- 「模型会自己理解因果关系」:它学到的通常只是相关性。相关性在分布变化时会失效。
延伸阅读
- Neural Network:机器学习里最主流的一类模型
- Large Language Model:把这一范式推到极致的产物