AI Radar
20 条关注线索,2026.09.21 最近更新。动态内容与长期知识分离——会过期的信息留在这里,不进知识地图。
Models 模型
New models & capabilities
- 2026.09.21TypeSafe 推出 System One 模型:不生成文本,只返回类型化决策
把输出的消费者从人换成程序:返回选项、分值、概率分布与置信度,而不是需要解析的文本;同时提出 RLCD 作为 RLHF/RLVR 之外的第三条后训练路径。真正值得注意的是它把不确定性变成了可编程的量(置信度分档路由),而不只是又一个结构化输出方案。公开实现目前基本只有这一家,长期适用性未知——其中可长期成立的部分已整理进知识地图的 AI-Powered Software 条目。
TypeSafe 文档 ↗ - 2026.09.14开源权重模型在推理类任务上的追赶速度
关注开源权重模型与闭源模型在数学、代码、多步推理上的差距是否继续收窄,以及收窄的代价(推理成本、部署门槛)。
Hugging Face Trending ↗ - 2026.09.08小模型的性价比曲线
每美元能买到多少能力,比榜单第一名更有实际意义。留意小模型在固定工作流里替代大模型的可能性。
OpenRouter 模型列表 ↗ - 2026.08.30长上下文与检索的边界在哪里
上下文窗口持续变大,但「能放进去」不等于「能用好」。留意有效上下文长度与检索式方案的实测对比。
arXiv cs.CL ↗ - 2026.08.22原生多模态是否成为默认形态
文本、图像、音频、视频是否在同一个模型里统一处理,决定了产品能不能自然地跨模态工作。
Google DeepMind Blog ↗
Agents 智能体
New agent products & frameworks
- 2026.09.12Agent 框架正在变薄
早期框架试图用复杂编排解决问题,现在趋势是:模型更强、框架更薄、协议更标准。留意哪些抽象被证明是多余的。
Model Context Protocol ↗ - 2026.09.02浏览器与桌面成为 Agent 的新执行面
当 API 不存在时,Agent 只能像人一样操作界面。留意这条路径在可靠性、速度与合规上的真实成本。
GitHub Trending ↗ - 2026.08.18多 Agent 协作还是单 Agent 加好工具
多 Agent 听起来更接近组织形态,但工程上常常是单 Agent 加一个可靠的工具体系更划算。
arXiv cs.AI ↗
Research 研究
Papers & important findings
- 2026.09.10上下文工程正在成为独立的研究方向
如何组织、压缩、排序上下文,对结果的影响常常大于换一个模型。留意上下文压缩与记忆管理的进展。
arXiv cs.CL ↗ - 2026.08.26评测基准的饱和问题
主流基准被刷满之后,什么才是可信的能力信号?留意面向真实任务、难以被针对性优化的评测方式。
LMArena ↗ - 2026.08.14用可验证奖励提升推理能力
数学、代码这类可自动判对错的领域进展最快。留意这套方法能否迁移到没有标准答案的任务上。
arXiv cs.LG ↗
Open Source 开源
Projects worth watching
- 2026.09.15MCP 生态的服务端数量与质量
协议的价值取决于有多少真实可用的服务端。留意官方与社区实现的维护活跃度,而不是数量。
modelcontextprotocol ↗ - 2026.09.05本地推理栈的成熟度
本地跑模型的体验正在从「能跑」变成「好用」。留意量化、显存管理与本地工具调用的进展。
llama.cpp ↗ - 2026.08.20高吞吐推理服务的工程实践
批量调度、KV 缓存、前缀复用决定了自托管模型的单位成本,是 AI 基础设施里最实在的工程。
vLLM ↗
Tools 工具
Useful AI products
- 2026.09.16AI 编程助手的形态变化
从补全到对话,再到能独立改仓库的 Agent。留意 review 成本与代码可信度,而不是生成速度。
GitHub Trending ↗ - 2026.09.01会议与语音场景的自动化程度
转录已经商品化,真正的差异在于「会后能自动做什么」。留意从记录到执行的闭环能力。
OpenAI News ↗ - 2026.08.24个人知识库的 AI 化改造
笔记工具正在从「存储」转向「检索与再生成」。留意本地优先与可移植性,避免知识被锁进单一产品。
Obsidian Blog ↗
Companies 公司
Industry movements
- 2026.09.11模型层的价格与能力竞争
单位 token 价格持续下探,同时头部能力仍有溢价空间。留意定价结构而非绝对数字。
OpenRouter 价格榜 ↗ - 2026.08.28应用层的护城河到底是什么
当模型能力被平权,应用层的价值来自数据、分发还是工作流深度?这个问题到目前为止还没有稳定答案。
Sequoia Perspectives ↗ - 2026.08.16推理成本成为产品设计的约束
单位成本下降并不代表总成本下降——用量会同步暴涨。留意成本结构如何反过来决定产品形态。
Google AI Blog ↗
Radar 的规矩
没有规则的动态信息流,三个月后就是一堆无法判断真伪的碎片。
必须带来源
每条记录都指向一个可点击的来源。没有来源的判断,不写进来。
必须带日期
动态信息的价值随时间衰减。看到日期,你才知道该打几折。
写下「为什么关注」
标题本身没有信息量。真正有用的是:这件事改变了什么判断。
Signals fade.
Concepts last.
Radar 上的东西大多会在一年内失去意义。真正值得投入时间的,是知识地图上那些不会过期的节点。
回到知识地图 →