#AI 模型

当微调不再是默认答案

分清微调、长上下文、检索与工具调用各自解决的问题,再判断一个 AI 应用究竟该改模型,还是改模型看到的世界。

种下2026/05/13 3 分钟 常青

很长一段时间里,做一个垂直 AI 应用的标准动作是微调:准备数据、训练一个版本、跑评测,再把它部署起来。模型答得不好,先想到的也是再补一批数据。

2026 年 5 月,Latent Space 用一句很重的标题概括正在发生的变化:The End of Finetuning。 起因是 OpenAI 收缩微调服务,但真正值得看的不是一个接口的去留,而是越来越多应用开始绕过“改模型”这条路。

园丁没有修剪树本身,而是重新摆放树旁的路牌、书页和工具 有时要改的不是树,而是它每次醒来看到的花园。

模型不会,还是模型没拿到

一个客服 Agent 不知道刚更新的退款规则,微调当然能让它记住。但规则下个月又变了,训练出来的记忆立刻过期。把规则放进可检索的知识库,回答前现查,更新只需要替换一份文档。

一个编程 Agent 总忘记项目的目录约定,也不一定需要训练。把约定写进项目规则,在会话启动时加载,成本更低,错了也能直接改。

这里其实混着三类问题:

  • 知识缺失:用检索和上下文补。
  • 能力缺失:给工具、示例或更强的模型。
  • 行为偏差:稳定且反复出现时,才考虑微调或强化学习。

微调过去经常同时承担这三件事。现在模型的基础能力更强,窗口更长,工具调用也更可靠,把问题拆开以后,真正需要改权重的部分变少了。

很长的提示词不是廉价微调

另一种极端是把所有东西都塞进提示词。产品说明、历史对话、代码规范、几十个工具描述一起送进去,看起来省掉了训练,实际把维护成本转移到了上下文。

模型每次都要重新读,规则之间还会争夺注意力。内容越多,不等于相关信息越多。上下文工程真正处理的是选择:这一刻该让模型看到什么,哪些东西应该暂时留在门外。

微调把经验写进权重,长上下文把经验摊在桌面。前者不容易更新,后者容易变乱。二者都不是免费的。

顶尖应用为什么还在训练

“微调结束了”只适用于大多数并不需要自有模型的应用。Cursor、Cognition 这类把模型行为直接做成核心产品的团队,反而还在增加针对开放模型的训练和强化学习。

差别在于回报能不能覆盖成本。

如果只是让模型知道一份业务手册,改权重太重。如果产品每天重复同一种高价值动作,错误模式稳定、反馈可量化,训练带来的每一点提升都会被调用次数放大,账就可能算得过来。

这个花园的文章规范也一样。标题口吻、标签数量、结尾怎么收,都能写成模型每次会读的规则,没有理由为此训练一个模型。真正有价值的是把改稿中反复出现的问题固化进下一轮,而不是把整个花园压进一组权重里。

原始材料:The End of Finetuning

先判断缺的是知识、工具还是行为,再决定要不要动模型。