为什么Agent需要IM和多agent

August 11, 2026 · 5 min read

Agent 自己的运行界面——目前所有的 agent,不管是 TUI 还是 GUI —— 应该被看作是 agent 自己的运行后台。

用这个界面进行交互,等于 micro-manage 一个下属,盯着人家干活。干得不对的时候就可以及时打断、纠正,但也依赖使用者一步一步地指导。

既然 agent 的发展方向是全自动、长程任务,那就没有道理需要去 micro-manage. 人根本不应该过度干预 agent 的运行。

之前只需要干预是因为模型差,对人类需求的判断不够拟合真实情况,所以需要人类不断输入额外的信息进行纠正。

但是现在的模型基本上对任务执行的判断很多决策的质量都很高了,而且很多都比人类做决策要好。因为使用者的先验知识肯定没有大模型丰富。那为什么还要使用者来监督着 agent 的执行呢?

给 agent IM channel 就相当于是让 agent 只在需要汇报的时候汇报。只在需要关键信息输入来做关键决策时候来请示。

你想想是不是如果你总是事无巨细所有小决策都上报让老板拍板,老板也会很烦?现在的 agent 用法就是这样。

所以一个区别于 agent 自己工作后台的“前台通信渠道”是最好的解决方法。不管是接入 slack、telegram 这种IM,还是自建一个,还是配个 email 给它,都是这个意思。

第二个原因:

agent 要长程执行任务,分两种:工作流已经确定性非常高,这就和运行代码区别不大;第二种是执行过程中有不确定性决策需要做。

第二种才是我们要追求的全智能、全自动的价值。

但是第二种不可能在单个 agent loop 内部实现。即使在内部实现了,也是通过 harness 在内部拉起 subagent 或者 agent team,或者多个判断循环来判断。

这个场景的本质是单个 agent loop 要约长程就需要约确定和稳定标准,但是约确定越稳定,遇到决策的时候就约会卡住不知道怎么判断。

所以多agent系统的价值就是剥离不确定性步骤,让不确定性步骤的决策在另一个 agent 那里变成确定性高的步骤。

比如你有一个 agent,你让他每天自己做一个网页。如果有关参数风格什么的你都定好了,那么这类决策就不是不确定性决策。不确定决策指的是,有一天做的一个网站所需要用到的数据需要额外的权限或者付费,那么单个 agent 就会停止循环,询问人类决策意见。但是如果有第二个 agent ,那么这类决策就可以给第二个 agent 来判断,第二个 agent 的任务是保证产出网页,或者根据用户的资料代替用户做决策,就像是摄政王。那么这个时候,两个 agent 的系统的执行自动化程度会更加高。展现出来的智能也会更加高。

这类场景当然会被模型吸收掉一部分。比如,如果未来的后训练对齐中针对用户隐私权限、付款、成本代价等的对齐标准拟合了收集上来的用户数据的高分布选择,或者就是简单的更宽松,那么单个 agent loop 也能更自主。

但是tricky的地方在于,不管怎么训练,真实使用者的分布总是存在的,模型行为不可能拟合所有人的意图。而 prompt engineering 也不能解决所有问题,因为你不知道一项包含着非确定型决策的任务中会需要用到哪些信息。


dynamic workflow 是确定性极强的loop,步骤之间传递的结果是 schema写死的。但是真正智能的系统能做出来的 workflow ,中间的每一个步骤都应该允许包含一定的不确定性的。

在 IM 中和用户不断沟通交流所沉淀下来的信息,才慢慢把一个不确定性的workflow可以发展成一个稳定的、确定的workflow。

这个顺序的改变带来的价值是巨大的。这就是意图识别。

打个比方,就相当于是老板定了个目标,交给一个角色齐全的团队去实现。但是前者就相当于是逼着老板要完整确定的执行方案,或者对很多细节排板决策;后者则是团队先根据自己的理解快速做一个出来给老板看。

相信我,很多时候老板根本不知道怎么决策。老板定战略目标就行。

这在agent产品上更加明显。因为人不可能比大模型知识丰富。而且随着执行的成本降低,越来越多的决策都是可撤销的,重做一遍的成本非常非常小。

你不可能先验预测用户意图,因为你根本没有样本。没法预测就没法执行。没法执行,用户就用不起来。正如现在大量用户其实很难描述自己的需求。

但是真实世界都是先跑起来,再看反馈迭代。

IM+多agent 的价值就是让一个跛脚的loop能先跑起来,有结果,先做出一坨屎。跑起来之后还能收集反馈进行迭代,再把这坨屎慢慢改成想要的样子。


回到 IM 上面来。既然多 agent 之间要交换信息。那么隔离上下文也才是最理想的方案。这当然可以用 spectrum 或者 herdr、claude code 的那些方式去做。但是因为有多agent 参与,还有人类消息,所以要区分,要有“工牌”。所以 IM 带身份信息,是最好的解法。

← All essays