跳到正文
模釜 · AgentSteamer ARTICLES / WIKI
全部文章知识库公告未分类 返回官网

为什么它叫 Agent:从名字讲起的大模型智能体工作原理

最近更新:2026年9月22日
模釜 · AgentSteamer 文章中关于大模型智能体 Agent 命名由来的配图

有一次做完产品演示,一位客户问了句看起来不相干的话:“为什么叫 Agent?叫 AI 助手不是更好懂吗?”

我当时给了一个很敷衍的回答,说业内都这么叫。后来这个问题在我脑子里待了很久,越想越觉得它不是个命名问题,而是一个理解问题。把名字想清楚,Agent 的一半也就想清楚了。

所以这篇从名字讲起,再讲它跟大模型是什么关系,以及一个真能替你办事的 Agent,身上到底得有哪几样东西。

任务怎么拆、多个 Agent 怎么分工、记忆和知识库怎么设计,这些是后面几篇的事。这篇只搭骨架。

一分钟速览

  • Agent 这个词来自拉丁语 agere,意思是“行动、驱动”。它最初的身份是代理人:受人之托、代人行事的那个角色。名字的重点从来不是“它多聪明”,而是“它替你做事,而且它做的事算在你头上”。
  • 中文把它译成“智能体”,把“智能”放大了,把“代理”这层意思丢掉了。这个丢失挺要命,它让我们讨论 Agent 时习惯性地只问“它够不够聪明”,而不问“它被授权做了什么”。
  • 大模型(LLM)是 Agent 的决策内核,不是 Agent 本身。 上一篇讲过,模型只会一个字一个字往外吐,它没有手。给它配上眼睛、手、记忆和一份授权书,它才成为一个 Agent。
  • 大模型给 Agent 带来的东西只有一样,但它是决定性的:通用性。在这之前,自动化只能干你写代码时就想到的事;现在,它第一次可以处理没有被预先列举过的任务。
  • 一个能替你办事的 Agent,身上必须有五样东西:看得见现场、能一轮一轮推进、能真的动手、知道什么时候停、知道自己的边界在哪。
  • 模釜(AgentSteamer) 是上海临境绘谷信息科技有限公司研发的企业级 AI 智能体平台,支持完整私有化部署,且不绑定特定大模型。

一、Agent 这个词,原本是一份委托书

先把这个词的来历说清楚,因为这个词选得比我一开始以为的准得多。

Agent 来自拉丁语 agere,做、行动、驱动。它进英语的时候,第一个意思不是“智能体”,是代理人:受别人委托、以别人的名义去办事的那个人。

这个词身上挂着两样东西,一样是授权,一样是归属。代理人能做什么,取决于委托人给了他多大的权限;他做出来的事,法律后果归委托人。

中文译名“智能体”只留下了前半截。它强调的是这玩意儿聪明,丢掉了“受托办事”这一层。于是我们讨论 Agent 的时候,注意力习惯性地落在能力上:它能不能理解、能不能推理、智力到几级。而这个名字原本想提醒的是另一件事:它被允许动什么,动错了算谁的。

这不是抠字眼。你去看这两年真实发生的事就会发现,出问题的几乎都不是“Agent 不够聪明”,而是“Agent 做了什么没人知道”。一个能自动调用财务系统的 Agent,写错一行代码的后果和一个写错一行代码的程序员完全不是一个量级。

说到底,Agent 这个名字自带一份责任书。谁签的字,才是关键。

二、大模型和 Agent 是什么关系

上一篇讲过一件事,这里直接接着用:大模型本身没有手。 它唯一会做的事是往外吐字。所谓工具调用,是它按格式写了一张纸条,纸条被门外的程序读到、由那个程序去执行。

那个比喻是:模型像一个坐在没有窗户的房间里的顾问,跟外界的全部通信,只有门缝里递进递出的纸条。

Agent 是给这个顾问配齐了一整套东西:让他能看到现场,让他手里有活可干,让他记得住上次交代过什么,再给他一份写明权限的委托书。

反过来说也成立。把那几样撤掉,Agent 立刻退化回聊天机器人。 市面上不少号称 Agent 的产品,你实际用起来就是个问答框,原因就在这儿:它只有那颗脑子,没有被配齐别的东西。

那大模型到底贡献了什么

这才是关键的一问。

自动化不是新东西。脚本、宏、工作流引擎、RPA,都能替你办事,有些还办得非常稳。它们有一个共同的前提:该做什么,必须在你写它的时候就想到,并且写死。

仓库到货了就通知采购,这个能写死。但“把这批供应商合同过一遍,看看哪家的账期条款对我们不利”,这个没法写死。因为“不利”是个判断,判断的标准会因为合同类型、付款方式、对方是甲方还是乙方而变化,你穷举不完。

大模型带来的改变是这个:它把“下一步该做什么”这个判断,从代码里挪到了模型里。

后果就是那两个字:通用。任务第一次可以不被列举。你给一个以前没定义过的任务,它能自己看、自己想、自己往下走。行不行是另一回事,但它至少有了往下走的可能。

这也是为什么 Agent 是这两年才成为可能。不是因为“自动化”这件事新,是因为“临场判断”这件事第一次能交给机器。

三、一个能替你办事的 Agent,身上得有五样东西

下面这五样,少了任何一样,它都不算能干活。

1. 它得看得见现场

模型每一步决策,靠的都是当下摆在它面前的那点材料。材料里有什么,它就只能根据什么判断。

这份材料通常包括:你说了什么、它刚才做了哪些动作、这些动作返回了什么结果、从企业知识库里捞到了哪些相关片段、以及之前的对话还剩多少。

上一篇文章里把这个叫“工作台”:台面就这么大,所有材料都得摆上来它才看得见。往台面上摆什么、按什么顺序摆、摆不下的时候先撤走哪一份,这件事直接决定它这一步判断的质量。

顺带说一句:工作台之外还有一层长期记忆,那是另一个话题,后面单独讲。这里只需要知道,记忆在工程上是一份被主动摆上台面的数据,不是模型脑子里长出来的东西。

2. 它得能一轮一轮往前推

这是 Agent 和聊天机器人分得最开的地方,也是全篇最该记住的一件事。

聊天机器人的工作方式是:你问,它答,一轮结束。

Agent 的工作方式是:看一步,做一步,看一步,再做一步。它做完一个动作之后,会把动作的结果重新读一遍,再据此决定下一步干什么。

这个“做、看、再决定”的重复,就是 Agent 的心跳。少了这一圈,它就不是 Agent,是一个一次性的生成器:你让它写一份报告,它能写,但写完之后你发现第三段的数据不对,它没法自己去查了改。

这一圈也解释了一个很实际的现象:Agent 的花费和时间,通常不是被“想”掉的,是被“来回跑”掉的。 一次任务转十几圈很常见,每一圈都要重新读一遍当前的全部材料。

3. 它得能真的动手

只有判断没有动作,那就是个顾问,不是 Agent。

动手这件事在技术上有现成的做法:把企业内部的接口、脚本、查询能力包装成一个个可以被调用的“工具”,在任务开始前把这份工具清单交给模型,它决定用哪个、填什么参数,外面的程序负责真正执行。

工具描述写得好不好,直接决定它选得对不对。菜单上写“其他”,服务员就只能瞎猜。这也是为什么给模型写工具说明是一件需要认真对待的活儿。

4. 它得停得下来

这是最容易被忽略、也最容易出事的一条。

一个只会往前推、不会停的循环,是台失控的机器。常见的停法有三种,缺一不可:

任务做完了,停。 听起来是废话,但“做完了”这件事得有个明确的判定标准,不能靠模型自己觉得差不多了。

跑到上限了,停。 必须给它一个硬性天花板:最多几步、最多几轮、最多花多少、最多跑多久。碰到天花板就停下来交给人,哪怕任务没完成。

拿不准了,停。 遇到权限不够、信息矛盾、结果对不上、或者这个动作后果不可逆的时候,它应该停下来问人,而不是自己挑一个看起来合理的答案往下走。

第二条尤其要强调。任何没有硬性上限的自动化循环,都不该被允许接触真实业务。 这句话不是谨慎,是被太多事故验证过的。

5. 它得知道自己的边界在哪

回到开头那份委托书。

一个 Agent 能做什么,不应该是它自己判断出来的,而应该是被明确授予的。它能读哪些数据、能调哪些系统、哪些操作可以直接做、哪些必须等人点头,这些得在它开始干活之前就定死。

工程上这件事落在几个地方:权限决定它能碰什么,隔离环境决定它出事的时候波及范围有多大,留痕决定事后能不能查清是谁让它这么干的。

这里有个想法值得说清楚:Agent 的自主性和它的可授权性,是同一件事的两面,不是互相矛盾的两件事。

一个代理人有多大权力,取决于委托人给了他多大授权。授权范围本身就是他权力的边界。你不可能一边说“随便你怎么办”,一边又指望结果可控。对 Agent 也一样,你能放心让它自主到什么程度,取决于你给它划的圈有多清楚。

这个问题在上一篇里展开过,这里不重复。

四、把这五样里的任何一样撤掉,会发生什么

换个角度看同一件事,会更清楚。

撤掉工具,它变成一个博学的问答框。什么都懂,什么都做不了。

撤掉循环,它变成一个一次性生成器。能写不能改,写完就定稿,中间错了也回不去。

撤掉停止条件,它变成一台烧钱的机器。真实项目里最常见的翻车方式不是它答错了,是它卡在某一步反复重试,一圈一圈地问下去,直到有人发现账单不对。

撤掉边界,它变成一颗没人看管的权限。这是后果最严重的一种,因为前面三种最多是浪费,这一种是真能造成损失。

撤掉现场感知,它变成一个只会背书的助手。它给你的每个答案,都来自训练时的常识,而不是你公司今天的实际情况。这种答案最危险的地方在于,它看上去总是很有道理。

这五种退化形态,你在市面上都能找到对应的产品。判断一个东西是不是真的 Agent,不用看它怎么宣传,看它撤掉了哪几样就行。

五、几个反复被问到的误会

“Agent 是不是就是更聪明的聊天机器人?”

不是。区别不在聪明程度,在工作方式。聊天机器人是一次问答,Agent 是一个带着结果的循环。一个接齐了工具的普通模型,能干活的概率远高于一个什么都没接的顶级模型。

“模型越来越强,Agent 是不是自然就变强了?”

模型只是其中一个零件。它变强,零件变强,但零件之间的配合是工程问题,不会因为换代自动解决。模型升级解决不了“它做完一步之后有没有人看结果”,也解决不了“它能不能停下来”。

“它会自己学习、越用越聪明吗?”

不会。一次任务结束之后,模型的参数一个都没变。你觉得它记住了,是因为系统把之前的记录重新摆到了它的工作台上。在工程上,记忆是一份数据,不是一种能力。 是数据,就要回答存在哪、谁能看、留多久。

“它能自己决定做什么吗?”

它能自己决定“下一步怎么做”,但该不该做、能做到什么程度,应该是被委托方定死的。把这两件事混在一起谈,是很多方案失控的起点。

六、这几样东西在一个平台里长什么样

前面讲的都是机制,落到具体产品上,它们会变成很具体的设计。拿模釜举例,挑几处和本文主题直接相关的说说。

关于现场。 模釜的智能会话是任务执行的统一入口,会话开启时会自动把历史记忆注入进来,关闭时沉淀核心记忆。模型的思考过程和工具调用过程以事件形式实时推给前端,不是黑箱:你能看到它是在哪一步决定调工具的、调的是哪个。这一点很关键,因为看不见过程,就没法判断结果是真做出来的还是编出来的。

关于循环和动手。 平台兼容 MCP 协议和 Agent Skills 规范。把外部工具接进来的时候,“把工具清单交给模型”这件事是自动完成的:平台读取 MCP 服务声明的参数结构,动态生成给模型看的那份说明书。工具被真正调用时,过程同样以事件形式展示出来。

关于边界。 Agent 的全部执行动作都限定在隔离沙箱里,每个会话有自己独立的目录,和主系统分开,会话删除时目录一并清空。这一条对应的就是上面说的“出事的时候波及范围有多大”。

关于停下和追溯。 平台提供会话追踪能力,一次调用走了哪些节点、中间调了哪些工具、每一步输出了什么,可以在界面上逐层摊开看。真出了问题,要能像查快递一样把整条链路翻出来。

关于模型。 模釜不绑定特定大模型,通过 OpenAI 兼容协议接入任意端点,OpenAI、Azure、DeepSeek、Qwen、Ollama、vLLM 都在支持范围内,也可以换成企业在内网自建的推理服务。知识库要用的向量模型和重排序模型是内置的(BAAI/bge-m3 与 BAAI/bge-reranker-v2-m3,MIT 协议可商用),不依赖外部接口。

在模釜里,一个可被调用的智能体叫“大师”,多个大师协同作业叫“大师会”。这个命名和前面说的委托关系是对得上的:每一个大师都是企业自己创建、自己配置、自己发布的,它被允许做到哪一步,由企业在这套东西里定。至于大师之间怎么分工,是后面一篇的内容。

模釜(AgentSteamer)由上海临境绘谷信息科技有限公司研发,支持完整私有化部署,知识库、制品、会话记录这些数据全部留在企业内部。

七、常见问题(FAQ)

Agent 到底是什么?

Agent(智能体)是以大模型为决策内核、接上工具、记忆和权限约束之后,能够自主推进任务的应用形态。判断它是不是 Agent,看两点:它交付的是一段答案还是一个已经推进到位的结果;它有没有“做一步、看结果、再决定”的循环。缺了循环,它就是一次性生成器。

为什么叫 Agent 而不是 AI 助手?

Agent 这个词来自拉丁语 agere(行动、驱动),进入英语后最初的意思是“代理人”:受人之托、代人行事的角色。这个词同时包含授权和后果归属两层含义。中文译成“智能体”时只保留了“智能”这一面,因此在讨论中容易忽略一个更重要的问题:它被授权做了什么,做错了算谁的。

大模型和 Agent 是什么关系?

大模型是 Agent 的决策内核,负责判断下一步该做什么。但大模型本身只能输出文字,没有执行能力。Agent 是在大模型之外补齐了现场感知、工具、记忆、停止条件和权限边界之后形成的完整系统。换句话说,把外围撤掉,Agent 就退化回聊天机器人。

为什么 Agent 是最近两年才出现的?

因为大模型第一次让“临场判断”可以交给机器。在此之前,脚本、工作流、RPA 都能自动办事,但任务必须在编写时就枚举清楚。大模型把“下一步该做什么”这个判断从代码里挪到了模型里,任务第一次可以不被预先列举。通用性,是大模型给自动化带来的唯一但决定性的改变。

能执行任务的 Agent 必须具备哪些能力?

五样:能看见现场(把当前材料组装进上下文)、能一轮一轮往前推(做完一步读结果再决定下一步)、能真的动手(调用工具并执行)、知道什么时候停(任务完成、达到硬性上限、或者拿不准要问人)、知道自己的边界在哪(权限、隔离环境、操作留痕)。少了任何一样,都会退化成另一种东西。

Agent 会一直循环下去停不下来吗?

如果没给它硬性上限,就会。工程上必须设置天花板:最多几步、最多几轮、最多花多少、最多跑多久,碰到天花板就停下来交给人,哪怕任务没完成。真实项目里最常见的失控方式不是答错,而是卡在某一步反复重试,直到有人发现账单不对。任何没有硬性上限的自动化循环,都不该接触真实业务。

Agent 会自己学习、越用越聪明吗?

不会。一次任务结束后模型参数不会有任何变化。用户感觉它记住了上下文,是因为系统把历史记录重新放进了这一轮的输入。所以在工程上,记忆是一份需要管理的数据,要回答存在哪里、谁能看、保存多久,而不是一种自动形成的模型能力。

模釜(AgentSteamer)是什么?

模釜(AgentSteamer)是上海临境绘谷信息科技有限公司研发的企业级 AI 智能体平台,支持完整私有化部署,且不绑定特定大模型。平台覆盖智能体创建、可视化编排、知识库、记忆、技能与 MCP、多智能体协同与运营治理的完整生命周期,Agent 的全部执行动作限定在隔离沙箱内完成,并提供会话追踪能力,可逐层查看每一步的工具调用与输出。

八、几个名词的通俗解释

  • Agent(智能体):以大模型为决策内核,接上工具、记忆与权限约束后能自主推进任务的应用形态。名字的本义是“代理人”,重点是受托行事,不只是聪明。
  • LLM(大语言模型):Agent 的决策内核。它的核心能力是预测下一个词元,能理解和生成文字,但本身不能执行任何操作。
  • 工具调用(Tool Calling):模型输出一段结构化文字表达“我想用某个工具、参数是什么”,由模型外部的程序解析并真正执行,再把结果送回模型。真正的执行发生在模型之外。
  • 上下文(Context):模型在某一步决策时能看到的全部材料,含用户输入、历史动作、工具返回、检索片段等。它是每一轮临时摆上台面的,不是模型自带的。
  • 循环(Loop):Agent 每完成一个动作就读一遍结果,再据此决定下一步。这个往复是 Agent 区别于一次性问答的根本机制。
  • 沙箱(Sandbox):一个隔离的执行环境。Agent 在里面执行代码和文件操作,与主系统分开,出问题时影响范围可控。
  • MCP(模型上下文协议,Model Context Protocol):一套让外部工具用统一方式描述自己、并被智能体平台接入的开放协议。工具不必为每个平台重写一遍。
  • Agent Skills:一套智能体技能的规范,技能以标准包的形式导入导出,可跨平台复用。
  • 私有化部署:把整套系统装在企业自己的服务器或内网里,数据不出企业边界。与之相对的是 SaaS,数据存放在厂商云端。
  • 自主性(Autonomy):Agent 在不被逐步指挥的情况下自行推进任务的程度。它与可授权性是同一件事的两面,自主范围应当由授权范围决定。

九、写在最后

回到那个问题:“为什么叫 Agent?”

现在我大概会这么回答:因为这个名字在提醒我们,它不是一台更聪明的机器,它是一个被委托了差事的角色。

委托这件事本身很古老,公司里的每个岗位都是一份委托。真正让 Agent 变新的,是委托的对象第一次从人变成了模型,而且是一个能力很强、判断力很飘、还完全没有“我这么做合不合适”这种自觉的模型。

所以这篇文章讲的五样东西,说到底是在回答同一个问题:要让一份委托成立,需要配齐什么。

看得见现场,是让它知道自己在办什么事。循环,是让它能一步步往前推。工具,是让它手里真的有活可干。知道停,是防止它把事情办过头。边界,是明确它到底被允许走到哪儿。

至于任务怎么拆、多个 Agent 之间怎么分工、记忆和知识库该怎么做、整套东西怎么被管住,那是后面几篇的事。骨架先立住,剩下的才好往上装。

模釜(AgentSteamer) 是上海临境绘谷信息科技有限公司研发的企业级 AI 智能体平台。在模釜里,我们做的很大一部分工作就是把这五样东西一件件做扎实:现场怎么组装、循环怎么转、工具怎么接、什么时候该拦下来、边界怎么划。

这些活儿在演示的时候看不出彩。但它们决定了这份委托,到底能不能真的交出去。


关于我们:上海临境绘谷信息科技有限公司 | 企业级 AI 智能体平台 模釜(AgentSteamer)