2026-09-09
李福东 资深实战人工智能和数字化转型专家 清华大学工学学士,北京邮电大学工学硕士
大家应该已经大概理解了:从我们输入一句话,到 AI 最终生成答案,中间其实经历了大量我们看不见的计算和信息处理。
但是,如果只有基础对话能力,AI 主要还是在"给答案"。真正要把事情干出来,还需要再往前走一步。
比如你问 AI:"青甘旅游有什么好的建议?"它可以很快给出一条路线:从西宁出发,经过青海湖、敦煌莫高窟、张掖七彩丹霞,再到门源看油菜花,最后返回西宁。
这个答案已经很有价值了,但它还只是"建议"。确定路线之后,你还得自己查航班、订酒店、买景区门票、租车、安排接送,临时碰到天气变化、航班延误,还得重新调整。
而当 AI 进一步接入工具、数据和执行环境,并获得必要授权之后,情况就不一样了。它可以像私人秘书一样,先跟你确认预算、时间、人数、住宿偏好等,再查询和比较方案,甚至在关键环节经过你的确认后,发起预订或调整。
也就是说,AI 正在从"告诉你怎么做",走向"围绕目标把事情推进下去"。
那么,它为什么能够做到这一点?
这就进入 AI 智能体干活儿的第二层:决策层。
为了便于理解,我把这一层拆成四个关键支撑:智能体、记忆与状态、知识与数据、本体/业务语义模型。这个拆法是本文用于科普的理解框架,并不是行业唯一的标准架构。
智能体是什么?现在有很多说法。有人说它是"数字员工",也有人把它形容成孙悟空拔下一根毫毛,变成很多小猴子,每个小猴子各自负责一项任务。
这些比喻都没有错,但如果要解释智能体为什么能够"干活儿",我更愿意把它比作一个"现场 CEO"。
为什么强调"现场"?因为智能体不是只在会议室里给建议,而是要面对真实任务的具体环境:现在是什么时间、任务做到哪一步、哪些工具可以用、当前有没有权限、刚才调用接口成功还是失败、用户有没有修改要求……这些都会影响下一步动作。
为什么又叫"CEO"?因为它要统筹目标、资源和行动,根据现场变化不断做出下一步判断。
不过这里要特别说明:"现场 CEO"只是一个方便理解的比喻。智能体并不是另一颗独立于大模型之外的"大脑"。在多数实现中,大模型本身就嵌在智能体系统内部,是主要的语言理解和推理引擎;智能体的运行系统则负责把上下文、工具、权限、任务状态和执行流程组织起来。
简单说,大模型更像"分析和推理能力",智能体则负责把这种能力放进真实任务里,让判断能够变成行动。
一个典型的智能体通常会反复经历这样的循环:理解目标 → 规划和拆解任务 → 调用工具执行 → 观察执行结果 → 根据结果调整计划 → 继续执行。
这个循环很关键。因为现实世界很少会完全按照最初计划发展。酒店没房了怎么办?接口返回失败怎么办?用户突然说预算降到 5000 元怎么办?真正的智能体不是把第一版计划执行到底,而是根据现场反馈继续判断和调整。
所以,所谓"智能体会干活儿",本质上不是它一次性想得多聪明,而是它能够在真实环境中持续地"判断—行动—观察—调整"。
一句话理解:大模型负责"想",智能体系统负责"把想法放进任务里不断执行和校验"。
记忆是智能连续性的基础之一。人类依靠神经系统形成记忆,AI 系统则更多依靠对话历史、持久化存储、任务状态、工作空间等工程机制来"记住"过去。
如果没有记忆和状态,智能体每一次工作都像第一次见你。你刚告诉它"我不吃辣",下一轮它又推荐川味火锅;刚刚已经下载过的数据,后面又重新下载一次;任务明明已经做到第 8 步,重新打开之后却不知道从哪里继续。
所以,对智能体来说,"记住什么"和"记住到哪里"都很重要。
比如我有一次给客户讲人工智能课程。去之前,我让 WorkBuddy 整理一段时间的气温数据,并生成折线图。后来再次演示类似任务时,它可以利用之前任务中已经沉淀的历史信息和工作空间成果,在已有基础上继续更新,而不必所有步骤都从零开始。
这里要区分一个容易混淆的概念:产品狭义上的"长期记忆",和任务过程中的"历史上下文、任务状态、工作空间文件",并不是完全一回事。
以 WorkBuddy 为例,长期记忆更偏向从历史会话中提取用户事实、偏好、习惯和近期事项;而任务中的数据、图表、中间文件,更多属于任务历史和工作空间。
为了便于讲解,本文把这些能够让后续任务延续过去工作的机制统称为"记忆与状态"。
有了这些机制之后,智能体就能够知道:我过去做过哪些事情?哪些成果可以直接复用?现在任务做到什么阶段?哪些信息已经失效,需要重新获取?
这也是为什么同一个智能体使用时间越长,如果记忆机制设计得好,它往往会表现得更连续、更懂你的工作方式。
当然,数据越多并不意味着越好。历史任务、缓存、中间文件、旧版本成果不断积累,如果长期不治理,也会带来检索噪声、版本混乱和存储成本。可以把它理解为一种"数据债"或"上下文债"。
因此,真正好的记忆系统不仅要会"记",还要会筛选、更新、归档和遗忘。
一句话理解:记忆与状态解决的是"别每次都从零开始",让智能体能够在已有成果上继续干。
智能体可以记住过去,但光有记忆还不够。真正做企业决策时,它还必须知道企业自己的制度、流程、产品、客户和实时业务状态。
基础大模型拥有大量通用知识和专业知识,但它并不天然知道你企业内部今天最新的订单、库存、客户状态、员工权限,也未必知道你上周刚刚发布的新制度。
企业通常也不会为了让模型"知道"这些信息,就把所有私有数据重新训练进基础模型。更常见的方式,是在任务发生时按需提供。
这里其实有两类信息来源。
第一类是相对稳定的"知识",比如制度、流程、操作手册、产品说明、案例、合同模板、技术规范等。这些内容适合进入企业知识库。
第二类是不断变化的"业务数据",比如订单、库存、收入、客户状态、设备状态、物流进度等。这些数据通常仍然保存在 ERP、CRM、MES、数据库或其他业务系统中,智能体通过受控的工具和 API 在需要时读取最新状态。
所以,企业智能体做决策时,往往既需要"查知识库",又需要"查业务系统"。一个解决"规则是什么",另一个解决"现在到底是什么情况"。
知识库本身并不等于某一种数据库。它首先是一个逻辑概念,底层可以由文件系统、文档管理系统、对象存储、搜索索引、关系数据库、向量数据库等多种技术组合实现。
最简单的知识查找方式,是按文件夹和关键词找资料。文件不多的时候,这种方式非常好用。
当资料越来越多,我们通常会建立全文检索。比如 Elasticsearch 就很擅长做全文搜索和搜索索引,它可以分词、计算相关性、支持同义词和复杂查询。
但是,关键词检索有一个天然局限:人和文档未必使用同一种说法。
比如文档里写的是"有限产能排程",用户问的却是"工厂怎样自动安排生产顺序"。两个表达没有完全相同的关键词,但说的可能是同一类问题。
这时候,语义检索就有价值了。它会把用户问题和文档片段转换成向量,然后在向量空间里寻找距离更近、相似度更高的内容,再把对应原文交给大模型进一步判断。
语义检索让我们不必"猜文档里到底用了哪个关键词",而是可以用更自然的语言表达需求。
不过,向量检索也不是万能的。它做的本质上仍然是相似度匹配,不代表相似度高就一定事实相关;对于长文档,通常还要先切块,切得太大、太小、边界不合理,都会影响召回效果。
因此,实际系统里越来越常见的做法不是只用关键词,也不是只用向量,而是把关键词检索和语义检索组合起来,再通过重排序提高稳定性。
还有一种情况,单纯从文档中找一段相似文字并不够。
比如在一个复杂装备企业里,我们要回答:某型号火箭是由哪个型号演化而来?它包含哪些关键部件?某个部件的设计负责人是谁?供应商是谁?这个部件和其他部件之间是连接、包含还是替代关系?
这些信息当然也可以写进文档。但当对象很多、关系复杂、需要频繁做多跳查询和关系追溯时,把关系显式表达出来会更可靠。
这时候,知识图谱往往更合适。图数据库是实现知识图谱的常见技术之一,但两者并不完全等同。知识图谱是一种知识组织和表达方式,图数据库则是一类用于存储和查询图结构的技术。
关系简单、证据集中时,文本检索加大模型推理可能已经够用;关系复杂、链路很长时,显式的图结构能够让查询、追溯和解释更加稳定。
这里最重要的不是你到底用了哪一种数据库,而是数据质量。如果制度本身写错了、版本过期了、权限配置错了,或者实时数据没有同步,那么再强的大模型也可能在错误的基础上做出错误判断。
举个最简单的例子:如果差旅制度里把"12级及以上员工住宿标准400元"误写成500元,那么智能体即使百分之百按照知识库执行,结果仍然是错的。
一句话理解:知识库告诉智能体"规则和经验是什么",业务系统告诉它"现在发生了什么"。
接下来要讲的,是这篇文章里最容易听起来"玄"的一个词:本体。
本体的英文是 Ontology。这个词最早来自哲学,讨论"世界上存在什么,以及这些存在之间如何被理解"。后来,它进入人工智能和知识工程领域,被用来解决一个非常实际的问题:不同的人、不同系统、不同数据源,怎样对同一个业务世界形成一致理解?
在 AI 和知识工程领域,Ontology 并不是 2004 年才出现。早在 20 世纪 90 年代初,学术界就已经在系统研究如何用本体支持知识共享和复用。Thomas Gruber 1993 年前后的工作,是这一领域非常经典的早期成果之一。
2004 年是另一个重要节点。W3C 正式发布 OWL(Web Ontology Language)推荐标准,让机器用标准化语言表达类、属性、个体以及它们之间的关系,本体开始成为语义网和知识工程的重要基础。
而到了今天,随着企业智能体的发展,本体又重新受到关注。一个很典型的代表就是 Palantir。
Palantir 并没有把 Ontology 仅仅当成一个"知识分类表"或者"概念关系图",而是把它放到了企业实际决策和执行的核心位置。
在 Palantir Foundry 中,Ontology 会把分散在 ERP、CRM、工业数据库、实时传感器、文档等不同来源的数据,映射成业务人员真正理解的对象、属性和关系。比如"客户""订单""设备""工厂""航班""供应商"都是对象;订单属于哪个客户、设备安装在哪个工厂,就是关系。
更进一步,Palantir 还把 Action、Function 等执行能力放进 Ontology 体系中,使它不仅能够描述"这个世界是什么样",还能够连接"接下来允许做什么、怎样改变这个世界"。在它当前的架构描述中,决策被组织成 Data、Logic、Action、Security 四方面的结合。
这正好说明了为什么本体在 AI 智能体时代重新重要起来:大模型擅长理解语言和处理模糊问题,但企业要真正让 AI 参与经营和执行,还需要一套稳定的业务世界模型,把"人、订单、产品、设备、关系、状态、规则、动作、权限"组织起来。
为了让这件事容易理解,本文把企业决策场景中的本体简化成四个观察角度:实体、关系、状态和规则。需要强调的是,这只是一个面向业务科普的工程化拆法,并不是本体领域唯一或标准的"四要素定义"。
我们用一个非常普通的商品退款场景来理解。
客户说:"这个订单我不想要了,帮我退款。"
如果只是让大模型在一堆制度文档里自己找规则、自己判断,它有可能漏掉条件,也可能读到旧版本,更不应该让它凭自然语言直接决定一笔钱能不能退。
更稳妥的方式,是先把业务世界描述清楚。
首先是实体:订单、客户、产品、支付、渠道等。
其次是关系:这个订单属于客户 A,包含产品 B 和产品 C,通过手机 App 渠道下单,关联某一笔支付记录。
第三是状态:订单当前是"已支付""未发货",产品是否属于特殊品类,退款申请是否在有效期限内。
第四是规则:比如"订单金额100元以下且满足指定条件,可以自动退款;100元以上需要进入人工审核"。
这里还要再强调一次:本体负责把"业务世界说清楚",但"100元以下自动退款"这种硬规则,最好交给确定性的规则、函数、策略或代码来判断,而不是单纯依赖大模型猜。
于是,完整流程就变成了:智能体识别退款意图 → 读取订单和客户的最新状态 → 根据业务语义理解对象之间的关系 → 调用规则或函数完成条件判断 → 规则通过后调用退款接口执行 → 不符合条件则给出原因或转人工审核。
这样一来,大模型负责处理自然语言和模糊判断,结构化的业务模型负责提供统一语义,确定性规则负责守住硬边界,工具和接口负责真正执行动作。
你会发现,AI 从"会聊天"走向"真干活儿",中间缺的恰恰就是这些东西。
一句话理解:本体不是简单"存知识",而是在告诉 AI——企业这个业务世界里究竟有哪些东西、它们是什么关系、处于什么状态,以及哪些动作在什么条件下允许发生。
现在把这四个部件重新放到一起,就比较清楚了。
假设一个客户提出退款申请。
第一步,智能体作为"现场 CEO",接收目标,识别这是一个退款任务,并开始组织上下文。
第二步,它查看记忆和任务状态:这个客户之前有没有沟通过?这个订单有没有已经提交过退款?任务是不是刚才已经执行到一半?
第三步,它从知识库中获取退款制度、产品规则和流程说明,同时通过业务系统读取订单金额、支付状态、发货状态等实时数据。
第四步,本体/业务语义模型帮助它理解"客户—订单—产品—支付—渠道"之间是什么关系,各对象现在处于什么状态。
第五步,大模型基于这些上下文完成语言理解和需要的推理,而明确的硬规则则由规则、函数、流程或代码进行确定性判断。
第六步,智能体根据判断结果调用退款接口、发起审批,或者把需要人工确认的事项交给人。
最后,执行结果再写回任务状态和业务系统,成为下一轮判断的最新上下文。
这才是一个比较完整的智能体闭环。
讲到这里,还需要补充一个非常重要的边界。
AI 智能体能做决策,不等于我们要把所有决策都交给大模型。
恰恰相反,越接近真实世界的高风险动作,越要把"灵活判断"和"确定性控制"分开。
比如写一份会议纪要,模型判断错一点,最多重新修改;但是退款、转账、删除数据、修改权限、发送正式邮件、控制工业设备,就不能只靠一句"我觉得可以"。
这些场景必须加入权限控制、参数校验、确定性规则、审计记录,必要时还要有人类确认。
所以,一个成熟的企业智能体,并不是"让 AI 拥有无限权力",而是让它在被清晰定义的业务边界里,尽可能自主地完成工作。
这也是为什么我在"干活儿金字塔"里把决策单独拿出来讲:真正难的并不是让模型给一个答案,而是让系统知道——什么时候可以自动做,什么时候必须停下来问人,依据是什么,做完以后结果又该写回哪里。
如果说大模型解决的是"AI 能不能理解、分析和生成",那么决策层解决的是"AI 怎样在真实环境里,根据已有信息和现场变化持续把事情推进下去"。
智能体负责统筹和执行循环;记忆与状态让工作具有连续性;知识库和业务系统提供决策依据;本体/业务语义模型把企业的对象、关系、状态和业务含义组织起来;而关键硬规则、权限和高风险动作,则由确定性机制和必要的人工确认来兜底。
把这些东西组合起来之后,AI 才不再只是一个"会回答问题的聊天机器人",而开始真正成为一个能够围绕目标持续工作的智能体。
当然,到这里它还没有真正把所有活儿干完。
知道"下一步该做什么",只是决策;真正把机票订上、把报表生成出来、把邮件发出去、把订单状态修改掉,还需要另外一层能力。
完 谢谢观看
CDA认证
关于CDA考试 最新考试安排 考试报名入口 CDA证书查询CDA合作
CDA教育 Pearson CDA网校 电子工业出版社关注CDA
关于我们 Email:exam@cdaglobal.com 电 话:010-68454276 手 机:15311595173
CDA认证小程序
CDA考试中心服务号
京公网安备 11010802034615号