【从0开发AI Agent】AI圈的新概念你知道多少?

  • 2026-08-10
  • 人工智能
  • ai
  • --

AI 圈创造新概念的速度,可能已经超过了前端圈。

AI Agent 还没有完全弄明白,Harness、Long-horizon Agent、Agent Runtime、Context Engineering、Agent Skills 又接连出现。每天打开技术社区,都能看到一批新的名词和架构图。有时候只是睡了一觉,再看行业动态,就会产生一种自己已经落后了好几代、快要变成“技术原始人”的错觉。

下面我们捋一捋最近AI圈一些新的或者比较重要的概念。


“开源模型”可能并不是真正的开源

模型圈里还有一个非常容易混淆的概念:开源模型(Open-source Model)和开放权重模型(Open-weight Model)。开放权重通常意味着开发者可以下载训练完成后的模型权重,在自己的设备上运行、微调或部署。但这不一定意味着模型的训练数据、数据处理流程、训练代码和完整方法都公开。严格意义上的开源 AI,不只是能够下载模型文件,还需要提供足够的代码、数据说明和参数信息,使其他人拥有研究、修改和重新构建系统的自由。开放源代码促进会对开源 AI 的定义,也明显区分了完整开源系统与仅公开权重的模型。因此,很多日常被称为“开源大模型”的产品,更准确的说法其实是开放权重模型。OpenAI 在介绍 gpt-oss 时采用的也是 “open-weight” 这一表述,强调公开的是可下载和运行的模型权重。这并不意味着开放权重没有价值。对于本地部署、隐私保护、模型定制和离线运行而言,开放权重非常重要。这里只是需要知道,“能够下载运行”和“完整开源”并不是同一件事。


Embedding、向量数据库和语义搜索在做什么?

当资料数量超过上下文窗口以后,我们不能把所有文档都发给模型,而是需要先找到与当前问题最相关的部分。这里就会遇到Embedding、向量数据库和语义搜索。Embedding,通常翻译为嵌入或向量表示,是把文字、图片或其他内容转换成一组数字。语义相近的内容,在向量空间中的位置通常也会更加接近。例如,“如何修复项目启动失败”和“程序运行时报错怎样排查”,虽然文字并不完全一样,但语义比较接近。传统关键词搜索可能只寻找相同词语,语义搜索则尝试寻找意思相近的内容。向量数据库(Vector Database)用于保存这些向量,并快速查找距离最接近的内容。它不是专门用来保存 AI 记忆的神秘数据库,本质上仍然是一种面向向量检索的数据系统。它们之间的关系可以简单理解为:

原始文档   ↓Embedding 模型转成向量   ↓向量数据库保存和建立索引   ↓用户提出问题   ↓把问题也转成向量   ↓寻找语义最接近的文档片段

Embedding 负责把内容变成可以计算的向量,向量数据库负责保存和检索,语义搜索则是建立在这些能力之上的搜索方式。


Workflow、Agent 和 Agentic Workflow

工具连接起来以后,系统开始变得像自动化程序,这时最容易混淆的是 Workflow 和 Agent。工作流(Workflow)的执行路径通常由开发者提前确定。程序知道第一步做什么,成功以后进入哪个节点,失败以后走哪条分支。例如:

读取文件 → 提取数据 → 生成报告 → 发送邮件

模型可以出现在某个节点中,但整体路线仍然固定。Agent则会根据目标和当前环境,动态决定下一步。例如分析项目启动失败时,它可能先读取配置,也可能先运行程序;得到错误以后,再决定搜索代码还是检查端口。真正的产品往往位于两者之间,于是又有了Agentic Workflow,可以理解为“带有 Agent 决策能力的工作流”。


Agent Loop:Agent 真正的核心并不是聊天界面

Agent 最核心的结构叫Agent Loop,也就是智能体循环。一个最简单的 Agent Loop 包含几个阶段:

理解目标   ↓观察当前环境   ↓决定下一步行动   ↓调用工具   ↓读取工具结果   ↓判断是否继续

例如,用户要求 Agent 修复一个程序错误。Agent 先读取错误日志,然后搜索相关代码,修改文件,运行测试,再根据测试结果决定继续修复还是结束任务。只调用一次工具,还不能完全体现 Agent 的价值。真正重要的是,工具执行结果会影响下一轮决策。系统不只是执行一份预先生成的计划,而是在行动和反馈之间不断调整。


Harness:模型外面的那套“运行支架”

模型能够调用工具以后,新的问题很快就会出现:谁来维护循环?谁来保存任务状态?谁来控制工具权限?任务失败后如何恢复?上下文太长怎么办?这些包裹在模型外面的运行机制,被越来越多地称为Agent Harness。微软将 Harness 描述为把语言模型变成真正可行动 Agent 的支架。模型只能生成内容,而 Harness 为它提供工具调用、多步任务、状态记录和持续运行能力。Harness 通常会包含提示词组装、工具注册、任务循环、上下文压缩、文件访问、记忆、权限审批、错误重试和日志追踪等机制。因此,同一个模型放进不同 Harness,表现可能差别很大。一个 Harness 只能让模型搜索一次网页,另一个 Harness 却能让它读取代码、修改文件、运行测试、保存任务进度,并在危险操作前请求确认。模型提供的是基础智能,Harness 决定这些智能怎样被组织、限制和转化为稳定行动。


Sandbox、Checkpoint、Trace 和 Evals

Agent 开始真正执行操作以后,又会出现一批工程术语。Sandbox,沙箱是一种隔离运行环境。Agent 可以在其中执行命令、安装依赖或者修改文件,但不能随意访问用户整个电脑或生产系统。沙箱的意义不是让 Agent 更聪明,而是控制它出错时的影响范围。Checkpoint,检查点用于保存任务的阶段状态。任务运行到一半被中断时,可以从最近检查点恢复,而不是全部重新开始。Trace,运行轨迹记录 Agent 在每一步看到了什么、选择了什么工具、工具返回了什么,以及最终为什么得到当前结果。传统程序主要看日志,Agent 除了日志,还需要观察完整决策链路。Evals,评估则用于系统性测试模型或 Agent 的表现。例如准备一组真实任务,统计工具选择是否正确、任务是否完成、输出是否符合要求,以及是否出现危险操作。评估 Agent 时,真正被测试的并不只是模型,而是模型与 Harness、工具和上下文共同组成的完整系统。Anthropic 对 Agent Evals 的说明也明确指出,评估一个 Agent,实际上是在评估 Harness 与模型的组合表现。


Long-horizon Agent:不是回答更长,而是工作更久

Long-horizon Agent通常翻译为长周期 Agent 或长时程 Agent。它并不是指模型生成一篇很长的文章,而是指 Agent 能够持续完成跨越大量步骤、较长时间甚至多个运行会话的任务。例如,修复一个简单报错可能只需要几分钟;完成大型代码迁移、开发完整功能、进行长期研究或者处理大量文件,可能需要几十个步骤,甚至跨越多个上下文窗口。长周期任务最困难的地方,不只是模型够不够聪明,而是如何保持任务连续性。上下文总会达到上限,程序可能重启,工具可能失败,中间结果也可能互相冲突。因此 Long-horizon Agent 通常依赖任务计划、阶段文件、上下文压缩、持久化记忆、检查点和结果验证。OpenAI 和 Anthropic 关于长周期 Agent 的工程实践,都重点强调了计划文件、阶段状态、持续验证和跨会话信息交接。所以,Long-horizon Agent 的关键不是“让模型一直运行”,而是让一个可能多次中断、压缩和恢复的系统,仍然能够围绕同一个目标继续工作。


Computer Use:没有 API,也让 Agent 学会操作界面

传统工具调用依赖 API 或函数,但现实中很多软件没有提供适合 Agent 使用的接口。这时就出现了Computer Use。Computer Use 让模型观察屏幕截图,并输出点击、输入、滚动等界面操作,再由外部程序执行。它使 Agent 能够像人一样使用网页和桌面软件。OpenAI 的官方文档将其描述为让模型通过用户界面操作软件,并允许将视觉交互与程序化工具组合起来。Computer Use 看起来很通用,但通常也比 API 调用更慢、更容易受到界面变化影响。按钮位置、弹窗和加载延迟都可能让操作失败。因此,有稳定 API 时,通常优先使用 API;没有接口或者必须操作图形界面时,再使用 Computer Use。它更像通用兜底能力,而不是所有操作的最佳方式。


Tool、Skill 和 MCP Server 到底有什么区别?

Agent 能力越来越多以后,Tool、Skill 和 MCP 又经常被混在一起。Tool 是原子操作能力。例如读取文件、执行命令、查询数据库或发送邮件。它告诉 Agent“可以做什么”。Skill 是完成某类工作的知识和流程。一个制作财务报告的 Skill,可能包含操作说明、模板、脚本、检查规则和参考文件。它不只是提供一个函数,而是告诉 Agent“怎样把一系列工具组合起来完成专业任务”。MCP Server则是按照 MCP 协议,把工具和数据提供给 AI 应用的一种服务。它不等于工具本身,而是工具和数据对外暴露的一种标准方式。


A2A:当一个 Agent 需要与另一个 Agent 合作

MCP 主要连接 Agent 与工具,A2A(Agent2Agent Protocol)则主要连接 Agent 与 Agent。A2A 由 Google 推出,用于标准化不同厂商、不同语言和不同框架构建的 Agent 之间如何发现彼此、交换信息、委托任务和传递结果。例如,一个总协调 Agent 可以把市场调查任务交给研究 Agent,把数据处理交给分析 Agent,再由报告 Agent 整理最终输出。只要它们遵循相同协议,即使内部使用不同模型和技术栈,也可以进行协作。可以简单理解为:

MCP:Agent 连接工具与数据 A2A:Agent 连接其他 Agent

不过,协议解决的是“怎样通信”,并不保证多个 Agent 合作以后一定比单 Agent 更好。


Multi-Agent 和 Agent Swarm 是一回事吗?

Multi-Agent System,多智能体系统,指一个任务由多个 Agent 共同完成。每个 Agent 可以负责不同角色,也可以互相讨论、审核或交接工作。例如,一个软件开发系统中可以包含产品 Agent、编码 Agent 和测试 Agent。Agent Swarm,智能体集群或智能体群体,通常更强调大量相对独立的 Agent 并行工作,通过局部协作或竞争产生整体结果。“Swarm”借用了自然界中蜂群和蚁群的概念,但在当前 AI 产品中,它并没有特别统一和严格的工程定义。很多产品把几个角色不同的 Agent 也称为 Swarm,更多时候是一种强调规模和自主协作的产品说法。多 Agent 也不天然比单 Agent 高级。多个 Agent 会产生重复上下文、通信成本、责任不清和错误传播。Anthropic 在 Agent 工程经验中反而建议优先使用简单、可组合的模式,只有单 Agent 确实无法满足任务时,再引入复杂协作结构。


Managed Agent:把长期运行交给托管平台

当 Agent 需要持续工作数小时、跨会话保存状态并使用隔离环境时,自己维护运行基础设施会变得复杂。于是又出现了Managed Agent,托管式 Agent。它通常指由云平台管理 Agent 的运行环境、任务状态、资源、文件和生命周期。开发者主要提交目标和工具,平台负责让任务持续运行、暂停、恢复和扩展。Anthropic 将 Managed Agents 描述为面向长周期 Agent 工作的托管服务,并强调把负责决策的“脑”与负责执行的环境解耦。这样,即使 Harness 不断升级,任务接口和运行环境仍然可以保持相对稳定。Managed Agent 与 Agent Runtime 关系很密切。可以理解为,Agent Runtime 是运行能力本身,而 Managed Agent 是平台把这些能力封装成了可以直接使用的托管服务。


Self-improving Agent:Agent 真的可以自己进化吗?

Self-improving Agent或Self-evolving Agent经常被翻译成自我改进或自我进化智能体。这个概念最容易被媒体夸大。它通常不是指 Agent 突然产生意识并重写自己,而是指系统根据历史任务轨迹和评估结果,改进提示词、工具描述、工作流程、Skill 或 Harness。例如,一个代码 Agent 经常在修改后忘记运行测试。系统可以通过分析失败记录,调整运行规则,要求以后每次修改都必须执行验证。也可以让 Agent生成多个方案,通过自动评分选择更好的结果。这种改进必须依赖明确的评价标准。没有测试、评分或者人工反馈,Agent 很难知道自己究竟变好了还是只是变得更复杂。目前这个方向很有潜力,但让 Agent 无限制地修改自己的运行规则风险很高。现实系统通常需要版本管理、回归测试和人工审批。


World Model:让 AI 不只理解语言,还能预测世界

大语言模型主要学习语言中的规律,而现实行动还需要理解空间、时间和物理后果。World Model,世界模型,试图学习环境如何变化,以及某个动作可能导致什么结果。它不仅回答“画面中有什么”,还需要预测“如果向前走、推动物体或改变方向,接下来可能发生什么”。Google DeepMind 的 Genie 系列就是世界模型方向的代表。Genie 3 可以根据文字生成可实时交互的环境,并被用于探索环境模拟和 Agent 训练。世界模型不仅服务于机器人。自动驾驶、游戏智能体、视频生成和虚拟环境训练,都可能使用类似思想。它与大语言模型的区别是:LLM 主要建模语言序列,World Model 更关注环境状态、动作和未来变化之间的关系。当然,未来系统可能把两者结合起来。


Embodied AI:让 Agent 进入物理世界

当 Agent 不只操作文件和网页,而是通过机器人、无人机或其他设备感知并改变现实环境时,就进入了Embodied AI,具身智能的范围。具身智能系统需要处理摄像头、声音、触觉和空间位置,还要控制机械动作,并理解动作对现实环境的影响。软件 Agent 点击错一个按钮还可以撤销,机器人抓取错误却可能损坏物品或伤害人。因此,具身智能对实时性、物理建模、控制精度和安全机制的要求远高于普通聊天 Agent。World Model 为系统提供对环境变化的预测,Embodied Agent 则真正拥有能够影响物理世界的“身体”。两者经常一起出现,但并不是同一个概念。


AGI、AI OS 和 AI Employee,哪些是技术,哪些更像愿景?

最后还有一类看起来更加宏大的词,例如AGI、AI OS、AI Employee、Agent Society 和 Autonomous Company。AGI(Artificial General Intelligence,通用人工智能)通常指能够在广泛任务上达到或超过人类通用认知能力的 AI。问题在于,行业并没有一个所有人都接受的严格标准。它更像一个长期目标,而不是某种可以直接安装的技术框架。AI OS通常表示一种以 AI 或 Agent 为核心的软件操作层。它可能负责理解用户目标、调用应用、管理工具和协调多个 Agent。但目前 AI OS 没有像 Windows、Linux 那样统一的技术定义,很多时候是产品架构和品牌定位。AI Employee强调 AI 能够承担某个岗位中的持续工作,例如客服、销售分析、程序开发或财务审核。它描述的是产品角色,而不是一种独立的模型技术。Agent Society、Autonomous Company则更接近愿景:大量 Agent 像组织成员一样分工协作,甚至让企业流程高度自动运行。这个方向并非完全没有技术基础,但距离真正稳定、无人监督的自治组织还有很长距离。


总结

AI 圈的新词确实很多,但它们大多不是凭空产生的。每一个概念背后,通常都对应上一阶段没有解决好的问题。Prompt 不够用了,于是出现 Context Engineering;模型只能说不能做,于是出现 Tool Use 和 Agent;Agent 跑不稳,于是大家开始研究 Harness 和 Runtime;单个 Agent 需要连接更多工具和其他 Agent,于是出现 MCP 与 A2A;任务越来越长,又推动了 Long-horizon Agent、检查点和持久化运行环境。


Maple
Maple
© 2025 by Maplezz 本文基于 CC BY-NC-SA 4.0 许可 CC 协议 必须注明创作者 仅允许将作品用于非商业用途 改编作品必须遵循相同条款进行共享 最后更新:2026/8/10