AI Agent 核心概念

一、核心思想

AI Agent 是一个能感知环境、做决策、执行动作的软件系统,核心公式为:

Agent = LLM + Planning(规划) + Memory(记忆) + Tools(工具)

它与普通聊天机器人的本质区别是:Agent 不只是“说”,而是在动态环境中持续观察、判断、执行,直到任务完成。


二、AI Agent 的演进阶段

阶段特点关键发展
2022年:对话时代模型只能基于已有知识回答Prompt Engineering 为主,只能“说”不能“做”
2023年中:工具时代模型可调用外部APIFunction Calling、RAG 出现,AutoGPT 等早期探索
2023年底:编排时代重视推理框架和多Agent协作ReAct 范式普及,Coze/Dify 等平台用 DAG 约束流程
2024年底:标准化时代协议和多模态变重要MCP 协议、Computer Use、AI编程工具快速发展
2025年:长任务时代Agent 成为可执行长流程的工作单元Agent Skills 机制出现,封装固定流程和校验规则
2026年:常驻时代更接近长期在线的数字工作单元Skills + Heartbeat(定时唤醒),Harness Engineering 受重视

分水岭:2023年中之前,AI基本只能“说”;之后开始逐渐能“做”。


三、Agent、传统编程、Workflow 的区别

类型控制方式适用场景
传统编程程序员写代码 → 执行结果逻辑固定、高频执行、高性能要求(如订单扣库存)
Workflow产品画流程图 → 执行结果流程清晰、步骤有限、需可视化管理(如审批流)
Agent用户说意图 → AI决策 → 动态执行步骤不确定、需理解意图、动态判断(如排查故障)

关键判断:执行路径能提前确定就用 Workflow,不能确定再用 Agent。


四、Agent 核心组件详解

1. Planning(推理与规划)

  • 用 LLM 分析任务状态、拆解目标、决定下一步。
  • 常用技术:Chain-of-Thought (CoT),让模型逐步推理。

2. Memory(记忆)

类型作用实现方式
短期记忆保持对话连续性上下文历史
长期记忆积累过去经验外部知识库(向量数据库、知识图谱)

3. Tools(工具)

  • 让 LLM 能操作外部世界(查数据、调API、读文件、执行代码)。
  • 关键闭环:工具执行后返回结果 → Agent 放入上下文 → 进入下一轮推理(Observation)。

4. Agent Loop(核心运行机制)

每一轮循环做三件事:

  1. LLM 推理:决定下一步(调用工具还是直接回复)。
  2. 执行工具:调用并捕获返回结果。
  3. 写回上下文:将观察结果追加到上下文,继续下一轮。
  • 安全兜底:设置最大迭代轮次(一般10-20轮)或 Token 阈值,防止死循环。

五、Tools 注册与调用标准

1. 数据格式:Function Calling Schema(OpenAI Schema)

  • JSON Schema描述工具的名称、用途、参数类型和必填字段。
  • 关键在description:要把使用场景和禁用场景讲清楚,直接影响模型是否调用及参数填充。
  • 示例(慢SQL查询工具):
{"type":"function","function":{"name":"query_slow_sql","description":"查指定微服务的慢SQL。服务响应慢时用。如果是网络问题,别调这个。","parameters":{"type":"object","properties":{"service_name":{"type":"string","description":"服务名"},"time_range":{"type":"string","description":"时间范围 HH:MM-HH:MM"}},"required":["service_name","time_range"]}}}