4.7 Agent实战
预计学习时间:120分钟
本节挂在第 4 章 · 智能体下。前面 4.1–4.6 是提示词、RAG、编排与选型;这里做 benchmark、框架、微调与演进。
先讲故事
Agent 要的不是多写几句更长的提示词。它要的是:模型在环境里行动——感知状态,选择动作,调用工具或关节,根据反馈再试。这个想法比深度学习老得多;深度学习只是把它又一次推到台前。
符号时代的「行动者」
纽厄尔与西蒙的逻辑理论家、通用问题解决器,早就在问:智能是否等于在状态空间里搜索。规则清楚的世界里,搜索与启发可以走得很远。开放的语言与物理世界,却把状态空间撑到搜不完——于是故事暂停,换了一间屋子。
棋盘上的显微镜
2016 年首尔,AlphaGo 对李世石。策略网络提议,价值网络评价,蒙特卡洛树搜索把两者接进对局。哈萨比斯反复说:游戏是显微镜——规则清楚、分数清楚,才能看见「行动着的智能」哪一步变强了。大卫·西尔弗等人把深度网络与搜索焊在一起;第四局的「神之一手」提醒观众:人机都还在场。时刻四 · DeepMind
同一套「策略 + 试错 + 反馈」的直觉,后来走进对话后的工具调用,也走进机器人里的 VLA——只是环境从棋盘换成了 API 与桌面。
对话框之后:Agent 变成产品词
2022 年门打开之后,用户不只想要一段回答,还想要「帮我查、帮我跑、帮我下单」。Shunyu Yao 等人的 ReAct 把推理轨迹与行动交错写出;Timo Schick 等人的 Toolformer 让模型自学何时呼叫工具。LangChain、各家 workflow,把这些论文直觉收成可编排的图。时刻六 · 群像突破
本章 benchmark、框架、微调与演进,读的是软件世界里的 Agent:返回值大体是 JSON 与网页。它已经很难;但还不是故事的尽头。
缝还开着:具身
当动作变成关节角与夹爪,数据比网页小几个数量级,接触在毫米里失败——RT-2、π0、GR00T 是认真的尝试,泛化控制仍未解决。那一页在延展最后,不在本章假装已经交付。具身智能
读完故事再进本章
先把软件 Agent 跑通,再决定要不要走进物理世界的缝。人名与论文钉在群像表;主线人物钉在史诗。
Agent是具备自主性、反应性、主动性和交互性的智能程序实体,能在环境中自主执行任务或与用户交互。
基本概念
核心定义与特征
- 自主性:独立完成预设目标(如自动调度任务、资源管理)
- 反应性:实时感知环境变化并响应(如客服机器人识别用户情绪)
- 主动性:主动发起交互或任务(如智能助手提醒日程)
- 交互性:支持多模态交互(自然语言、API调用等)
技术分类
-
反应式Agent:
- 基于规则引擎和预定义行为
- 适用于结构化场景(如简单问答系统)
- 可预测性高,但灵活性有限
-
认知型Agent:
- 集成知识库与推理引擎
- 能处理复杂查询(如医疗诊断系统)
- 具备初步理解与推理能力
-
混合型Agent:
- 结合深度学习与符号推理
- 支持多模态交互(如智能助手系统)
- 具备适应性学习能力
.png)
应用场景
| 领域 | 典型案例 | 核心价值 |
|---|---|---|
| 教育领域 | 个性化学习辅导Agent | 一对一智能教学,自适应学习 |
| 金融理财 | 投资组合管理Agent | 实时数据分析与策略推荐 |
| 工业制造 | 设备故障诊断Agent | 预测性维护,减少停机时间 |
| 生活助手 | 智能家居控制Agent | 场景化联动控制(如语音控制家电) |
| 科研辅助 | 文献检索与数据分析Agent | 加速科研数据处理与知识发现 |
Agent工作原理
现代Agent系统通常结合大语言模型(LLM)作为核心推理引擎,通过工具使用能力扩展其交互边界。
典型工作流程
- 输入理解:解析用户指令或环境信号
- 任务规划:将复杂任务分解为子任务序列
- 工具选择:根据任务需求选择合适的外部工具
- 执行动作:调用API、执行命令或生成响应
- 结果评估:分析执行结果,调整后续策略
# Agent执行流程伪代码
def agent_workflow(user_input):
# 1. 理解输入
task = parse_user_input(user_input)
# 2. 任务规划
subtasks = plan_execution(task)
# 3. 循环执行子任务
results = []
for subtask in subtasks:
# 选择工具
tool = select_tool(subtask)
# 执行动作
result = tool.execute(subtask)
results.append(result)
# 评估结果决定是否继续
if needs_replanning(result):
return agent_workflow(refine_task(task, results))
# 4. 整合结果返回
return synthesize_results(results)
ReAct推理模式
ReAct (Reasoning + Action) 是现代Agent的主流思维框架,结合:
- 显式推理步骤(思考)
- 外部环境交互(行动)
- 观察结果(反馈)
.png)
Agent与传统系统对比
| 特性 | 传统应用系统 | Agent系统 |
|---|---|---|
| 交互方式 | 菜单/表单驱动 | 自然语言/多模态 |
| 处理复杂性 | 预定义流程 | 自适应解决问题 |
| 自主程度 | 被动响应 | 主动推理与行动 |
| 学习能力 | 固定逻辑 | 可通过反馈优化 |
| 工具使用 | 固定集成 | 动态选择与组合 |
本章内容
在本章中,我们将深入探讨:
- Agent开发框架与工具:对比LangChain、AutoGPT、OpenCode等主流框架
- Tool Use 演进与模型调优:从 Function Calling 到现代 Tool Use、MCP 及分模型调优策略
- 实战案例:构建智能客服Agent,实现商品查询与订单追踪
- 评估与优化:Agent性能测试方法与常见优化技巧
- Agent持续演进:不训练模型,通过记忆与技能沉淀让 Agent 越用越好
- Agent微调(Agentic RL):通过强化学习优化 Agent 多轮决策轨迹
随着大语言模型能力的增强,Agent技术正迅速发展,成为构建新一代智能应用的关键范式。
下一节,我们将首先了解如何准备 Agent 开发的 benchmark 测试基准。完成框架选型后,可通过 Agent持续演进 学习无训练改进方案,或通过 Agent微调 学习 Agentic RL 后训练。