4.7 Agent实战

预计学习时间:120分钟

本节挂在第 4 章 · 智能体下。前面 4.1–4.6 是提示词、RAG、编排与选型;这里做 benchmark、框架、微调与演进。

先讲故事

Agent 要的不是多写几句更长的提示词。它要的是:模型在环境里行动——感知状态,选择动作,调用工具或关节,根据反馈再试。这个想法比深度学习老得多;深度学习只是把它又一次推到台前。

符号时代的「行动者」

纽厄尔与西蒙的逻辑理论家、通用问题解决器,早就在问:智能是否等于在状态空间里搜索。规则清楚的世界里,搜索与启发可以走得很远。开放的语言与物理世界,却把状态空间撑到搜不完——于是故事暂停,换了一间屋子。

棋盘上的显微镜

2016 年首尔,AlphaGo 对李世石。策略网络提议,价值网络评价,蒙特卡洛树搜索把两者接进对局。哈萨比斯反复说:游戏是显微镜——规则清楚、分数清楚,才能看见「行动着的智能」哪一步变强了。大卫·西尔弗等人把深度网络与搜索焊在一起;第四局的「神之一手」提醒观众:人机都还在场。时刻四 · DeepMind

同一套「策略 + 试错 + 反馈」的直觉,后来走进对话后的工具调用,也走进机器人里的 VLA——只是环境从棋盘换成了 API 与桌面。

对话框之后:Agent 变成产品词

2022 年门打开之后,用户不只想要一段回答,还想要「帮我查、帮我跑、帮我下单」。Shunyu Yao 等人的 ReAct 把推理轨迹与行动交错写出;Timo Schick 等人的 Toolformer 让模型自学何时呼叫工具。LangChain、各家 workflow,把这些论文直觉收成可编排的图。时刻六 · 群像突破

本章 benchmark、框架、微调与演进,读的是软件世界里的 Agent:返回值大体是 JSON 与网页。它已经很难;但还不是故事的尽头。

缝还开着:具身

当动作变成关节角与夹爪,数据比网页小几个数量级,接触在毫米里失败——RT-2、π0、GR00T 是认真的尝试,泛化控制仍未解决。那一页在延展最后,不在本章假装已经交付。具身智能

读完故事再进本章

先把软件 Agent 跑通,再决定要不要走进物理世界的缝。人名与论文钉在群像表;主线人物钉在史诗。

Agent是具备自主性、反应性、主动性和交互性的智能程序实体,能在环境中自主执行任务或与用户交互。

基本概念

核心定义与特征

  • 自主性:独立完成预设目标(如自动调度任务、资源管理)
  • 反应性:实时感知环境变化并响应(如客服机器人识别用户情绪)
  • 主动性:主动发起交互或任务(如智能助手提醒日程)
  • 交互性:支持多模态交互(自然语言、API调用等)

技术分类

  1. 反应式Agent:

    • 基于规则引擎和预定义行为
    • 适用于结构化场景(如简单问答系统)
    • 可预测性高,但灵活性有限
  2. 认知型Agent:

    • 集成知识库与推理引擎
    • 能处理复杂查询(如医疗诊断系统)
    • 具备初步理解与推理能力
  3. 混合型Agent:

    • 结合深度学习与符号推理
    • 支持多模态交互(如智能助手系统)
    • 具备适应性学习能力

Agent架构图示

应用场景

领域典型案例核心价值
教育领域个性化学习辅导Agent一对一智能教学,自适应学习
金融理财投资组合管理Agent实时数据分析与策略推荐
工业制造设备故障诊断Agent预测性维护,减少停机时间
生活助手智能家居控制Agent场景化联动控制(如语音控制家电)
科研辅助文献检索与数据分析Agent加速科研数据处理与知识发现

Agent工作原理

现代Agent系统通常结合大语言模型(LLM)作为核心推理引擎,通过工具使用能力扩展其交互边界。

典型工作流程

  1. 输入理解:解析用户指令或环境信号
  2. 任务规划:将复杂任务分解为子任务序列
  3. 工具选择:根据任务需求选择合适的外部工具
  4. 执行动作:调用API、执行命令或生成响应
  5. 结果评估:分析执行结果,调整后续策略
# Agent执行流程伪代码
def agent_workflow(user_input):
    # 1. 理解输入
    task = parse_user_input(user_input)
    
    # 2. 任务规划
    subtasks = plan_execution(task)
    
    # 3. 循环执行子任务
    results = []
    for subtask in subtasks:
        # 选择工具
        tool = select_tool(subtask)
        
        # 执行动作
        result = tool.execute(subtask)
        results.append(result)
        
        # 评估结果决定是否继续
        if needs_replanning(result):
            return agent_workflow(refine_task(task, results))
    
    # 4. 整合结果返回
    return synthesize_results(results)

ReAct推理模式

ReAct (Reasoning + Action) 是现代Agent的主流思维框架,结合:

  • 显式推理步骤(思考)
  • 外部环境交互(行动)
  • 观察结果(反馈)

ReAct推理流程

Agent与传统系统对比

特性传统应用系统Agent系统
交互方式菜单/表单驱动自然语言/多模态
处理复杂性预定义流程自适应解决问题
自主程度被动响应主动推理与行动
学习能力固定逻辑可通过反馈优化
工具使用固定集成动态选择与组合

本章内容

在本章中,我们将深入探讨:

  1. Agent开发框架与工具:对比LangChain、AutoGPT、OpenCode等主流框架
  2. Tool Use 演进与模型调优:从 Function Calling 到现代 Tool Use、MCP 及分模型调优策略
  3. 实战案例:构建智能客服Agent,实现商品查询与订单追踪
  4. 评估与优化:Agent性能测试方法与常见优化技巧
  5. Agent持续演进:不训练模型,通过记忆与技能沉淀让 Agent 越用越好
  6. Agent微调(Agentic RL):通过强化学习优化 Agent 多轮决策轨迹

随着大语言模型能力的增强,Agent技术正迅速发展,成为构建新一代智能应用的关键范式。

下一节,我们将首先了解如何准备 Agent 开发的 benchmark 测试基准。完成框架选型后,可通过 Agent持续演进 学习无训练改进方案,或通过 Agent微调 学习 Agentic RL 后训练。