AI Engineering · Deep Dive

驾驭
AI Agent

从聪明到可靠
AI 工程第三次重心迁移深度解析 · 从 Prompt 到 Context 再到 Harness
徐佳冰
Speaker Profile
徐佳冰
互联网从业 17 年 服务实体行业数字化 11 年 数字经营与管理硕士
创业 / 职业背景
五分钟 联合创始人
闪店科技 CEO
万信科技 副总裁
君妍医美 COO
智糖无界 联合创始人
东方数谷商学院 高级合伙人
代表产品
开心农场(偷菜) — 3亿人玩过的社交游戏
绿豆蛙漂流岛 — 中国第一个 WEB2.0 卡通 Avatar
闪店新零售 SaaS — 线上线下闭环餐饮及零售 SaaS 系统
智糖无界 GlucoFreedom — 无酶电化学传感技术的唾液葡萄糖检测系统
Supersales丨灵感销策 — 一线销售 AI 实时销售助手,情绪科学赋能 Agent
CONTENTS
目 录
01
Chapter
认识 AI Agent
什么是 Agent、四大核心能力、组成架构
02
Chapter
从聪明到可靠
六代进化史、三大工程演进
03
Chapter
驾驭 AI Agent
Harness 六层架构深度拆解
04
Chapter
实战案例
顶尖公司与国内企业 Agent 应用实践
05
Chapter
设计原则
优秀 Agent 的五个核心法则
CHAPTER ONE
01
认识 AI Agent
从 "顾问" 到 "执行者",Agent 究竟是什么?
01 · 认识 AI Agent
Agent 的本质:从 "顾问" 到 "执行者"
ChatGPT
被动响应的工具
角色定位
顾问 / 建议者
交互模式
一问一答,被动响应
能力边界
基于训练数据生成与推理
VS
AI Agent
主动完成任务的执行者
角色定位
执行者 / 数字员工
交互模式
目标导向,主动规划与执行
能力边界
感知环境、调用工具、交付结果
核心结论 ChatGPT 是顾问,Agent 是执行者 —— Agent 不仅能理解任务,还能主动完成任务
01 · 认识 AI Agent
Agent 四大核心能力
感知 → 决策 → 执行 → 进化,形成完整闭环
01
Perceive
多模态信息输入
  • 处理文本、理解图片、识别语音、解析视频
  • 读取网页、数据库、传感器数据
  • 进化:文本 → 多模态 → 全模态融合
02
Decide
深度推理与规划
  • 任务拆解为可执行步骤序列
  • 动态权衡多维变量,生成最优方案
  • 技术:CoT · ReAct · O 系列 / R1
03
Act
调用工具与环境交互
  • 查询 API、操作浏览器、发送邮件
  • 控制机器人、操作数据库、调用办公软件
  • 技术:MCP · Computer Use
04
Evolve
持续学习与优化
  • 自我反思:Reflection 评估执行结果
  • 强化学习:KPI 驱动策略优化
  • 记忆:工作 · 短期 · 长期
01 · 认识 AI Agent
Agent 的组成:从大脑到四肢
将四大能力拆解为可工程化的模块化结构
Agent = 大模型 + Memory + Tools + Planning + Action
Agent
Memory
Short-term Long-term
Tools
Calendar() Calculator() Search() CodeInt() …more
Planning
Reflection Self-critics CoT Subgoal
Action
API Browser Database Office
Agent 通过 Memory 存储经验、通过 Tools 扩展能力、通过 Planning 制定策略、通过 Action 完成执行
CHAPTER TWO
02
从聪明到可靠
AI 工程的三次重心迁移
02 · 从聪明到可靠
六代进化史:从被动到自治
AI 正在完成从 "会说话" 到 "能干活" 的关键一跃
0
被动响应
2022 年底
ChatGPT 为代表,一问一答
1
工具觉醒
2023 年中
Function Calling,AutoGPT
2
工程化编排
2023 年底
ReAct 框架,Coze / Dify
3
标准化多模态
2024 年底
MCP 协议,Cursor
4
常驻自治
2025 年底
Heartbeat,24h 数字实体
5
未来
具身智能、闭环系统、自治 Agent 集群
关键洞察

AI 正在完成从 "会说话" 到 "能干活" 的关键一跃

从 0 代的被动响应到 4 代的常驻自治,每一次跃升都标志着 AI 向 "可靠执行者" 更近一步。

02 · 从聪明到可靠
三大工程演进:Prompt → Context → Harness
决定 Agent 能否稳定交付的,从来不是模型本身
Stage 01
Prompt Engineering
让模型听懂你
  • 通过设计输入语言塑造局部概率空间
  • 本质:让模型猜得更准,而非更聪明
  • 角色设定、示例、约束都是 Prompt 技巧
局限:无法弥补信息缺失,无法处理复杂任务链路
Stage 02
Context Engineering
让模型看到该看的信息
  • 召回:从大量信息中召回最相关的内容
  • 压缩:把长文档压缩成摘要和关键点
  • 组装:按特定顺序组装进上下文
局限:无法阻止 Agent "做不该做的事",依然会失控
Stage 03
Harness Engineering
让模型稳定可靠地做事
  • 六层架构:上下文 → 工具 → 编排 → 记忆 → 评估 → 恢复
  • 检查清单 + 汇报机制 + 阶段验收 + 错误回滚
  • 真正决定系统能否稳定跑起来的,是 Harness
AI Agent = 大模型 + Harness
类比

Prompt = 给实习生布置任务  |  Context = 准备好参考资料  |  Harness = 完整的管理制度与质检流程

CHAPTER THREE
03
驾驭 AI Agent
Harness 工程 —— 六层架构深度拆解
03 · 驾驭 AI Agent
Harness 六层架构全景
Agent = Model + Harness | 除了模型本身,所有决定 Agent 能否稳定交付的都属于 Harness
L1
结构化上下文管理
明确角色、目标、成功标准,过滤无关信息
L2
工具系统设计
给什么工具、何时调用、结果如何反馈
L3
执行编排引擎
理解目标 → 找缺口 → 调工具 → 出结果 → 检查达标
L4
状态与记忆管理
区分当前任务进度、中间产物和长期记忆
L5
独立评估与观测
检查输出是否符合规则,统计错误,量化成功率
L6
约束校验与恢复
定义边界条件、关键节点校验、失败恢复策略
核心洞察

模型 = CPU(负责计算) | Harness = 操作系统(负责调度、内存、IO、约束、恢复、反馈)

03 · 驾驭 AI Agent
底层三驾马车:上下文 · 工具 · 编排
Harness 的前 L1–L3 —— 决定 Agent 是 "工程师" 还是 "实习生"
L1
上下文管理
  • 明确角色、目标、成功标准
  • 过滤无关信息,按层次组织
避免:上下文混乱让模型忘记约束
L2
工具系统
  • 给什么工具?何时调用?
  • 结果如何精炼反馈?
避免:50 条原文直接塞给模型
L3
执行编排
  • 理解目标 → 找信息缺口
  • 调工具 → 出结果 → 检查达标
决定 Agent 是工程师还是实习生
Agent 工作闭环
思考 执行 反馈 再思考

支撑这个闭环稳定运行的,不是模型本身,而是外面的 Harness

03 · 驾驭 AI Agent
上层三驾马车:记忆 · 评估 · 恢复
Harness 的 L4–L6 —— 把失败从例外变为常态
L4
状态与记忆
  • 当前任务进度
  • 会话中间产物
  • 长期偏好与规则
避免:每轮都像失忆
L5
评估与观测
  • 输出是否符合规则
  • 执行日志与错误统计
  • 任务成功率量化
没有评估 = 自我感觉良好
L6
约束与恢复
  • 哪些事绝对不能做
  • 关键节点必须验收
  • 失败:回滚 / 重试 / 换方案
将失败从例外变为常态
关键洞察

越来越多顶尖团队开始把重点从调提示词和换模型,转向重构整套执行骨架(Harness)。

因为决定 Agent 能否稳定交付的,从来不是模型本身

CHAPTER FOUR
04
实战案例
Agent 创造价值的真实故事
04 · 实战案例
Anthropic:GAN 式三智能体架构
用 "生产 + 验收" 分离解决自评失真
问题一 · 上下文焦虑(Context Reset)
  • Sonnet 上下文快填满时变得犹豫、提前收工
  • 仅靠压缩不够,最终解法:重启进程
  • 提取任务状态 → 启动全新 Agent → 结构化交接
  • 类比:内存泄漏时直接重启,从检查点恢复
问题二 · 自评失真
  • Agent 自信满满,实际质量一般
  • 解法:生产与验收分离
  • Generator 生成结果 + Evaluator 独立验证
  • 借鉴软件 QA 原则,形成生成-检查-修复循环
GAN 式三智能体架构
Planner
规划者
Generator
执行者
Evaluator
评估者
生成 — 检查 — 修复 循环
来源:Anthropic Engineering Blog · 2024
04 · 实战案例
OpenAI:渐进式披露与自动治理
工程师角色转变:人类设计环境,不写代码
"写代码的人" 变成 "设计 AI 工作环境的人" —— 知识管理的结构化比超长 System Prompt 更有效
渐进式披露:AGENTS.md 变革
Before

巨大文件,规范 + 架构 + 约定全塞入

上下文窗口塞太满 = 什么都没说

After

目录页(~100 行) + 子文档按需加载

信息读取准确率提升 40%+

自动治理系统
  • 资深工程师经验固化为系统规则
  • 构建可持续运行的自动治理系统
  • 为 Agent 配备完整验证环境(浏览器、日志系统)
  • 自主完成编码-验证-修复的闭环
  • 从 "超级 System Prompt" 走向目录 + 分层文档的结构化知识管理
来源:OpenAI Engineering Blog · 2024
04 · 实战案例
国内企业 Agent 应用案例
从概念验证到价值创造,Agent 成为企业降本增效的核心引擎
容联七陌
银行客服质检 Agent
80%
处理效率提升
60%
人力成本降低
来源:沙丘社区 2024 TOP20 AI Agent 最佳案例
数势科技
书亦烧仙草数据分析 Agent
· 业务部门自助取数,无需等待开发团队
· 统一指标平台确保数据看板一致性
自助化
业务部门满意度显著提升
来源:书亦烧仙草 CIO 王世飞
实在智能
山东高速智能数字员工
4822 h
每月节省工时
300 万
年用工成本节省
来源:中国信通院智能体应用优秀案例
洞察Agent 正在从 "概念验证" 走向 "价值创造",成为企业降本增效的核心引擎
CHAPTER FIVE
05
设计原则
优秀 Agent 的五个核心法则
05 · 设计原则
五个核心原则:从目标到进化
把 Agent 从 "能跑" 推到 "好用" 的五条工程准则
01
目标导向
  • 每个 Agent 有清晰目标
  • 先跑通再优化
  • 不做万能 Agent
02
模块化设计
  • 感知 / 认知 / 执行 / 记忆
  • 模块独立接口明确
  • 灵活替换与升级
03
人机协作
  • 透明可控可纠正
  • 关键决策人工确认
  • 渐进式自动化
04
安全护栏
  • 最小权限原则
  • 沙箱隔离执行
  • 警惕记忆投毒
05
持续进化
  • KPI 驱动优化
  • 强化学习反馈
  • 经验沉淀复用
落地细则
目标导向专注具体痛点,从简单目标开始,先跑通再优化
模块化设计职责清晰、降低耦合,API 变化只改执行层映射
人机协作置信度低时转人工,渐进自动化让用户有掌控感
安全护栏Docker / WASM 沙箱,高危操作审批,防御记忆投毒
持续进化设定 KPI 指标,任务后全局复盘,经验升华为战略记忆
FINAL WORD

驾驭 AI Agent
从聪明到可靠

决定你能不能做出 Demo 的,是模型

决定你能不能做成 产品 的,是 Harness

从让模型看起来聪明,到让模型真正稳定地工作
感谢观看 | 从 Demo 走向产品

感谢观看

THANK YOU FOR WATCHING
驾驭 AI Agent · 从聪明到可靠
← / → · space