1 先判断任务与边界 先决定要不要用 Agent,再把目标、责任和控制权写清。 20 什么时候需要 Agent 核心 Agent 适合什么任务 什么时候用普通代码 Workflow 和 Agent 怎样配合 怎样确定自主程度 为什么默认从单 Agent 开始 把目标写成可验收任务 核心 目标和完成证据 成功、失败和停止条件 子任务和依赖关系 时间、Token 和成本预算 中间产物和最终交付 划清模型、运行时和环境 核心 模型负责做什么 Harness 负责做什么 环境负责做什么 用户保留什么控制权 开放世界和封闭世界 建立 LLM 应用直觉 核心 Token 和上下文窗口 消息角色和指令优先级 采样和非确定性 幻觉、拒答和过度思考 能力和版本漂移
2 让模型看到对的信息 选对模型,只把当前步骤真正需要的信息交给它。 22 选择模型和路由请求 核心 按任务选择模型 主模型和降级模型 能力探测和注册 版本固定和漂移监测 模型网关 路由、缓存和批处理 写出可执行的 Prompt 核心 角色、目标和限制 好示例和边界示例 指令冲突怎么处理 Prompt 的组件和版本 Prompt 回归测试 组装和压缩上下文 核心 上下文从哪里来 上下文工程 信息怎样排序 截断、摘要和递归压缩 长任务的状态栏 工具结果怎样进入上下文 约束模型输入和输出 核心 JSON Schema Function Calling 结构校验和修复 自然语言和机器结果分开 不确定性和证据要求
3 给 Agent 知识、记忆和状态 让知识有来源,让记忆可纠正,让运行能够恢复。 25 把资料变成可检索知识 核心 采集、解析和清洗 分块和层级 元数据和来源 增量更新和删除传播 Embedding 版本迁移 找到足够好的证据 核心 关键词检索和向量检索 查询改写和拆分 元数据和权限过滤 Reranker 和多样性 无结果和停止检索 用证据生成回答 核心 证据排序和 Context Packing 引用和原文定位 有据回答和拒答 区分检索失败和生成失败 评估召回和忠实度 设计可以纠正的记忆 核心 Agent Memory 记忆的主体和作用域 什么值得写入 冲突、更新和遗忘 记忆污染 保存运行状态和产物 核心 Session、Task 和 Run Step、Action 和 Observation Artifact Checkpoint 和 Snapshot 状态所有权和并发版本
4 让 Agent 安全地动手 用清楚的契约连接外部能力,并管住真实副作用。 27 认识不同类型的工具 核心 感知工具 执行工具 协作和沟通工具 事件触发工具 同步和异步工具 写清 Tool 契约 核心 用途和禁用条件 Tool Calling 与 Tool 契约 错误分类 副作用和幂等标注 版本和兼容性 让副作用可恢复 核心 幂等键 超时后的状态确认 异步任务句柄 可撤销与不可撤销动作 并发冲突和资源锁 Dry-run 和执行确认 理解 MCP 和 Skill 场景 MCP Host、Client 和 Server Tool、Resource 和 Prompt 会话和能力协商 OAuth、Scope 和凭据托管 Skill 的组成 什么时候不用 MCP 使用代码和计算机环境 场景 Shell、REPL 和 Notebook 文件编辑和补丁 代码作为推理工具 浏览器和桌面操作 沙箱、快照和回滚
5 把循环做成可恢复的运行 把模型循环变成可以暂停、恢复和长期执行的系统。 26 建立显式执行循环 核心 观察、判断、行动和验证 运行状态机 完成和终止 循环和无进展检测 暂停、继续和取消 选择合适的工作流模式 核心 Prompt Chaining Routing Parallelization Orchestrator Workers Evaluator Optimizer 规划、验证和修复 核心 任务分解和计划 动态重规划 规则、程序和模型验证 修复范围 什么时候停止 Agent Loop 让长任务跨进程继续 核心 同步请求和异步任务 Checkpoint 和 Durable Execution Webhook、队列和定时器 人工审批和恢复 心跳、租约和孤儿任务 失败事件和人工处置 隔离框架和业务架构 核心 领域模型和统一术语 确定性核心和概率判断 框架无关接口 服务和事件边界 框架选型
6 用评测和 Trace 证明效果 用数据和运行轨迹证明改动真的让系统变好了。 21 决定评什么 核心 Agent 评测 组件评测和端到端评测 固定环境和真实环境 单步、会话和长时程任务 质量、安全、成本和体验 建立评测数据和 Grader 核心 真实失败和黄金样本 正常、边界和对抗数据 Golden Output 和 Golden Trajectory 规则 Grader 和模型 Grader Pass@k 和连续可靠性 样本量和置信区间 用 Trace 定位首个错误 核心 Trace、Log、Metric 和 Artifact 关联标识和版本 首错归因 重放和单步重跑 采样和脱敏 把评测接进发布和改进 核心 回归门禁 成对比较和消融 Shadow 和 Canary 生产失败回流 改 Prompt、代码还是模型
7 把安全和授权放在模型外面 把权限、审批、隐私和防护放在模型之外。 20 识别威胁和注入路径 核心 资产、主体和信任边界 直接和间接 Prompt Injection Confused Deputy 数据外泄路径 威胁模型和滥用案例 绑定身份和最小权限 核心 用户身份和代理身份 默认拒绝和 Allowlist 任务级临时授权 每个 Tool 的 Scope 多租户权限校验 设计审批和 Guardrail 核心 哪些动作必须审批 审批时展示什么 Pause、Resume 和 Revoke Policy Engine 沙箱和资源限制 保护隐私并准备事故处理 核心 数据最小化和目的限定 凭据隔离和脱敏 保留、导出和删除 审计记录 事故响应和恢复验证
8 部署成可运营的服务 把 Agent 部署成能扩展、能回滚、有人值守的服务。 21 组织服务和存储 核心 Gateway、Agent Service 和 Worker Queue 和 Scheduler State、Artifact 和 Trace Store 控制面和执行面 同步和异步执行边界 处理故障和流量增长 核心 超时和重试预算 熔断、隔离和降级 限流、背压和公平调度 容量和队列积压 故障恢复演练 隔离租户并控制成本 核心 租户命名空间和数据隔离 资源配额 成本归因 预算预警和硬终止 成本与质量取舍 管理配置、发布和运行保障 核心 配置和版本登记 Feature Flag 和 Canary 回滚和兼容性 生产评测与运行指标 告警、值班和 Runbook 依赖适配和迁移能力
9 设计交互、协作和进阶能力 设计人能理解的界面,再按需要加入实时、多 Agent 和后训练。 27 设计看得懂的 Agent 界面 场景 Chat、Artifact 和 Canvas 展示状态和进度 展示工具动作和证据 取消、撤销和恢复入口 异步通知 安排人机协作点 场景 缺信息时追问 编辑后批准 Human in the Loop Human on the Loop 人工接管和交还 处理多模态和实时交互 场景 语音处理流程 打断和全双工 Computer Use 图像、视频和传感器 实时响应和深度推理 引入多 Agent 和 A2A 进阶 多 Agent 的启用条件 Supervisor 和 Worker 共享上下文和独立上下文 结构化消息和 Artifact 交接 A2A 和跨信任域 协作失败模式 理解后训练和持续进化 进阶 先改系统还是先改模型 SFT 和示范轨迹 偏好优化和奖励设计 Credit Assignment 从生产 Trace 到训练数据 持续进化的发布边界