AI Agent 全能工程师知识库

面向有一定 AI 与软件开发基础的开发人员。目标不是“会调用一个 Agent 框架”,而是能够从 0 到 1 设计、实现、评估、部署、治理并维护真实的大型 Agent / Multi-Agent 平台

当前仓库已经包含什么

这不是只有 Markdown 的知识库。当前仓库已经形成四层学习体系:

Layer 1|Knowledge
核心概念、原理、Pattern、Framework
        ↓
Layer 2|Practice
18 个可运行 Hands-on Labs
        ↓
Layer 3|Engineering
Golden Evals + Schemas + ADR + Reference Architecture + CI
        ↓
Layer 4|Production
Reference Platform Starter + Security + SRE + Platform Engineering

当前工程化资产包括:

  • 15 个知识领域:从模型、Context、Tool、RAG、Pattern、Multi-Agent 到 Runtime、Security、SRE、Platform;
  • 18 个实际 Lab:每个 Lab 都有代码和工程验收目标;
  • Golden Dataset / Security Red Team Dataset:用于 Output、Trajectory、Tool、安全回归;
  • GitHub Actions:自动执行 Lab 和 Reference Starter 测试;
  • Reference Agent Platform Starter:FastAPI Task API、Typed Contract、Dockerfile、PostgreSQL、Redis、API Test;
  • Reference Architecture:统一生产级 Agent 平台架构蓝图;
  • Schemas / ADR / Glossary / References:数据契约、架构决策、术语与官方资料。

注意:GitHub Actions Workflow 已经写入仓库,但是否通过应以仓库 Actions 页面中的实际 Check Run 为准;不要把“存在 CI 配置”与“当前 CI 已绿”混为一谈。

最终目标是完成从:

知道 → 会写 → 会设计 → 会测试 → 会排障 → 会上线 → 会治理

的完整能力闭环。

学完应具备的能力

完成本知识库后,应能够独立:

  • 根据业务复杂度选择 LLM、Workflow、Single Agent 或 Multi-Agent;
  • 设计 Prompt、Context、State、Session、Memory、Artifact 与 Structured Output;
  • 设计 Tool Calling、Function Calling、MCP Server、Skills 与工具权限;
  • 构建企业级 RAG、Agentic RAG、长期 Memory 与知识更新链路;
  • 实现 ReAct、Plan & Solve、ReWOO、LLMCompiler、Reflection、Reflexion、LATS、STORM 等模式;
  • 使用 LangGraph 等框架实现有状态、可恢复、可中断的复杂工作流;
  • 设计 Supervisor、Handoff、Debate、Voting、Swarm、Shared State 等 Multi-Agent 架构;
  • 理解 MCP、A2A、AG-UI 三类边界,实现 Tool、Agent、Frontend 的标准化互操作;
  • 构建 Agent Runtime / Harness、Sandbox、Shell、Filesystem、Browser / Computer Use 能力;
  • 设计 Agent Identity、Delegation、Tool Gateway、最小权限与 HITL;
  • 建立 Model Gateway、模型路由、Fallback、Quota 与成本治理;
  • 实现 Event-Driven / Proactive Agent、Queue、DLQ、Replay 和 Scheduler;
  • 建立 Evaluation、Scenario Simulation、Regression、Tracing、Logging 与 Observability;
  • 建立 SLI / SLO、Circuit Breaker、Degraded Mode、Runbook 与 Agent SRE;
  • 建设 Agent Registry、Release、Canary、Rollback 和 Control Plane;
  • 独立完成生产级 Coding、Research、Data、Browser、RAG 与 Multi-Agent 项目。

推荐学习顺序

模型能力 / Model Gateway
  ↓
Prompt / Context / State / Artifact
  ↓
Tool / MCP / Skills
  ↓
RAG / Memory
  ↓
Agent Loop / Workflow Pattern
  ↓
Multi-Agent / A2A
  ↓
LangGraph / Agent SDK
  ↓
Runtime / Harness / Sandbox
  ↓
AG-UI / Realtime / Multimodal
  ↓
Eval / Simulation / Observability
  ↓
Identity / Security / Governance
  ↓
Backend / Event Driven / SRE / DevOps
  ↓
Agent Platform Engineering
  ↓
18 Labs
  ↓
Reference Agent Platform
  ↓
生产级毕业项目

完整学习目录

00|能力地图与架构选型

  1. Agent 全能工程师能力地图与学习路线
  2. Agent 架构选型:从函数、Workflow 到 Multi-Agent

01|模型与推理基础

  1. LLM、Reasoning Model 与 Agent 所需模型能力
  2. 模型路由、Fallback、多模态与成本优化
  3. Model Gateway、Serving 与 Inference Infrastructure

02|Prompt、Context、State 与 Artifact

  1. Agent Prompt Engineering 与 Structured Output
  2. Context Engineering、State、Session 与 Compaction
  3. Agent Artifact、Evidence 与数据契约工程

03|Tool、MCP、Skills 与能力扩展

  1. Tool Calling 与 Function Calling 工程实践
  2. MCP:从 Tool 协议到生产级 Server
  3. Agent Skills、Capability Registry 与渐进式能力加载

04|RAG、Knowledge 与 Memory

  1. 企业级 RAG:从文档接入到可评估知识系统
  2. Agentic RAG 与高级检索架构
  3. Agent Memory Engineering:从会话历史到长期记忆

05|Agent Workflow 与设计模式

  1. Workflow Pattern:Prompt Chaining、Routing、Parallelization、MapReduce 与 Orchestrator-Workers
  2. ReAct、Plan & Solve、ReWOO 与 LLMCompiler
  3. Reflection、Evaluator-Optimizer 与 Reflexion
  4. Self-Discover、LATS、STORM 与高级推理 / Research Pattern

06|Multi-Agent 与分布式智能体

  1. Multi-Agent 架构设计与职责拆分
  2. Multi-Agent 协作模式:Supervisor、Handoff、Debate、Voting、Blackboard 与 Swarm
  3. A2A 与分布式 Agent:Agent-to-Agent 互操作

07|Agent Framework 与 LangGraph

  1. LangGraph 核心:State、Node、Edge 与 Graph Runtime
  2. LangGraph 高级工程:Persistence、Checkpoint、HITL、Streaming 与 Memory
  3. Agent Framework / SDK 选型与框架无关设计

08|Agent Runtime、Harness 与执行环境

  1. Agent Runtime、Runner 与 Harness
  2. Sandbox、Shell、Filesystem 与 Code Execution
  3. Browser Agent、Computer Use 与环境交互

09|Agent 交互、Realtime 与多模态

  1. Streaming、Realtime、Voice 与 Multimodal Agent
  2. Agent UX、任务进度、Artifact 与 Human Interaction
  3. AG-UI 与 Agent 前后端协议

10|Evaluation、Testing 与 Observability

  1. Agent Evaluation 与 Benchmark:从最终答案到执行轨迹
  2. Agent Testing、Regression 与 Red Team
  3. Agent Observability:Tracing、Logging、Metrics 与事件模型
  4. Agent Simulation、Scenario Test 与 Environment Eval

11|Security、Identity 与 Governance

  1. Agent 安全威胁:从 Prompt Injection 到 Rogue Agent
  2. Agent 权限、Identity、Guardrails 与 Human-in-the-Loop
  3. Agent Governance、Audit、数据安全与供应链治理
  4. Agent Identity、Delegation 与 Authorization

12|Production Engineering、Event 与 SRE

  1. Agent Backend:长任务、Queue、Checkpoint 与任务状态机
  2. Agent 性能工程:并发、缓存、预算、模型路由与成本
  3. Agent Deployment、CI/CD 与 Agent DevOps
  4. Event-Driven 与 Proactive Agent
  5. Agent SRE:Reliability Engineering 与故障治理

13|专项 Agent 与大型项目

  1. 专项 Agent 架构:Coding、Research、Data 与 Browser Agent
  2. 企业知识库 Agent:从 RAG Demo 到生产平台
  3. 毕业项目:生产级 Research + RAG + Data Multi-Agent 平台

14|Agent Platform Engineering

  1. Agent Platform:Control Plane 与 Data Plane
  2. Agent Registry、Versioning 与 Release Governance

工程实训与规范

18 个实训覆盖的工程链

01 Structured Output
 ↓
02 Tool Runtime
 ↓
03 MCP Server
 ↓
04 Enterprise RAG
 ↓
05 Agent Loop
 ↓
06 LangGraph HITL
 ↓
07 Agent Eval
 ↓
08 Model Gateway
 ↓
09 Agentic RAG
 ↓
10 Memory Engineering
 ↓
11 Multi-Agent + Typed Artifact
 ↓
12 Agent Identity / Delegation
 ↓
13 AG-UI Event Console
 ↓
14 Sandbox Coding Agent
 ↓
15 Security Red Team
 ↓
16 Event-Driven Agent
 ↓
17 Agent SRE
 ↓
18 Agent Platform / Canary / Rollback

完成后再进入 reference-architecture/starter/,把这些能力逐步装配到同一个 Agent Platform 中。

每篇知识文档的统一标准

  1. 概念与定位:解决什么问题;
  2. 专业名词通义:解释容易混淆的术语;
  3. 核心原理:内部机制与数据流;
  4. 架构 / 流程:图、Schema 或伪代码;
  5. 核心实现:接口、状态、数据契约和代码层设计;
  6. 工程落地:生产项目中的实现方式;
  7. 优势与限制:明确成本和边界;
  8. 故障与安全:失败时发生什么;
  9. 适用与不适用场景
  10. 常见反模式
  11. Lab / 实训建议
  12. 检查清单 / 验收标准

学习时始终问这 12 个问题

1. 它解决什么工程问题?
2. 谁控制下一步?
3. State 保存在哪里?
4. Context 如何构建与压缩?
5. 模块之间传递什么 Artifact / Schema?
6. Tool / Agent 的权限在哪里判断?
7. 失败如何 Retry / Fallback / Resume?
8. 如何测试 Output 和 Trajectory?
9. 如何 Trace?
10. 如何限制 Token / Step / Cost?
11. 如何部署、扩缩容和降级?
12. 出事故如何止损、回滚和复盘?

如果这些问题都能回答,换 Agent 框架或模型时迁移成本会很低。

一条最重要的工程原则

能用确定性代码解决的问题,不要交给 LLM;能用 Workflow 解决的问题,不要强行做自治 Agent;能用一个 Agent 解决的问题,不要为了“高级”拆成多个 Agent。

Agent 工程的目标不是最大化 Agent 数量或推理轮数,而是在 质量、可控性、延迟、成本、安全、可靠性、可观测性与可维护性 之间取得合理平衡。