AI Agent 全能工程师知识库
面向有一定 AI 与软件开发基础的开发人员。目标不是“会调用一个 Agent 框架”,而是能够从 0 到 1 设计、实现、评估、部署、治理并维护真实的大型 Agent / Multi-Agent 平台。
当前仓库已经包含什么
这不是只有 Markdown 的知识库。当前仓库已经形成四层学习体系:
Layer 1|Knowledge
核心概念、原理、Pattern、Framework
↓
Layer 2|Practice
18 个可运行 Hands-on Labs
↓
Layer 3|Engineering
Golden Evals + Schemas + ADR + Reference Architecture + CI
↓
Layer 4|Production
Reference Platform Starter + Security + SRE + Platform Engineering
当前工程化资产包括:
- 15 个知识领域:从模型、Context、Tool、RAG、Pattern、Multi-Agent 到 Runtime、Security、SRE、Platform;
- 18 个实际 Lab:每个 Lab 都有代码和工程验收目标;
- Golden Dataset / Security Red Team Dataset:用于 Output、Trajectory、Tool、安全回归;
- GitHub Actions:自动执行 Lab 和 Reference Starter 测试;
- Reference Agent Platform Starter:FastAPI Task API、Typed Contract、Dockerfile、PostgreSQL、Redis、API Test;
- Reference Architecture:统一生产级 Agent 平台架构蓝图;
- Schemas / ADR / Glossary / References:数据契约、架构决策、术语与官方资料。
注意:GitHub Actions Workflow 已经写入仓库,但是否通过应以仓库 Actions 页面中的实际 Check Run 为准;不要把“存在 CI 配置”与“当前 CI 已绿”混为一谈。
最终目标是完成从:
知道 → 会写 → 会设计 → 会测试 → 会排障 → 会上线 → 会治理
的完整能力闭环。
学完应具备的能力
完成本知识库后,应能够独立:
- 根据业务复杂度选择 LLM、Workflow、Single Agent 或 Multi-Agent;
- 设计 Prompt、Context、State、Session、Memory、Artifact 与 Structured Output;
- 设计 Tool Calling、Function Calling、MCP Server、Skills 与工具权限;
- 构建企业级 RAG、Agentic RAG、长期 Memory 与知识更新链路;
- 实现 ReAct、Plan & Solve、ReWOO、LLMCompiler、Reflection、Reflexion、LATS、STORM 等模式;
- 使用 LangGraph 等框架实现有状态、可恢复、可中断的复杂工作流;
- 设计 Supervisor、Handoff、Debate、Voting、Swarm、Shared State 等 Multi-Agent 架构;
- 理解 MCP、A2A、AG-UI 三类边界,实现 Tool、Agent、Frontend 的标准化互操作;
- 构建 Agent Runtime / Harness、Sandbox、Shell、Filesystem、Browser / Computer Use 能力;
- 设计 Agent Identity、Delegation、Tool Gateway、最小权限与 HITL;
- 建立 Model Gateway、模型路由、Fallback、Quota 与成本治理;
- 实现 Event-Driven / Proactive Agent、Queue、DLQ、Replay 和 Scheduler;
- 建立 Evaluation、Scenario Simulation、Regression、Tracing、Logging 与 Observability;
- 建立 SLI / SLO、Circuit Breaker、Degraded Mode、Runbook 与 Agent SRE;
- 建设 Agent Registry、Release、Canary、Rollback 和 Control Plane;
- 独立完成生产级 Coding、Research、Data、Browser、RAG 与 Multi-Agent 项目。
推荐学习顺序
模型能力 / Model Gateway
↓
Prompt / Context / State / Artifact
↓
Tool / MCP / Skills
↓
RAG / Memory
↓
Agent Loop / Workflow Pattern
↓
Multi-Agent / A2A
↓
LangGraph / Agent SDK
↓
Runtime / Harness / Sandbox
↓
AG-UI / Realtime / Multimodal
↓
Eval / Simulation / Observability
↓
Identity / Security / Governance
↓
Backend / Event Driven / SRE / DevOps
↓
Agent Platform Engineering
↓
18 Labs
↓
Reference Agent Platform
↓
生产级毕业项目
完整学习目录
00|能力地图与架构选型
01|模型与推理基础
- LLM、Reasoning Model 与 Agent 所需模型能力
- 模型路由、Fallback、多模态与成本优化
- Model Gateway、Serving 与 Inference Infrastructure
02|Prompt、Context、State 与 Artifact
- Agent Prompt Engineering 与 Structured Output
- Context Engineering、State、Session 与 Compaction
- Agent Artifact、Evidence 与数据契约工程
03|Tool、MCP、Skills 与能力扩展
- Tool Calling 与 Function Calling 工程实践
- MCP:从 Tool 协议到生产级 Server
- Agent Skills、Capability Registry 与渐进式能力加载
04|RAG、Knowledge 与 Memory
05|Agent Workflow 与设计模式
- Workflow Pattern:Prompt Chaining、Routing、Parallelization、MapReduce 与 Orchestrator-Workers
- ReAct、Plan & Solve、ReWOO 与 LLMCompiler
- Reflection、Evaluator-Optimizer 与 Reflexion
- Self-Discover、LATS、STORM 与高级推理 / Research Pattern
06|Multi-Agent 与分布式智能体
- Multi-Agent 架构设计与职责拆分
- Multi-Agent 协作模式:Supervisor、Handoff、Debate、Voting、Blackboard 与 Swarm
- A2A 与分布式 Agent:Agent-to-Agent 互操作
07|Agent Framework 与 LangGraph
- LangGraph 核心:State、Node、Edge 与 Graph Runtime
- LangGraph 高级工程:Persistence、Checkpoint、HITL、Streaming 与 Memory
- Agent Framework / SDK 选型与框架无关设计
08|Agent Runtime、Harness 与执行环境
- Agent Runtime、Runner 与 Harness
- Sandbox、Shell、Filesystem 与 Code Execution
- Browser Agent、Computer Use 与环境交互
09|Agent 交互、Realtime 与多模态
- Streaming、Realtime、Voice 与 Multimodal Agent
- Agent UX、任务进度、Artifact 与 Human Interaction
- AG-UI 与 Agent 前后端协议
10|Evaluation、Testing 与 Observability
- Agent Evaluation 与 Benchmark:从最终答案到执行轨迹
- Agent Testing、Regression 与 Red Team
- Agent Observability:Tracing、Logging、Metrics 与事件模型
- Agent Simulation、Scenario Test 与 Environment Eval
11|Security、Identity 与 Governance
- Agent 安全威胁:从 Prompt Injection 到 Rogue Agent
- Agent 权限、Identity、Guardrails 与 Human-in-the-Loop
- Agent Governance、Audit、数据安全与供应链治理
- Agent Identity、Delegation 与 Authorization
12|Production Engineering、Event 与 SRE
- Agent Backend:长任务、Queue、Checkpoint 与任务状态机
- Agent 性能工程:并发、缓存、预算、模型路由与成本
- Agent Deployment、CI/CD 与 Agent DevOps
- Event-Driven 与 Proactive Agent
- Agent SRE:Reliability Engineering 与故障治理
13|专项 Agent 与大型项目
- 专项 Agent 架构:Coding、Research、Data 与 Browser Agent
- 企业知识库 Agent:从 RAG Demo 到生产平台
- 毕业项目:生产级 Research + RAG + Data Multi-Agent 平台
14|Agent Platform Engineering
工程实训与规范
- Hands-on Labs:18 个已实现 Agent 工程实训
- Reference Agent Platform Starter:可启动工程脚手架
- Production Reference Architecture:生产架构蓝图
- Golden Evals
- Examples:最小可运行示例规划
- Shared Schemas:Task / Event / Artifact / Evidence 数据契约
- ADR:Architecture Decision Records
- Agent Engineering 专业名词速查
- 官方资料与继续学习索引
18 个实训覆盖的工程链
01 Structured Output
↓
02 Tool Runtime
↓
03 MCP Server
↓
04 Enterprise RAG
↓
05 Agent Loop
↓
06 LangGraph HITL
↓
07 Agent Eval
↓
08 Model Gateway
↓
09 Agentic RAG
↓
10 Memory Engineering
↓
11 Multi-Agent + Typed Artifact
↓
12 Agent Identity / Delegation
↓
13 AG-UI Event Console
↓
14 Sandbox Coding Agent
↓
15 Security Red Team
↓
16 Event-Driven Agent
↓
17 Agent SRE
↓
18 Agent Platform / Canary / Rollback
完成后再进入 reference-architecture/starter/,把这些能力逐步装配到同一个 Agent Platform 中。
每篇知识文档的统一标准
- 概念与定位:解决什么问题;
- 专业名词通义:解释容易混淆的术语;
- 核心原理:内部机制与数据流;
- 架构 / 流程:图、Schema 或伪代码;
- 核心实现:接口、状态、数据契约和代码层设计;
- 工程落地:生产项目中的实现方式;
- 优势与限制:明确成本和边界;
- 故障与安全:失败时发生什么;
- 适用与不适用场景;
- 常见反模式;
- Lab / 实训建议;
- 检查清单 / 验收标准。
学习时始终问这 12 个问题
1. 它解决什么工程问题?
2. 谁控制下一步?
3. State 保存在哪里?
4. Context 如何构建与压缩?
5. 模块之间传递什么 Artifact / Schema?
6. Tool / Agent 的权限在哪里判断?
7. 失败如何 Retry / Fallback / Resume?
8. 如何测试 Output 和 Trajectory?
9. 如何 Trace?
10. 如何限制 Token / Step / Cost?
11. 如何部署、扩缩容和降级?
12. 出事故如何止损、回滚和复盘?
如果这些问题都能回答,换 Agent 框架或模型时迁移成本会很低。
一条最重要的工程原则
能用确定性代码解决的问题,不要交给 LLM;能用 Workflow 解决的问题,不要强行做自治 Agent;能用一个 Agent 解决的问题,不要为了“高级”拆成多个 Agent。
Agent 工程的目标不是最大化 Agent 数量或推理轮数,而是在 质量、可控性、延迟、成本、安全、可靠性、可观测性与可维护性 之间取得合理平衡。
No comments yet
Be the first to share your take.