
Agent与大模型学习路线整理
原文自(Alex www.ragnote.top)https://www.ragnote.top/article/6a3f62a5495a4375afcf8743d8d18552
这里作为自己学习的笔记导读加深下印象。
本文作为大纲目录,总结一下 agent 大模型开发的学习路线、基础概念,建立完整知识认知框架,方便后续学习、整理归纳与实践落地。
第一部分:基础概念
1-1. LLM 大语言模型与 Agent 基础概念
个人拙见,大语言模型本质是概率文本生成。依靠预训练、海量数据清洗,搭配SFT、RLHF/DPO对齐优化,尽可能实现“答及所问”。但不论如何训练进化,模型本身不存在真正的感知、感情与情绪;即便输出内容专业严谨,也只是学习海量文本后拟合生成的结果。它能够结合语境组织文字,并不真正理解自己“说的是什么”。
作为生产力工具,LLM带来巨大行业变革,可以释放大量重复劳动。AI基础使用门槛极低,仅通过对话即可交互;但想要熟练驾驭、搭建稳定可用的AI应用,需要掌握底层基础原理、能力边界与固有缺陷。
LLM ≠ 向量检索
LLM:学习语言概率分布,生成、总结、组合全新文本,存在幻觉问题
向量检索:基于已有知识库,查找已经存在的相似内容
RAG = LLM + 向量检索,二者互补,解决大模型知识滞后、私有知识缺失问题
Transformer 架构
现代主流LLM的技术基石,核心创新为**自注意力机制(Self-Attention)**,赋予模型理解上下文关联的能力。
学习不需要深入数学推导,重点掌握输入输出流程、注意力作用、编码器 / 解码器结构区别。
参考资料:
-
图解 Transformer(The Illustrated Transformer)(英文,强烈推荐):图文通俗讲解 Transformer 完整工作流程
-
3Blue1Brown:Transformer 工作原理动画展示(中文翻译)
LLM 推理与调用
业务开发场景下,绝大多数情况通过 API 远程调用大模型。核心基础参数与概念:
-
Token:文本基础计算单元,同时计费、上下文窗口限制均基于 Token
-
Context Window(上下文窗口):模型单次能够处理的最大 token 长度,是长文本、Agent、记忆系统所有痛点的根源
-
Temperature:随机性控制参数,越高输出越发散、创造性越强;越低回答越确定
-
Top-p / Top-k:采样截断策略,控制候选词汇范围
-
Frequency_penalty / Presence_penalty:重复词抑制惩罚
-
Max-Length / Max_tokens:限制单次生成 token 上限
-
Stop 词:提前终止生成的标记
-
Streaming 流式输出:逐块返回生成内容,前端对话必备交互方案
区分两类模型:
-
Base 基础模型:仅预训练,无法直接对话,适合续写、补全任务
-
Chat 对话模型:经过对齐微调(SFT/DPO),适配人类对话格式,日常开发主流选择
提示工程(Prompt Engineering)
原生 LLM 属于无状态模型,单次调用不会自带记忆;对话能够连贯,是开发者持续拼接历史上下文实现的。
模型唯一接收的输入信息就是 Prompt,输入质量直接决定输出质量。
核心技巧:
-
清晰、结构化指令
-
完善上下文信息
-
Few-shot Learning(提供示例)
-
结构化输出(JSON Mode,强制模型输出标准格式,Function Calling 必备)
-
Self-Consistency 多次采样择优
风险点:Prompt Injection(提示词注入),后续安全章节联动学习
函数调用 / 工具使用(Function Calling/ Tool Use)
原生 LLM 仅能输出纯文本,只能一问一答。
函数调用(FC)让大模型具备感知外部世界、执行动作的能力,可以自主选择调用工具:
-
执行代码
-
读写文件
-
调用第三方 API
-
联网检索网页信息
不同厂商实现存在差异:OpenAI 原生 FC、Anthropic Tool Use 等。
目前通用标准化方案:MCP 协议(Agent 通用工具调用协议,支持 stdout、json 两种返回格式)
常见工程痛点:工具调用幻觉、参数格式错误、多轮工具调用状态维护
1-2. Agent(智能体)系统基本架构
一套完整 Agent 智能体系统由五大核心模块组合构成:
-
LLM 推理层:思考、决策、生成文本的大脑
-
工具调用层:连接外部能力(搜索、数据库、代码执行等)
-
记忆模块:存储历史对话、长期事实、任务信息
-
规划模块:任务拆解、分步方案设计
-
执行与反馈模块:执行动作、接收结果、复盘修正
第二部分:主流开发框架
技术选型最佳实践:
Python:优先从 LangChain 入手,生态最成熟;配套学习 LangSmith 用于应用评测调试。
Go:重点了解字节 Eino。
Java:存量 Spring 项目优先 Spring AI / Spring AI Alibaba;需要复杂 RAG、灵活 Agent 编排、非 Spring 环境优先 LangChain4j。
2.1 主流 Python Agent 框架对比
| 框架 | 核心优势 | 适用场景 | 上手难度 | 官方链接 |
|---|---|---|---|---|
| LangChain & LangGraph | 组件化强、生态最成熟、支持多模型工具。LangGraph 支持图结构 Agent,方便实现循环、分支、断点持久化 | 快速原型、复杂工作流、多工具协作、生产级 Agent | ★★☆☆☆ | https://www.langchain.com |
| LlamaIndex | 专注 RAG,文档处理强,PDF/PPT 等文件原生支持好 | 知识库问答、文档分析、私有知识库系统 | ★★☆☆☆ | https://www.llamaindex.ai |
| AutoGen(Microsoft) | 原生支持多 Agent 协作,依靠角色对话完成复杂任务 | 多角色协作、代码生成、复杂辩论规划场景 | ★★★☆☆ | https://github.com/microsoft/autogen |
2.2 主流 Java Agent 框架对比
| 框架 | 核心优势 | 适用场景 | 上手难度 | 官方 / GitHub 链接 |
|---|---|---|---|---|
| Spring AI(Spring 官方) | 原生适配 SpringBoot/SpringCloud,自动配置、和现有微服务体系打通;API 简洁、生产工程化友好;内置 RAG、Tool Calling | 已有 Spring 业务系统嵌入 AI、轻量化对话、企业级标准化 AI 集成 | ★★☆☆☆ | https://spring.io/projects/spring-ai |
| Spring AI Alibaba | 基于 Spring AI 拓展,深度适配国内大模型(通义等),中文文档、国内云环境最佳实践完善 | 国内云环境、使用国产大模型的 Spring 项目 | ★★☆☆☆ | https://java2ai.com |
| LangChain4j | 对标 Python LangChain 设计;向量库支持丰富(原生支持 Milvus);RAG 流水线、对话 Memory、自定义 Chain 能力灵活;框架中立(可脱离 Spring 运行) | 深度 RAG 系统、自定义 Agent 流程、社区知识库应用、非 Spring 工程 | ★★★☆☆ | https://github.com/langchain4j/langchain4j |
| Agents-Flex | 国产 Java Agent 框架,原生支持多模态、多 Agent 编排、模型路由、可观测能力;原生支持 MCP 协议 | 复杂多智能体、生产级任务编排、私有化 AI 平台 | ★★★☆☆ | https://agentsflex.com |
第三部分:RAG(增强检索生成)
RAG全称Retrieval-Augmented Generation。让AI依托私有知识库内容检索信息再生成答案;典型场景:企业官网AI助手、内部知识库问答、文档智能问答。核心价值:解决大模型知识过时、无法使用私有数据、幻觉问题。
核心流程
先检索,再生成。
-
用户提问
-
根据问题检索知识库相关文档片段
-
将检索结果拼接进 Prompt 上下文
-
LLM 结合问题 + 检索内容生成答案
技术栈拆解
1. 文档加载与切分(Loading 和 Splitting)
-
加载来源:PDF/TXT/HTML/Markdown/Notion/Word 等多种格式文档
-
文档统一切分为固定大小片段 Chunk
切分策略
-
固定字符切分
-
Token 粒度切分
-
递归字符切分(通用首选)
-
语义切分、结构化文档分层切分(进阶方案)
常用工具
langchain、llamaIndex
2. 嵌入与向量存储
-
Embedding:将文本转换成高密度向量,实现语义表达,用于语义相似度匹配
-
向量数据库:专门持久化存储向量与文档元数据,主流选型 Milvus、Chroma、Qdrant、PGVector
3.RAG 进阶优化模块
-
Query 改写 / Query 扩展:优化用户原始提问,提升检索命中率
-
Hybrid Search 混合检索:稠密向量检索 + BM25 关键词检索,兼顾语义与关键词匹配
-
Reranker 重排序:对初次检索结果二次打分筛选,过滤无关片段(工业落地必备)
-
高级检索方案:父文档检索、自适应 RAG、Self-RAG、GraphRAG(知识图谱检索)
RAG 常见痛点
检索噪声、上下文溢出、信息遗漏、答案与检索内容矛盾(幻觉)
第四部分:大模型推理范式、单 Agent & 多智能体、A2A
ReAct(reason + act)
论文:https://arxiv.org/abs/2210.03629
推理+行动,构建【思考-执行-接收反馈-再思考】逻辑闭环。
技术对比:
-
CoT:思维链,仅内部推理,无法调用外部工具
-
Tool Use:工具调用,缺少自主推理规划
ReAct 完整链路:
-
Thought 思考分析
-
Action 执行工具调用
-
Observation 获取外部反馈
能力收益:
-
动态联网查询资料
-
根据结果自我修正
-
自主多轮工具调用
主流推理范式拓展
-
CoT 思维链
-
ToT 思维树
-
Self-Consistency 自洽性采样
-
Plan-and-Solve 规划求解
-
Reflexion 自省式 Agent(自我反思纠错)
多智能体
单一Agent能力存在上限,通过多个具备不同角色的智能体分工协作,完成复杂任务。
参考论文 / 框架
单 Agent 局限 vs 多 Agent 方案
| 单 Agent 问题 | 多 Agent 方案 |
|---|---|
| 上下文窗口爆炸 | 任务拆分、角色隔离,分散上下文压力 |
| 单一角色推理能力有限 | 专家角色分工,各司其职 |
| 超长复杂流程容易失控 | 分层拆解任务,流水线协作 |
常见多 Agent 架构
-
Supervisor 主管模式(主管 Agent 分配任务、汇总结果)
-
Debate 辩论模式(多个 Agent 相互辩驳、校验答案)
-
Loop 循环协作模式(任务流转迭代,工程常用)
A2A(Agent to Agent)
智能体之间标准化通信协议,实现跨系统、跨框架智能体互相调用、信息交互。
第五部分:上下文工程(Context Engineering)
原生LLM本身无持久记忆,每次推理相互独立。上下文工程就是一套机制,让模型具备短期对话记忆与长期记忆能力,解决上下文长度受限问题。
一、MemGPT
论文:https://arxiv.org/abs/2310.08560
核心思想:
把 LLM 类比成操作系统,给模型设计内存管理机制。
结构:
-
Working Memory 工作内存(当前对话上下文)
-
Archival Memory 归档长期记忆
-
Recall 记忆检索
-
Memory Paging 内存换页机制(解决上下文窗口限制)
二、mem0(工程化长期记忆方案)
https://github.com/mem0ai/mem0
核心思想:
智能提取、持久保存关键记忆,而非无脑存储全部对话历史。
特点:
-
自动提取对话内关键事实、用户偏好
-
自动记忆更新、冲突信息覆盖
-
跨会话长期记忆持久可用
三、向量数据库与记忆系统结合
核心知识点:
-
Embedding 语义向量原理
-
Top-K 相似度检索
-
Hybrid Search 混合检索
-
父子索引存储方案
四、上下文工程核心能力
-
Prompt 动态编排与模版管理
-
上下文动态裁剪、冗余信息剔除
-
记忆分段压缩、摘要机制
-
多角色记忆隔离
-
Token 预算管控,防止上下文溢出
记忆分层概念(补充)
-
短时记忆:当前轮对话上下文
-
中期记忆:近期会话摘要
-
长期记忆:持久化存储的事实信息
第六部分:评测、安全、监控与链路追踪
核心准则:没有量化指标,就无法持续优化 AI 应用
6.1 评测指标体系
RAG 评测指标
-
Context Precision 上下文精确率
-
Context Recall 上下文召回率
-
Faithfulness 忠实度(答案不能脱离检索信息、减少幻觉)
-
Answer Relevancy 答案相关性
Agent 评测指标
-
任务完成率
-
工具调用正确率
-
多轮任务鲁棒性
-
步骤冗余程度
6.2 主流评测方法
-
人工评估:准确度最高,成本高,难以大规模自动化
-
LLM-as-a-Judge:大模型充当裁判自动打分,业界主流自动化方案
6.3 可观测 & 评测工具对比
| 工具 | 核心特点 | 亮点功能 | 官方链接 |
|---|---|---|---|
| LangSmith | LangChain 官方全链路调试平台 | trace 追踪 / 自动化评估 / 可视化 | https://smith.langchain.com |
| TruLens | RAG 专用评估工具 | 三元组评估、幻觉检测 | https://www.trulens.org |
| Phoenix (Arize) | OpenTelemetry 标准 LLM 可观测平台 | embedding 向量聚类分析、异常检测 | https://phoenix.arize.com |
| DeepEval / OpenAI Evals | 单元测试式自动化评测框架 | 支持 CI 持续集成 | https://github.com/confident-ai/deepeval |
6.4 AI 应用安全体系
-
提示词注入(直接注入、间接隐式注入)
-
输出内容安全审核
-
私有知识库数据泄露风险
-
Agent 逃逸、越权调用工具风险
-
用户输入隐私保护
6.5 运维监控要点
-
完整调用链路追踪(OpenTelemetry)
-
Token 消耗统计、成本监控
-
限流、重试、异常熔断策略
-
多模型负载均衡、模型路由
第七部分:进阶内容
模型微调基础
-
SFT 监督微调
-
RLHF 基于人类反馈的强化学习
-
DPO 直接偏好优化(主流 RLHF 替代方案)
-
LoRA / QLoRA 轻量化微调(私有化场景主流方案)
推理部署相关
-
高性能推理引擎:vLLM、SGLang
-
模型量化:INT8、INT4 量化、KV Cache 量化
-
本地私有化模型部署基础概念
Agent 深度优化
-
Planner 任务规划算法优化
-
Agent 循环检测,防止无限工具调用
-
Agent 会话状态持久化、断点续跑
拓展方向
-
Agent + 知识图谱 GraphRAG
-
多模态 Agent(图文音视频输入输出)
-
落地架构选型:场景决策,何时只用 RAG、何时引入 Agent、单 / 多智能体选型标准