
Agent与大模型开发理论 - 第一部分
适用阶段:零基础入门完成、已掌握LLM调用/提示工程/FC/Agent架构(跳过Transformer底层数学)
定位:所有AI应用、RAG、Agent、多智能体的基础概念
学习状态:理论全部吃透、可直接进入框架与RAG实战阶段
1. LLM 核心本质与底层认知
1.1 LLM 核心定义与局限性
大语言模型不是“理解语言”,而是基于海量文本学习概率分布,逐词预测生成文本。
核心特质:
-
无真实意识、无情感、无逻辑认知,仅拟合数据规律
-
输出内容是概率生成结果,天然存在幻觉
-
原生无状态、无记忆,每一次API调用都是独立推理
1.2 关键概念区分
LLM vs 向量检索
-
LLM:生成全新文本、总结、创作、推理 → 会创造、会幻觉
-
向量检索:匹配已有知识库内容 → 只查找、不生成、无幻觉
-
RAG本质:向量检索兜底真实知识 + LLM润色生成,互补解决幻觉与知识滞后
Base模型 vs Chat模型
-
Base基础模型:仅预训练,擅长文本续写,不适合对话
-
Chat对话模型:经过SFT/DPO对齐,适配人类对话交互,工程开发通用选择
2. LLM 推理与 API 调用
所有AI应用的入口,所有参数直接影响输出效果与成本。
2.1 核心基础概念
-
Token:LLM最小计算/计费单位,汉字、字母、符号均会拆分,上下文窗口、计费、生成都依赖Token
-
上下文窗口 Context Window:模型单次最大处理Token长度,是长文本、记忆溢出、Agent截断的根本痛点
-
流式输出 Streaming:逐段返回生成内容,前端对话必备,提升交互体验
2.2 核心采样参数
-
Temperature 温度:随机性控制。0=严谨确定、1=高创造发散,问答/知识库取0.1
0.3,创作取0.71.0 -
Top-p / Top-k:截断候选词范围,限制随机采样区间,避免离谱输出
-
频率/存在惩罚:抑制文本重复、话术循环
-
Max-Token:限制最大生成长度,防止超长输出、控成本
-
Stop终止符:匹配指定字符后提前结束生成,精准控制输出格式
3. 提示工程 Prompt Engineering
3.1 核心原理
LLM无记忆、无预设逻辑,Prompt是模型唯一的输入信息,输出质量完全由提示词决定。
3.2 核心实战技巧(已掌握)
-
清晰结构化指令:角色、任务、约束、输出格式明确
-
上下文补全:手动拼接历史对话,实现连续聊天效果
-
Few-Shot 示例学习:给出输入输出案例,大幅提升任务准确率
-
JSON结构化输出:强制模型输出标准格式,是函数调用、Agent自动化的基础
-
Self-Consistency:多次采样、择优输出,提升推理稳定性
3.3 安全风险
Prompt Injection 提示词注入:用户恶意输入覆盖系统指令,导致越权、泄露、违规输出,是AI应用首要安全风险。
4. 函数调用 & 工具使用(FC / MCP)
4.1 核心价值
原生LLM只能纯文本生成,函数调用让模型拥有“动手能力”,从被动回答升级为主动执行任务。
4.2 可执行能力
-
调用第三方API、联网搜索
-
代码执行、计算器运算
-
文件读写、数据查询、数据库操作
4.3 技术规范
-
厂商原生:OpenAI FC、Anthropic Tool Use(各有差异、不通用)
-
MCP 通用工具协议:跨框架统一工具调用标准,支持stdout、json双格式,现代Agent开发主流规范
4.4 工程常见坑
-
工具调用幻觉:无意义重复调用、错误选工具
-
参数格式不合法、JSON解析失败
-
多轮工具调用状态丢失、任务中断
5. Agent 智能体完整架构(核心五大模块)
Agent = LLM大模型 + 工具 + 记忆 + 规划 + 反馈执行
缺一不可,这是所有单智能体、多智能体的通用底层架构。
5.1 五大核心模块详解
1-LLM 推理层(大脑)
负责思考、理解需求、决策是否调用工具、生成回答、制定任务方案。
2-工具调用层(手脚)
承接FC/MCP能力,对接外部世界,突破模型知识与能力边界。
3-记忆模块(记忆)
解决LLM无状态问题,存储对话、用户信息、任务进度、长期偏好。
4-规划模块(逻辑)
复杂任务拆解、分步执行、优先级判断,避免一次性任务过载。
5-执行与反馈模块(迭代闭环)
执行动作、接收结果、校验对错、二次思考修正,形成闭环迭代。
5.2 核心认知总结
-
普通LLM对话:单次输入→单次输出
-
Agent智能体:思考→行动→反馈→再思考的循环闭环
LLM不会真正理解内容,只是概率生成;AI应用开发的本质,就是用工程手段弥补模型缺陷 :用Prompt规范输出、用FC扩展能力、用记忆补全状态、用规划解决复杂任务、用RAG解决幻觉与知识滞后。