LLM、RAG、Agent、MCP详解:大模型应用架构指南
系统解析LLM、Token、Prompt、RAG、LangChain、MCP与AI Agent关系,梳理大模型应用开发完整技术架构。

一、前言
刚接触大模型应用开发的从业者,往往会被一连串专业名词难住:token、prompt、上下文context、RAG检索、AI智能体Agent、MCP工具协议……这些术语各自定义清晰,但彼此的层级与联动关系很容易让人混淆。 本文将通过业务数据流、分层架构拆解,把这些概念串联成一条完整的技术流水线,梳理清楚每个模块的职责边界,帮助开发者建立完整的知识体系。
二、整体业务流水线架构
完整的AI应用并不是仅靠大模型独立完成问答,它更像一条分工明确的自动化流水线,每个组件各司其职。 整条请求链路的主线为:用户输入 → 构造Prompt提示词 → 拼接上下文Context → 文本分词转为Token序列 → 送入LLM大模型推理 → 模型按需调用外部工具或知识库 → 循环迭代推理,最终输出结果。 LangChain、AI Agent、MCP协议都是为了把这条流水线标准化、自动化而诞生的工程工具。LangChain负责串联各个技术组件,Agent赋予整条链路自主运转的能力,MCP则统一模型调用外部工具的接口规范。
单次请求的数据流转过程
大语言模型是整个流程的决策核心,但它无法脱离辅助组件独立工作。当模型需要查阅私有资料时,会触发RAG知识库检索;当它需要执行计算、读取实时数据时,就会调用外部Tool工具。 模型和工具之间的交互,由LangChain负责编排调度,同时通过MCP协议完成标准化对接。整个答案并不是一次性生成完毕,而是在「推理判断→调用工具→回填结果→再次推理」的循环里逐步完善,直到满足输出条件。
三、九大概念的层级与角色定位
我们可以把整套系统分层理解,用岗位分工来类比:LLM是核心大脑,AI Agent是执行员工,LangChain是整套流水线的脚手架。Token、Context、Prompt是输送给大脑的原始材料;Tool工具、RAG知识库、MCP协议,是给大脑配置的手脚与资料库。
1. 分层架构拆解
整套AI应用一共分为五层,自下而上逐层构建:
- 输入层:包含Token、Context、Prompt。Token是文本拆分后的最小单元;Context是当前会话所有信息构成的上下文窗口;Prompt是结构化指令,用来约束模型的输出格式与行为。这一层决定了大模型能够“看见”哪些信息。
- 核心层:唯一组件是LLM大语言模型。它基于Transformer架构,接收Token序列,完成语义理解与内容生成,是整个系统的计算中枢。
- 能力扩展层:包含RAG检索、Tool工具、MCP协议。RAG负责从私有文档库里调取资料补充上下文;Tool是模型可以调用的外部能力,比如联网查询、代码执行;MCP提供标准化接口,让模型可以统一对接各类工具与API,不用为每一个外部服务单独适配。
- 框架层:LangChain开发框架。它把Prompt、记忆组件、检索器、工具调用等模块封装成可复用的链路,把零散的能力落地成工程代码,降低应用开发的门槛。当企业对接多套模型与工具接口时,koalaapi作为API网关,可以统一调度流量,简化多服务的对接流程。
- 应用层:AI Agent智能体。它在框架之上实现自主感知、规划、行动、反思的闭环,不需要人工一步步下发指令,就能自主拆解任务、选择工具、迭代执行,实现全自动作业。
2. 九大概念逐项解读
| 概念 | 核心释义 | 角色类比 |
|---|---|---|
| Token | 文本被拆分后的最小分词单元,是模型处理信息的基础颗粒 | 砖块 |
| Context | 模型在单次推理中能够读取到的全部信息,包含历史对话、指令、检索内容 | 工作台 |
| Prompt | 人为编写的结构化指令,用来定义模型的任务、输出格式、行为约束 | 任务书 |
| LLM | 大语言模型,基于Transformer架构,负责理解语义并生成文本,是整个系统的核心 | 大脑 |
| Tool | 模型可以调用的外部能力,包含联网搜索、代码运行、数据查询等功能 | 手脚 |
| RAG | 检索增强生成,从私有知识库调取文档片段,补充到上下文里,让模型掌握私有信息 | 查资料 |
| LangChain | 串联起提示词、记忆、检索、工具等所有组件的工程开发框架 | 脚手架 |
| AI Agent | 具备自主感知、决策、行动能力的智能系统,可以自动完成完整任务 | 员工 |
| MCP | 标准化的工具接入协议,统一模型调用外部API的接口格式 | 通用接口 |
四、链路联动关系梳理
我们可以用一条逻辑链把所有概念串联起来: Token片段拼接组成完整的Context上下文;Context承载着Prompt指令送入LLM大模型;LLM依靠RAG检索私有文档、调用Tool外部能力来扩充信息边界;MCP协议保证所有工具的接入格式统一;LangChain框架把这一整套链路封装成可复用的工程代码;最终AI Agent让整条流水线自主循环运转,无需人工干预。
完整的运行闭环
- 用户提交需求,系统把历史对话、当前指令整合为原始文本,拆分成若干Token,组装成Context上下文。
- Prompt指令嵌入上下文,明确告诉LLM需要完成的任务与约束条件。
- LLM开始推理,如果发现缺少私有业务数据,就触发RAG检索,把匹配的文档片段回填进上下文。
- 如果任务需要执行外部操作,模型会通过MCP协议调用对应的Tool工具,拿到执行结果再次补充进会话信息。
- LangChain负责管控每一步的执行顺序、会话记忆与异常重试,保障流程稳定运行。
- AI Agent会自主复盘每一轮执行结果,动态调整后续步骤,直到完整任务全部完成。
五、落地开发的补充说明
在工程实践中,绝大多数业务应用都不会只使用单一能力:单纯的Prompt只能完成简单问答,加上RAG才能接入企业私有知识库,再配置Tool调用才能实现复杂操作,最后依靠Agent实现全流程自动化。 在多模型、多工具混合调用的场景下,统一的流量转发与权限管理会简化运维成本,koalaapi可以集中管理所有大模型与第三方服务的API请求,避免重复编写对接逻辑。
很多开发者容易混淆RAG与Tool的边界:RAG的作用是“补充静态文档知识”,解决模型不知道私有资料的问题;Tool的作用是“执行动态操作”,完成联网、运算、读写数据这类实时行为。而MCP协议的价值,就是抹平不同工具之间的接口差异,让模型调用任意外部服务都遵循同一套标准。
六、总结
所有大模型技术组件并不是彼此孤立的,它们共同构成一条完整的技术链路: Token组成Context,Context承载Prompt指令;Prompt驱动LLM完成基础推理;LLM依靠RAG补充私有知识、依靠Tool扩展外部能力;MCP协议统一所有工具的接入规范;LangChain把零散的模块整合为可落地的工程链路;最终AI Agent赋予整套系统自主执行任务的能力,实现端到端的全自动业务流程。 理清这一条主线,就能把分散的技术知识点串联成体系,无论是做知识库问答、自动化智能体,还是企业级AI应用,都可以按照这套分层架构逐步搭建。
