文章目录
- 1. RAG 五大阶段
- 2. 基础概念
- 2.1 Documents(文档)
- 2.2 Nodes(节点)
- 2.3 Connectors(数据连接器)
- 3. 资源介绍
- 3.1 LlamaHub
- 3.2 llama-index-integrations
- 3.3 LlamaParse
- 3.4 LiteParse
- 3.5 LlamaParse / LiteParse / LlamaAgents / LlamaIndex Framework
1. RAG 五大阶段
当前大语言模型(LLM)原生存在知识滞后、事实幻觉、无法对接私有数据等核心痛点,单纯依靠模型本身无法满足企业落地、私有知识库问答、垂直领域智能检索等实际业务需求。
因此,工业界主流的LLM落地应用,均不再是简单的模型单次调用,而是形成了一套标准化、可迭代、可工程化的完整运行流水线。
所有成熟的RAG落地应用,底层逻辑高度统一,核心离不开数据加载、索引构建、持久化存储、查询检索、效果评估五大闭环环节。
这五个环节层层递进、相互支撑,覆盖了数据接入、模型预处理、工程优化、用户交互、迭代调优的全流程。掌握该整套流程,能够系统性解决大模型幻觉问题、降低调用成本、提升问答精准度与业务适配性,为各类垂直领域LLM智能应用开发提供核心支撑。
2. 基础概念
Loading(数据加载)是LLM应用流水线的起点,负责对接各类异构数据源,将外部原始数据导入业务流程,支持文本文件、PDF文档、网页内容、业务数据库、第三方API接口等多种数据来源。
数据加载完成后,可以在此基础上:
- 构建索引(Index)
- 使用查询引擎(Query Engine)提问
- 使用聊天引擎(Chat Engine)进行对话
2.1 Documents(文档)
Document是LlamaIndex里的数据源容器,对应一份完整原始数据,一份PDF文件、一次API返回结果、数据库单条/一批查询结果、一篇网页都可以封装成一个Document对象。
它保存原始完整文本以及来源、时间等基础元信息,代表未经切分的完整资料,是数据进入框架后的第一层封装,还没有做文本拆分,后续会被进一步处理生成更小粒度的单元。
2.2 Nodes(节点)
Node是LlamaIndex中最小的原子数据单元,本质就是文档经过文本切分之后得到的Chunk文本块。
RAG做向量向量化、检索召回,都是以Node为单位执行。Node除了存储片段文本,还携带丰富元数据,可以记录它归属哪一份原始Document、页码、位置信息,同时支持和其他Node建立关联关系,记录前后上下文,方便检索时还原片段上下文,是索引构建、语义检索的核心操作对象。
2.3 Connectors(数据连接器)
数据连接器(Connectors)(也常称作读取器Reader),是LlamaIndex数据接入层的核心组件,负责对接各类异构数据源与多样化文件格式,完成原始数据的读取、初步解析与格式归一化工作。
它能够适配本地文档、PDF文件、网页内容、数据库、API接口等多种输入来源,屏蔽不同数据源之间的接口差异与格式差异,把杂乱的原始业务数据统一解析转换为框架标准的Document文档对象。
后续再经由文本切分逻辑,将完整文档进一步拆解为粒度更细的Node节点对象。作为整个RAG流水线的入口模块,连接器的能力直接决定知识库能够支持哪些数据来源,是实现多源数据接入、为后续索引构建与检索召回提供标准化数据输入的首要环节。
3. 资源介绍
3.1 LlamaHub
数据连接器通过 LlamaHub 🦙 提供。LlamaHub是一个开源仓库,
包含各类数据加载器,可以轻松地将它们即插即用地集成到任何LlamaIndex应用中。
查找一个文件Reader:
点开后,可以看到使用介绍:
3.2 llama-index-integrations
LlamaIndex主仓库的llama‑index‑integrations目录包含了所有加载器、LLM、向量库、嵌入的实现,每个子模块独立打包成PyPI包。
llama‑index‑integrations/readers/包含了所有的Reader,所有在LlamaHub网页上看到的连接器,源码都在主仓库的llama‑index‑integrations下面,LlamaHub只是个是网页市场 / 注册表,展示所有集成,二者是源码仓库 ↔ 展示门户的关系。
3.3 LlamaParse
LlamaParse是由LlamaIndex推出的云端解析服务,用于高效解析、结构化各类文件,配合LlamaIndex框架实现高质量检索与上下文增强。
可以与 LlamaIndex 直接集成,注册即可免费使用!支持数十种文档格式,包含PDF、Word、PowerPoint、Excel表格等多种文件。
入门指引请查看 LlamaParse 文档。
3.4 LiteParse
LiteParse是一款开源文档解析库,能够解析文本并保留空间布局信息与文本包围盒。底层使用Rust开发,兼顾速度与稳定性;完全在本机运行,无云端依赖、不调用大模型、不需要API Key。
LiteParse本身不依赖LlamaIndex,是独立Rust开源库;LlamaIndex通过LiteParseReader 适配器把它封装成标准BaseReader,输出LlamaIndex Document对象。
因为是学习教程,我们肯定先重点学习
LlamaIndex自带的读取器,LiteParse、LlamaParse文档解析引擎后续再深入!!!
入门指引请查看 LiteParse 文档。
3.5 LlamaParse / LiteParse / LlamaAgents / LlamaIndex Framework
LlamaIndex官方文档中可以看到四个产品:
这些产品构成了整个文档处理链路:
他们之间的定位和区别如下:
| 对比项 | LlamaParse | LiteParse | LlamaAgents | LlamaIndex Framework |
|---|---|---|---|---|
| 角色 | 云端文档解析服务 | 本地开源解析引擎 | Agent工作流编排 | RAG/Agent开发基座 |
| 部署 | 云端API | 本地/WASM运行 | 本地/微服务 | Python/TS库 |
| 开源 | 闭源 | Apache‑2.0开源 | MIT开源 | MIT开源 |
| 大模型 | 用多模态LLM解析 | 无LLM,传统OCR | 依赖外部LLM | 对接各类LLM/Embedding |
| 密钥 | 需要API Key | 不需要 | 仅LLM需Key | 仅LLM/向量库需Key |
| 费用 | 免费额度,按页计费 | 完全免费 | 框架免费 | 框架免费 |
| 核心优势 | 扫描件、复杂表格解析强 | 离线、保留布局bbox | 多步骤Agent自动化 | 检索、索引、RAG全套能力 |
| 适用场景 | 文档复杂,可上云 | 数据敏感、私有化部署 | 生产级多Agent流程 | 搭建知识库、RAG应用 |