LlamaIndex 系列【7】RAG Data Loading(数据加载)
2026/8/26 15:03:08 网站建设 项目流程

文章目录

  • 1. RAG 五大阶段
  • 2. 基础概念
    • 2.1 Documents(文档)
    • 2.2 Nodes(节点)
    • 2.3 Connectors(数据连接器)
  • 3. 资源介绍
    • 3.1 LlamaHub
    • 3.2 llama-index-integrations
    • 3.3 LlamaParse
    • 3.4 LiteParse
    • 3.5 LlamaParse / LiteParse / LlamaAgents / LlamaIndex Framework

1. RAG 五大阶段

当前大语言模型(LLM)原生存在知识滞后、事实幻觉、无法对接私有数据等核心痛点,单纯依靠模型本身无法满足企业落地、私有知识库问答、垂直领域智能检索等实际业务需求。

因此,工业界主流的LLM落地应用,均不再是简单的模型单次调用,而是形成了一套标准化、可迭代、可工程化的完整运行流水线。

所有成熟的RAG落地应用,底层逻辑高度统一,核心离不开数据加载、索引构建、持久化存储、查询检索、效果评估五大闭环环节。

这五个环节层层递进、相互支撑,覆盖了数据接入、模型预处理、工程优化、用户交互、迭代调优的全流程。掌握该整套流程,能够系统性解决大模型幻觉问题、降低调用成本、提升问答精准度与业务适配性,为各类垂直领域LLM智能应用开发提供核心支撑。


2. 基础概念

Loading(数据加载)LLM应用流水线的起点,负责对接各类异构数据源,将外部原始数据导入业务流程,支持文本文件、PDF文档、网页内容、业务数据库、第三方API接口等多种数据来源。

数据加载完成后,可以在此基础上:

  1. 构建索引(Index)
  2. 使用查询引擎(Query Engine)提问
  3. 使用聊天引擎(Chat Engine)进行对话

2.1 Documents(文档)

DocumentLlamaIndex里的数据源容器,对应一份完整原始数据,一份PDF文件、一次API返回结果、数据库单条/一批查询结果、一篇网页都可以封装成一个Document对象。

它保存原始完整文本以及来源、时间等基础元信息,代表未经切分的完整资料,是数据进入框架后的第一层封装,还没有做文本拆分,后续会被进一步处理生成更小粒度的单元。


2.2 Nodes(节点)

NodeLlamaIndex最小的原子数据单元,本质就是文档经过文本切分之后得到的Chunk文本块。

RAG做向量向量化、检索召回,都是以Node为单位执行。Node除了存储片段文本,还携带丰富元数据,可以记录它归属哪一份原始Document、页码、位置信息,同时支持和其他Node建立关联关系,记录前后上下文,方便检索时还原片段上下文,是索引构建、语义检索的核心操作对象。


2.3 Connectors(数据连接器)

数据连接器(Connectors)(也常称作读取器Reader),是LlamaIndex数据接入层的核心组件,负责对接各类异构数据源与多样化文件格式,完成原始数据的读取、初步解析与格式归一化工作。

它能够适配本地文档、PDF文件、网页内容、数据库、API接口等多种输入来源,屏蔽不同数据源之间的接口差异与格式差异,把杂乱的原始业务数据统一解析转换为框架标准的Document文档对象。

后续再经由文本切分逻辑,将完整文档进一步拆解为粒度更细的Node节点对象。作为整个RAG流水线的入口模块,连接器的能力直接决定知识库能够支持哪些数据来源,是实现多源数据接入、为后续索引构建与检索召回提供标准化数据输入的首要环节。

3. 资源介绍

3.1 LlamaHub

数据连接器通过 LlamaHub 🦙 提供。LlamaHub是一个开源仓库,
包含各类数据加载器,可以轻松地将它们即插即用地集成到任何LlamaIndex应用中。

查找一个文件Reader

点开后,可以看到使用介绍:

3.2 llama-index-integrations

LlamaIndex主仓库的llama‑index‑integrations目录包含了所有加载器、LLM、向量库、嵌入的实现,每个子模块独立打包成PyPI包。

llama‑index‑integrations/readers/包含了所有的Reader,所有在LlamaHub网页上看到的连接器,源码都在主仓库的llama‑index‑integrations下面,LlamaHub只是个是网页市场 / 注册表,展示所有集成,二者是源码仓库 ↔ 展示门户的关系。

3.3 LlamaParse

LlamaParse是由LlamaIndex推出的云端解析服务,用于高效解析、结构化各类文件,配合LlamaIndex框架实现高质量检索与上下文增强。

可以与 LlamaIndex 直接集成,注册即可免费使用!支持数十种文档格式,包含PDFWordPowerPointExcel表格等多种文件。

入门指引请查看 LlamaParse 文档。

3.4 LiteParse

LiteParse是一款开源文档解析库,能够解析文本并保留空间布局信息与文本包围盒。底层使用Rust开发,兼顾速度与稳定性;完全在本机运行,无云端依赖、不调用大模型、不需要API Key

LiteParse本身不依赖LlamaIndex,是独立Rust开源库;LlamaIndex通过LiteParseReader 适配器把它封装成标准BaseReader,输出LlamaIndex Document对象。

因为是学习教程,我们肯定先重点学习LlamaIndex自带的读取器,LiteParseLlamaParse文档解析引擎后续再深入!!!

入门指引请查看 LiteParse 文档。

3.5 LlamaParse / LiteParse / LlamaAgents / LlamaIndex Framework

LlamaIndex官方文档中可以看到四个产品:

这些产品构成了整个文档处理链路:

他们之间的定位和区别如下:

对比项LlamaParseLiteParseLlamaAgentsLlamaIndex Framework
角色云端文档解析服务本地开源解析引擎Agent工作流编排RAG/Agent开发基座
部署云端API本地/WASM运行本地/微服务Python/TS库
开源闭源Apache‑2.0开源MIT开源MIT开源
大模型用多模态LLM解析无LLM,传统OCR依赖外部LLM对接各类LLM/Embedding
密钥需要API Key不需要仅LLM需Key仅LLM/向量库需Key
费用免费额度,按页计费完全免费框架免费框架免费
核心优势扫描件、复杂表格解析强离线、保留布局bbox多步骤Agent自动化检索、索引、RAG全套能力
适用场景文档复杂,可上云数据敏感、私有化部署生产级多Agent流程搭建知识库、RAG应用

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询