信息检索新高度:Jina Reranker 3.5 优势尽显
信息检索的竞争,已进入新高度。Jina Reranker 3.5 在判例法表现比 v3 提升超 50%,在法律、医疗和金融基准测试中,缩小与体积大 7 倍模型差距,在结构化数据上超越它们,且是 v3 直接替代品,无需修改 API。可通过 Elasticsearch 动手实践,深入体验示例 Notebook,查看 Elasticsearch Labs repo ,开始 免费云试用,或在本地机器体验 Elastic。
jina - reranker - v3.5 是拥有 6 亿参数的重排序模型,相比前代 jina - reranker - v3,在法律检索任务显著提升,在法律、医疗和金融重排序任务缩小与参数规模大 7 倍模型差距。长文档场景下,比 jina - reranker - v3 最快提升 56%运行速度,判例法检索任务得分提高超 50%,还在 STaRK 结构化数据基准测试击败 Qwen3 - Reranker - 4B。对 v3 用户来说,可直接替换,无需修改 API 代码。
重排序模型揭秘
重排序模型(reranker)用于信息检索流水线后期,对候选结果从最匹配到最不匹配重新排序,用针对候选结果排序训练的模型可提升检索结果质量。Jina AI 最新重排序模型采用后期交互(late interaction)技术,将查询和文档分别编码为 token 向量嵌入(embeddings),表示 token 语义后比较。这类似词汇和语法歧义消解在 AI 中的实现,基于 Transformer 的模型能完成歧义消解并编码更丰富语义信息。
后期交互重排序模型为查询和候选文档生成融合上下文信息的 token 向量,通过比较计算可排序分数,不依赖候选结果生成方式,但最终效果取决于候选结果质量,虽无法修复糟糕的第一阶段检索,但能提升已有检索结果质量。jina - reranker - v3.5 是 listwise 重排序模型,采用 [last - but - not - late](https://jina.ai/news/jina - reranker - v3 - 0 - 6b - listwise - reranker - for - sota - multilingual - retrieval/#:~:text=query%2Ddocument%20interaction%20%22-,last%20but%20not%20late,-.%22%20It%27s%20%22last) 技术,查询和候选结果一起输入模型,一次前向计算处理,为候选结果返回数值分数,能利用更多信息生成更好排序结果。jina - reranker - v3 证明该交互方式的列表式重排序模型可在通用重排序基准测试与最大模型竞争,目前只有 jina - reranker - v3.5 和参数规模超 40 亿模型在大规模文本向量嵌入基准([Massive Text Embedding Benchmark,MTEB](https://mteb - leaderboard.hf.space/benchmark/MTEB%28Multilingual%2C%20v2%29))重排序任务表现超它,但该方法对候选列表大小有限制。
Jina Reranker v3.5 解决的问题
尽管 `jina - reranker - v3` 有业界领先性能,但存在明显短板。在特定领域文本检索方面,它基于通用文本语料训练,在法律文本、医学文献、金融数据集、计算机编程和 IT 文档、产品目录等场景表现不理想。在结构化数据处理上,大量现实世界数据以结构化记录存储,仅针对文本比较训练的 `jina - reranker - v3` 处理这类数据表现差。长候选列表带来高计算成本,多数文本处理 AI 模型采用自注意力架构,内存和计算需求随输入规模增加呈二次方增长,jina - reranker - v3 使用完整输入上下文窗口时计算成本高,而要发挥模型效果需放入更多候选匹配结果,导致运行速度慢、计算成本高。开发 jina - reranker - v3.5 就是为解决这些问题,且不降低通用文本检索任务性能。
Jina Reranker v3.5 新特性
`jina - reranker - v3.5` 采用改进后的注意力机制,提升性能、处理速度,降低推理([inference](https://www.elastic.co/docs/explore - analyze/elastic - inference))阶段处理完整输入上下文窗口的计算资源。引入全新三阶段自蒸馏训练流程,适合大输入上下文模型的滑动窗口架构。针对 `jina - reranker - v3` 短板,使用新训练数据,包括多语言法律文本、医学文本(含中文医疗问答数据)、金融行业数据、结构化数据(电商领域及公开表格语料数据)、扩展后的多语言和跨语言文本。有关其数据来源和技术创新详细信息,可参阅技术报告。
Jina Reranker 3.5 在检索基准测试中的表现
在通用文本重排序性能(BEIR 和 MIRACL)方面,`jina - reranker - v3.5` 表现提升。英文 [Benchmarking Information Retrieval (BEIR)](https://github.com/beir - cellar/beir) 基准测试中,平均得分超业界领先的 `[Qwen3 - Reranker - 4B](https://huggingface.co/Qwen/Qwen3 - Reranker - 4B)`、`[Qwen3 - Reranker - 0.6B](https://huggingface.co/Qwen/Qwen3 - Reranker - 0.6B)` 以及 Mixedbread AI 的重排序模型。还提升了 jina - reranker - v3 在 Multilingual Information Retrieval Across a Continuum of Languages (MIRACL) 基准测试的多语言重排序性能,目前只有拥有 40 亿参数的 Qwen3 重排序模型能稳定超 jina - reranker - v3.5 得分。
在法律、医疗和金融领域重排序中,[Retrieval Embedding Benchmark (RTEB) suite](https://huggingface.co/blog/rteb) 包含多领域检索基准测试,`jina - reranker - v3.5` 在相关 RTEB 任务中超 `jina - reranker - v3` 表现,只有参数量接近 7 倍的大型 Qwen3 重排序模型平均性能更好,新模型在法律数据提升显著,判例法检索任务得分相比 `jina - reranker - v3` 提升超 50%。
在结构化数据重排序(Struct - IR 和 STaRK 基准测试)中,评估 `jina - reranker - v3.5` 能力,两个基准测试含 AI 生成的 JSON 文本数据,覆盖多种场景。jina - reranker - v3.5 在 Struct - IR 基准测试得分提升,仅 Qwen3 - Reranker - 4B 超它,在 STaRK 基准测试击败所有其他测试模型。
推理速度方面,候选文档越长,`jina - reranker - v3.5` 架构改进优势越明显。用两个平均文档长度差异大的检索数据集验证,jina - reranker - v3.5 在两种情况下都更快。Natural Questions 基准测试中,速度提升 22%,平均请求延迟从 371.1 毫秒降至 305.3 毫秒。AILAcasedocs 基准测试中,jina - reranker - v3 需 16,064.9 毫秒,jina - reranker - v3.5 需 10,290.9 毫秒,实现 56%速度提升,降低应用程序延迟和计算成本。
使用建议与方式
重排序能提升搜索精准度,`jina - reranker - v3.5` 适用于各种信息检索场景,但有一定限制,最佳实践建议总结在表格中。`jina - reranker - v3.5` 可通过 [Jina API](https://jina.ai/reranker/) 使用,有免费 token 体验,也可通过 [Elastic Inference API](https://www.elastic.co/docs/explore - analyze/elastic - inference/inference - api) 和 [Elastic Inference Service](https://www.elastic.co/docs/explore - analyze/elastic - inference/eis) 使用。已使用 `jina - reranker - v3` 的用户,修改相应字段即可替换,两模型接口一致。可将其作为 [Jina On - Prem 容器](https://www.elastic.co/search - labs/blog/on - prem - ai - jina - embedding - models) 安装在本地硬件运行,模型权重可下载测试研究,按 [Hugging Face 上该模型页面](https://huggingface.co/jinaai/jina - reranker - v3.5) 说明操作。该模型基于 [CC BY - NC - 4.0](https://creativecommons.org/licenses/by - nc/4.0/deed.en) 许可证提供,可用于测试、构建原型或科研,商业用途联系 Elastic 销售团队。