☰
如何正确引用arXiv论文:BibTeX模板、版本管理与常见错误
2026/9/25 4:26:48 网站建设 项目流程

1. 先说清楚:arXiv上的参考文献到底特殊在哪

1.1 为什么arXiv引用总让人头疼

我在帮学生改论文和日常审稿过程中,几乎每周都会遇到关于arXiv如何引用参考文献的问题。说实话,这个看似基础的操作,翻车率远比想象中高。很多人上来就直接从arXiv页面复制BibTeX,粘贴进LaTeX就完事了,结果交稿前被期刊编辑打回来,说引用格式不规范;还有人引用的是v1版本,但自己实际参考的是v2甚至v3的内容,这种引用错误在学术上是非常尴尬的硬伤,严重的甚至会被认定为文献引用不端。

先说一个最容易被忽视的事实:arXiv不是期刊。它本质上是开放获取的预印本服务器,论文在这里发布后不经过传统意义上的同行评审(虽然现在有endorsement机制,但那是准入资格审核,不是学术内容评审)。这意味着arXiv论文没有卷号、期号、页码,传统的期刊引用格式在它身上根本不适用。所以“如何在arXiv引用参考文献”这个问题的核心,不应该是“怎么从页面复制一段格式”,而应该是“怎样让读者能稳定地找到你引用的这个版本,并且明白你引用的内容经过了怎样的演化”。

1.2 理解arXiv的核心机制:预印本、版本与永久ID

在动手写引用之前,必须先建立两个认知,否则后续所有操作都是盲人摸象。

第一个认知是arXiv论文的版本演进机制。作者上传第一版后,如果修改了内容,会在同一个ID下提交新版本,标注为v2、v3。这里有个关键细节:同一篇论文的不同版本之间,页码、定理编号、甚至核心结论都可能不同。你引用一个v1,但读者点开链接默认看到的是最新版,如果最新的正好是v2而且结论改了,你说读者会不会懵?

第二个认知是arXiv的永久标识符体系。每篇论文在投稿时会分配一个唯一的arXiv ID,格式经历了两个阶段。2015年之前的格式是math.RA/0601001这种“分类缩写+斜杠+序号”的形式,2015年之后改成了2401.12345这种“年份+月份+序号”的形式。这个ID是永久有效的,无论作者是否撤稿,无论后来是否发表了期刊版,只要官方服务器还在维护,这个ID就指向这篇论文的历史记录。

理解了这两点,才能明白引用arXiv文献的真正目标:用最小的信息量,让读者在任何时刻打开链接都能找到那个特定版本的论文,不会产生歧义。

2. 找引用信息的正确姿势:从页面到源码

2.1 论文页面上现成的引用格式能用吗

arXiv论文详情页的右侧栏里有一个“export citation”按钮,点开会出现BibTeX、EndNote、RefWorks等多种格式的选项,还有Copiar直接复制BibTeX的快捷键。很多人直接复制这个结果就用了,不是说不行,但我必须提醒你:这个自动生成的BibTeX有一个常见问题——它经常拿不到完整的作者列表,特别是对于超多作者的论文。

出现过这样的情况:某篇高能物理领域的论文有3000多个作者,arXiv自动生成的BibTeX里作者字段是完整的,没问题,但如果是几百位作者的论文也有可能只保留前几位加et al。不同时期、不同类型的论文,这个自动导出格式的完整度是不同的。更稳妥的做法是:页面自动生成的格式只作为参考骨架,关键字段必须人工核对。

另外还要注意页面上的引用格式是动态的,它会根据当前展示的版本生成对应的引用信息。如果你打开了v1版本的页面,导出的BibTeX就是v1的;如果你直接打开的是默认的最新版,那导出的就是最新版。很多人忽略了这一点,导致引用版本和实际参考版本不一致。

2.2 从页面源码中提取关键字段

如果你想做一次完全可靠的人工整理,最直接的方法不是复制页面上的导出结果,而是从arXiv的源码视图获取原始信息。操作方法很简单:进入论文的abs页面(就是arxiv.org/abs/xxxx.xxxxx这个地址),然后把它改成arxiv.org/src/xxxx.xxxxx,你会看到论文源码文件的列表,包括所有版本的源文件。但这只是获取源码的方式。

更关键的步骤是,在abs页面右键查看源代码,你会发现页面顶部有一段meta信息,里面包含了:

  • citation_arxiv_id:这个字段直接给出arXiv ID
  • citation_title:论文标题
  • citation_author:作者列表,每个作者一个标签
  • citation_date:提交日期,注意这是原始版本提交日期
  • citation_pdf_url:论文PDF的实际地址

这些meta标签是结构化数据,搜索引擎和学术数据库(如Google Scholar)就是靠它们来索引arXiv论文的。手动提取这些字段来构造BibTeX,虽然多花两分钟,但能确保每个字段都没有经过“人类加工”的损耗。

2.3 第三方索引数据库怎么配合使用

如果你的论文正式发表在某个期刊后,那么正确的引用方式通常是以正式出版版本为主,arXiv版本为辅。这时候你去Google Scholar里搜这篇论文,会同时看到期刊版和arXiv版两个条目。需要注意的一点是:Google Scholar的BibTeX导出偶尔会把期刊版本的信息和arXiv版本混在一起,特别是当论文标题改动过、作者顺序调整过的情况下,容易出现张冠李戴。

我建议的流程是这样的:先在arXiv上确定你实际参考的那个版本,记录下版本号;然后去期刊官网上找正式出版版的DOI;最后回到BibTeX里把两个信息都填好,形成“双引用”的完整格式。具体怎么组织这种双引用,后面第三部分专门讲。

3. BibTeX实操:不同场景的模板与参数详解

3.1 最常用的@article写法

如果你要引用的arXiv论文还没有正式的期刊版(或者你引用它的原因就是因为它在arXiv上),最常规的写法是使用@article类型,但把journal字段替换成arXiv相关信息。这是我个人最常用的模板:

@article{zhang2024transformer, title = {A Novel Transformer Architecture for Efficient Sequence Modeling}, author = {Zhang, San and Li, Si and Wang, Wu}, journal = {arXiv preprint arXiv:2401.12345}, year = {2024}, volume = {2401}, number = {12345}, pages = {1--15}, eprint = {2401.12345}, archivePrefix = {arXiv}, primaryClass = {cs.CL} }

这里解释一下每个字段的作用。journal字段写arXiv preprint arXiv:xxx是为了让阅读你论文的人一眼就明白这是一个预印本,不是正式出版物。volume和number在传统期刊引用中表示卷号和期号,但对于arXiv来说,它们本质上是形式主义的填充——我习惯把年份和序号拆开放在这两个位置,虽然BibTeX处理器不会因为字段值“奇怪”而报错,但也不要为了形式主义误导读者。真正重要的是eprint、archivePrefix和primaryClass这三个字段,这是一种约定俗成的扩展字段,专门用来描述arXiv论文。eprint写完整的arXiv ID,archivePrefix固定写arXiv,primaryClass写论文的主分类。

3.2 更稳妥的@misc写法

如果你用的是较老的BibTeX工具链,或者需要确保兼容性(比如投某些老牌期刊,它们的LaTeX环境比较保守),可以用@misc类型,这是最不容易出错的方案:

@misc{vaswani2023attention, title = {Attention Is All You Need}, author = {Vaswani, Ashish and Shazeer, Noam and Parmar, Niki and Uszkoreit, Jakob and Jones, Llion and Gomez, Aidan N. and Kaiser, {\L}ukasz and Polosukhin, Illia}, howpublished = {arXiv preprint arXiv:1706.03762}, year = {2023}, note = {v7, accessed October 2025}, eprint = {1706.03762}, archivePrefix = {arXiv}, primaryClass = {cs.CL} }

为什么说它“更稳妥”?因为@misc类型对字段的约束最少,任何BibTeX风格文件都不会因为缺了某个字段而报警。我在note字段里加注了“v7, accessed October 2025”,表示这个引用指向的是第7版,而且我在某年某月访问过。这个细节在严谨的学术语境下非常重要,因为如果你引用的结论在后续版本中被修改了,这个note就是你免责的凭证——你明确说明了引用的是哪个版本、什么时候查的。

3.3 双引用:arXiv版本与正式期刊版怎么共存

这是很多投稿人最困惑的场景:论文已经正式发表在期刊上,但我实际读的是arXiv版,或者导师要求“把两个都放上去”。这种情况下,BibTeX的正确做法是用两个独立条目,然后在正文里只引用其中一个,但把另一个的信息以注释或脚注的形式说明。

比如你引用了某篇论文,它先在arXiv上发布,后来发表在IEEE Transactions上,那么你可以这样写:

@article{li2024efficient, title = {Efficient Training of Large Language Models}, author = {Li, Si and Wang, Wu and Zhang, San}, journal = {IEEE Transactions on Neural Networks and Learning Systems}, volume = {35}, number = {6}, pages = {7456--7468}, year = {2024}, doi = {10.1109/TNNLS.2024.1234567}, eprint = {2303.12345}, archivePrefix = {arXiv}, primaryClass = {cs.LG} }

关键点在于:即使你引用的是期刊正式版,也不妨碍你把arXiv扩展信息一起写进BibTeX条目里。这样编译出来的参考文献列表会同时显示期刊信息和arXiv信息,读者既能去期刊库下载正式版,也能去arXiv查看历史版本。需要注意的是,如果你引用的结论在arXiv版和期刊版之间存在细节差异,应在正文的引用位置附近以“see also arXiv:xxxx”的形式说明你参考的具体是哪一个,不要让编辑和审稿人去猜。

4. 版本问题与引用细节:把最容易翻车的点讲透

4.1 v1和v2到底该引哪个

这是个经常被问到的问题,但答案取决于你引用的是什么内容。如果你引用的是论文的核心贡献、通用方法,那引最新版即可。但如果你引用的具体是某个公式、某个定理、某段数据的分析,就必须搞清楚这个内容在哪一版才有,然后明确标注对应版本号。

我遇到过一个很典型的案例:有篇论文在v1中提出了一个引理,后来作者在v2中发现这个引理的条件不够严谨,修改后需要额外的正则性假设。如果你在论文里说“根据该引理”,但实际上引的是v1,而读者下载到的是v2,那你的推理链条在读者眼中就是断掉的。所以我的习惯是,在真正动手写引用之前,先点开abs页面的不同版本,确认你依赖的那个关键结论在各版本中是否存在、是否一致。如果有变动,宁可在引用中标注得更啰嗦,也不要冒咬文嚼字的风险。

4.2 arXiv ID、DOI、URL三者的关系

这三个不是一回事,但在实际引用中经常被混用。

arXiv ID是arXiv体系的永久标识,格式如1706.03762,它由系统分配,不可更改,用它定位论文最稳定。

DOI是数字对象标识符,是期刊出版界通用的标识。arXiv论文本身没有DOI,但每一篇在arXiv上发布的论文在2023年后可以获得一个DataCite DOI(见下文4.3节)。如果论文后来被期刊接收,期刊会分配一个新的DOI,这个DOI指向正式出版版本。也就是说,一篇论文可能有两个DOI:一个来自arXiv的数据镜像,一个来自出版社。

URL是统一的资源定位符,在引用格式中通常写成https://arxiv.org/abs/1706.03762。但要注意,这个URL是“绝对稳定”的,不管版本如何更新,这个地址指向的都是abs页面,用户在这个页面上可以选择查看哪个版本。而如果写成https://arxiv.org/pdf/1706.03762v3,就精确指向了v3版本的PDF。

在实际的参考文献列表中,BibTeX的eprint字段应该存放arXiv ID本身,不包含网址前缀。各种参考文献管理软件会自动拼出URL。你最好不要手动在eprint字段里塞一个完整的https://arxiv.org/abs/...,这会导致某些期刊模板输出两遍URL,非常难看。

4.3 2023年后的新机制:arXiv DOI前缀变化

2022年11月,arXiv与DataCite达成合作,之后所有新提交的论文会自动获得一个带有10.48550前缀的DOI。这意味着你在引用2023年1月之后的新论文时,可以直接在BibTeX里使用这个DOI,而不一定需要走eprint字段的曲线流程。

这个DOI在arXiv左侧栏的“DOI”位置可见,格式类似于10.48550/arXiv.2401.12345。在BibTeX中,如果你把这个DOI放进doi字段,参考文献会显示DOI链接;如果你用的是真的老旧模板,也可以把arXiv信息放进辅助字段。我个人建议两者都放,即DOI字段放正式的DataCite DOI,eprint字段照旧放arXiv ID,这样兼容性最好:现代工具链优先解析DOI,老工具也能通过eprint字段知道这是arXiv论文。

但有一点必须说清楚:这个DataCite DOI并不代表“同行评审通过”,它只是数字化对象标识,它的作用只是让arXiv论文在全球DOI注册体系中有唯一身份。你不能在论文中把带这个DOI的条目当作正式出版物来引用。

5. 常见错误与排查实录:这些年我见过的引用事故

5.1 五个高频错误速查表

下面这五个错误反复出现在学生初稿和投稿退回的意见里,我把它们整理成表格,方便你自查。

错误类型具体表现后果解决方案
版本缺失未标注v1/v2,只写arXiv ID读者无法确定你参考的内容是否被后续修改在note或howpublished字段写清楚版本号
作者截断不规范手动从页面复制,作者列表不完整某些期刊编辑要求列出全部作者,否则退回从meta标签或ADS等数据库核对完整作者
eprint字段混入URLeprint = {https://arxiv.org/abs/xx}编译后网址重复或显示错误eprint只写ID,不带前缀
DOI与arXiv信息冲突DOI指向期刊版,但引用的是预印本内容内容与载体不匹配,被质疑学术严谨性双引用时在正文明确说明参考的是哪个
年份与版本日期混淆year写的是最新版更新年份,而不是引用当年学术不端风险year填原始发表年份,版本号单独标注

这五个错误的共同根源其实只有一个:图省事,不愿意点开abs页面逐项核对。引用是一个白纸黑字的技术活,当你的论文写完之后,审稿人完全有能力也完全有理由去核对你的每一条参考文献是否存在、是否真实支撑了你的论点。与其事后花大力气去修正,不如写的时候就慢下来。

5.2 不同文献管理工具的操作差异

如果你使用Zotero或Mendeley管理文献,在抓取arXiv论文信息时会遇到一个共性问题:工具自动抓取的元数据通常是最新版本的,不会提示你版本历史。

Zotero正确的操作方式是,在arXiv页面上用浏览器插件保存论文后,手动编辑条目,在“Extra”字段里补上你实际参考的版本信息。具体做法是右键条目 → 编辑 → Extra字段,填入arXiv:2401.12345v2,这样导出的BibTeX就会带上这个标记。

Mendeley的自动抓取逻辑类似,但它在同步到云端后有时会覆盖你手动修改的字段。如果你的引用信息包含特殊版本标注,建议先把Mendeley的云同步暂停,修改完条目标注后再重新同步,否则容易出现改完又被自动抓取覆盖的情况。

另外一个很多人不知道的小技巧:直接用ADSBib或INSPIRE-HEP这类学科数据库找arXiv条目。比如在天体物理和粒子物理领域,INSPIRE-HEP的BibTeX格式做得非常规范,它会自动把arXiv版本和正式期刊版合并成一个条目,还自带DOI、报告编号等额外信息。对于计算机视觉、自然语言处理等方向,Google Scholar的导出也可以用,但需要检查它是否把手动标注的笔记信息带入字段中。

5.3 容易忽略的LaTeX编译细节

再说一个编译层面的坑。某次我的学生写论文,引用了arXiv论文,编译时一直报错。检查发现他在BibTeX条目里写了author = {Author, A. and Author, B.},这没问题;但标题里包含了一个特殊字符如$ \mathcal{L}$,BibTeX没做转义处理,导致编译失败。解决方法是把特殊字符用双引号包起来,或者用{\"u}这样的LaTeX转义形式。

还有一次,学生引用了一篇标题里包含&符号的论文,BibTeX里直接写Attention & Beyond,编译报错。正确的做法是写Attention \& Beyond。这些细节虽然在正式代码块里看起来简单,但实际写作中非常容易漏掉,因为你是从网页复制的纯文本,粘贴进BibTeX后特殊字符没有自动转义。

6. 我个人的一些习惯和最后建议

先说说我自己沉淀下来的稳定习惯。我在自己的论文中引用arXiv论文时,会遵循一个“三查三确认”的流程:查版本号,确认你读的是v几;查作者全表,确认没有截断;查题目原句,确认语言拼写没有被网页格式干扰过。这个流程看起来很死板,但它帮我避免过至少三起引用事故。其中最严重的一次是一篇论文在标题中使用了特殊的数学符号排版,我复制的标题在全角半角之间发生了不可见的变化,投稿后审稿人指出标题与实际不一致,最后只能发勘误。

另一个值得一提的技巧是,在写引言中文献综述段落时,如果涉及多篇arXiv论文,我会按“版本相关度”而不是“时间顺序”排序。版本相关度是一个我自创的概念,含义是:如果某篇论文的最新版与你的论点最贴合,尽管它原始发布时间更早,它也应当排在前面。这样读者在你的文献综述中扫过一眼,就能知道你依赖的学术依据是“稳定的近期共识”还是“仍在演进中的预印本”。

最后说一个关于引用态度的体会。arXiv的文献引用不像期刊论文那样有一个“权威答案”,因为arXiv本身不是权威发布渠道。但恰恰因为它的灵活性和开放性,我们在引用它的时候更要自觉、严谨。一个负责任的科研工作者,应该像记录实验参数一样记录引用信息:版本、日期、环境、动机。只有这样才能保证,几年后有人翻阅你的论文时,能像考古一样一层层剥离出当时的知识轮廓。这也是我愿意写这篇教程的直接原因——技术细节都是小事,但科研写作的严谨态度是从每一个citation开始的。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询