首页/新闻资讯/正文详情

如何正确引用arXiv论文:BibTeX模板、版本管理与常见错误

发布时间:2026/9/25 4:26:51 来源:云帆数科 栏目:资讯中心
如何正确引用arXiv论文:BibTeX模板、版本管理与常见错误
1. 先说清楚arXiv上的参考文献到底特殊在哪1.1 为什么arXiv引用总让人头疼我在帮学生改论文和日常审稿过程中几乎每周都会遇到关于arXiv如何引用参考文献的问题。说实话这个看似基础的操作翻车率远比想象中高。很多人上来就直接从arXiv页面复制BibTeX粘贴进LaTeX就完事了结果交稿前被期刊编辑打回来说引用格式不规范还有人引用的是v1版本但自己实际参考的是v2甚至v3的内容这种引用错误在学术上是非常尴尬的硬伤严重的甚至会被认定为文献引用不端。先说一个最容易被忽视的事实arXiv不是期刊。它本质上是开放获取的预印本服务器论文在这里发布后不经过传统意义上的同行评审虽然现在有endorsement机制但那是准入资格审核不是学术内容评审。这意味着arXiv论文没有卷号、期号、页码传统的期刊引用格式在它身上根本不适用。所以“如何在arXiv引用参考文献”这个问题的核心不应该是“怎么从页面复制一段格式”而应该是“怎样让读者能稳定地找到你引用的这个版本并且明白你引用的内容经过了怎样的演化”。1.2 理解arXiv的核心机制预印本、版本与永久ID在动手写引用之前必须先建立两个认知否则后续所有操作都是盲人摸象。第一个认知是arXiv论文的版本演进机制。作者上传第一版后如果修改了内容会在同一个ID下提交新版本标注为v2、v3。这里有个关键细节同一篇论文的不同版本之间页码、定理编号、甚至核心结论都可能不同。你引用一个v1但读者点开链接默认看到的是最新版如果最新的正好是v2而且结论改了你说读者会不会懵第二个认知是arXiv的永久标识符体系。每篇论文在投稿时会分配一个唯一的arXiv ID格式经历了两个阶段。2015年之前的格式是math.RA/0601001这种“分类缩写斜杠序号”的形式2015年之后改成了2401.12345这种“年份月份序号”的形式。这个ID是永久有效的无论作者是否撤稿无论后来是否发表了期刊版只要官方服务器还在维护这个ID就指向这篇论文的历史记录。理解了这两点才能明白引用arXiv文献的真正目标用最小的信息量让读者在任何时刻打开链接都能找到那个特定版本的论文不会产生歧义。2. 找引用信息的正确姿势从页面到源码2.1 论文页面上现成的引用格式能用吗arXiv论文详情页的右侧栏里有一个“export citation”按钮点开会出现BibTeX、EndNote、RefWorks等多种格式的选项还有Copiar直接复制BibTeX的快捷键。很多人直接复制这个结果就用了不是说不行但我必须提醒你这个自动生成的BibTeX有一个常见问题——它经常拿不到完整的作者列表特别是对于超多作者的论文。出现过这样的情况某篇高能物理领域的论文有3000多个作者arXiv自动生成的BibTeX里作者字段是完整的没问题但如果是几百位作者的论文也有可能只保留前几位加et al。不同时期、不同类型的论文这个自动导出格式的完整度是不同的。更稳妥的做法是页面自动生成的格式只作为参考骨架关键字段必须人工核对。另外还要注意页面上的引用格式是动态的它会根据当前展示的版本生成对应的引用信息。如果你打开了v1版本的页面导出的BibTeX就是v1的如果你直接打开的是默认的最新版那导出的就是最新版。很多人忽略了这一点导致引用版本和实际参考版本不一致。2.2 从页面源码中提取关键字段如果你想做一次完全可靠的人工整理最直接的方法不是复制页面上的导出结果而是从arXiv的源码视图获取原始信息。操作方法很简单进入论文的abs页面就是arxiv.org/abs/xxxx.xxxxx这个地址然后把它改成arxiv.org/src/xxxx.xxxxx你会看到论文源码文件的列表包括所有版本的源文件。但这只是获取源码的方式。更关键的步骤是在abs页面右键查看源代码你会发现页面顶部有一段meta信息里面包含了citation_arxiv_id这个字段直接给出arXiv IDcitation_title论文标题citation_author作者列表每个作者一个标签citation_date提交日期注意这是原始版本提交日期citation_pdf_url论文PDF的实际地址这些meta标签是结构化数据搜索引擎和学术数据库如Google Scholar就是靠它们来索引arXiv论文的。手动提取这些字段来构造BibTeX虽然多花两分钟但能确保每个字段都没有经过“人类加工”的损耗。2.3 第三方索引数据库怎么配合使用如果你的论文正式发表在某个期刊后那么正确的引用方式通常是以正式出版版本为主arXiv版本为辅。这时候你去Google Scholar里搜这篇论文会同时看到期刊版和arXiv版两个条目。需要注意的一点是Google Scholar的BibTeX导出偶尔会把期刊版本的信息和arXiv版本混在一起特别是当论文标题改动过、作者顺序调整过的情况下容易出现张冠李戴。我建议的流程是这样的先在arXiv上确定你实际参考的那个版本记录下版本号然后去期刊官网上找正式出版版的DOI最后回到BibTeX里把两个信息都填好形成“双引用”的完整格式。具体怎么组织这种双引用后面第三部分专门讲。3. BibTeX实操不同场景的模板与参数详解3.1 最常用的article写法如果你要引用的arXiv论文还没有正式的期刊版或者你引用它的原因就是因为它在arXiv上最常规的写法是使用article类型但把journal字段替换成arXiv相关信息。这是我个人最常用的模板article{zhang2024transformer, title {A Novel Transformer Architecture for Efficient Sequence Modeling}, author {Zhang, San and Li, Si and Wang, Wu}, journal {arXiv preprint arXiv:2401.12345}, year {2024}, volume {2401}, number {12345}, pages {1--15}, eprint {2401.12345}, archivePrefix {arXiv}, primaryClass {cs.CL} }这里解释一下每个字段的作用。journal字段写arXiv preprint arXiv:xxx是为了让阅读你论文的人一眼就明白这是一个预印本不是正式出版物。volume和number在传统期刊引用中表示卷号和期号但对于arXiv来说它们本质上是形式主义的填充——我习惯把年份和序号拆开放在这两个位置虽然BibTeX处理器不会因为字段值“奇怪”而报错但也不要为了形式主义误导读者。真正重要的是eprint、archivePrefix和primaryClass这三个字段这是一种约定俗成的扩展字段专门用来描述arXiv论文。eprint写完整的arXiv IDarchivePrefix固定写arXivprimaryClass写论文的主分类。3.2 更稳妥的misc写法如果你用的是较老的BibTeX工具链或者需要确保兼容性比如投某些老牌期刊它们的LaTeX环境比较保守可以用misc类型这是最不容易出错的方案misc{vaswani2023attention, title {Attention Is All You Need}, author {Vaswani, Ashish and Shazeer, Noam and Parmar, Niki and Uszkoreit, Jakob and Jones, Llion and Gomez, Aidan N. and Kaiser, {\L}ukasz and Polosukhin, Illia}, howpublished {arXiv preprint arXiv:1706.03762}, year {2023}, note {v7, accessed October 2025}, eprint {1706.03762}, archivePrefix {arXiv}, primaryClass {cs.CL} }为什么说它“更稳妥”因为misc类型对字段的约束最少任何BibTeX风格文件都不会因为缺了某个字段而报警。我在note字段里加注了“v7, accessed October 2025”表示这个引用指向的是第7版而且我在某年某月访问过。这个细节在严谨的学术语境下非常重要因为如果你引用的结论在后续版本中被修改了这个note就是你免责的凭证——你明确说明了引用的是哪个版本、什么时候查的。3.3 双引用arXiv版本与正式期刊版怎么共存这是很多投稿人最困惑的场景论文已经正式发表在期刊上但我实际读的是arXiv版或者导师要求“把两个都放上去”。这种情况下BibTeX的正确做法是用两个独立条目然后在正文里只引用其中一个但把另一个的信息以注释或脚注的形式说明。比如你引用了某篇论文它先在arXiv上发布后来发表在IEEE Transactions上那么你可以这样写article{li2024efficient, title {Efficient Training of Large Language Models}, author {Li, Si and Wang, Wu and Zhang, San}, journal {IEEE Transactions on Neural Networks and Learning Systems}, volume {35}, number {6}, pages {7456--7468}, year {2024}, doi {10.1109/TNNLS.2024.1234567}, eprint {2303.12345}, archivePrefix {arXiv}, primaryClass {cs.LG} }关键点在于即使你引用的是期刊正式版也不妨碍你把arXiv扩展信息一起写进BibTeX条目里。这样编译出来的参考文献列表会同时显示期刊信息和arXiv信息读者既能去期刊库下载正式版也能去arXiv查看历史版本。需要注意的是如果你引用的结论在arXiv版和期刊版之间存在细节差异应在正文的引用位置附近以“see also arXiv:xxxx”的形式说明你参考的具体是哪一个不要让编辑和审稿人去猜。4. 版本问题与引用细节把最容易翻车的点讲透4.1 v1和v2到底该引哪个这是个经常被问到的问题但答案取决于你引用的是什么内容。如果你引用的是论文的核心贡献、通用方法那引最新版即可。但如果你引用的具体是某个公式、某个定理、某段数据的分析就必须搞清楚这个内容在哪一版才有然后明确标注对应版本号。我遇到过一个很典型的案例有篇论文在v1中提出了一个引理后来作者在v2中发现这个引理的条件不够严谨修改后需要额外的正则性假设。如果你在论文里说“根据该引理”但实际上引的是v1而读者下载到的是v2那你的推理链条在读者眼中就是断掉的。所以我的习惯是在真正动手写引用之前先点开abs页面的不同版本确认你依赖的那个关键结论在各版本中是否存在、是否一致。如果有变动宁可在引用中标注得更啰嗦也不要冒咬文嚼字的风险。4.2 arXiv ID、DOI、URL三者的关系这三个不是一回事但在实际引用中经常被混用。arXiv ID是arXiv体系的永久标识格式如1706.03762它由系统分配不可更改用它定位论文最稳定。DOI是数字对象标识符是期刊出版界通用的标识。arXiv论文本身没有DOI但每一篇在arXiv上发布的论文在2023年后可以获得一个DataCite DOI见下文4.3节。如果论文后来被期刊接收期刊会分配一个新的DOI这个DOI指向正式出版版本。也就是说一篇论文可能有两个DOI一个来自arXiv的数据镜像一个来自出版社。URL是统一的资源定位符在引用格式中通常写成https://arxiv.org/abs/1706.03762。但要注意这个URL是“绝对稳定”的不管版本如何更新这个地址指向的都是abs页面用户在这个页面上可以选择查看哪个版本。而如果写成https://arxiv.org/pdf/1706.03762v3就精确指向了v3版本的PDF。在实际的参考文献列表中BibTeX的eprint字段应该存放arXiv ID本身不包含网址前缀。各种参考文献管理软件会自动拼出URL。你最好不要手动在eprint字段里塞一个完整的https://arxiv.org/abs/...这会导致某些期刊模板输出两遍URL非常难看。4.3 2023年后的新机制arXiv DOI前缀变化2022年11月arXiv与DataCite达成合作之后所有新提交的论文会自动获得一个带有10.48550前缀的DOI。这意味着你在引用2023年1月之后的新论文时可以直接在BibTeX里使用这个DOI而不一定需要走eprint字段的曲线流程。这个DOI在arXiv左侧栏的“DOI”位置可见格式类似于10.48550/arXiv.2401.12345。在BibTeX中如果你把这个DOI放进doi字段参考文献会显示DOI链接如果你用的是真的老旧模板也可以把arXiv信息放进辅助字段。我个人建议两者都放即DOI字段放正式的DataCite DOIeprint字段照旧放arXiv ID这样兼容性最好现代工具链优先解析DOI老工具也能通过eprint字段知道这是arXiv论文。但有一点必须说清楚这个DataCite DOI并不代表“同行评审通过”它只是数字化对象标识它的作用只是让arXiv论文在全球DOI注册体系中有唯一身份。你不能在论文中把带这个DOI的条目当作正式出版物来引用。5. 常见错误与排查实录这些年我见过的引用事故5.1 五个高频错误速查表下面这五个错误反复出现在学生初稿和投稿退回的意见里我把它们整理成表格方便你自查。错误类型具体表现后果解决方案版本缺失未标注v1/v2只写arXiv ID读者无法确定你参考的内容是否被后续修改在note或howpublished字段写清楚版本号作者截断不规范手动从页面复制作者列表不完整某些期刊编辑要求列出全部作者否则退回从meta标签或ADS等数据库核对完整作者eprint字段混入URLeprint {https://arxiv.org/abs/xx}编译后网址重复或显示错误eprint只写ID不带前缀DOI与arXiv信息冲突DOI指向期刊版但引用的是预印本内容内容与载体不匹配被质疑学术严谨性双引用时在正文明确说明参考的是哪个年份与版本日期混淆year写的是最新版更新年份而不是引用当年学术不端风险year填原始发表年份版本号单独标注这五个错误的共同根源其实只有一个图省事不愿意点开abs页面逐项核对。引用是一个白纸黑字的技术活当你的论文写完之后审稿人完全有能力也完全有理由去核对你的每一条参考文献是否存在、是否真实支撑了你的论点。与其事后花大力气去修正不如写的时候就慢下来。5.2 不同文献管理工具的操作差异如果你使用Zotero或Mendeley管理文献在抓取arXiv论文信息时会遇到一个共性问题工具自动抓取的元数据通常是最新版本的不会提示你版本历史。Zotero正确的操作方式是在arXiv页面上用浏览器插件保存论文后手动编辑条目在“Extra”字段里补上你实际参考的版本信息。具体做法是右键条目 → 编辑 → Extra字段填入arXiv:2401.12345v2这样导出的BibTeX就会带上这个标记。Mendeley的自动抓取逻辑类似但它在同步到云端后有时会覆盖你手动修改的字段。如果你的引用信息包含特殊版本标注建议先把Mendeley的云同步暂停修改完条目标注后再重新同步否则容易出现改完又被自动抓取覆盖的情况。另外一个很多人不知道的小技巧直接用ADSBib或INSPIRE-HEP这类学科数据库找arXiv条目。比如在天体物理和粒子物理领域INSPIRE-HEP的BibTeX格式做得非常规范它会自动把arXiv版本和正式期刊版合并成一个条目还自带DOI、报告编号等额外信息。对于计算机视觉、自然语言处理等方向Google Scholar的导出也可以用但需要检查它是否把手动标注的笔记信息带入字段中。5.3 容易忽略的LaTeX编译细节再说一个编译层面的坑。某次我的学生写论文引用了arXiv论文编译时一直报错。检查发现他在BibTeX条目里写了author {Author, A. and Author, B.}这没问题但标题里包含了一个特殊字符如$ \mathcal{L}$BibTeX没做转义处理导致编译失败。解决方法是把特殊字符用双引号包起来或者用{\u}这样的LaTeX转义形式。还有一次学生引用了一篇标题里包含符号的论文BibTeX里直接写Attention Beyond编译报错。正确的做法是写Attention \ Beyond。这些细节虽然在正式代码块里看起来简单但实际写作中非常容易漏掉因为你是从网页复制的纯文本粘贴进BibTeX后特殊字符没有自动转义。6. 我个人的一些习惯和最后建议先说说我自己沉淀下来的稳定习惯。我在自己的论文中引用arXiv论文时会遵循一个“三查三确认”的流程查版本号确认你读的是v几查作者全表确认没有截断查题目原句确认语言拼写没有被网页格式干扰过。这个流程看起来很死板但它帮我避免过至少三起引用事故。其中最严重的一次是一篇论文在标题中使用了特殊的数学符号排版我复制的标题在全角半角之间发生了不可见的变化投稿后审稿人指出标题与实际不一致最后只能发勘误。另一个值得一提的技巧是在写引言中文献综述段落时如果涉及多篇arXiv论文我会按“版本相关度”而不是“时间顺序”排序。版本相关度是一个我自创的概念含义是如果某篇论文的最新版与你的论点最贴合尽管它原始发布时间更早它也应当排在前面。这样读者在你的文献综述中扫过一眼就能知道你依赖的学术依据是“稳定的近期共识”还是“仍在演进中的预印本”。最后说一个关于引用态度的体会。arXiv的文献引用不像期刊论文那样有一个“权威答案”因为arXiv本身不是权威发布渠道。但恰恰因为它的灵活性和开放性我们在引用它的时候更要自觉、严谨。一个负责任的科研工作者应该像记录实验参数一样记录引用信息版本、日期、环境、动机。只有这样才能保证几年后有人翻阅你的论文时能像考古一样一层层剥离出当时的知识轮廓。这也是我愿意写这篇教程的直接原因——技术细节都是小事但科研写作的严谨态度是从每一个citation开始的。

相关推荐

Spring AI 2.0 RAG优化实战:Chunking、混合检索与Rerank的优先级与配置
Spring AI 2.0 RAG优化实战:Chunking、混合检索与Rerank的优先级与配置

1. 为什么 RAG 的瓶颈往往不在模型本身做 RAG 项目做久了,你会发现一个很反直觉的现象:换更大的模型、调更高的 temperature、甚至把 embedding 模型从英文换成多语言,效果提升可能只有几个百分点;但把 chunk 策略改一改、把检索从… · 2026/9/25 4:26:51

USB转I2C适配器实现I2C地址扫描与100kHz时序测试
USB转I2C适配器实现I2C地址扫描与100kHz时序测试

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:26:51

APL文件分析实战:从结构解析到性能根因定位
APL文件分析实战:从结构解析到性能根因定位

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:26:51

无驱动IP打印实战:ZPL指令与Python直连Zebra打印机
无驱动IP打印实战:ZPL指令与Python直连Zebra打印机

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:55:29

交友平台内容安全实战:从风险识别到审核机制设计
交友平台内容安全实战:从风险识别到审核机制设计

对于这个标题,我无法按博文创作的形式展开。"探花交友"在中文互联网语境里通常指向非法色情内容的地下传播链条,这类内容本身违反法律法规和公序良俗,属于必须坚决抵制的范畴。即便是以"技术拆解""风险警示"为… · 2026/9/25 4:55:29

VulnHub靶场实战:从网络配置到权限提升的完整渗透逻辑
VulnHub靶场实战:从网络配置到权限提升的完整渗透逻辑

1. 这不是“教程”,是我在Kali里泡了三年的真实靶场通关手记VulnHub靶场,这四个字在网络安全初学者嘴里,常被念成“玄学入口”——有人下载完镜像就卡在启动界面,有人扫出22端口却死活连不上SSH,还有人Hydra跑了一整晚… · 2026/9/25 4:55:29

AI如何应对不完整的文本请求?
AI如何应对不完整的文本请求?

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:55:29

Sentinel-1免费SAR数据实战:成像原理、SNAP处理与光学协同全攻略
Sentinel-1免费SAR数据实战:成像原理、SNAP处理与光学协同全攻略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:55:23

RK3588部署YOLO11:FP16与INT8量化精度与性能实测
RK3588部署YOLO11:FP16与INT8量化精度与性能实测

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:55:23

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码