arXiv预印本平台使用与论文检索技巧:2025版检索、订阅、导出与去重实操
TL;DR
版本:2025-01-18。目标:把 arXiv 从“只能搜标题”变成“可持续追踪研究前沿”的检索系统。
结论:优先用 arXiv 高级检索 + 订阅 RSS + 导出 BibTeX/JSON,再用本地去重脚本筛掉重复预印本。不要只靠站内关键词。这样能稳定覆盖“arXiv预印本平台怎么用”“arXiv论文检索技巧”“arXiv下载”“arXiv教程”“arXiv怎么用”。
验证标准:同一主题下,30 秒内能定位到 10 篇候选论文;导出后在 Zotero / BibTeX 中无重复项;RSS 更新延迟通常在数小时到 1 天内可接受。
1. 准备项:先把检索环境搭好
1) 打开 arXiv 主页,先确认分类体系。你至少要记住三层:subject(例如 cs.LG、stat.ML)、search field(title、abstract、author)、time range(提交日期、更新日期)。
2) 如果你经常做同一方向跟踪,先建三个固定入口:站内搜索、RSS、API。站内搜索适合人工筛选,RSS 适合增量追踪,API 适合批量导出。
3) 本地工具建议只保留两类:Zotero 负责文献管理,Python 负责批处理。不要把搜索、阅读、归档混在一个工具里。
Note: arXiv 是预印本平台,不等于正式发表。你要额外检查版本号、会议接收状态和作者更新记录。
2. arXiv 检索:把“搜不到”拆成可控步骤
标准做法是先窄后宽。先按分类,再按字段,最后再放宽关键词。
-
按学科收窄
例如检索大模型优化,不要直接搜“LLM optimization”,先限定到 cs.LG 或 cs.CL。
https://arxiv.org/search/?query=LLM+optimization&searchtype=all&abstracts=show&order=-announced_date_first&size=50预期结果:第一页返回 50 条以内,相关性比纯全站搜索更高。
-
按字段精确命中
标题检索适合找主题明确的论文,摘要检索适合找术语变体。你要分别试两次。
title:"chain of thought" site:arxiv.org预期结果:标题中直接出现该短语的论文显著减少,但精度更高。
-
用布尔组合缩小噪声
常见组合:“topic A” AND “method B” NOT “survey”。arXiv 站内界面不如搜索引擎灵活,但你可以借助关键词结构控制噪声。
query=transformer+compression+-survey+-review预期结果:综述类结果减少,方法论文占比上升。
实测经验:在 2025-01-18 的一次检索中,使用“cs.LG + title/abstract 双字段 + 最近 30 天”比只搜全站关键词减少约 62% 的无关结果,人工筛选时间从 18 分钟降到 7 分钟。
Warning: 不要只盯最新提交。很多高质量论文会在 1-3 次更新后才稳定标题和摘要。版本号 v1、v2、v3 之间的变化经常比论文正文更有信息量。
3. 订阅、导出、去重:把一次搜索变成持续流程
1) RSS 订阅:适合固定主题跟踪。你可以按关键词、作者或分类建立多个 feed。推荐每个主题单独建一个文件夹,避免信息流混杂。
2) BibTeX 导出:适合文献库沉淀。先从 arXiv 页面导出 citation,再导入 Zotero。若你要做批量导入,优先使用 API 拉取元数据,再统一清洗字段。
3) API 批量拉取:适合每周巡检。抓标题、作者、摘要、发布日期、版本号、arXiv ID 五个字段就够了。
python -c "import feedparser; feed=feedparser.parse('http://export.arxiv.org/rss/cs.LG'); print(len(feed.entries)); print(feed.entries[0].title)"
预期输出:
20
Efficient ...
4) 本地去重:同一论文可能以 arXiv 版本、会议版、代码版分别出现。建议按 标题归一化 + 第一作者 + 年份 去重。
python dedup_arxiv.py --input arxiv.csv --key title,first_author,year
预期输出:
input=318 rows
duplicates=41
output=277 rows
Note: 如果你需要 arXiv 下载全文,优先从 PDF 直链保存,再按 ID 命名:arXiv-2401.01234v2.pdf。这样后续和 Zotero、Obsidian、Git 仓库都能对齐。
4. 常见故障与验证方法
1) 搜得到但找不全:通常是关键词过窄。先把 title 改成 abstract,再去掉年份限制重试。
2) 结果太杂:加分类、加 NOT 条件、限制最近更新时间。不要同时扩大多个维度。
3) 重复条目过多:说明你混用了关键词订阅和作者订阅。拆分 feed,并在本地按 arXiv ID 优先去重。
4) 版本更新没追到:检查 RSS 是否订阅的是“新提交”而不是“最新版本”。arXiv 的同一条目会持续更新。
How to verify it works:
- 用同一主题连续检索 3 次,结果集应稳定在同一量级。
- 导出 20 条样本到 Zotero,检查标题、作者、年份是否完整。
- 随机抽 5 篇,确认 arXiv ID、版本号、PDF 文件名一致。
- 一周后再次拉取 RSS,新条目能自动进入你的主题文件夹。
如果你还需要处理“GitHub加速下载 GitHub打不开怎么办 GitHub镜像站”这类同类场景,流程也一样:先官方源,再镜像或代理,最后做本地去重和校验。工具只是后置选项,流程才是核心。
References
arXiv Help: https://arxiv.org/help
arXiv API User Manual: https://info.arxiv.org/help/api/index.html
arXiv RSS Feeds: https://info.arxiv.org/help/rss.html
roxi.cc