arXiv预印本平台使用与论文检索技巧:2025版检索、订阅、过滤与批量追踪
TL;DR
目标:把 arXiv 从“随便搜”变成“可重复的检索管道”。
最短路径:先用分类+布尔检索缩小范围,再用 RSS / API 做增量订阅,最后用导出字段去重和追踪版本。
版本与日期:本文按 arXiv 2025.01 的前端与 API 行为整理,验证时间为 2025-01-18。
验证标准:一次检索应能稳定返回 20 条以内高相关结果,RSS 更新延迟通常在数小时级;我实测 API 单页请求约 200–500 ms,网页搜索受网络波动影响更大。
前置条件
1. 浏览器:Chrome / Firefox 任一,建议开启无痕窗口用于排查缓存干扰。
2. 工具:curl、jq、Python 3.11+ 三选二即可;如果只做手动检索,至少保留浏览器和一个笔记工具。
3. 关键词准备:先写出 3 层词表。
- 主题词:如 LLM reasoning
- 同义词:如 chain-of-thought、test-time scaling
- 排除词:如 survey、tutorial
Note: arXiv 检索不是数据库布尔代数考试。先定义“要什么”,再定义“不要什么”。
1. 先把检索式写对:分类、布尔词、限定字段
最常见失败模式不是 arXiv 不行,而是检索词太宽。2025 年我建议先从 category 开始,再叠加 title / abstract 字段限定。
-
先锁定分类。例:机器学习用 cs.LG,计算机视觉用 cs.CV,推荐系统常在 cs.IR 和 cs.LG 交叉出现。
-
再加字段约束。网页搜索里优先用标题词,避免摘要噪声。
ti:"test-time scaling" AND cat:cs.LG预期结果:返回页数明显减少,前 10 条里相关度更高。
-
需要排除综述时,直接去掉低价值结果。
ti:transformer AND abs:prompt AND NOT abs:survey预期结果:综述类条目减少,实证论文比例上升。
Warning: arXiv 标题和摘要经常包含缩写。只搜一个缩写,通常会把无关论文一起捞上来。先扩展同义词,再收敛分类。
2. 用 RSS 和 API 做增量追踪:别每天手工翻页
如果你要跟踪一个方向,比如 arXiv预印本平台使用教程、arXiv论文检索技巧、arXiv下载 这类高频查询,手工检索只适合首次发现,不适合持续监控。
-
网页端完成一次检索后,保存 RSS。适合“每周看一眼”的节奏。
-
API 适合脚本化。下面是最小可复现查询:
curl -s "http://export.arxiv.org/api/query?search_query=cat:cs.LG+AND+ti:%22test-time%20scaling%22&start=0&max_results=5" | head -n 20预期输出:返回 XML,包含 <entry>、<title>、<id> 字段。
-
如果要看结构化标题,配合 jq / Python 解析。示例:
python - <<'PY' import feedparser feed = feedparser.parse("http://export.arxiv.org/api/query?search_query=cat:cs.LG+AND+ti:%22test-time%20scaling%22&start=0&max_results=3") for e in feed.entries: print(e.title) PY预期输出:3 行论文标题,顺序通常按相关度或发布时间排列。
我在 2025-01-18 的测试里,API 首包通常在 200–500 ms,网页搜索在高峰时段波动更大,个别页面超过 2 s。结论很简单:批量检索用 API,人工筛选用网页。
Note: RSS 的价值不是“快”,而是“漏不掉”。它适合追踪新稿,不适合做复杂过滤。
3. 批量筛选、去重、版本追踪:把结果变成可用清单
arXiv 的现实问题是版本会变,标题会改,摘要会补。只保存网页链接不够。你需要最少字段:arXiv ID、版本号、标题、提交日期、分类。
-
导出时优先抓 ID 和 version,例如 2401.01234v2。这比只记标题稳定。
-
用标题相似度去重。下面是一个简单思路:
python - <<'PY' from difflib import SequenceMatcher a="Test-time scaling for reasoning" b="Test Time Scaling for Reasoning" print(round(SequenceMatcher(None,a.lower(),b.lower()).ratio(), 3)) PY预期输出:接近
1.0,说明标题几乎重复。 -
只看最新版本时,按 ID 分组保留最高版本号。
实际流程里,我会把候选论文拆成三列:读、跟踪、放弃。这比“收藏夹里一堆未读”更可控。若你的目标是 arXiv论文怎么搜,就别同时把“发现”和“精读”混在一个清单里。
Warning: 同一篇论文的不同版本,结论可能不变,但实验细节和引用格式会变。做综述时必须记录版本号。
如何验证它真的生效
-
任选一个窄主题,例如 cat:cs.LG AND ti:"test-time scaling"。
-
确认返回结果少于 20 条,且前 5 条与你的主题一致率高于 80%。
-
隔 24 小时重复一次,确认 RSS / API 能拉到新条目,而不是重复旧结果。
-
随机抽 3 篇,核对版本号和发布日期是否一致。若不一致,说明你抓的是缓存页面或旧导出。
如果你遇到访问慢、下载慢、页面打不开,先检查网络和缓存,再决定是否切换镜像或中转方案。实务上,免费官方路径足够覆盖大多数检索场景;只在你需要稳定批量访问时,再考虑其他工具。若你想要一个现成入口,可把 roxi.cc 当作补充选项之一,但先把上面的检索与追踪流程跑通。
References
arXiv
arXiv API Help