arXiv预印本高效文献发现与筛选:基于标签策略的工程实践 (v2024.11.15)
TL;DR: 本文档旨在为科研人员提供一种系统性的方法,高效利用arXiv预印本平台进行文献发现与筛选。重点阐述标签分类理解、高级搜索语法应用及自动化订阅配置,以规避信息过载并提升检索精度。
前置条件
- 有效互联网连接。
- 对领域关键词有基本了解。
1. arXiv标签分类体系解析
arXiv平台依赖其内部的分类标签系统来组织和索引提交的预印本。理解这些标签是进行精准检索的基础。例如,cs.AI指代的是计算机科学领域中的人工智能子类。
Note: 每个标签通常包含一个主分类(如cs)和一个子分类(如AI)。熟悉常用标签可显著缩短检索路径。
- 查看分类列表:
访问arXiv分类页面以获取完整的标签列表及描述。
2. 高级搜索语法与精准匹配
熟练运用arXiv的高级搜索语法是实现文献高效发现的关键。结合逻辑运算符和字段限定符可以显著提高检索结果的相关性。
Warning: 关键词过多或语法错误会导致检索结果不准确或无结果。建议从简单查询入手,逐步细化。
- 基本关键词搜索:
- 字段限定搜索:
- 使用分类标签组合搜索:
- 日期范围限定:
直接在搜索框输入关键词。
(LLMs AND ethics) OR (large language model AND bias)
预期输出: 包含“LLMs”和“ethics”或“large language model”和“bias”的论文。
(注: 实际输出为arXiv搜索结果页面)
使用ti:(Title), au:(Author), abs:(Abstract)等限定符将关键词限制在特定字段。
ti:(federated learning) AND au:(Konečný)
预期输出: 标题包含“federated learning”且作者为“Konečný”的论文。
(注: 实际输出为arXiv搜索结果页面)
在搜索查询中明确指定分类标签,进行跨分类或特定分类检索。
cat:cs.CV AND ti:(object detection)
预期输出: 计算机视觉领域中标题包含“object detection”的论文。
(注: 实际输出为arXiv搜索结果页面)
通过URL参数或高级搜索界面限定发表日期,获取最新研究成果。
方法一:URL参数(示例,需手动构建URL)
https://arxiv.org/search/advanced?advanced=()&date-filter_by=submitted_date&date-filter_start=2024-01-01&date-filter_end=2024-03-31
查询2024年1月1日至2024年3月31日内提交的文档。
3. RSS订阅与自动化追踪
为持续追踪感兴趣的领域,配置RSS订阅是高效信息获取的“arXiv预印本下载”策略。
- 生成RSS订阅链接:
- RSS阅读器集成:
在每次搜索结果页面的左侧,通常会提供一个“RSS Feed”选项。
示例搜索页面的RSS链接结构:
https://arxiv.org/rss/cs.CL.new
此链接订阅计算机语言学(cs.CL)分类的最新论文。用户可根据自身需求进行修改。
将上述链接添加至喜欢的RSS阅读器(如Feedly, Inoreader等)。
Note: 部分阅读器支持关键词过滤,可进一步精炼推送内容。
References
- arXiv.org Category Taxonomy. (Version 2024.11.15)
- arXiv.org Search Help. (Version 2024.11.15)
- Roxi.cc - GitHub镜像站 for faster access.