首页文献管理数据分析开源社区写作排版
首页数据分析科研数据集整合:Kaggle与Hug

科研数据集整合:Kaggle与Hugging Face平台实用操作指南 (Revision 2024.11.08)

Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR: 本文档旨在为研究人员提供Kaggle和Hugging Face两大开源数据集平台的实用操作指南。内容涵盖API配置、数据集检索、下载以及本地环境集成,确保数据获取的效率与规范性。重点关注命令行操作与自动化流程,减少人工干预。版本:2024.11.08。

1. 环境与API凭证配置

在开始数据集操作前,需确保API凭证已正确配置。这允许命令行工具直接与平台交互,无需浏览器操作。

1.1 Kaggle API配置

Kaggle API凭证用于认证用户身份,以下为配置步骤。此凭证对于进行Kaggle数据集下载至关重要。

  1. 从Kaggle官网生成API Token。
  2. 下载 kaggle.json 文件。
  3. kaggle.json 复制到指定目录。

mkdir -p ~/.kaggle/

mv kaggle.json ~/.kaggle/

chmod 600 ~/.kaggle/kaggle.json

预期输出: 无直接输出,若文件存在则覆盖,若目录不存在则创建。

Note: 确保 kaggle.json 文件权限设置为 600,以防止未授权访问。

1.2 Hugging Face CLI配置

Hugging Face提供 huggingface_hub 库,用于与Hugging Face Hub交互。其CLI工具简化了模型和数据集的管理。这是Hugging Face数据集怎么用的关键一步。

  1. 安装 huggingface_hub

pip install huggingface_hub

预期输出:

Successfully installed huggingface-hub-...
  1. 登录Hugging Face。

huggingface-cli login

预期输出:

Token: 

Add token to git credential helper? (Y/n) y

Note: 输入在Hugging Face官网生成的Access Token (Settings -> Access Tokens)。

2. 数据集检索与下载实践

掌握平台API后,即可高效检索和下载所需数据集,支持Kaggle数据集下载教程和Hugging Face的自动化获取。

2.1 Kaggle数据集操作

使用Kaggle CLI进行数据集检索和下载。

  1. 搜索数据集。

kaggle datasets search "covid-19"

预期输出: 列出包含 "covid-19" 关键词的数据集。

ref                                                                 title                                                size  lastUpdated          downloadCount  voteCount  usabilityRating

------------------------------------------------------------------ -------------------------------------------------- ----- ------------------- ------------- --------- ---------------

allen-institute-for-ai/CORD-19-research-challenge COVID-19 Open Research Dataset Challenge (CORD-19) 46GB 2020-09-02 23:25:01 250000 4000 0.82

...

  1. 下载特定数据集。

kaggle datasets download -d allen-institute-for-ai/CORD-19-research-challenge -p ./data/covid-19

预期输出: 显示下载进度和完成信息。

Downloading CORD-19-research-challenge.zip to ./data/covid-19

...

2.2 Hugging Face数据集操作

Hugging Face Hub上的数据集通常通过 datasets 库加载。

  1. 安装 datasets 库。

pip install datasets

预期输出:

Successfully installed datasets-...
  1. 加载并缓存数据集。

from datasets import load_dataset

dataset_name = "emotion"

dataset = load_dataset(dataset_name)

print(dataset)

预期输出:

DatasetDict({

train: Dataset({

features: ['text', 'label'],

num_rows: 16000

})

validation: Dataset({

features: ['text', 'label'],

num_rows: 2000

})

test: Dataset({

features: ['text', 'label'],

num_rows: 2000

})

})

Warning: 大型数据集的首次加载会下载所有数据到本地缓存目录 (默认为 ~/.cache/huggingface/datasets),请确保磁盘空间充足。这对于理解Hugging Face数据集教程至关重要。

3. 数据集本地集成与管理

下载的数据集需要规范化管理,以便后续研究使用。建议采用统一目录结构。

  1. 创建统一的数据根目录。

mkdir -p /data/research_datasets/kaggle

mkdir -p /data/research_datasets/huggingface

预期输出: 无。

  1. 将下载的Kaggle数据集解压到对应目录。

unzip ./data/covid-19/CORD-19-research-challenge.zip -d /data/research_datasets/kaggle/covid-19

预期输出: 显示解压进度。

Note: Hugging Face数据集默认缓存至 ~/.cache/huggingface/datasets。可以通过设置环境变量 HF_HOME 或在 load_dataset 函数中指定 cache_dir 参数来更改缓存位置,例如:HF_HOME=/data/research_datasets/huggingface load_dataset("emotion")

通过上述步骤,科研人员可以高效地管理和利用Kaggle与Hugging Face上的海量开源数据集,为研究工作提供坚实的数据基础。

References

上一篇Jupyter Notebook在科研笔记与可复现研究中的工程实践 (版本 20 下一篇科研加速器选择指南:规避“跑路”风险,保障学术资源稳定访问

猜你喜欢

延伸阅读