首页文献管理数据分析开源社区写作排版
首页 › 数据分析 › Kaggle与Hugging Fac

Kaggle与Hugging Face数据集集成:本地开发环境配置与命令行数据管理实践 (v2024.08.20)

Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR

本文档旨在指导SRE团队成员高效地配置本地环境,以便从Kaggle和Hugging Face平台获取并管理数据集。核心内容包括API密钥配置、命令行工具安装及常用数据操作指令。重点关注数据下载、同步及版本控制。适用于数据分析、机器学习模型训练等场景。

1. 前置条件 (Prerequisites)

🎯STEP 1确定选题🔧STEP 2检索文献✅STEP 3整理分析⚙️STEP 4成文发表

在进行数据集操作之前,请确保以下环境已配置完成。

  1. Python 3.8+ 环境已安装。
  2. pip 包管理器可用。
  3. Kaggle账户已注册并生成API Token。
  4. Hugging Face账户已注册并生成Access Token。

2. Kaggle数据集本地集成

本节详细说明如何配置Kaggle API并在本地下载数据集。

2.1 Kaggle API配置

Warning: 保护好你的API密钥,勿泄露。

  1. 从Kaggle账户设置页面下载kaggle.json文件。此文件包含你的API凭证。

  2. 将kaggle.json文件移动到指定目录。在Linux/macOS系统上,通常是~/.kaggle/。

    mkdir -p ~/.kaggle/
    mv kaggle.json ~/.kaggle/
    chmod 600 ~/.kaggle/kaggle.json

    Expected Output: (无直接输出,命令行提示符返回)

    $
  3. 安装kaggle命令行工具。

    pip install kaggle

    Expected Output:

    Successfully installed ... kaggle-...

2.2 Kaggle数据集下载与管理

使用kaggle命令下载数据集。例如,下载一个公开数据集。

  1. 搜索数据集 (Kaggle数据集搜索)。

    kaggle datasets search 'titanic'

    Expected Output: (部分)

    ref                                          title                                         size  lastUpdated          downloadCount  voteCount  usabilityRating
    -------------------------------------------  ------------------------------------------  ----  -------------------  -------------  ---------  ---------------
    test-data/titanic                            Titanic                                     12KB  2017-09-08 19:42:04          72993       1056  0.7058824
    ...
  2. 下载指定数据集 (Kaggle数据集下载)。

    kaggle datasets download -d test-data/titanic -p ./data/titanic

    Expected Output:

    Downloading titanic.zip to ./data/titanic
    ...

    Note: -p 参数指定下载路径。下载完成后通常是压缩包,需要手动解压。

3. Hugging Face数据集本地集成

亚洲 (40%)北美 (25%)欧洲 (20%)其他 (15%)

本节涵盖Hugging Face datasets库的安装和使用。

3.1 Hugging Face认证配置

Note: Hugging Face通常通过huggingface_hub库进行认证。

  1. 安装huggingface_hub库。

    pip install huggingface_hub datasets

    Expected Output:

    Successfully installed ... huggingface_hub-... datasets-...
  2. 登录Hugging Face账户。这将提示你输入Access Token。

    huggingface-cli login

    Expected Output:

    Token: 
    Add token to git credential helper? (Y/n) y
    Token is valid (permission: write).
    Your token has been saved to /home/user/.cache/huggingface/token
    Login successful

    Warning: 确保使用具有相应权限的Access Token。此步骤将你的token保存在本地,以便后续操作。

3.2 Hugging Face数据集下载与加载

使用datasets库加载数据集 (Hugging Face数据集怎么用)。

  1. 加载一个公共数据集,例如glue任务中的mrpc。

    from datasets import load_dataset
    
    dataset = load_dataset('glue', 'mrpc')
    print(dataset)

    Expected Output:

    DatasetDict({
        train: Dataset({features: ['sentence1', 'sentence2', 'label', 'idx'], num_rows: 3668})
        validation: Dataset({features: ['sentence1', 'sentence2', 'label', 'idx'], num_rows: 408})
        test: Dataset({features: ['sentence1', 'sentence2', 'label', 'idx'], num_rows: 1725})
    })
    

    Note: load_dataset函数会自动处理数据集的下载和缓存。数据通常存储在~/.cache/huggingface/datasets/。

References

上一篇Jupyter Notebook科研环境构建与可复现性实践:SRE视角下的版本控 下一篇GitHub开源项目贡献:基于SSH密钥的PR提交与CI/CD集成实践 (Ver

猜你喜欢

延伸阅读