HuggingFace Datasets logo

HuggingFace Datasets

開く

Hugging Face 公式のデータセットスキル。Dataset Viewer API で分割の一覧、行のページング、検索、フィルタ、parquet URL の取得を行い、データやエージェントのトレースもアップロードできます。

共有:
代替ツールを見る

HuggingFace Datasets は、公式リポジトリ huggingface/skills の huggingface-datasets スキル(スキルフォルダ)です。2026 年 3 月の再編以降は Dataset Viewer 向けのスキルで、読み取り専用の API 呼び出しで Hub のデータセットを探索・抽出する方法と、いくつかのアップロード手順をエージェントに教えます。(似た名前の旧データセット作成スキルは、その再編で削除されました。)

すべて https://datasets-server.huggingface.co への通常の GET で行うため、ダウンロードせずにデータセットを確認できます。

主な機能

  • 構造の把握:/is-valid、サブセットと分割を返す /splits、プレビュー用の /first-rows。
  • 行のページング:/rows。offset は 0 始まり、length は最大 100。num_rows_total と partial で続きを判断。
  • 検索とフィルタ:/search で文字列列を検索、/filter で where 条件と任意の orderby。
  • ファイルと統計:シャード URL の /parquet、/size、列ごとの /statistics、利用可能なら /croissant メタデータ。
  • ゲート付きデータ:非公開やゲート付きのデータセットには Authorization: Bearer <HF_TOKEN> が必要。
  • アップロード:Hub の UI、または npx -y @huggingface/hub upload datasets/<ns>/<repo> ./folder data(--private で非公開)。
  • エージェントのトレース:Claude Code、Codex、Pi の生の JSONL セッションをデータセットに上げるとトレースビューアが使えます。スキルは非公開リポジトリを推奨。

使用シナリオ

  • 学習用データセットを決める前に列とサンプル行を確認する。
  • 条件に合う行だけを取り出して素早く分析する。
  • 自分のエージェントセッションのトレースを公開してレビューしてもらう。

料金

無料のオープンソースです(リポジトリは Apache-2.0)。公開データセットに対する Dataset Viewer API は誰でも利用できます。

はじめに

  1. HuggingFace CLI を入れ、hf skills add huggingface-datasets を実行。
  2. 「stanfordnlp/imdb の分割と先頭の行を見せて」と依頼。
  3. REST ではなく SQL を使いたい場合は、CLI スキルの hf datasets sql が同じ parquet に DuckDB で問い合わせます。

制約:行エンドポイントは 1 回あたり約 100 行が上限なので、大量取得には多数のリクエストか parquet のダウンロードが必要です。トレースにはプロンプト、ファイルパス、シークレットが含まれうるため、スキルは非公開を求めています。

よくある質問

データセットに書き込みますか?

ビューア系の呼び出しは読み取り専用です。アップロードは別の明示的なコマンドです。

非公開データセットも読めますか?

アクセス権のあるトークンがあれば読めます。

代替案

まとめ

何 GB もダウンロードする前に、Hub のデータセットの中身を軽く確認できます。詳しくは skills カテゴリ と hugging-face タグ へ。

コメント

まだコメントがありません。最初のコメントを投稿してください!