HuggingFace Datasets logo

HuggingFace Datasets

打开

Hugging Face 官方数据集 Skill:调用 Dataset Viewer API 列出切分、分页读取、搜索过滤、获取 parquet 地址,并支持上传数据集和智能体会话记录。

分享:
查看替代方案

HuggingFace Datasets 是官方仓库 huggingface/skills 中的 huggingface-datasets Skill(Skill 目录)。自 2026 年 3 月重组后,它是一个 Dataset Viewer Skill:教编程智能体通过只读 API 调用浏览和提取 Hub 数据集,并附带几种有文档说明的上传方式。(同名的旧版数据集创建 Skill 已在那次重组中移除。)

所有请求都发往 https://datasets-server.huggingface.co,使用普通的 GET,因此智能体无需下载就能查看数据集。

核心功能

  • 了解结构:/is-valid、列出子集与切分的 /splits、预览用的 /first-rows。
  • 分页读取:/rows,offset 从 0 开始,length 最多 100,借助 num_rows_total 和 partial 决定是否继续。
  • 搜索与过滤:/search 在字符串列中搜索文本;/filter 使用 where 条件,可选 orderby 排序。
  • 文件与统计:/parquet 获取分片地址,/size、按列的 /statistics,以及可用时的 /croissant 元数据。
  • 受限数据:私有或受限数据集需要 Authorization: Bearer <HF_TOKEN>。
  • 上传:通过 Hub 网页,或 npx -y @huggingface/hub upload datasets/<ns>/<repo> ./folder data(加 --private 设为私有)。
  • 智能体会话记录:把 Claude Code、Codex、Pi 的原始 JSONL 会话上传到数据集后,Hub 会提供会话查看器;Skill 建议使用私有仓库。

适用场景

  • 确定训练数据集之前先检查列和样例行。
  • 只拉取满足过滤条件的行做快速分析。
  • 发布自己的智能体会话记录供他人审阅。

定价

免费开源(仓库为 Apache-2.0)。公开数据集的 Dataset Viewer API 可公开调用。

快速开始

  1. 安装 HuggingFace CLI,再运行 hf skills add huggingface-datasets。
  2. 提问:"显示 stanfordnlp/imdb 的切分和前几行"。
  3. 若想用 SQL 而不是 REST,CLI Skill 的 hf datasets sql 可用 DuckDB 查询同一批 parquet 文件。

局限:行接口每次约 100 行上限,大量读取意味着多次请求或直接下载 parquet。会话记录可能包含提示词、文件路径和密钥,Skill 要求这类仓库保持私有。

常见问题

它会写入我的数据集吗?

查看类调用都是只读的,上传是单独、显式的命令。

能读取私有数据集吗?

可以,只要令牌有访问权限。

替代方案

总结

在下载几个 GB 之前,用它轻量地看清 Hub 数据集的内容。更多见 skills 分类 与 hugging-face 标签。

评论

还没有评论。成为第一个评论的人!