HuggingFace Datasets 是官方仓库 huggingface/skills 中的 huggingface-datasets Skill(Skill 目录)。自 2026 年 3 月重组后,它是一个 Dataset Viewer Skill:教编程智能体通过只读 API 调用浏览和提取 Hub 数据集,并附带几种有文档说明的上传方式。(同名的旧版数据集创建 Skill 已在那次重组中移除。)
所有请求都发往 https://datasets-server.huggingface.co,使用普通的 GET,因此智能体无需下载就能查看数据集。
核心功能
- 了解结构:
/is-valid、列出子集与切分的/splits、预览用的/first-rows。 - 分页读取:
/rows,offset从 0 开始,length最多 100,借助num_rows_total和partial决定是否继续。 - 搜索与过滤:
/search在字符串列中搜索文本;/filter使用where条件,可选orderby排序。 - 文件与统计:
/parquet获取分片地址,/size、按列的/statistics,以及可用时的/croissant元数据。 - 受限数据:私有或受限数据集需要
Authorization: Bearer <HF_TOKEN>。 - 上传:通过 Hub 网页,或
npx -y @huggingface/hub upload datasets/<ns>/<repo> ./folder data(加--private设为私有)。 - 智能体会话记录:把 Claude Code、Codex、Pi 的原始 JSONL 会话上传到数据集后,Hub 会提供会话查看器;Skill 建议使用私有仓库。
适用场景
- 确定训练数据集之前先检查列和样例行。
- 只拉取满足过滤条件的行做快速分析。
- 发布自己的智能体会话记录供他人审阅。
定价
免费开源(仓库为 Apache-2.0)。公开数据集的 Dataset Viewer API 可公开调用。
快速开始
- 安装 HuggingFace CLI,再运行
hf skills add huggingface-datasets。 - 提问:"显示 stanfordnlp/imdb 的切分和前几行"。
- 若想用 SQL 而不是 REST,CLI Skill 的
hf datasets sql可用 DuckDB 查询同一批 parquet 文件。
局限:行接口每次约 100 行上限,大量读取意味着多次请求或直接下载 parquet。会话记录可能包含提示词、文件路径和密钥,Skill 要求这类仓库保持私有。
常见问题
它会写入我的数据集吗?
查看类调用都是只读的,上传是单独、显式的命令。
能读取私有数据集吗?
可以,只要令牌有访问权限。
替代方案
- HuggingFace CLI:在终端用
hf datasets parquet和hf datasets sql。 - HuggingFace Tool Builder:把重复的数据集查询封装成脚本。
- Hugging Face:托管数据的平台本身。
总结
在下载几个 GB 之前,用它轻量地看清 Hub 数据集的内容。更多见 skills 分类 与 hugging-face 标签。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
按仓库任务选 AI 编程 CLI
按你真正要跑的工作,在 Claude Code、Codex CLI、OpenCode、Pi、omp、DeepSeek Harness 与 Grok Build 之间选择。2026-10-06 对照官方文档复核。
Skills + Hooks + Plugins:Anthropic 如何重新定义 AI 编程工具的扩展性
深入解析 Claude Code 的 Skills、Hooks 和 Plugins 三位一体架构,探讨为什么这种设计比 GitHub Copilot 和 Cursor 更先进,以及它如何通过开放标准重新定义 AI 编程工具的扩展性。