HuggingFace Experiment Tracking logo

HuggingFace Experiment Tracking

打开

Hugging Face 官方 Trackio Skill:让编程智能体记录训练指标、在损失异常时触发告警,并通过 CLI 以 JSON 查询实验结果,仪表盘可同步到 Space。

分享:
查看替代方案

HuggingFace Experiment Tracking 对应官方仓库 huggingface/skills 中的 huggingface-trackio Skill(Skill 目录)。它教编程智能体使用 Hugging Face 的实验追踪库 Trackio:训练中记录指标、发出结构化告警、并从命令行读回结果。仪表盘可同步到 Hugging Face Space,云端训练机器关机后指标依然保留。

Skill 把工作拆成三种接口:用于记录的 Python API、用于告警的 Python API,以及用于查询的 trackio CLI,每一种在 Skill 目录里都有单独的参考文档。

核心功能

  • 记录指标:trackio.init()、trackio.log()、trackio.finish(),或在 TRL 训练器中设置 report_to="trackio"。
  • 同步到 Space:传入 space_id 即可持久化实时仪表盘。自动创建的 Space 默认公开,需要私有时传 private=True。
  • 告警:trackio.alert(title=..., level=trackio.AlertLevel.WARN),分 INFO、WARN、ERROR 三级。告警会打印到终端、写入数据库、显示在仪表盘,并可推送到 Slack 或 Discord webhook。
  • 查询 CLI:trackio list projects、trackio get metric ...、trackio list alerts --project <name> --json --since <timestamp>、trackio show、trackio sync。
  • 智能体闭环:Skill 描述了一个自主循环:插入告警、后台启动训练、轮询告警、读取指标,然后调整参数重新启动。

适用场景

  • 让智能体盯着微调任务,损失发散时及时停掉。
  • 不开浏览器就能对比多组超参数实验。
  • 把训练仪表盘作为 Space 公开分享。

定价

Skill 免费开源(仓库为 Apache-2.0)。同步到 Space 使用你的 Hugging Face 账户,若选用付费 Space 硬件则按 Hugging Face 的定价计费。

快速开始

  1. 先装基础 Skill HuggingFace CLI,再运行 hf skills add huggingface-trackio。
  2. 在训练脚本中加入 trackio.init(project="my-project", space_id="username/trackio", private=True)。
  3. 用 trackio.log({"loss": loss}) 记录,并为 NaN 或损失停滞添加告警。
  4. 用 trackio list alerts --project my-project --json 轮询告警。

局限:Space 默认公开,容易泄露指标或配置。Skill 只覆盖 Trackio,如果团队已统一使用其他追踪工具,它不会帮你打通。

常见问题

这和早先的 "experiment tracking" 词条是同一个吗?

是。仓库后来把目录名统一为 huggingface-trackio。

必须用 Space 吗?

不必。本地记录即可使用,只有训练机器是临时的时候才需要 space_id。

替代方案

总结

当智能体替你跑训练、需要可靠地发现问题时,就用这个 Skill。除非有意公开,否则记得把 Space 设为私有。更多见 skills 分类。

评论

还没有评论。成为第一个评论的人!