HuggingFace Model Trainer logo

HuggingFace Model Trainer

打开

Hugging Face 官方 LLM 训练 Skill:在 Hugging Face Jobs 云端 GPU 上用 TRL 或 Unsloth 微调模型,支持 SFT、DPO、GRPO、奖励模型与 GGUF 导出。

分享:
查看替代方案

HuggingFace Model Trainer 对应官方仓库 huggingface/skills 中的 huggingface-llm-trainer Skill(Skill 目录),2026 年 3 月由 hugging-face-model-trainer 更名而来。它教编程智能体在 Hugging Face Jobs 云端 GPU 上,用 TRL 或 Unsloth 微调语言模型和视觉语言模型,无需本地 GPU,结果推送到 Hub。

它是仓库里最详尽的 Skill 之一,附带约十份参考文档和多个示例脚本。

核心功能

  • 训练方法:SFT、DPO、GRPO 和奖励模型训练,references/training_methods.md 说明各自适用场景。
  • Unsloth 路线:显存紧张、模型大于 13B 或训练视觉语言模型时,Skill 推荐改用 Unsloth。
  • 示例脚本:train_sft_example.py、train_dpo_example.py、train_grpo_example.py、unsloth_sft_example.py,均为内联依赖的 UV 脚本。
  • 辅助工具:dataset_inspector.py 在花钱租 GPU 前校验数据集格式,estimate_cost.py 估算成本,convert_to_gguf.py 导出供 llama.cpp、Ollama、LM Studio 使用。
  • 监控:每个训练脚本都应集成 Trackio。
  • 防护规则:任务环境是临时的,必须设置 push_to_hub=True 并传入 HF_TOKEN 密钥;TRL 配置使用 max_length 而不是 max_seq_length。

适用场景

  • 用自己的对话数据对小型开源模型做指令微调。
  • 在首轮 SFT 之后用 DPO 做偏好对齐。
  • 导出 GGUF 文件在本地运行训练结果。

定价

Skill 免费(仓库为 Apache-2.0)。训练在 Hugging Face Jobs 上运行,Skill 说明需要 Pro、Team 或 Enterprise 方案,按 GPU 类型和时长计费。

快速开始

  1. 安装 HuggingFace CLI,再运行 hf skills add huggingface-llm-trainer。
  2. 登录并确认令牌有写权限。
  3. 先校验数据集:uv run scripts/dataset_inspector.py --help。
  4. 正式训练前先跑一次小规模演示(Skill 建议在 t4-small 上用 50 到 100 条样本)。

局限与风险:Jobs 默认 30 分钟超时对多数训练都太短,超时会丢失全部进度。Skill 要求智能体通过 Hugging Face MCP 的 hf_jobs() 工具提交任务;没有该服务器时,可用 hf jobs uv run 运行同一个 UV 脚本。

常见问题

能在自己的 GPU 上训练吗?

重点是 Hugging Face Jobs,另有一份 macOS 本地训练参考,适合小实验。

支持视觉检测模型吗?

不支持,Hugging Face 为此单独提供了 huggingface-vision-trainer Skill。

替代方案

  • Unsloth:更快的微调库,可在自有硬件上使用。
  • Modal:在无服务器 GPU 上运行自己的训练代码。
  • HuggingFace Evaluation:训练后评测检查点。

总结

这是让智能体在 Hugging Face 基础设施上跑微调最完整的方式,对成本和数据丢失都有实在的防护。可搭配 实验追踪 使用。更多见 skills 分类。

评论

还没有评论。成为第一个评论的人!