HuggingFace Model Trainer logo

HuggingFace Model Trainer

開く

Hugging Face 公式の LLM 学習スキル。Hugging Face Jobs のクラウド GPU で TRL や Unsloth を使いモデルをファインチューニング。SFT、DPO、GRPO、報酬モデル、GGUF 出力に対応。

共有:
代替ツールを見る

HuggingFace Model Trainer は、公式リポジトリ huggingface/skills の huggingface-llm-trainer スキル(スキルフォルダ)に対応し、2026 年 3 月に hugging-face-model-trainer から改名されました。Hugging Face Jobs のクラウド GPU 上で、TRL または Unsloth を使って言語モデルや視覚言語モデルをファインチューニングする方法をエージェントに教えるため、ローカル GPU は不要です。結果は Hub に保存されます。

リポジトリで最も詳しいスキルの一つで、約 10 本の参照ドキュメントとサンプルスクリプトが付属します。

主な機能

  • 学習手法:SFT、DPO、GRPO、報酬モデル学習。references/training_methods.md が使い分けを説明。
  • Unsloth ルート:GPU メモリが厳しい、モデルが 13B を超える、視覚言語モデルを学習する、といった場合に Unsloth を推奨。
  • サンプルスクリプト:train_sft_example.py、train_dpo_example.py、train_grpo_example.py、unsloth_sft_example.py。いずれもインライン依存の UV スクリプト。
  • 補助ツール:dataset_inspector.py で GPU 代を払う前にデータ形式を検証、estimate_cost.py でコスト見積もり、convert_to_gguf.py で llama.cpp、Ollama、LM Studio 向けに出力。
  • 監視:すべての学習スクリプトに Trackio を組み込む。
  • ガードレール:ジョブ環境は一時的なので push_to_hub=True と HF_TOKEN シークレットが必須。TRL の設定は max_seq_length ではなく max_length。

使用シナリオ

  • 自社のチャットデータで小型のオープンモデルを指示チューニングする。
  • 最初の SFT の後に DPO で選好を調整する。
  • 結果を GGUF にしてローカルで動かす。

料金

スキルは無料です(リポジトリは Apache-2.0)。学習は Hugging Face Jobs 上で行われ、スキルによれば Pro、Team、Enterprise プランが必要で、GPU の種類と時間で課金されます。

はじめに

  1. HuggingFace CLI を入れ、hf skills add huggingface-llm-trainer を実行。
  2. ログインし、トークンに書き込み権限があることを確認。
  3. まずデータセットを検証:uv run scripts/dataset_inspector.py --help。
  4. 本番前に小さなデモ実行を依頼(スキルの目安は t4-small で 50 から 100 件)。

制約とリスク:Jobs の既定 30 分タイムアウトはほとんどの学習に短すぎ、タイムアウトすると進捗がすべて失われます。スキルは Hugging Face MCP の hf_jobs() ツールでジョブを投入するよう指示しますが、そのサーバーがなければ同じ UV スクリプトを hf jobs uv run で実行できます。

よくある質問

自分の GPU で学習できますか?

主眼は Hugging Face Jobs ですが、小規模な実験向けに macOS でのローカル学習の参照資料もあります。

物体検出などの視覚モデルにも対応しますか?

いいえ。そのために別の huggingface-vision-trainer スキルが用意されています。

代替案

  • Unsloth:自前のハードウェアでも使える高速なファインチューニングライブラリ。
  • Modal:サーバーレス GPU で独自の学習コードを実行。
  • HuggingFace Evaluation:学習後にチェックポイントを評価。

まとめ

エージェントに Hugging Face のインフラでファインチューニングを任せる最も充実した方法で、コストとデータ消失への対策も具体的です。実験管理 と組み合わせてください。詳しくは skills カテゴリ へ。

コメント

まだコメントがありません。最初のコメントを投稿してください!