HuggingFace Evaluation は現在、公式リポジトリ huggingface/skills の huggingface-community-evals スキル(スキルフォルダ)に対応します。フォルダは 2026 年 3 月に hugging-face-evaluation から改名されました。対象は意図的に絞られており、Hugging Face Hub のモデルをローカルのハードウェアで評価し、適切なフレームワークと推論バックエンドを選び、本番前にスモークテストを行います。
モデルカードの編集、.eval_results の公開、プルリクエストの作成、リモートジョブのオーケストレーションは行わず、それらは別のツールに引き継ぎます。
主な機能
- 二つのフレームワーク:タスクを細かく制御する
inspect-ai、leaderboard|mmlu|5のようなリーダーボード形式のタスク文字列に向くlighteval。 - 同梱スクリプト三つ:
inspect_eval_uv.py(Inference Providers 経由、ローカル GPU 不要)、inspect_vllm_uv.py(ローカル GPU、vLLM または Transformers)、lighteval_vllm_uv.py(ローカル GPU、vLLM または accelerate)。 - バックエンドのフォールバック:スループットには vLLM を優先し、非対応アーキテクチャでは
--backend hfか--backend accelerateに切り替え。 - スモークテスト:inspect-ai は
--limit 10、lighteval は--max-samples 10。 - ハードウェアの目安:3B 未満は一般向け GPU や Apple Silicon、3B から 13B はより強力な GPU、それ以上は大容量メモリの GPU かリモート計算資源。
使用シナリオ
- 公開前にファインチューニング済みチェックポイントを MMLU や GSM8K で確認する。
- 手元の GPU で二つの小型モデルを同じタスクで比較する。
- リーダーボード形式のスコアをローカルで再現する。
料金
スキルは無料のオープンソースです(リポジトリは Apache-2.0)。ローカル実行は自前のハードウェアを使い、Inference Providers 経由では Hugging Face アカウントに利用料が発生する場合があります。
はじめに
- HuggingFace CLI を入れ、
hf skills add huggingface-community-evalsを実行。 - 前提を確認:
uv --version、ゲート付きモデル用のHF_TOKEN、ローカル GPU ならnvidia-smi。 - スモークテスト:
uv run scripts/inspect_eval_uv.py --model meta-llama/Llama-3.2-1B --task mmlu --limit 20。 - スモークテストが通ってから規模を広げる。
制約:リモート実行について、スキルは今も hugging-face-jobs スキルへの引き継ぎを指示していますが、そのスキルは 2026 年 4 月に削除されています。代わりに CLI スキルの hf jobs uv run を使ってください。カスタムモデルコードには --trust-remote-code が必要で、モデルリポジトリのコードが実行されます。
よくある質問
結果を Hub に公開しますか?
いいえ。評価の実行が終わったところで止まります。
GPU がない場合は?
Inference Providers 用スクリプトを使うか、同じスクリプトを hf jobs でリモート実行してください。
代替案
- HuggingFace Model Trainer:ここで評価するチェックポイントを学習。
- Garak:ベンチマーク精度ではなくセキュリティ上の弱点を検査。
- Langfuse:生のチェックポイントではなく、デプロイ済み LLM アプリを評価。
まとめ
妥当なフォールバックを備えた、ローカルベンチマーク用の実用的なスキルです。リモート実行は CLI スキルと組み合わせてください。詳しくは skills カテゴリ へ。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
リポジトリの作業で AI コーディング CLI を選ぶ
Claude Code、Codex CLI、OpenCode、Pi、omp、DeepSeek Harness、Grok Build を、実際に回す作業に合わせて選ぶ。2026-10-06 に公式ドキュメントを再確認。
Skills + Hooks + Plugins:AnthropicによるAIコーディングツールの拡張性の再定義
Claude CodeのSkills、Hooks、Pluginsという三位一体アーキテクチャを深く分析し、なぜこの設計がGitHub CopilotやCursorよりも先進的なのか、そしてオープンスタンダードを通じてAIコーディングツールの拡張性をどのように再定義しているかを探ります。