HuggingFace Evaluation 现对应官方仓库 huggingface/skills 中的 huggingface-community-evals Skill(Skill 目录),该目录于 2026 年 3 月由 hugging-face-evaluation 更名而来。它的范围刻意收窄:在本地硬件上评测 Hugging Face Hub 模型,选对评测框架和推理后端,并在完整运行前先做冒烟测试。
它不修改模型卡、不发布 .eval_results、不创建 PR,也不编排远程任务,这些步骤交给别的工具。
核心功能
- 两套框架:
inspect-ai适合精细控制任务,lighteval适合leaderboard|mmlu|5这类排行榜式任务串。 - 三个内置脚本:
inspect_eval_uv.py(走 Inference Providers,无需本地 GPU)、inspect_vllm_uv.py(本地 GPU,vLLM 或 Transformers)、lighteval_vllm_uv.py(本地 GPU,vLLM 或 accelerate)。 - 后端回退:优先 vLLM 提高吞吐;架构不受支持时切换到
--backend hf或--backend accelerate。 - 冒烟测试:inspect-ai 用
--limit 10,lighteval 用--max-samples 10。 - 硬件建议:3B 以下用消费级 GPU 或 Apple Silicon,3B 到 13B 用更强的 GPU,更大的模型用大显存 GPU 或远程算力。
适用场景
- 发布前在 MMLU 或 GSM8K 上检查微调后的检查点。
- 在自己的 GPU 上用同一组任务对比两个小模型。
- 在本地复现排行榜式的分数。
定价
Skill 免费开源(仓库为 Apache-2.0)。本地运行消耗自己的硬件;走 Inference Providers 可能在你的 Hugging Face 账户产生调用费用。
快速开始
- 安装 HuggingFace CLI,再运行
hf skills add huggingface-community-evals。 - 检查前置条件:
uv --version、访问受限模型所需的HF_TOKEN,本地 GPU 运行需nvidia-smi。 - 冒烟测试:
uv run scripts/inspect_eval_uv.py --model meta-llama/Llama-3.2-1B --task mmlu --limit 20。 - 冒烟测试通过后再扩大规模。
局限:需要远程执行时,Skill 仍让智能体转交给 hugging-face-jobs Skill,而该 Skill 已于 2026 年 4 月被移除,请改用 CLI Skill 的 hf jobs uv run。需要自定义模型代码时要加 --trust-remote-code,这会执行模型仓库里的代码。
常见问题
它会把结果发布到 Hub 吗?
不会,评测运行结束即停止。
没有 GPU 怎么办?
用 Inference Providers 脚本,或用 hf jobs 在远程运行同一脚本。
替代方案
- HuggingFace Model Trainer:训练出这里要评测的检查点。
- Garak:检测模型的安全漏洞,而非基准准确率。
- Langfuse:评测已部署的 LLM 应用,而非原始检查点。
总结
这是一个专注、实用的本地评测 Skill,回退策略合理。涉及远程执行时搭配 CLI Skill 使用。更多见 skills 分类。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
按仓库任务选 AI 编程 CLI
按你真正要跑的工作,在 Claude Code、Codex CLI、OpenCode、Pi、omp、DeepSeek Harness 与 Grok Build 之间选择。2026-10-06 对照官方文档复核。
Skills + Hooks + Plugins:Anthropic 如何重新定义 AI 编程工具的扩展性
深入解析 Claude Code 的 Skills、Hooks 和 Plugins 三位一体架构,探讨为什么这种设计比 GitHub Copilot 和 Cursor 更先进,以及它如何通过开放标准重新定义 AI 编程工具的扩展性。