HuggingFace Evaluation logo

HuggingFace Evaluation

打开

Hugging Face 官方 community-evals Skill:用 inspect-ai 或 lighteval 在本地硬件上评测 Hub 模型,自动在 vLLM、Transformers 与 accelerate 之间选择推理后端。

分享:
查看替代方案

HuggingFace Evaluation 现对应官方仓库 huggingface/skills 中的 huggingface-community-evals Skill(Skill 目录),该目录于 2026 年 3 月由 hugging-face-evaluation 更名而来。它的范围刻意收窄:在本地硬件上评测 Hugging Face Hub 模型,选对评测框架和推理后端,并在完整运行前先做冒烟测试。

它不修改模型卡、不发布 .eval_results、不创建 PR,也不编排远程任务,这些步骤交给别的工具。

核心功能

  • 两套框架:inspect-ai 适合精细控制任务,lighteval 适合 leaderboard|mmlu|5 这类排行榜式任务串。
  • 三个内置脚本:inspect_eval_uv.py(走 Inference Providers,无需本地 GPU)、inspect_vllm_uv.py(本地 GPU,vLLM 或 Transformers)、lighteval_vllm_uv.py(本地 GPU,vLLM 或 accelerate)。
  • 后端回退:优先 vLLM 提高吞吐;架构不受支持时切换到 --backend hf 或 --backend accelerate。
  • 冒烟测试:inspect-ai 用 --limit 10,lighteval 用 --max-samples 10。
  • 硬件建议:3B 以下用消费级 GPU 或 Apple Silicon,3B 到 13B 用更强的 GPU,更大的模型用大显存 GPU 或远程算力。

适用场景

  • 发布前在 MMLU 或 GSM8K 上检查微调后的检查点。
  • 在自己的 GPU 上用同一组任务对比两个小模型。
  • 在本地复现排行榜式的分数。

定价

Skill 免费开源(仓库为 Apache-2.0)。本地运行消耗自己的硬件;走 Inference Providers 可能在你的 Hugging Face 账户产生调用费用。

快速开始

  1. 安装 HuggingFace CLI,再运行 hf skills add huggingface-community-evals。
  2. 检查前置条件:uv --version、访问受限模型所需的 HF_TOKEN,本地 GPU 运行需 nvidia-smi。
  3. 冒烟测试:uv run scripts/inspect_eval_uv.py --model meta-llama/Llama-3.2-1B --task mmlu --limit 20。
  4. 冒烟测试通过后再扩大规模。

局限:需要远程执行时,Skill 仍让智能体转交给 hugging-face-jobs Skill,而该 Skill 已于 2026 年 4 月被移除,请改用 CLI Skill 的 hf jobs uv run。需要自定义模型代码时要加 --trust-remote-code,这会执行模型仓库里的代码。

常见问题

它会把结果发布到 Hub 吗?

不会,评测运行结束即停止。

没有 GPU 怎么办?

用 Inference Providers 脚本,或用 hf jobs 在远程运行同一脚本。

替代方案

  • HuggingFace Model Trainer:训练出这里要评测的检查点。
  • Garak:检测模型的安全漏洞,而非基准准确率。
  • Langfuse:评测已部署的 LLM 应用,而非原始检查点。

总结

这是一个专注、实用的本地评测 Skill,回退策略合理。涉及远程执行时搭配 CLI Skill 使用。更多见 skills 分类。

评论

还没有评论。成为第一个评论的人!