AngelSlim
AngelSlim 是腾讯混元 AI Infra 团队开发的模型压缩工具包,将量化、蒸馏、稀疏注意力和推测解码放进统一的工程流程。公开仓库创建于 2025 年 7 月 4 日。本次线索来自微博上的离线翻译讨论,但工具包与相关翻译示例都不应被写成 2026 年 10 月刚发布的项目。
它提供什么
官方仓库记录了语言模型、视觉语言模型和扩散模型的支持情况。使用前先看兼容性表:支持某个模型系列不代表所有压缩方法和推理后端都适用于每个检查点。项目同时提供压缩模型示例,以及复现实验流程的文档。
量化适合权重超出内存预算的场景;蒸馏涉及让较小模型学习另一个模型提供的指导;稀疏注意力和推测解码处理的是不同的运行瓶颈。这些方法在合适配置下可以结合,但不是互相替代的开关,也不会自动保证压缩后精度不变。
实践评估流程
先选择一个受支持模型和一个可测量的部署约束,例如翻译服务所需内存。保留未压缩基线和独立评估集,使用文档中的量化方案;方案要求校准时,要用代表实际输入的数据。然后在相同硬件和输入长度下,比较内存、延迟与任务质量。除了平均分,还要检查翻译漏信息、术语错误等具体失败案例。
一次只增加一个优化步骤,确认收益来自哪里。保留原始检查点、配置和结果,便于定位退化并回退。端侧部署还应实测设备上的峰值内存和冷启动,不能只看导出文件大小。
费用、许可与快速开始
工具包许可说明为 Apache 2.0,并列明第三方组件例外;模型和依赖仍需分别核对条款。仓库没有列出托管订阅套餐。压缩、蒸馏需要计算资源,后续推理服务也有运行成本。
- 阅读官方文档和最新支持表。
- 按文档要求在独立环境安装
angelslim。 - 选择与检查点、目标运行环境匹配的示例。
- 先复现示例,再调整校准数据和精度。
- 以自己的任务评估与资源实测作为部署条件。
常见问题、限制与替代选择
压缩文件更小就代表翻译更好吗? 不是。文件体积、内存、延迟和输出质量是不同指标。本词条没有把微博上的竞品对比复述成已复现的基准结论。
它是直接给用户聊天或翻译的应用吗? 它主要是面向开发者的模型优化工具包,而不是终端翻译应用。
Strata适合研究受支持模型的本地运行;Ollama提供另一种运行流程。这些运行工具不能替代压缩质量评估。更多选择见 AI 生态目录与开源标签。下一步是挑一个官方支持示例,用可核对的基线验证压缩是否适合你的任务。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。
Codex 接入任意模型:一个 magpie,不用再装 Codex Router
免费开源的菜单栏应用 magpie 在本机跑一个网关,把 OpenRouter、DeepSeek 这类按 key 计费的供应商和 ChatGPT、Claude、Cursor、Grok、Copilot 的订阅,一起塞进 Codex 的原生模型选择器,一键切换,不用再装 Codex Router。
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。