ExLlamaV3 logo

ExLlamaV3

打开

围绕 EXL3 量化格式构建的高效本地 LLM 推理库,在消费级 GPU 上运行大型开源模型,支持张量与专家并行,并驱动 TabbyAPI 服务器。

分享:
查看替代方案

ExLlamaV3 是一个在当代消费级 GPU 上运行本地 LLM 的推理库。它的招牌功能是建立在 QTIP 之上的 EXL3 量化格式,让大型开源权重能以出奇可用的速度跑在日常硬件上。它同时支持面向消费级配置的张量并行与专家并行、连续动态批处理、投机解码、2 到 8 bit 缓存量化、多模态与 LoRA 支持,以及 Hugging Face Transformers 插件。推荐的配套后端是 TabbyAPI,它提供 OpenAl 兼容的本地或远程推理服务器。

对比 Ollama 了解更简单可脚本化的本地运行时,或查看 Llama 在挑选本地运行权重时的选择。

核心功能

  • EXL3 量化:基于 QTIP 的格式,把权重压缩到能塞进消费级显存。
  • 并行推理:为消费级硬件裁量的张量并行与专家并行执行。
  • 动态批处理:连续批处理在请求变化下保持吞吐。
  • OpenAl 兼容服务器:TabbyAPI 把它封装成开箱即用的本地/远程 API。
  • 广泛架构支持:可运行 DeepSeek、GLM、Gemma、Cohere Command、多个 MoE 与多模态模型。

适用场景

谁应该使用这个工具?

  • 本地模型爱好者:单卡跑开源权重,无需集群。
  • 重视隐私的团队:在一个 OpenAl 兼容端点后面把推理留在室内。
  • 量化模型重度用户:在已有显存上跑尽可能大的模型。

解决的问题

  1. 显存天花板:优秀的量化把大模型压进买得起的 GPU。
  2. 负载下的吞吐:动态批处理让服务器应对大量并发请求。
  3. 厂商依赖:本地 OpenAl 兼容服务器免去付费托管模型端点。

定价方案

ExLlamaV3 采用 MIT 许可,免费。唯一成本是你自己的 GPU 硬件与电费,或租用 GPU 时支付的实例费用。

优势对比

  1. 以 EXL3 为默认:量化与推理共同设计,追求每 GB 显存的速度。
  2. 消费级优先的并行:为一两张卡而非数据中心裁量。
  3. API 兼容:TabbyAPI 在运行时之上给你熟悉的 OpenAl 形状端点。

快速开始

  1. 安装库并下载一个 EXL3 量化模型。
  2. 用类似 TabbyAPI 的后端指向该模型,暴露 OpenAl 兼容 API。
  3. 按 GPU 数量配置张量与专家并行,然后发送请求。

常见问题

什么是 EXL3?

它是基于 QTIP 的 EXL 量化格式,专为让大模型在消费级 GPU 上跑出不错速度而设计。

能替代 llama.cpp 吗?

它是另一套运行时,有自己的量化与并行选择。很多用户两者都保留,按模型挑选。

能当 API 用吗?

可以。TabbyAPI 是 ExLlamaV3 推荐使用的 OpenAl 兼容服务器。

替代方案

  • Ollama:简单的本地模型并带云选项。
  • Llama:选择权重时的 Meta 开源系列。
  • OpenCode:可调用本地 API 端点的智能体。

使用技巧

  1. 把缓存量化设到低位,腾出显存给上下文。
  2. 大型 MoE 模型按显存池配置张量并行。
  3. 用 TabbyAPI 让既有客户端代码直接复用本地端点。

总结

ExLlamaV3 让大型开源模型在你自己拥有的硬件上变得可行。如果你想要一个 EXL3 优化、背后是 OpenAl 兼容 API 的快速本地运行时,从 github.com/turboderp-org/exllamav3 开始。

评论

还没有评论。成为第一个评论的人!