Agnes-3.0-Flash Preview 是 Hugging Face 上的开源权重。卡片协议 Apache-2.0,pipeline 为 image-text-to-text,语言英/中。2026-09-13 Hugging Face 显示 120 likes、近 30 天 34 次下载。createdAt 为 2026-09-11。safetensors 合计约 33.09B 参数(BF16)。r/LocalLLaMA 2026-09-13 热帖标题写成「Agnes-AI/Agnes-3.0-Flash 33B Multimodal, AA score: 36」。把 AA 分数当成 专有 API 的成绩,不要算在这套权重上。
卡片写得很清楚:仓库是更早的 Preview 检查点。Artificial Analysis 上的生产/API 模型是另一套(1M 上下文、专有)。不要把 API 分数抄到 33B 文件上。
对照 Qwen3.8-27B 若你要稠密本地对话,对照 Muse Glimmer 若你要另一个约 30B 开源多模态,对照 Ling-3.0-Flash 若你要托管 flash 规格。
核心功能
- 混合注意力:72 层解码器,门控 delta-rule 与全局注意力 3:1。只有 18 层的 KV 缓存随序列增长。Preview 卡片上下文 262,144 token。
- 多模态:文本、图像、视频走自带 processor。视觉塔 27 层,hidden 1152,patch 16。
- 推理力度:聊天模板提供
high/medium/low,以及enable_thinking=False。 - 工具调用:
<tool_call><function=…>。仓库内带 SGLangserve.sh和补丁。 - 远程代码:必须
trust_remote_code=True。卡片测试路径是transformers>=5.12。
局限:120 likes 是热度,不是审计。自定义架构依赖远程代码。卡片硬件建议 1 x H200 141 GB 或 H100 80 GB bf16,磁盘约 66 GB。Preview 厂商行(IFBench 74.20、GPQA Diamond 85.05、SciCode 38.08)是混杂 harness 的参考值。我们没有复跑。
规格
| 项 | 值 | 来源 |
|---|---|---|
| 参数 | 约 33.09B BF16 | HF API,2026-09-13 |
| 上下文(Preview) | 262,144 token | HF 卡片 |
| 协议 | Apache-2.0 | 同一卡片 |
| likes / 近 30 天下载 | 120 / 34 | HF API,2026-09-13 |
| API 孪生(不是这套权重) | 1M 上下文,$0.05 / $0.15 每百万,AA Index 36 | Artificial Analysis,2026-09-13 |
| 软件价格 | 权重 $0 | Apache-2.0 |
适用场景
- 能拿出一张 H100/H200、要 Apache-2.0 且带图和视频的本地多模态。
- 刚看过 r/LocalLLaMA 33B 帖、需要把 Preview 和 API 分开的人。
- 其实该调 API 的人:要 1M 上下文专有规格,$0.05 / $0.15。
若要便宜的托管 flash,从 DeepSeek-V4-Flash 开始。
快速开始
- 打开 Agnes-AI/Agnes-3.0-Flash。
pip install "transformers>=5.12" torch torchvision accelerate。- 用
trust_remote_code=True、dtype="bfloat16"、device_map="auto"加载。 - 推理服务跟
serve.sh和sglang_patch/,不要假设公版镜像认识agnes。
第一方资源:模型卡片。产品站:agnes-ai.com。
常见问题
Hugging Face 仓库就是 Artificial Analysis 36 分那个吗?
不是。卡片写 Preview 是 33B / 262k。AA 列的是专有 1M 上下文 API。Reddit 标题把两套混在一起。
能不用 trust_remote_code 吗?
不能。架构是自定义的 AgnesForConditionalGeneration。
Preview 有 1M 窗口吗?
开源权重没有。1M 是生产/API 检查点。
替代方案
- Qwen3.8-27B:稠密本地对话,不必远程代码栈。
- Muse Glimmer:本站另一个约 30B 开源多模态。
- DeepSeek-V4-Flash:不想自托管时的托管 flash。
使用技巧
- 不要把 AA Index 36 贴到 33B 文件上。
- 采样先用
temperature1.0、top_p0.95、top_k20,除非你自己测过。 - 用仓库里的
serve.sh,不要假设公版 vLLM 认识agnes。
总结
Agnes-3.0-Flash Preview 适合有 H100 级机器、能接受远程代码的人去跑 33B Apache-2.0 多模态权重。从 Hugging Face 卡片 开始,并把专有 API 页分开看。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。