多模态全部工具(共 54 款)
- UI-TARS-desktop字节跳动开源的视觉多模态智能体套件:像人一样操作电脑与浏览器,提供 Agent TARS CLI、远程操作器与 UI-TARS-1.5 模型。
- MiniMax上海实验室,产品线是 Hailuo 以及 2026 年的 M3 / H3 编程模型。TalkAPI 上 M3 每百万 token $0.24/$0.98。
- NotebookLMGoogle 基于你资料做研究的笔记本,现以 Gemini Notebook 出现在 notebook.google。分析文件并生成音频、视频等。
- ToAPIsOpenAI 兼容 AI API 网关:一个 Base URL、一个 Key 统一接入 GPT、Claude、Gemini、DeepSeek、Sora、VEO 等 60+ 模型,支持路由、故障切换与统一计费。
- Doubao字节跳动消费级 AI 助手,覆盖聊天、写作、编程,并在应用内接入 Seedance 视频。官网当前写登录后可免费使用 Seedance 2.0。
- TRAE字节跳动的 AI IDE。连续包月 Lite $3、Pro $10、Pro+ $30、Ultra $100。用量按美元 Basic Usage 扣,不再按 extra-fast 次数包。
- Veo 3Google DeepMind 的 Veo 视频模型,官方现以 Veo 3.1 呈现:带原生音频的电影级视频,并提供 1080p 与 4K 输出。
- cogvlm-base-490-hf上一代 CogVLM 快照。网站已从错误的 DeepSeek-VL 卡改回 CogVLM。不是 2026 VLM 默认。
- DeepSeek-V4.1-FlashDeepSeek-V4.1-Flash 是 MIT 的 552B 多模态 MoE,预填充 8B、解码 16B 激活,1M 上下文,KV 缓存约为 V4-Flash 的四分之一。
- DeepSeek-V4-Flash-Vision-ExpDeepSeek-V4-Flash-Vision-Exp 是 V4 家族首个多模态实验:Flash 架构加视觉模块,MIT 权重,约 305B 参数。
- deepseek-vl-7b-base上一代 DeepSeek-VL 7B Base 快照。活路径已经是 V4 Flash/Pro。不是 2026 默认视觉语言模型。
- FLUX 3Black Forest Labs 多模态模型,覆盖视频、音频、即将推出的图像与动作预测,支持最长 20 秒片段、原生音频和先草稿后精渲。
- Gemma 4 26B A4BGoogle DeepMind 开源权重模型,25.2B 总参数 MoE 架构每 token 仅激活 3.8B,256K 上下文,支持图文多模态输入,Apache 2.0 商用友好协议。
- GLM-5.3-Flash智谱首个原生多模态 GLM 系列模型(即此前匿名的 'Ox Alpha'):320B MoE、仅 18B 激活、1M 上下文、MIT 开源权重,输入定价 $0.15/百万 token。
- Google: Gemini 2.0 Flash以往的 Gemini 2.0 Flash 快照。已弃用并在 2026-06-01 关停。活 Flash 是 Gemini 3.7 Flash。
- Google: Gemini 3.1 Flash-LiteGoogle Gemini 3.1 Flash-Lite:活模型页上的 leftover 便宜 Flash-Lite 兄弟。2026-08-18 复核官方模型页。
- Google: Gemini 3.1 Flash LiveGoogle Gemini 3.1 Flash Live:活 Gemini 模型页上的 leftover 实时/音频兄弟。2026-08-18 复核。不是 2026 Flash 默认。不编造美元行。
- Google: Gemini 3.1 ProGoogle Gemini 3.1 Pro:活模型页上的 leftover Pro 兄弟。2026-08-18 复核。不是 2026 Pro 默认。
- Google: Gemini 3.5 Flash-LiteGoogle Gemini 3.5 Flash-Lite:活 Gemini 模型页上仍挂着的廉价 Flash-Lite 行。2026-08-18 复核。
- Google: Gemini 3.5 FlashGoogle 以行动为导向的前沿模型:为智能体与编码而生,支持 100 万 token 上下文,以 Flash 级别的速度与成本实现长程任务。
- Google: Gemini 3.6 FlashGoogle Gemini 3.6 Flash:3.5 之后、活 3.7 Flash 之前的上一代 Flash。2026-08-18 复核官方模型页。
- Google: Gemini 3.7 FlashGoogle 面向智能体工作流与多模态推理的最强 Flash 模型:100 万 token 上下文、6.5 万输出 token,并支持 Computer Use 预览。
- Google: Gemini 3 FlashGoogle 最新前沿模型,以前所未有的速度和成本效益提供突破性智能。Google: Gemini 3 Flash 收录于 models,可对比功能、定价与替代方案。
- Google: Gemini 3 Pro上一代 Gemini 3 Pro Preview 快照。官方模型索引已标关停。不是 2026 视觉王冠,也不是当前默认。
- Google: Gemini Omni FlashGoogle Gemini Omni Flash:活 Gemini 模型页上的 leftover Omni Flash 兄弟。2026-08-18 复核。不是 2026 Flash 默认。不编造美元行。
- GPT Image 2OpenAI 最新图像生成模型,面向快速、高质量的生成与编辑,支持灵活尺寸至 4K,并按 token 计费的官方 API。
- Grok 4.6SpaceXAI(原 xAI)的前沿 1.5T 推理模型,具备 50 万 token 上下文、出色的智能体编码能力与实时 X 数据接入,API 定价约为同级前沿对手的一半。
- GrokxAI / SpaceXAI 的 Grok 家族。当前文档旗舰是 grok-4.6:50 万上下文、$2/$6 每百万 token,另有 Imagine 图像/视频和 Voice API。
- Jina Embeddings v4上一代 Jina Embeddings v4 快照。leftover 2025 年 6 月卡。旧的 3.8B / 8192 / 最全能王冠不当普查。
- Kimi K3月之暗面(Moonshot AI)开源的 2.8T 参数多模态智能体模型,1M token 上下文,全球首个开源 3T 级模型,在编码与智能体基准上逼近封闭前沿模型。
- Ling-3.0-flash-VLLing-3.0-flash-VL 是 inclusionAI 的 MIT 多模态 MoE:总参 124B,激活 5.5B,支持图像和视频。
- llava-v1.6-34b-hf上一代 LLaVA-NeXT / LLaVA 1.6 快照。
- Meta Llama 3.2 Vision2024 年 Llama 3.2 视觉快照。llama.com 现在主推 Llama 4。不是 2026 默认多模态。
- MiniMax H3MiniMax 于 2026 年 7 月 31 日发布的开源向多模态视频模型:文/图/视频/音频输入,768P 或 2K 输出,4–15 秒,原生立体声,按秒计费。
- MiniMax M3MiniMax 2026 年 6 月 1 日的开源向旗舰模型:MSA 架构、100 万 token 上下文、原生图像/视频输入与桌面计算机使用,API 现价有折扣。
- Mistral OCR 4.1Mistral OCR 4.1:活目录上的最新 OCR,带段落框、结构标签与置信度。每 1000 页 $4,不是 leftover OCR 4.0。
- Mistral Pixtral 12B2024 年 Mistral 12B 视觉快照。活目录是 Medium 3.5 / Small 4 / Large 3。不是唯一的首个多模态。
- Mistral Shieldstral 1.0Mistral Shieldstral 1.0:活目录上的紧凑多模态审核模型。2026-08-18 复核。Apache 2.0。不编造美元行。
- Nex-N2.5-miniNex-N2.5-mini 是 Nex-AGI 的 Apache-2.0 多模态智能体模型,面向计算机使用、浏览和编程。
- OpenAI: GPT-4o-mini以往的 GPT-4o mini 快照。仍挂牌 $0.15/$0.60;活起点是 GPT-5.6 Sol。不是 2026 最新。
- OpenAI: GPT-4o以往的 GPT-4o 全能快照。仍挂牌 $2.50/$10;活起点是 GPT-5.6 Sol。不是 2026 最新。
- Qwen-Drive-1.0-4BQwen-Drive-1.0-4B 是阿里 Apache-2.0 的驾驶视觉语言模型,把三维感知、VQA 和运动规划放在同一套权重里。
- Qwen-VL上一代阿里 Qwen-VL 快照。活旗舰已经是 Qwen3.8。不是 2026 默认大规模视觉语言模型,也不是当前 LVLM。
- Qwen2-VL 72B Instruct上一代 Qwen2-VL 72B Instruct 快照。活路径已经是 Qwen3.8。不是 2024 视觉语言王冠。
- Qwen3.8-2.4T-A95B阿里巴巴旗舰 2.4T MoE 模型,激活参数 95B,1M token 上下文,原生多模态输入,PaperBench 与 OSWorld 全球登顶,史上最大的 Qwen 模型。
- Qwen3.8-27B阿里巴巴开源的 27B 稠密模型,Qwen3.8-Max 的配套稠密版本,Apache 2.0 协议,支持图文多模态输入,面向本地部署与小批量推理。
- Qwen3.8-Flash-Next阿里通义千问公开的 Qwen4 架构预览:125B 多模态 MoE、每 token 仅激活 6B,外加 51B N-gram 词表,原生 262K 上下文,输入定价 $0.16/百万 token。
- Qwen3.8-Max阿里 2.4T 参数开源旗舰:95B 激活的 MoE,原生文本/图片/视频输入,1M 上下文,输入 $2 / 输出 $6 每百万 token。
- Qwen3-VL-Embedding上一代 Qwen3-VL 嵌入快照。Hugging Face 仍列出 2B / 8B。旧的最新多模态嵌入王冠不当普查。
- Qwen3-VL-Reranker上一代 Qwen3-VL 重排序快照。Hugging Face 仍列出 2B / 8B。旧的前沿多模态重排序王冠不当普查。
- Seedance 2.5ByteDance Seed 的音画联合生成模型,面向 30 秒叙事、更准的参考控制、可延长两次,并提供绿幕等专业剪辑能力。
- WeMM-Embedding腾讯微信视觉团队推出的通用多模态嵌入模型家族(2B/4B/9B),基于 Qwen3.5。文本、图像、视频与视觉文档统一映射到 L2 归一化空间。Apache 2.0。
- YuE2-3BYuE2-3B 是 M·A·P 的 CC BY-NC 音乐模型,先写出可编辑乐谱,再渲染人声与伴奏,可在本地 24GB GPU 上跑。
- YouMindYouMind 是 AI 创作工作室:把收藏的文章、视频和笔记做成文稿、幻灯片、图像、网页和视频,并带付费 Skills 市场。
所有标签
A2A协议AI内容生成AI助手AI搜索AI支付AI智能体AnthropicAPIAWSBlack Forest LabsClaudeClaude CodeCloudflareCodexCohereCursorDeepgramDeepSeekElevenLabsFLUXGeminiGemmaGitGoGoogleGPTGPUGrokHugging FaceIBMJina AIKimiLangChainLangGraphLinuxLlamamacOSMarkdownMCPMetaMicrosoftMiniMaxMistralMixedbread AINous ResearchNVIDIAObsidianOpenAIOpenClawOpenCodeOpenHandsOpenRouterPerplexityPythonRAGReplitRustStability AITypeScriptVoyage AIxAI云计算代码助手代码审查代码质量企业级健康写作前沿模型加密与Web3协议可观测性向量嵌入向量数据库命令行图像生成多智能体多模态
标签为 多模态 的内容 (54 个)
Month Visit20000000DR: 90AS: 95
Month Visit20000000DR: 90AS: 95
Month Visit15700000DR: 72AS: 58
Month Visit15000000DR: 95AS: 98
Month Visit12000000DR: 88AS: 90
Month Visit12000000DR: 88AS: 90
Month Visit4800000DR: 95AS: 80
Month Visit2500000DR: 70AS: 60
Month Visit800000DR: 90AS: 88
Month Visit800000DR: 90AS: 88
Month Visit800000DR: 78AS: 82
Month Visit500000DR: 65AS: 70
Month Visit150000DR: 60AS: 55
Month Visit1500DR: 95AS: 92
Month Visit100DR: 100AS: 100
Month Visit100DR: 100AS: 100
Month Visit100DR: 100AS: 100
Month Visit100DR: 100AS: 100
Month Visit100DR: 100AS: 100
Month Visit235DR: 95AS: 90
Month Visit800DR: 88AS: 85
Month Visit215DR: 92AS: 87
Month Visit245DR: 91AS: 85
Month Visit180DR: 91AS: 85