UI-TARS-desktop
UI-TARS-desktop 是字节跳动开源的视觉多模态智能体套件,能「看见」你的屏幕,像人一样操作电脑和浏览器。它包含两个项目:Agent TARS,提供 CLI 与 Web UI 的通用多模态智能体套件;以及 UI-TARS Desktop,基于 UI-TARS 模型的原生桌面应用。它不是通过 API 驱动,而是看着像素执行鼠标键盘操作:点击按钮、填表、拖拽窗口、导航。仓库创建于 2025 年 1 月 19 日,目前约有 3.9 万 Star。
核心功能
- 靠视觉操作的 GUI 智能体:智能体解读截图并执行真实鼠标键盘操作,适用于没有 API 的应用。
- Agent TARS CLI:一条命令安装,支持有界面的 Web UI 与无头服务端执行。
- 远程电脑与浏览器操作器:v0.2.0 新增 Remote Computer Operator 与 Remote Browser Operator,均免费,可远程控制电脑或浏览器。
- UI-TARS-1.5 模型支持:桌面应用支持先进的 UI-TARS-1.5 模型,性能与操控精度更好。
- MCP 集成:通过 Model Context Protocol 接入现实世界工具,包括用于 DOM 与网络检查的 Chrome DevTools MCP。
- 领先的基准成绩:UI-TARS-1.5 在 OSWorld、AndroidWorld 等 10+ GUI 基准上表现领先,超过此前的 Claude 与 GPT-4o 结果。
适用场景
谁应该使用这个工具?
- 自动化构建者:自动化重复的表单填写、UI 测试和多步骤桌面工作流。
- QA 工程师:用基于视觉的交互驱动浏览器与桌面应用做端到端测试。
- AI 工程师:在终端或产品中嵌入 GUI 智能体能力,实现类人任务完成。
- 研究者:用 UI-TARS 模型套件评估多模态 GUI 智能体。
解决的问题
- 没有 API 的应用:当应用没有 API 时,智能体直接像人一样操作界面。
- 屏幕数据隐私:本地运行意味着屏幕数据不必离开你的机器。
- 跨应用工作流:跨多个桌面应用的多步骤流程变得可自动化。
定价方案
UI-TARS-desktop 采用 Apache-2.0 开源协议。桌面应用与 Agent TARS CLI 免费;v0.2.0 的远程电脑与浏览器操作器同样免费。你只需为选择运行的模型推理付费,支持本地与远程模型选项。
优势对比
- 真正的 computer use:通过像素和输入事件操作,而非注入代码,屏幕上可见的一切都能操作。
- 一个仓库两个产品:Agent TARS 面向终端/Web UI 自动化,UI-TARS Desktop 面向原生 GUI 控制。
- 免费远程操作器:远程电脑与浏览器操作器没有付费档。
快速开始
入门指南
- 从 GitHub Releases 下载最新版本,或用
git clone、npm install、npm run build从源码构建。 - 运行应用并选择模型:本地运行 UI-TARS-1.5,或连接远程操作器。
- 用自然语言给智能体一个任务,例如「预订圣何塞到纽约 9 月 1 日最早的航班」。
- 使用 Agent TARS CLI 或 Web UI 做无头与终端驱动自动化。
- 用 MCP 服务器扩展图表、DevTools 或其他现实世界工具。
常见问题
需要 API Key 吗?
不一定。你可以运行本地模型或连接远程操作器;应用本身免费且开源。
屏幕数据会被发到别处吗?
项目支持本地运行,屏幕数据可以留在本机。远程操作器模式会传输控制会话,具体请看文档。
支持哪些模型?
支持 UI-TARS-1.5 模型及该套件围绕的多模态 LLM,并可通过 MCP 工具扩展。
和 browser-use 有什么区别?
browser-use 是专注于网页自动化的 Python 库。UI-TARS-desktop 是原生桌面智能体,用 UI-TARS 多模态套件同时覆盖电脑与浏览器控制。
替代方案
- browser-use:开源 Python 库,用于 AI 智能体的浏览器自动化。
- Playwright:脚本化 Web 测试的浏览器自动化框架。
- Steel:面向 AI 智能体与 computer-use 工作负载的浏览器基础设施。
使用技巧
- 先在已知任务上验证:在信任它做大量工作前,先在一个流程上验证其像素级控制。
- 配合 MCP 工具:Chrome DevTools MCP 和图表 MCP 服务器能让智能体在检查与输出上强得多。
- 注意远程会话:远程操作器模式很强,请限制访问并检查涉及敏感屏幕的会话。
总结
UI-TARS-desktop 让基于视觉的 computer use 变得实用且开源。如果你需要一个能点击、填写并导航真实应用和浏览器的智能体,并且希望它本地、免费,这是当前最能打的套件之一。
评论
还没有评论。成为第一个评论的人!
相关工具
Trigger.dev
trigger.dev
开源(Apache 2.0)的 TypeScript 持久执行平台,为 AI 智能体和工作流而生。任务无超时,靠检查点恢复机制扛住崩溃、部署和空闲,自带重试、队列、幂等和可观测性。chat.agent 把每段对话变成一个长寿命任务,有消息就唤醒、没消息就冻结,等人工批准不计费。只按真实执行的算力收费,可自托管。
agentmemory
agent-memory.dev
面向 AI 编码智能体的持久化、可检索记忆:LongMemEval 上 R@5 召回 95.2%,本地 SQLite 运行,MCP/钩子/54 个工具适配 Claude Code、Cursor 与 Codex。
DeerFlow
deerflow.tech
字节跳动开源的 SuperAgent harness,面向长周期任务。基于 LangGraph 编排子智能体、记忆、沙箱和技能,自带浏览器的 Docker 沙箱,支持多种模型。
相关洞察

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。