UI-TARS-Desktop 实测:字节开源的桌面 AI Agent,38k Stars,自然语言控制你的电脑
当 AI 不再满足于「对话框里回答问题」,它开始伸手去碰你的鼠标。字节跳动开源的 UI-TARS-Desktop 正是这样一个项目——它不生成文本,而是直接操作你的屏幕。
一句话总结
UI-TARS-Desktop 是字节跳动 Seed 团队开源的多模态桌面 AI Agent 套件(GitHub 38k+ Stars,Apache 2.0 协议),包含两个核心产品:Agent TARS(通用多模态 Agent,CLI + Web UI)和 UI-TARS Desktop(基于 UI-TARS 视觉模型的本地桌面 GUI Agent)。它用自然语言指挥 AI 看屏幕、动鼠标、敲键盘,像真人一样完成桌面任务。
如果说 ChatGPT 是「嘴」,DeerFlow 是「脑」,那么 UI-TARS-Desktop 就是「手」——它让 AI 第一次真正伸进了你的操作系统。
桌面 AI Agent 是什么?和聊天机器人、浏览器 Agent 有什么区别?
在理解 UI-TARS-Desktop 之前,先厘清三个容易混淆的概念:
| 类型 | 代表产品 | 交互界面 | 能力边界 |
|---|---|---|---|
| 聊天机器人 | ChatGPT、Claude | 对话框 | 只能生成文本/代码,不能操作任何东西 |
| 浏览器 Agent | Page-Agent、Browser Use | 网页 DOM | 只能操作浏览器内的网页 |
| 桌面 AI Agent | UI-TARS-Desktop、Computer Use | 整个屏幕 | 能操作任何 GUI 应用:浏览器、Office、IDE、设计工具… |
桌面 AI Agent 的核心突破在于:它不依赖 API,不依赖 DOM,不依赖 accessibility tree——它直接「看」屏幕截图,像人一样用眼睛理解界面,然后操作鼠标键盘。这意味着理论上任何有图形界面的软件,它都能用。
UI-TARS-Desktop 是什么?
一个仓库,两个产品
UI-TARS-Desktop 仓库(github.com/bytedance/UI-TARS-desktop)实际包含两个独立项目:
1. Agent TARS —— 通用多模态 Agent 栈
- 提供 CLI 和 Web UI 两种使用方式
- 支持接入多种多模态 LLM(Claude、GPT-4o、豆包等)
- 内置浏览器 Agent(GUI + DOM 混合策略)
- 支持 MCP 工具集成,可连接外部工具链
- 一行命令启动:
npx @agent-tars/cli@latest
2. UI-TARS Desktop —— 本地桌面 GUI Agent
- 基于 UI-TARS 视觉语言模型的 Electron 桌面应用
- 支持本地模型和云端模型两种模式
- 提供 Computer Operator(控制整个电脑)和 Browser Operator(控制浏览器)
- 跨平台支持 Windows / macOS
- 完全本地处理,隐私安全
38k Stars 背后的时间线
| 时间 | 里程碑 |
|---|---|
| 2025-01 | 仓库创建,UI-TARS 论文发布 |
| 2025-02 | UI-TARS SDK 发布 |
| 2025-04 | Desktop v0.1.0,支持 UI-TARS-1.5 模型 |
| 2025-06 | Agent TARS Beta + CLI 发布 |
| 2025-09 | UI-TARS-2 发布,All-in-One Agent 模型 |
| 2025-11 | Agent TARS CLI v0.3.0,流式工具支持 |
| 2026-08 | 38k+ Stars,持续活跃更新 |
核心技术:UI-TARS 视觉模型
UI-TARS-Desktop 的「眼睛」是字节 Seed 团队训练的 UI-TARS 视觉语言模型。理解这个模型,才能理解整个系统的能力边界。
模型架构
UI-TARS 基于 Qwen 2.5 VL 架构,核心能力是看截图 → 理解界面 → 输出操作:
输入:屏幕截图 + 自然语言指令
↓
视觉编码器:理解截图中的 UI 元素(按钮、输入框、菜单…)
↓
思维链推理:规划操作步骤(先点这里,再输入文字,再点提交)
↓
动作输出:click(x, y) / type("hello") / scroll(down) / drag(x1,y1,x2,y2)
关键特性
- 坐标定位:模型输出的是绝对像素坐标(基于 1000×1000 归一化),不依赖 DOM 或 accessibility API
- 强化学习推理:UI-TARS-1.5 引入 RL 训练,模型会先「想」再「做」,显著提升复杂任务成功率
- 多 Prompt 模板:内置 COMPUTER_USE(桌面)、MOBILE_USE(移动端)、GUI+GAME(游戏)三种模式
- All-in-One:UI-TARS-2 将 GUI 操作、游戏、代码、工具使用融合进单一模型
模型规格
| 版本 | 参数量 | 特点 |
|---|---|---|
| UI-TARS-1.5-7B | 7B | 开源,HF 可下载,需 GPU 部署 |
| Doubao-1.5-UI-TARS | - | 火山引擎云端 API,开箱即用 |
| UI-TARS-2 | - | 最新版,多能力融合 |
UI-TARS-Desktop vs DeerFlow vs Page-Agent:三者定位完全不同
这三个项目都来自字节或阿里,都叫「AI Agent」,但解决的问题完全不同:
| 维度 | UI-TARS-Desktop | DeerFlow | Page-Agent |
|---|---|---|---|
| 出品方 | 字节 Seed | 字节跳动 | 阿里巴巴 |
| 核心能力 | 控制桌面 GUI | 自主研究与工作 | 控制网页 DOM |
| 交互层 | 屏幕截图 + 鼠标键盘 | 子 Agent + 沙箱执行 | 浏览器 DOM 树 |
| 运行位置 | Electron 桌面应用 | 本地 / Docker | 浏览器内 JS |
| 是否需要 GPU | 本地模型需要,云端不需要 | 取决于模型选择 | 不需要(调用云端 LLM) |
| 适用场景 | 操作任何桌面软件 | 研究报告、数据分析、代码编写 | SaaS 产品 AI Copilot |
| Stars | 38k+ | 50k+ | 18k+ |
| 协议 | Apache 2.0 | MIT | MIT |
一句话区分:
- UI-TARS-Desktop:AI 坐在你电脑前,用你的鼠标键盘干活
- DeerFlow:AI 在后台独立工作,交付研究报告
- Page-Agent:AI 住在网页里,操作网页界面
本地部署实战
方式一:Agent TARS CLI(最简单)
# 直接运行(需要 Node.js >= 22)
npx @agent-tars/cli@latest
# 或全局安装
npm install @agent-tars/cli@latest -g
# 启动时指定模型
agent-tars --provider anthropic \
--model claude-3-7-sonnet-latest \
--apiKey your-api-key
启动后会在本地起一个 Web UI,直接在里面下指令。
方式二:UI-TARS Desktop 桌面应用
macOS(Homebrew):
brew install --cask ui-tars
macOS(手动):
- 从 Releases 页面 下载 .dmg
- 拖入 Applications 文件夹
- 系统设置 → 隐私与安全性 → 授予「辅助功能」和「屏幕录制」权限
- 打开应用
Windows:
- 下载 .exe 安装包
- 安装并运行
配置模型
打开应用后进入 Settings,有两种模型选择:
选项 A:云端模型(推荐新手)
VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS
VLM Base URL: https://ark.cn-beijing.volces.com/api/v3
VLM API KEY: 你的火山引擎 API Key
VLM Model Name: doubao-1.5-ui-tars-250328
选项 B:本地模型(需要 GPU)
VLM Provider: Hugging Face for UI-TARS-1.5
VLM Base URL: https://your-endpoint.huggingface.cloud/v1/
VLM API KEY: your_api_key
VLM Model Name: UI-TARS-1.5-7B
本地部署 UI-TARS-1.5-7B 建议配置:
- GPU:NVIDIA RTX 3090 / 4090(24GB VRAM)或更高
- 内存:32GB+
- 磁盘:50GB+(模型权重约 14GB)
开始使用
配置完成后,点击「新建对话」,选择操作模式:
- Computer Operator:控制整个电脑屏幕
- Browser Operator:只控制浏览器(需安装 Chrome/Edge/Firefox)
然后输入自然语言指令,例如:
帮我打开 VS Code 的自动保存功能,并设置延迟 500 毫秒
AI 会截图 → 思考 → 移动鼠标 → 点击 → 验证,整个过程可视化。
实际使用场景
场景一:办公软件自动化
帮我在 Excel 中把 A 列的日期格式从 2026/08/23 改成 2026-08-23
AI 会打开 Excel,选中 A 列,调出格式设置,修改日期格式。适合批量重复操作。
场景二:跨应用工作流
从 Safari 复制当前网页标题,粘贴到备忘录,再加一个时间戳
这种跨应用的操作是传统自动化工具(如 Automator)很难做到的,但 GUI Agent 天然支持。
场景三:测试自动化
打开 Chrome,访问 http://localhost:3000,点击注册按钮,填写表单并提交
可以作为端到端测试的补充,尤其适合没有现成测试框架的老项目。
场景四:远程协助
Agent TARS 的 Remote Operator 支持远程控制(注:官方免费 Remote 服务已于 2025-08-20 下线,可改用火山引擎 OS Agent Services)。
技术架构深度解析
UI-TARS-Desktop 架构
┌─────────────────────────────────────────┐
│ UI-TARS Desktop App │
│ (Electron + React, 跨平台桌面应用) │
├─────────────────────────────────────────┤
│ ┌───────────┐ ┌───────────────────┐ │
│ │ Agent UI │ │ Screenshot Loop │ │
│ │ (对话界面) │ │ (实时截屏循环) │ │
│ └───────────┘ └───────────────────┘ │
├─────────────────────────────────────────┤
│ Operator Layer │
│ ┌─────────────┐ ┌─────────────────┐ │
│ │ Computer │ │ Browser │ │
│ │ Operator │ │ Operator │ │
│ │ (鼠标键盘) │ │ (CDP 控制) │ │
│ └─────────────┘ └─────────────────┘ │
├─────────────────────────────────────────┤
│ VLM Backend │
│ UI-TARS-1.5 / Doubao / Claude / GPT │
└─────────────────────────────────────────┘
Agent TARS 架构
┌─────────────────────────────────────────┐
│ Agent TARS (CLI / Web UI) │
├─────────────────────────────────────────┤
│ Event Stream (协议驱动的事件流) │
│ ├── Context Engineering │
│ ├── Tool Call Streaming │
│ └── Agent UI Rendering │
├─────────────────────────────────────────┤
│ MCP Kernel (Model Context Protocol) │
│ ├── Built-in Tools │
│ └── External MCP Servers │
├─────────────────────────────────────────┤
│ Multimodal LLM Layer │
│ ├── GUI Agent (Vision) │
│ ├── Browser Agent (DOM + Vision) │
│ └── Reasoning Engine │
└─────────────────────────────────────────┘
核心设计亮点:
- Event Stream 协议:所有工具调用、思考过程、动作执行都序列化为事件流,可回放、可调试
- MCP 原生集成:内核基于 Model Context Protocol 构建,可无缝接入任何 MCP Server
- 混合浏览器策略:同时使用 GUI(视觉)和 DOM(结构)两种策略操作网页
局限性和注意事项
已知限制
- 单显示器:UI-TARS Desktop 目前只支持单显示器设置,多显示器可能导致操作失败
- 本地模型门槛高:UI-TARS-1.5-7B 需要 24GB+ VRAM 的 GPU,普通笔记本跑不了
- 速度不如脚本:每一步都要截屏 → 推理 → 执行,比直接写自动化脚本慢很多
- 偶尔误操作:视觉识别不是 100% 准确,复杂界面可能点错位置
- Remote Operator 下线:官方免费远程操作服务已于 2025-08-20 停止
安全建议
- 首次使用建议在虚拟机或沙箱环境中测试
- 不要在有敏感信息的屏幕上运行不信任的模型
- 本地模型优先,云端模型注意 API Key 安全
- 复杂操作前可以先用「只思考不执行」模式验证计划
与其他桌面 Agent 方案对比
| 方案 | 开源 | 本地运行 | 模型要求 | 成熟度 |
|---|---|---|---|---|
| UI-TARS-Desktop | ✅ Apache 2.0 | ✅ | 自有 7B 模型或云端 | ⭐⭐⭐⭐⭐ |
| Anthropic Computer Use | ❌ | ❌ | Claude API | ⭐⭐⭐⭐ |
| Open Interpreter | ✅ | ✅ | 任意 LLM | ⭐⭐⭐ |
| AutoGLM | ❌ | 部分 | 自有模型 | ⭐⭐⭐ |
UI-TARS-Desktop 的核心优势:自有开源视觉模型 + 完整桌面应用 + 活跃社区。Anthropic Computer Use 虽然能力强,但必须依赖 Claude API 且不开源;Open Interpreter 更偏命令行而非 GUI。
总结评价
优点
- ✅ 真正开源(Apache 2.0),可商用
- ✅ 自有视觉模型,不强制依赖云端 API
- ✅ 双产品矩阵:CLI 版(Agent TARS)适合开发者,桌面版(UI-TARS Desktop)适合普通用户
- ✅ MCP 生态集成,可扩展性强
- ✅ 38k+ Stars,社区活跃,更新频繁
缺点
- ❌ 本地模型硬件门槛高(24GB VRAM)
- ❌ 单显示器限制
- ❌ 执行速度比脚本慢
- ❌ 文档以中文为主,英文文档不够完善
适合谁?
- 自动化爱好者:想让 AI 帮你操作桌面软件,不想写脚本
- 开发者:想用 Agent TARS CLI 构建自己的多模态 Agent 工作流
- 测试工程师:需要跨应用端到端测试,又没有现成框架
- AI 研究者:想研究 GUI Agent 的视觉理解和动作规划
不适合谁?
- 只需要网页自动化 → 用 Page-Agent 更轻量
- 只需要研究报告和数据分析 → 用 DeerFlow 更专注
- 没有 GPU 也不想用云端 API → 考虑 Needle 2 等纯本地小模型方案
常见问题(FAQ)
Q1:UI-TARS-Desktop 和 Agent TARS 是什么关系? A:同一个仓库里的两个项目。Agent TARS 是通用多模态 Agent(CLI + Web UI),支持多种 LLM;UI-TARS Desktop 是基于 UI-TARS 视觉模型的桌面应用,专注于本地 GUI 操作。
Q2:没有 GPU 能用吗? A:可以。使用火山引擎的 Doubao-1.5-UI-TARS 云端 API,或 Agent TARS 接入 Claude/GPT-4o 等云端模型,都不需要本地 GPU。只有本地部署 UI-TARS-1.5-7B 模型才需要 GPU。
Q3:支持中文指令吗? A:支持。UI-TARS 模型和 Doubao-1.5-UI-TARS 都原生支持中文,直接用中文下指令即可。
Q4:和 Anthropic Computer Use 有什么区别? A:Anthropic Computer Use 是 Claude 的内置能力,必须调用 Claude API,不开源;UI-TARS-Desktop 完全开源(Apache 2.0),有自己的视觉模型,可以本地部署,数据不出本机。
Q5:可以在多显示器环境下使用吗? A:目前不建议。官方文档明确说明 UI-TARS Desktop 仅支持单显示器设置,多显示器可能导致坐标计算错误和操作失败。
希望这篇博客文章对您有所帮助!如果你对桌面 AI Agent 感兴趣,也推荐阅读:
相关链接:
- GitHub 仓库:bytedance/UI-TARS-desktop
- UI-TARS 模型:bytedance/UI-TARS
- 论文:UI-TARS: Pioneering Automated GUI Interaction with Native Agents
- Agent TARS 官网:agent-tars.com
- Hugging Face 模型:ByteDance-Seed/UI-TARS-1.5-7B