UI-TARS-Desktop 实测:字节开源的桌面 AI Agent,38k Stars,自然语言控制你的电脑

UI-TARS-Desktop 实测:字节开源的桌面 AI Agent,38k Stars,自然语言控制你的电脑

UI-TARS-Desktop 实测:字节开源的桌面 AI Agent,38k Stars,自然语言控制你的电脑

当 AI 不再满足于「对话框里回答问题」,它开始伸手去碰你的鼠标。字节跳动开源的 UI-TARS-Desktop 正是这样一个项目——它不生成文本,而是直接操作你的屏幕。

一句话总结

UI-TARS-Desktop 是字节跳动 Seed 团队开源的多模态桌面 AI Agent 套件(GitHub 38k+ Stars,Apache 2.0 协议),包含两个核心产品:Agent TARS(通用多模态 Agent,CLI + Web UI)和 UI-TARS Desktop(基于 UI-TARS 视觉模型的本地桌面 GUI Agent)。它用自然语言指挥 AI 看屏幕、动鼠标、敲键盘,像真人一样完成桌面任务。

如果说 ChatGPT 是「嘴」,DeerFlow 是「脑」,那么 UI-TARS-Desktop 就是「手」——它让 AI 第一次真正伸进了你的操作系统。

桌面 AI Agent 是什么?和聊天机器人、浏览器 Agent 有什么区别?

在理解 UI-TARS-Desktop 之前,先厘清三个容易混淆的概念:

类型代表产品交互界面能力边界
聊天机器人ChatGPT、Claude对话框只能生成文本/代码,不能操作任何东西
浏览器 AgentPage-Agent、Browser Use网页 DOM只能操作浏览器内的网页
桌面 AI AgentUI-TARS-Desktop、Computer Use整个屏幕能操作任何 GUI 应用:浏览器、Office、IDE、设计工具…

桌面 AI Agent 的核心突破在于:它不依赖 API,不依赖 DOM,不依赖 accessibility tree——它直接「看」屏幕截图,像人一样用眼睛理解界面,然后操作鼠标键盘。这意味着理论上任何有图形界面的软件,它都能用。

UI-TARS-Desktop 是什么?

一个仓库,两个产品

UI-TARS-Desktop 仓库(github.com/bytedance/UI-TARS-desktop)实际包含两个独立项目:

1. Agent TARS —— 通用多模态 Agent 栈

  • 提供 CLI 和 Web UI 两种使用方式
  • 支持接入多种多模态 LLM(Claude、GPT-4o、豆包等)
  • 内置浏览器 Agent(GUI + DOM 混合策略)
  • 支持 MCP 工具集成,可连接外部工具链
  • 一行命令启动:npx @agent-tars/cli@latest

2. UI-TARS Desktop —— 本地桌面 GUI Agent

  • 基于 UI-TARS 视觉语言模型的 Electron 桌面应用
  • 支持本地模型和云端模型两种模式
  • 提供 Computer Operator(控制整个电脑)和 Browser Operator(控制浏览器)
  • 跨平台支持 Windows / macOS
  • 完全本地处理,隐私安全

38k Stars 背后的时间线

时间里程碑
2025-01仓库创建,UI-TARS 论文发布
2025-02UI-TARS SDK 发布
2025-04Desktop v0.1.0,支持 UI-TARS-1.5 模型
2025-06Agent TARS Beta + CLI 发布
2025-09UI-TARS-2 发布,All-in-One Agent 模型
2025-11Agent TARS CLI v0.3.0,流式工具支持
2026-0838k+ Stars,持续活跃更新

核心技术:UI-TARS 视觉模型

UI-TARS-Desktop 的「眼睛」是字节 Seed 团队训练的 UI-TARS 视觉语言模型。理解这个模型,才能理解整个系统的能力边界。

模型架构

UI-TARS 基于 Qwen 2.5 VL 架构,核心能力是看截图 → 理解界面 → 输出操作

输入:屏幕截图 + 自然语言指令

视觉编码器:理解截图中的 UI 元素(按钮、输入框、菜单…)

思维链推理:规划操作步骤(先点这里,再输入文字,再点提交)

动作输出:click(x, y) / type("hello") / scroll(down) / drag(x1,y1,x2,y2)

关键特性

  • 坐标定位:模型输出的是绝对像素坐标(基于 1000×1000 归一化),不依赖 DOM 或 accessibility API
  • 强化学习推理:UI-TARS-1.5 引入 RL 训练,模型会先「想」再「做」,显著提升复杂任务成功率
  • 多 Prompt 模板:内置 COMPUTER_USE(桌面)、MOBILE_USE(移动端)、GUI+GAME(游戏)三种模式
  • All-in-One:UI-TARS-2 将 GUI 操作、游戏、代码、工具使用融合进单一模型

模型规格

版本参数量特点
UI-TARS-1.5-7B7B开源,HF 可下载,需 GPU 部署
Doubao-1.5-UI-TARS-火山引擎云端 API,开箱即用
UI-TARS-2-最新版,多能力融合

UI-TARS-Desktop vs DeerFlow vs Page-Agent:三者定位完全不同

这三个项目都来自字节或阿里,都叫「AI Agent」,但解决的问题完全不同:

维度UI-TARS-DesktopDeerFlowPage-Agent
出品方字节 Seed字节跳动阿里巴巴
核心能力控制桌面 GUI自主研究与工作控制网页 DOM
交互层屏幕截图 + 鼠标键盘子 Agent + 沙箱执行浏览器 DOM 树
运行位置Electron 桌面应用本地 / Docker浏览器内 JS
是否需要 GPU本地模型需要,云端不需要取决于模型选择不需要(调用云端 LLM)
适用场景操作任何桌面软件研究报告、数据分析、代码编写SaaS 产品 AI Copilot
Stars38k+50k+18k+
协议Apache 2.0MITMIT

一句话区分

  • UI-TARS-Desktop:AI 坐在你电脑前,用你的鼠标键盘干活
  • DeerFlow:AI 在后台独立工作,交付研究报告
  • Page-Agent:AI 住在网页里,操作网页界面

本地部署实战

方式一:Agent TARS CLI(最简单)

# 直接运行(需要 Node.js >= 22)
npx @agent-tars/cli@latest

# 或全局安装
npm install @agent-tars/cli@latest -g

# 启动时指定模型
agent-tars --provider anthropic \
  --model claude-3-7-sonnet-latest \
  --apiKey your-api-key

启动后会在本地起一个 Web UI,直接在里面下指令。

方式二:UI-TARS Desktop 桌面应用

macOS(Homebrew):

brew install --cask ui-tars

macOS(手动):

  1. Releases 页面 下载 .dmg
  2. 拖入 Applications 文件夹
  3. 系统设置 → 隐私与安全性 → 授予「辅助功能」和「屏幕录制」权限
  4. 打开应用

Windows:

  1. 下载 .exe 安装包
  2. 安装并运行

配置模型

打开应用后进入 Settings,有两种模型选择:

选项 A:云端模型(推荐新手)

VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS
VLM Base URL: https://ark.cn-beijing.volces.com/api/v3
VLM API KEY: 你的火山引擎 API Key
VLM Model Name: doubao-1.5-ui-tars-250328

选项 B:本地模型(需要 GPU)

VLM Provider: Hugging Face for UI-TARS-1.5
VLM Base URL: https://your-endpoint.huggingface.cloud/v1/
VLM API KEY: your_api_key
VLM Model Name: UI-TARS-1.5-7B

本地部署 UI-TARS-1.5-7B 建议配置:

  • GPU:NVIDIA RTX 3090 / 4090(24GB VRAM)或更高
  • 内存:32GB+
  • 磁盘:50GB+(模型权重约 14GB)

开始使用

配置完成后,点击「新建对话」,选择操作模式:

  • Computer Operator:控制整个电脑屏幕
  • Browser Operator:只控制浏览器(需安装 Chrome/Edge/Firefox)

然后输入自然语言指令,例如:

帮我打开 VS Code 的自动保存功能,并设置延迟 500 毫秒

AI 会截图 → 思考 → 移动鼠标 → 点击 → 验证,整个过程可视化。

实际使用场景

场景一:办公软件自动化

帮我在 Excel 中把 A 列的日期格式从 2026/08/23 改成 2026-08-23

AI 会打开 Excel,选中 A 列,调出格式设置,修改日期格式。适合批量重复操作。

场景二:跨应用工作流

从 Safari 复制当前网页标题,粘贴到备忘录,再加一个时间戳

这种跨应用的操作是传统自动化工具(如 Automator)很难做到的,但 GUI Agent 天然支持。

场景三:测试自动化

打开 Chrome,访问 http://localhost:3000,点击注册按钮,填写表单并提交

可以作为端到端测试的补充,尤其适合没有现成测试框架的老项目。

场景四:远程协助

Agent TARS 的 Remote Operator 支持远程控制(注:官方免费 Remote 服务已于 2025-08-20 下线,可改用火山引擎 OS Agent Services)。

技术架构深度解析

UI-TARS-Desktop 架构

┌─────────────────────────────────────────┐
│           UI-TARS Desktop App           │
│  (Electron + React, 跨平台桌面应用)      │
├─────────────────────────────────────────┤
│  ┌───────────┐  ┌───────────────────┐  │
│  │ Agent UI  │  │  Screenshot Loop  │  │
│  │ (对话界面) │  │  (实时截屏循环)    │  │
│  └───────────┘  └───────────────────┘  │
├─────────────────────────────────────────┤
│           Operator Layer                │
│  ┌─────────────┐  ┌─────────────────┐  │
│  │  Computer   │  │    Browser      │  │
│  │  Operator   │  │    Operator     │  │
│  │ (鼠标键盘)   │  │  (CDP 控制)     │  │
│  └─────────────┘  └─────────────────┘  │
├─────────────────────────────────────────┤
│           VLM Backend                   │
│  UI-TARS-1.5 / Doubao / Claude / GPT   │
└─────────────────────────────────────────┘

Agent TARS 架构

┌─────────────────────────────────────────┐
│         Agent TARS (CLI / Web UI)       │
├─────────────────────────────────────────┤
│  Event Stream (协议驱动的事件流)          │
│  ├── Context Engineering                │
│  ├── Tool Call Streaming                │
│  └── Agent UI Rendering                 │
├─────────────────────────────────────────┤
│  MCP Kernel (Model Context Protocol)    │
│  ├── Built-in Tools                     │
│  └── External MCP Servers               │
├─────────────────────────────────────────┤
│  Multimodal LLM Layer                   │
│  ├── GUI Agent (Vision)                 │
│  ├── Browser Agent (DOM + Vision)       │
│  └── Reasoning Engine                   │
└─────────────────────────────────────────┘

核心设计亮点:

  • Event Stream 协议:所有工具调用、思考过程、动作执行都序列化为事件流,可回放、可调试
  • MCP 原生集成:内核基于 Model Context Protocol 构建,可无缝接入任何 MCP Server
  • 混合浏览器策略:同时使用 GUI(视觉)和 DOM(结构)两种策略操作网页

局限性和注意事项

已知限制

  1. 单显示器:UI-TARS Desktop 目前只支持单显示器设置,多显示器可能导致操作失败
  2. 本地模型门槛高:UI-TARS-1.5-7B 需要 24GB+ VRAM 的 GPU,普通笔记本跑不了
  3. 速度不如脚本:每一步都要截屏 → 推理 → 执行,比直接写自动化脚本慢很多
  4. 偶尔误操作:视觉识别不是 100% 准确,复杂界面可能点错位置
  5. Remote Operator 下线:官方免费远程操作服务已于 2025-08-20 停止

安全建议

  • 首次使用建议在虚拟机或沙箱环境中测试
  • 不要在有敏感信息的屏幕上运行不信任的模型
  • 本地模型优先,云端模型注意 API Key 安全
  • 复杂操作前可以先用「只思考不执行」模式验证计划

与其他桌面 Agent 方案对比

方案开源本地运行模型要求成熟度
UI-TARS-Desktop✅ Apache 2.0自有 7B 模型或云端⭐⭐⭐⭐⭐
Anthropic Computer UseClaude API⭐⭐⭐⭐
Open Interpreter任意 LLM⭐⭐⭐
AutoGLM部分自有模型⭐⭐⭐

UI-TARS-Desktop 的核心优势:自有开源视觉模型 + 完整桌面应用 + 活跃社区。Anthropic Computer Use 虽然能力强,但必须依赖 Claude API 且不开源;Open Interpreter 更偏命令行而非 GUI。

总结评价

优点

  • ✅ 真正开源(Apache 2.0),可商用
  • ✅ 自有视觉模型,不强制依赖云端 API
  • ✅ 双产品矩阵:CLI 版(Agent TARS)适合开发者,桌面版(UI-TARS Desktop)适合普通用户
  • ✅ MCP 生态集成,可扩展性强
  • ✅ 38k+ Stars,社区活跃,更新频繁

缺点

  • ❌ 本地模型硬件门槛高(24GB VRAM)
  • ❌ 单显示器限制
  • ❌ 执行速度比脚本慢
  • ❌ 文档以中文为主,英文文档不够完善

适合谁?

  • 自动化爱好者:想让 AI 帮你操作桌面软件,不想写脚本
  • 开发者:想用 Agent TARS CLI 构建自己的多模态 Agent 工作流
  • 测试工程师:需要跨应用端到端测试,又没有现成框架
  • AI 研究者:想研究 GUI Agent 的视觉理解和动作规划

不适合谁?

  • 只需要网页自动化 → 用 Page-Agent 更轻量
  • 只需要研究报告和数据分析 → 用 DeerFlow 更专注
  • 没有 GPU 也不想用云端 API → 考虑 Needle 2 等纯本地小模型方案

常见问题(FAQ)

Q1:UI-TARS-Desktop 和 Agent TARS 是什么关系? A:同一个仓库里的两个项目。Agent TARS 是通用多模态 Agent(CLI + Web UI),支持多种 LLM;UI-TARS Desktop 是基于 UI-TARS 视觉模型的桌面应用,专注于本地 GUI 操作。

Q2:没有 GPU 能用吗? A:可以。使用火山引擎的 Doubao-1.5-UI-TARS 云端 API,或 Agent TARS 接入 Claude/GPT-4o 等云端模型,都不需要本地 GPU。只有本地部署 UI-TARS-1.5-7B 模型才需要 GPU。

Q3:支持中文指令吗? A:支持。UI-TARS 模型和 Doubao-1.5-UI-TARS 都原生支持中文,直接用中文下指令即可。

Q4:和 Anthropic Computer Use 有什么区别? A:Anthropic Computer Use 是 Claude 的内置能力,必须调用 Claude API,不开源;UI-TARS-Desktop 完全开源(Apache 2.0),有自己的视觉模型,可以本地部署,数据不出本机。

Q5:可以在多显示器环境下使用吗? A:目前不建议。官方文档明确说明 UI-TARS Desktop 仅支持单显示器设置,多显示器可能导致坐标计算错误和操作失败。


希望这篇博客文章对您有所帮助!如果你对桌面 AI Agent 感兴趣,也推荐阅读:

相关链接: