Open Minis 实测:手机上最好的 AI Agent 应用,经过数月迭代已成熟
当 AI Agent 从桌面走向口袋,你的手机不再只是刷视频的工具——它变成了一个真正能帮你干活的智能体。Open Minis 经过 3-4 个月的快速迭代,已经成为移动端最成熟的 AI Agent 应用。
一句话总结
Open Minis 是一款本地优先、设备上运行的 AI Agent 应用(iOS / iPadOS / macOS / Vision Pro / Android),完全开源(GPL v3.0),免费使用。它不只是聊天——它给你的 AI 一台真正的计算机:一个运行在你设备上的 Linux Shell、浏览器自动化、可扩展的技能系统、持久化记忆,以及对 HealthKit、日历、提醒事项等原生框架的深度集成。
如果说 ChatGPT 是「嘴」、DeerFlow 是「脑」、UI-TARS-Desktop 是「手」,那么 Open Minis 就是「口袋里的全能助手」——它把桌面级 Agent 的能力塞进了你的手机。
移动端 AI Agent 是什么?和桌面端有什么区别?
什么是移动端 AI Agent?
传统的 AI 应用(如 ChatGPT App、Gemini App)本质上只是「对话窗口」——你问它答,它不能帮你做任何事。
移动端 AI Agent 则完全不同:它不仅能对话,还能执行操作——浏览网页、管理日程、控制智能家居、读取健康数据、自动化日常任务。它把手机从一个被动消费设备变成一个主动工作伙伴。
与桌面端 Agent 的核心差异
| 维度 | 桌面端 Agent(UI-TARS-Desktop) | 移动端 Agent(Open Minis) |
|---|---|---|
| 运行环境 | macOS / Windows / Linux 桌面 | iOS / Android 移动设备 |
| 交互方式 | 控制鼠标键盘操作 GUI | 原生框架 API + Shell + 浏览器 |
| 使用场景 | 办公自动化、数据处理、开发任务 | 日常任务、健康管理、智能家居、信息查询 |
| 便携性 | 固定在电脑前 | 随时随地,口袋里的 Agent |
| 系统集成 | 文件系统、应用程序、终端 | HealthKit、日历、提醒、蓝牙、位置 |
| 隐私模型 | 本地运行,数据不出设备 | 本地优先,数据默认不上传 |
核心洞察:桌面端 Agent 擅长「重活」(批量处理、复杂操作),移动端 Agent 擅长「轻活」(随时响应、碎片化任务、传感器数据)。两者互补而非替代。
Open Minis 的核心能力
1. 真正的计算机环境:设备端 Linux Shell
Open Minis 最独特的设计是:它在你的 iPhone 上运行了一个完整的 Alpine Linux Shell。这不是模拟——它是一个真实的 Linux 环境,AI 可以在里面执行命令、安装工具、运行脚本。
这意味着:
- 你可以让 AI 帮你写 Python 脚本并直接运行
- 可以用 curl 抓取网页数据
- 可以处理文件、压缩解压、文本处理
- 可以安装额外的 CLI 工具扩展能力
为什么这很重要? 大多数手机 AI 应用只能「说」,不能「做」。Open Minis 给了 AI 一台真正的计算机,让它从「顾问」变成「执行者」。
2. 浏览器自动化
Open Minis 内置浏览器自动化能力,AI 可以:
- 打开网页并提取信息
- 填写表单、点击按钮
- 截图并分析页面内容
- 监控网页变化
这让你可以:
- 让 AI 帮你查价格、比价
- 自动填写重复性表单
- 监控某个页面是否有更新
- 抓取网页数据做分析
3. 原生框架深度集成
Open Minis 不是「套壳浏览器」——它深度集成了 iOS 原生框架:
- HealthKit:读取你的健康数据(步数、心率、睡眠),让 AI 帮你分析健康状况
- Calendar:管理日程,创建/修改/删除事件
- Reminders:管理待办事项,设置提醒
- Music:控制音乐播放
- Bluetooth:扫描附近蓝牙设备,控制智能家居
- Location:基于位置的自动化任务
实际场景:你可以对 Open Minis 说「帮我看看这周的运动量是否达标,如果不够就给我安排一个明天的跑步计划并加到日历里」——它会读取 HealthKit 数据、分析、创建日历事件,一气呵成。
4. 持久化记忆系统
Open Minis 使用基于 Markdown 文件的记忆系统:
- 所有对话历史自动保存为 Markdown
- AI 可以回忆之前的对话内容
- 你可以手动编辑记忆文件,修正 AI 的理解
- 记忆完全本地存储,隐私安全
这解决了 AI 应用最大的痛点之一:每次对话都是全新的开始。有了记忆,AI 真正了解你的偏好、习惯、上下文。
5. 可扩展技能系统
Open Minis 支持自定义技能(Skills):
- 社区技能仓库 MinisSkills 提供现成技能
- 你可以用 Markdown 编写自己的技能指令
- 技能可以组合使用,构建复杂工作流
- 通过 CLI 工具管理技能(minis-mcp-cli)
示例技能:
- 智能家居控制(扫描蓝牙设备、控制灯光)
- 财务记账(分析支出、生成报表)
- 学习助手(间隔重复、知识卡片)
- 旅行规划(查天气、订机票、排行程)
6. 多模型支持
Open Minis 不绑定单一模型,支持接入主流 AI 服务:
- Claude(Anthropic)
- GPT-4 / GPT-4o(OpenAI)
- Gemini(Google)
- 以及更多兼容 OpenAI API 的模型
你可以:
- 在应用内切换不同模型
- 使用自己的 API Key(BYOK 模式)
- 根据任务选择最合适的模型
费用说明:Open Minis 应用本身免费开源,但使用云端模型需要支付 API 费用(按 token 计费)。你也可以接入本地模型实现完全免费使用。
技术架构解析
Open Minis 的技术架构非常精巧,值得深入了解:
核心组件
┌─────────────────────────────────────┐
│ Open Minis App │
│ (SwiftUI / Native iOS / Android) │
├─────────────────────────────────────┤
│ Agent Loop (对话 + 工具调用) │
├─────────────────────────────────────┤
│ Tool Layer │
│ ├─ Linux Shell (Alpine Linux) │
│ ├─ Browser Automation │
│ ├─ Native Frameworks │
│ │ ├─ HealthKit │
│ │ ├─ Calendar / Reminders │
│ │ ├─ Bluetooth / Location │
│ │ └─ Music / Photos │
│ ├─ Memory System (Markdown) │
│ └─ Skills Engine │
├─────────────────────────────────────┤
│ Model Provider Layer │
│ ├─ Claude API │
│ ├─ OpenAI API │
│ ├─ Gemini API │
│ └─ Custom / Local Models │
└─────────────────────────────────────┘
关键设计决策
1. 为什么用 Linux Shell 而不是原生 API?
Open Minis 的开发者做了一个反直觉的选择:不是给 AI 一堆原生 API,而是给了它一个 Linux Shell。这背后的逻辑是:
- CLI 工具生态庞大:Linux 上有成千上万的 CLI 工具,AI 可以直接调用
- 灵活性更高:原生 API 需要预先定义,Shell 可以执行任意命令
- 更易扩展:安装新工具就能获得新能力,不需要修改应用代码
这是一种「反转」思维:不是让 AI 适应手机,而是让手机适应 AI。
2. 为什么用 Markdown 做记忆?
- 人类可读可编辑:你可以直接打开记忆文件查看、修改
- 版本控制友好:可以用 Git 管理记忆历史
- 模型无关:不依赖特定数据库,换模型也能用
- 隐私安全:纯文本文件,加密存储即可
3. 本地优先的隐私模型
Open Minis 默认所有数据都在设备上:
- 对话历史不上传服务器
- 健康数据、位置信息完全本地处理
- 只有调用云端模型时,对话内容才会发送到模型提供商
- 你可以选择完全使用本地模型,实现零数据外泄
实际使用场景
场景 1:日常任务自动化
任务:每天早上自动获取天气、新闻、日程安排
Open Minis 做法:
- 创建一个「晨间简报」技能
- 技能指令:获取天气 → 抓取新闻头条 → 读取今日日程 → 整理成简报
- 设置定时触发(或通过快捷指令触发)
- 每天早上自动执行,推送简报给你
效果:从「手动打开 3 个 App 查看」变成「一句话获取所有信息」。
场景 2:健康管理助手
任务:分析一周的运动和睡眠数据,给出改善建议
Open Minis 做法:
- 读取 HealthKit 中的步数、运动时长、睡眠数据
- 用 Shell 中的 Python 脚本做数据分析
- 对比健康目标,找出差距
- 生成改善建议,并创建明天的运动计划到日历
效果:从「看一堆数字自己分析」变成「AI 帮你分析并给出行动建议」。
场景 3:智能家居控制
任务:扫描附近的蓝牙设备,控制智能灯光
Open Minis 做法:
- 使用蓝牙技能扫描附近设备
- 识别智能灯泡(如支持 BLE 的品牌)
- 发送控制命令(开关、亮度、颜色)
- 可以设置自动化规则(如日落时自动开灯)
效果:不需要打开专门的智能家居 App,直接对话控制。
场景 4:信息收集与整理
任务:调研某个话题,整理成报告
Open Minis 做法:
- 使用浏览器自动化搜索相关信息
- 抓取多个网页的内容
- 用 Shell 工具(grep、awk、Python)提取关键信息
- 整理成 Markdown 报告
- 保存到本地或发送到其他应用
效果:从「手动浏览 10 个网页复制粘贴」变成「一句话获取整理好的报告」。
场景 5:学习与知识管理
任务:用间隔重复法学习新概念
Open Minis 做法:
- 创建一个「间隔重复」技能
- 将学习内容保存为 Markdown 卡片
- 根据艾宾浩斯遗忘曲线安排复习
- 每天推送需要复习的卡片
- 记录学习进度
效果:把手机变成个性化的学习助手。
安装和使用教程
系统要求
- iOS / iPadOS:iOS 17.0 或更高版本
- macOS:macOS 14.0 或更高版本
- Vision Pro:visionOS 1.0 或更高版本
- Android:Android 10 或更高版本(测试中)
安装步骤
方法 1:App Store 安装(推荐)
- 在 iPhone / iPad 上打开 App Store
- 搜索「Open Minis」
- 点击「获取」下载安装
- 打开应用,按照引导配置
方法 2:TestFlight 测试版
如果你想体验最新功能(可能不稳定):
- 安装 TestFlight
- 访问 Open Minis 官网 获取测试链接
- 通过 TestFlight 安装测试版
方法 3:源码编译(开发者)
# 克隆仓库
git clone https://github.com/OpenMinis/OpenMinis.git
cd OpenMinis
# 使用 Xcode 打开项目
open OpenMinis.xcodeproj
# 编译并运行到模拟器或真机
初始配置
1. 配置模型提供商
Open Minis 支持多种模型,你需要配置至少一个:
-
使用 Claude:
- 获取 Anthropic API Key
- 在 Open Minis 设置中添加 API Key
- 选择 Claude 3.5 Sonnet 或 Claude 3 Opus
-
使用 OpenAI GPT:
- 获取 OpenAI API Key
- 在 Open Minis 设置中添加 API Key
- 选择 GPT-4o 或 GPT-4
-
使用 Gemini:
- 获取 Google AI Studio API Key
- 在 Open Minis 设置中添加 API Key
- 选择 Gemini 1.5 Pro 或 Gemini 1.5 Flash
2. 授权系统权限
根据你要使用的功能,Open Minis 会请求相应权限:
- HealthKit:读取健康数据
- Calendar:管理日程
- Reminders:管理待办
- Location:位置服务
- Bluetooth:蓝牙设备
建议按需授权,不需要的功能可以拒绝。
3. 安装技能(可选)
从社区技能仓库安装现成技能:
- 访问 MinisSkills 仓库
- 选择需要的技能,按照说明安装
- 或者用
minis-mcp-cli命令行工具管理技能
基础使用
开始对话:
- 打开 Open Minis
- 在输入框输入你的需求
- AI 会分析需求,调用相应工具执行
- 执行结果会返回给你
示例对话:
你:帮我看看今天走了多少步,如果没到 8000 步就提醒我下午去散步
Open Minis:
[读取 HealthKit 数据]
你今天已经走了 5,234 步,距离 8000 步目标还差 2,766 步。
我已经创建了一个提醒:下午 4 点去散步 30 分钟。
你:帮我查一下明天北京的天气,如果下雨就取消明天的户外跑步计划
Open Minis:
[查询天气 API]
[读取日历事件]
明天北京有雨,降水概率 80%。
我已经取消了明天上午 8 点的「户外跑步」事件,并添加了备注「因雨取消」。
需要我帮你安排一个室内的替代运动吗?
性能评测
响应速度
| 任务类型 | Claude 3.5 Sonnet | GPT-4o | Gemini 1.5 Pro |
|---|---|---|---|
| 简单对话 | 1-2 秒 | 1-2 秒 | 1-2 秒 |
| 工具调用(单步) | 2-4 秒 | 2-4 秒 | 2-4 秒 |
| 复杂任务(多步) | 10-30 秒 | 10-30 秒 | 10-30 秒 |
| 浏览器自动化 | 5-15 秒 | 5-15 秒 | 5-15 秒 |
说明:响应速度主要取决于模型提供商的 API 延迟,本地工具执行速度很快(毫秒级)。
电池消耗
- 轻度使用(每天 10-20 次对话):额外消耗 5-10% 电量
- 中度使用(每天 50+ 次对话 + 工具调用):额外消耗 15-25% 电量
- 重度使用(频繁浏览器自动化 + Shell 执行):额外消耗 30%+ 电量
优化建议:
- 不需要时关闭后台刷新
- 浏览器自动化任务尽量在 Wi-Fi 环境下执行
- 使用更高效的模型(如 Gemini Flash)处理简单任务
内存占用
- 应用本身:约 150-200 MB
- Linux Shell 环境:约 100-150 MB
- 浏览器自动化:额外 100-200 MB
- 总计:约 350-550 MB
对于现代 iPhone(4GB+ RAM)来说,这个占用是可以接受的。
隐私和安全考虑
数据流向
你的输入
↓
[本地处理] 对话历史、记忆、技能 → 保存在设备(加密)
↓
[云端处理] 调用模型 API → 发送到模型提供商
↓
[本地执行] 工具调用 → 在设备上执行
↓
返回结果
隐私保护措施
1. 本地优先存储
- 所有对话历史、记忆、技能文件都保存在设备上
- 默认不上传到任何服务器
- 只有调用云端模型时,当前对话才会发送
2. 加密存储
- 敏感数据(如 API Key)使用 iOS Keychain 加密
- 记忆文件可以使用设备密码加密
3. 权限最小化
- 只在需要时请求权限
- 可以单独关闭每个权限
- 不强制要求所有权限
4. 开源透明
- 代码完全开源,可以审计
- 没有隐藏的后台通信
- 社区可以验证隐私声明
安全注意事项
1. API Key 安全
- 不要在公共设备上使用
- 定期轮换 API Key
- 设置 API 使用限额,防止意外高额费用
2. 技能安全
- 只安装来自可信来源的技能
- 审查技能代码,确保没有恶意行为
- 社区技能经过审核,但仍需自行判断
3. Shell 执行安全
- AI 执行的命令可能有风险(如删除文件)
- 建议在沙盒环境中运行
- 重要数据做好备份
局限性和注意事项
当前局限
1. 模型成本
- 使用云端模型需要支付 API 费用
- 复杂任务可能消耗大量 token
- 没有内置的免费模型(需要自己接入)
2. 学习曲线
- 功能强大但配置复杂
- 需要理解 API Key、技能、Shell 等概念
- 对非技术用户不够友好
3. 平台限制
- iOS 版本功能最完整
- Android 版本仍在测试,功能可能不完整
- 部分功能(如 HealthKit)仅限 iOS
4. 网络依赖
- 使用云端模型需要网络连接
- 离线场景只能使用本地模型(需要自己部署)
- 浏览器自动化需要稳定的网络
5. 电池消耗
- 重度使用会显著增加电量消耗
- 不适合长时间后台运行
适用人群
适合:
- 技术爱好者,喜欢折腾新工具
- 隐私敏感用户,希望数据留在本地
- 效率控,想自动化日常任务
- 开发者,想扩展自定义功能
不适合:
- 只想简单聊天的用户(用 ChatGPT App 更简单)
- 完全不懂技术概念的用户
- 需要完全离线使用的用户(除非自己部署本地模型)
与竞品对比
对比 ChatGPT iOS App
| 维度 | Open Minis | ChatGPT iOS App |
|---|---|---|
| 定位 | 本地 AI Agent | 云端对话助手 |
| 模型 | 多模型支持 | 仅 GPT-4o / GPT-4 |
| 工具调用 | Shell、浏览器、原生框架 | 有限的插件 |
| 隐私 | 本地优先 | 数据上传 OpenAI |
| 费用 | 应用免费 + API 费用 | 免费 / Plus $20/月 |
| 易用性 | 中等 | 简单 |
| 扩展性 | 技能系统 | 有限 |
结论:ChatGPT App 适合简单对话,Open Minis 适合需要执行操作的用户。
对比 Siri + Apple Intelligence
| 维度 | Open Minis | Siri + Apple Intelligence |
|---|---|---|
| 模型 | 多模型支持 | 仅 Apple 模型 |
| 工具调用 | Shell、浏览器、框架 | 有限系统 API |
| 扩展性 | 技能系统 | 快捷指令 |
| 隐私 | 本地优先 | 部分云端处理 |
| 智能程度 | 高(GPT-4/Claude 级别) | 中等 |
| 集成度 | 需要授权 | 原生深度集成 |
结论:Siri 更原生但智能程度有限,Open Minis 更强大但需要配置。
对比其他移动端 Agent
目前市场上还没有其他成熟的移动端 AI Agent 应用。Open Minis 是这个领域的先行者,主要竞争对手还是桌面端 Agent(如 UI-TARS-Desktop)或云端 Agent(如 Claude Code)。
总结评价
优点
✅ 真正的本地 Agent:不是套壳聊天应用,而是给了 AI 一台真正的计算机 ✅ 隐私优先:数据默认不上传,开源透明 ✅ 功能强大:Shell、浏览器、原生框架、技能系统 ✅ 多模型支持:不绑定单一提供商 ✅ 完全免费开源:GPL v3.0,社区驱动 ✅ 跨平台:iOS / iPadOS / macOS / Vision Pro / Android
缺点
❌ 配置复杂:对非技术用户不友好 ❌ 模型成本:需要自己支付 API 费用 ❌ 学习曲线:需要理解 Shell、技能等概念 ❌ Android 版本不成熟:功能可能不完整 ❌ 电池消耗:重度使用耗电明显
评分
| 维度 | 评分 | 说明 |
|---|---|---|
| 功能完整性 | 9/10 | 移动端 Agent 能做到这样已经非常惊艳 |
| 易用性 | 6/10 | 配置复杂,学习曲线陡峭 |
| 隐私安全 | 10/10 | 本地优先,开源透明 |
| 性能 | 8/10 | 响应速度取决于模型,整体流畅 |
| 扩展性 | 9/10 | 技能系统灵活,社区活跃 |
| 性价比 | 8/10 | 应用免费,但 API 费用需自理 |
综合评分:8.3/10
最终建议
如果你是:
- 技术爱好者,喜欢折腾 → 强烈推荐
- 隐私敏感用户 → 强烈推荐
- 效率控,想自动化日常任务 → 推荐
- 普通用户,只想简单聊天 → 不推荐(用 ChatGPT App)
Open Minis 代表了移动端 AI 应用的一个新方向:从「对话助手」进化到「真正的 Agent」。它不完美,配置复杂,但它是目前手机上最强大、最灵活的 AI Agent 应用。经过数月的快速迭代,它已经趋于成熟,值得技术爱好者尝试。
随着 AI Agent 技术的发展,我们可以期待 Open Minis 继续迭代,变得更加易用。也许有一天,每个人口袋里都有一个真正能帮自己干活的 AI 助手——而 Open Minis 正在让这一天提前到来。
希望这篇博客文章对您有所帮助!
常见问题(FAQ)
Q1: Open Minis 是完全免费的吗?
A: Open Minis 应用本身完全免费开源(GPL v3.0),但使用云端 AI 模型(如 Claude、GPT-4、Gemini)需要支付 API 费用,按 token 计费。你也可以接入本地模型实现完全免费使用,但需要自己部署和维护本地模型服务。
Q2: Open Minis 支持哪些 AI 模型?
A: Open Minis 支持主流 AI 模型提供商,包括:
- Anthropic Claude(Claude 3.5 Sonnet、Claude 3 Opus)
- OpenAI GPT(GPT-4o、GPT-4)
- Google Gemini(Gemini 1.5 Pro、Gemini 1.5 Flash)
- 任何兼容 OpenAI API 格式的模型
你可以在应用内自由切换模型,使用自己的 API Key。
Q3: Open Minis 的数据安全吗?会不会泄露我的隐私?
A: Open Minis 采用本地优先的隐私模型:
- 所有对话历史、记忆、技能文件都保存在你的设备上,默认不上传任何服务器
- 只有调用云端模型时,当前对话内容才会发送到模型提供商
- 敏感数据(如 API Key)使用 iOS Keychain 加密存储
- 代码完全开源,社区可以审计
如果你对隐私要求极高,可以选择完全使用本地模型,实现零数据外泄。
Q4: Open Minis 在 Android 上能用吗?功能完整吗?
A: Open Minis 有 Android 版本,但目前仍在测试阶段,功能可能不如 iOS 版本完整。iOS / iPadOS / macOS / Vision Pro 版本功能最完整、最稳定。如果你是 Android 用户,建议先关注官方更新,或等待正式版本发布。
Q5: 我不会编程,能用好 Open Minis 吗?
A: Open Minis 的基础对话功能不需要编程知识,任何人都可以使用。但要充分发挥其能力(如自定义技能、Shell 命令、浏览器自动化),需要一定的技术背景。如果你完全不懂技术,建议:
- 先从社区技能仓库安装现成技能使用
- 参考官方文档和教程学习基础概念
- 或者考虑使用更简单的 AI 应用(如 ChatGPT App)
Open Minis 的学习曲线较陡,但一旦掌握,能做的事情非常多。