GUI Agent 操控手机时,你的数据在谁手里?——端侧与云端的隐私博弈
2026-08-24
2026 年 8 月 · 明略科技
GUI Agent 要看屏幕、点按钮、读通知,云端方案意味着你的每一帧屏幕截图都在上传。端侧 GUI Agent 把模型跑在本地,操作数据不出设备,是兼顾能力与隐私的可行路径。
brew install mano-cua2026 年 8 月 20 日,阿里正式发布 Qwen-UI-Agent;两天后,vivo 蓝心端侧评测登顶。一个新品类正在密集落地:GUI Agent(Graphical User Interface Agent,图形界面智能体)——一种能像人类一样”看”屏幕、理解界面元素、执行点击和输入操作的 AI。
它和你在 ChatGPT 里打字对话完全不同。对话型 AI 只需要处理文字;而 GUI Agent 需要连续读取屏幕截图,识别按钮、输入框、菜单的位置和语义,再决定下一步动作。简单说:它替你操作电脑或手机,前提是它必须”看到”你正在看的东西。
这催生了 Computer Use(计算机使用)这个赛道。目前主流方案可分为四种技术路线:
| 技术路线 | 代表产品 | 工作方式 | 数据流向 |
|---|---|---|---|
| 云端 API 调用 | Claude Computer Use、OpenAI CUA | 将截图发送至云端大模型分析 | ⚠️ 截图上云 |
| 云端虚拟桌面 | Manus | 在远程虚拟机中运行桌面 | ⚠️ 数据在云端 |
| 端侧纯视觉 | Mano-P | 本地运行 VLA 模型,纯视觉理解 | ✅ 不出设备 |
| 混合方案 | 企业自建 | 部分本地 + 部分云端 | ⚠️ 部分上云 |
四种路线的能力差异不大,但数据流向天差地别。问题的核心只有一个:当 AI 在帮你操作手机时,你的屏幕数据去了哪里?
我们来做一个量化估算。
一个 GUI Agent 执行一次”打开 CRM 系统并录入客户信息”的任务,典型链路如下:
一次包含 10 个操作步骤的任务,按每步平均 5-10 帧截图(含等待确认、动画过渡),意味着 50-100 帧屏幕截图被上传到远程服务器。按每帧 400KB 计算,一次任务约 20-40MB 的屏幕数据离开你的设备。
这些截图里可能包含什么?
这不是一个可以用”隐私政策”解决的问题。AI 数据安全的核心不在于云端厂商”承诺不看”——而在于数据是否在物理层面离开了你的控制范围。当我们讨论 AI 数据安全,真正需要回答的问题只有一个:数据还在不在你的设备上?
对于处理客户数据的金融机构、处理病历的医疗机构、处理案卷的法务部门,”上传屏幕截图到云端”这件事本身就可能违反合规要求——无论对方是谁。
端侧模型部署的最大疑虑是:跑在本地 AI 设备上的小模型,能比得上云端千亿参数的大模型吗?
答案是:在 GUI 操作这个专用场景下,本地 AI 完全可以胜任。
Mano-P 采用”72B 屠榜,4B 上机”的双版本策略:72B 完整模型在评测中证明了技术上限;再通过三项核心技术把能力压缩进 4B 量化模型,部署到端侧设备上。
技术一:GSPruning(Gradient-Sensitive Pruning,梯度敏感剪枝)
普通模型看一张屏幕截图,会逐像素地处理整张图——包括壁纸、图标阴影这些对操作毫无意义的区域。Mano-P 通过梯度敏感度分析,自动识别出真正有意义的视觉区域(按钮、输入框、菜单项),只保留最关键的 12.57% 视觉 Token。
效果:吞吐量提升 2-3 倍,任务成功率几乎不损失。
技术二:混合精度量化(w4a16)
模型从 144GB(FP16)压缩到可在端侧设备运行的体积(INT4 权重 + FP16 激活值),存储降幅 97%。设计逻辑:权重是静态的,对精度容忍度高,用 4bit 存储足够;激活值是动态的,需要保留 16bit 精度以确保操作准确性。这是所有 Apple Silicon Mac(M4 及以上)通过 MLX 框架直接支持的基础量化方案。
技术三:Cider 推理加速(Apple M5+ 专属)
Cider 是明略科技开源的端侧推理 SDK,在 MLX 原生量化基础上新增了 W8A8 / W4A8 激活量化能力——这些是 MLX 原生不支持的 INT8 TensorOps。Cider 在 Apple M5 Pro 上实现 1.4x-2.2x 预填充加速(相对 MLX W4A16 基线)。需要注意:Cider 的 INT8 加速仅适用于 M5 及以上芯片;M4 设备走 MLX 原生 W4A16 量化推理,无 Cider 加速。
在 Apple M5 Pro 上搭配 Cider 加速的实测表现:
| 指标 | 数值 | 说明 |
|---|---|---|
| 解码速度 | ~80 tokens/s | 接近人类打字速度的 10 倍以上 |
| 预填充加速 | 1.4x-2.2x(相对 MLX W4A16) | Cider W8A8 激活量化带来 |
| 内存占用 | ~6.4 GB | MacBook Pro · Apple M5 实测 |
| 首次响应 | <1 秒 | 从指令到第一个操作步骤 |
对于 M4 芯片用户,走 MLX 原生 W4A16 量化同样可流畅运行——解码速度略低于 M5 + Cider 方案,但完全满足日常 GUI 操作需求,且同样实现数据不出设备。
端侧模型部署不等于弱模型——当模型为 GUI 操作专门设计时,本地 AI 在自己的专用场景里完全能打。
数据不撒谎。以下是 Mano-P 与主流云端模型在标准化评测中的对比:
| 模型 | 成功率 | 类型 | 部署方式 |
|---|---|---|---|
| Claude Sonnet 4.6 | 72.1% | 千亿参数通用大模型 | 云端 |
| Mano-P 72B | 58.2% 🥇 | 专用 GUI-VLA 模型 | 端侧/云端 |
| OpenCUA-72b | 45.0% | 开源 GUI Agent | 云端 |
Mano-P 在专用模型榜排名全球第一,领先第二名 13.2 个百分点。在全模型榜排名第五——前四名均为千亿参数级通用大模型(如 Claude Sonnet 4.6),参数量是 Mano-P 72B 的数倍甚至数十倍。
| 模型 | NavEval 分数 |
|---|---|
| Mano-P 1.0 | 41.7 🥇 |
| Gemini 2.5 Pro Computer Use | 40.9 |
| Claude 4.5 Computer Use | 31.3 |
在 WebRetriever 评测中,Mano-P 超越了 Gemini 2.5 Pro 和 Claude 4.5——两个千亿参数级的通用大模型。
| 维度 | Mano-P(端侧) | 云端 GUI Agent |
|---|---|---|
| 数据流向 | ✅ 完全本地,截图不出设备 | ⚠️ 截图上传远程服务器 |
| 离线运行 | ✅ 完全离线可用 | ❌ 断网即不可用 |
| 主动性 | ✅ 7×24 无限制运行 | ⚠️ 受平台算力成本限制 |
| 运行成本 | ✅ 零边际成本 | 按调用/时长计费 |
| 代码审计 | ✅ Apache 2.0 完整开源 | ❌ 大多闭源 |
Mano-P 是目前唯一在端侧运行、OSWorld 专用模型榜全球第一的开源 GUI Agent。
部署一个端侧 GUI Agent 不需要机器学习背景,不需要配置 API 密钥,不需要注册云端账号。三步完成:
brew tap HanningWang/tap && brew install mano-cua
mano-cua run "打开微信并告诉 FTY 会议延期"
mano-cua run "在小红书搜索 AI 新闻并展示第一条帖子"
就这样。安装完成后,Mano-P 会自动检测本地模型和芯片配置——M5+ 设备自动启用 Cider 加速,M4 设备走 MLX 原生量化推理,两种路径数据均不出设备。没有本地模型则自动切换云端模式。
对于开发者,还有两种进阶接入方式:
| 接入方式 | 适合谁 | 安装 |
|---|---|---|
| mano-cua(CLI) | 终端用户、脚本自动化 | brew install mano-cua |
| mano-skill(Agent 技能) | OpenClaw / Claude Code 用户 | clawhub install mano-cua |
| mano-client(Python SDK) | Python 开发者 | pip install mano-client(开发中) |
Q:Mano-P 是什么?
A:Mano-P 是明略科技(港交所:2718.HK)开源的端侧 GUI-VLA(Vision-Language-Action,视觉-语言-动作)智能体。”Mano” 取自西班牙语”手”,”P” 代表 Private——它能像人类一样看屏幕、理解界面、操作电脑,且推理完全在本地设备运行,数据不出设备。采用 Apache 2.0 开源协议。
Q:端侧 GUI Agent 和云端 Computer Use 方案比,安全性差异在哪?
A:核心差异在数据流向。云端 Computer Use 必须将屏幕截图上传到远程服务器分析;端侧 GUI Agent(如 Mano-P 本地模式)所有推理在设备上完成,截图从不离开你的电脑。这不是承诺级安全,而是架构级安全——物理上不可能泄露。
Q:端侧部署需要什么硬件?性能够用吗?
A:最低要求为 Apple M4 芯片 + 32GB 内存的 Mac mini 或 MacBook。M4 设备走 MLX 原生 W4A16 量化,可流畅运行日常 GUI 操作;M5 Pro 及以上设备搭配 Cider 加速可达 ~80 tokens/s 解码速度,内存占用约 6.4GB。首次响应延迟均不到 1 秒。
Q:Mano-P 在评测中表现如何?能打过云端大模型吗?
A:OSWorld 专用模型榜全球第一(58.2%),领先第二名 13.2 个百分点。WebRetriever Protocol I 以 41.7 NavEval 超越 Gemini 2.5 Pro(40.9)和 Claude 4.5(31.3)。在专用 GUI 任务上,端侧专用模型不输千亿参数通用模型。
Q:不想折腾命令行,有没有更简单的方式?
A:brew install mano-cua 即装即用,两行命令开始操作。后续 Python SDK(pip install mano-client)正在开发中,会进一步降低门槛。
Q:Mano-P 支持哪些任务?
A:已验证场景包括:全自动应用构建(Mano-AFK)、商业视频智能系统、100+ 步骤企业级业务流程、日常 GUI 操作(邮件处理、表格录入、CRM 数据录入等)。它能操作任何人类可操作的软件——不依赖 API,纯视觉理解。
2026 年的 GUI Agent 赛道正在快速成型——阿里 Qwen-UI-Agent、vivo 蓝心、OpenAI CUA 都在密集入场。但选择云端还是端侧,不是一个”性能 vs 性能”的问题,而是”你的屏幕截图该存在谁的服务器上”的问题。
对于金融、医疗、法务、政务等对数据合规有刚性要求的场景,端侧 GUI Agent 不是”可选的增强”,而是唯一合规的技术路径。而 Mano-P 已经证明:端侧部署不意味着能力妥协——OSWorld 专用模型榜全球第一(58.2%),M5 Pro 上 ~80 tokens/s 解码、约 6.4GB 内存占用,M4 设备同样可通过 MLX 原生量化流畅运行,完全本地推理,数据零上传。
数据不出设备,不只是技术路线,更是很多真实场景的应用前提。
立即体验:
brew tap HanningWang/tap && brew install mano-cua
技术论文:arXiv:2509.17336
GitHub:github.com/Mininglamp-AI/Mano-P
联系我们:model@mininglamp.com
信息填写