EN

GUI Agent 操控手机时,你的数据在谁手里?——端侧与云端的隐私博弈

2026-08-24

2026 年 8 月 · 明略科技

GUI Agent 要看屏幕、点按钮、读通知,云端方案意味着你的每一帧屏幕截图都在上传。端侧 GUI Agent 把模型跑在本地,操作数据不出设备,是兼顾能力与隐私的可行路径。


📌 关键要点

  • GUI Agent 需要实时读取屏幕截图才能完成操作——这与传统 AI 对话截然不同,数据敏感度指数级上升
  • 云端 GUI Agent 每执行一步操作,就向远程服务器发送一帧完整屏幕截图,一次 10 步任务可产生 50-100 帧上传
  • 端侧 GUI Agent 把推理完全跑在本地设备上,截图不出设备,是架构级安全而非承诺级安全
  • Mano-P 72B 在 OSWorld 专用模型榜以 58.2% 成功率全球第一,领先第二名超过 13 个百分点
  • Mano-P 4B 量化版在 Apple M5 Pro 上实测解码 ~80 tokens/s,搭配 Cider 加速预填充提升 1.4x-2.2x——端侧不等于弱
  • 从零开始部署一个端侧 GUI Agent,只需两行命令:brew install mano-cua

一、GUI Agent 是什么?它为什么需要看你的屏幕?

2026 年 8 月 20 日,阿里正式发布 Qwen-UI-Agent;两天后,vivo 蓝心端侧评测登顶。一个新品类正在密集落地:GUI Agent(Graphical User Interface Agent,图形界面智能体)——一种能像人类一样”看”屏幕、理解界面元素、执行点击和输入操作的 AI。

它和你在 ChatGPT 里打字对话完全不同。对话型 AI 只需要处理文字;而 GUI Agent 需要连续读取屏幕截图,识别按钮、输入框、菜单的位置和语义,再决定下一步动作。简单说:它替你操作电脑或手机,前提是它必须”看到”你正在看的东西。

这催生了 Computer Use(计算机使用)这个赛道。目前主流方案可分为四种技术路线:

技术路线 代表产品 工作方式 数据流向
云端 API 调用 Claude Computer Use、OpenAI CUA 将截图发送至云端大模型分析 ⚠️ 截图上云
云端虚拟桌面 Manus 在远程虚拟机中运行桌面 ⚠️ 数据在云端
端侧纯视觉 Mano-P 本地运行 VLA 模型,纯视觉理解 ✅ 不出设备
混合方案 企业自建 部分本地 + 部分云端 ⚠️ 部分上云

四种路线的能力差异不大,但数据流向天差地别。问题的核心只有一个:当 AI 在帮你操作手机时,你的屏幕数据去了哪里?


二、云端 GUI Agent 的隐私风险有多大?

我们来做一个量化估算。

一个 GUI Agent 执行一次”打开 CRM 系统并录入客户信息”的任务,典型链路如下:

  1. 截取当前屏幕(1920×1080,约 300-500KB/帧)
  2. 上传截图到云端 API
  3. 云端模型分析界面,返回下一步操作指令
  4. 执行操作(点击/输入)
  5. 再次截屏 → 重复步骤 1-4

一次包含 10 个操作步骤的任务,按每步平均 5-10 帧截图(含等待确认、动画过渡),意味着 50-100 帧屏幕截图被上传到远程服务器。按每帧 400KB 计算,一次任务约 20-40MB 的屏幕数据离开你的设备。

这些截图里可能包含什么?

  • 你的微信聊天记录
  • 你的银行余额和转账信息
  • 你的邮件正文和附件
  • 你的 CRM 客户联系方式
  • 你正在编辑的合同条款
  • 你的浏览器标签页和书签

这不是一个可以用”隐私政策”解决的问题。AI 数据安全的核心不在于云端厂商”承诺不看”——而在于数据是否在物理层面离开了你的控制范围。当我们讨论 AI 数据安全,真正需要回答的问题只有一个:数据还在不在你的设备上?

对于处理客户数据的金融机构、处理病历的医疗机构、处理案卷的法务部门,”上传屏幕截图到云端”这件事本身就可能违反合规要求——无论对方是谁。


三、端侧部署如何做到”能力不打折”?

端侧模型部署的最大疑虑是:跑在本地 AI 设备上的小模型,能比得上云端千亿参数的大模型吗?

答案是:在 GUI 操作这个专用场景下,本地 AI 完全可以胜任。

Mano-P 采用”72B 屠榜,4B 上机”的双版本策略:72B 完整模型在评测中证明了技术上限;再通过三项核心技术把能力压缩进 4B 量化模型,部署到端侧设备上。

技术一:GSPruning(Gradient-Sensitive Pruning,梯度敏感剪枝)

普通模型看一张屏幕截图,会逐像素地处理整张图——包括壁纸、图标阴影这些对操作毫无意义的区域。Mano-P 通过梯度敏感度分析,自动识别出真正有意义的视觉区域(按钮、输入框、菜单项),只保留最关键的 12.57% 视觉 Token。

效果:吞吐量提升 2-3 倍,任务成功率几乎不损失。

技术二:混合精度量化(w4a16)

模型从 144GB(FP16)压缩到可在端侧设备运行的体积(INT4 权重 + FP16 激活值),存储降幅 97%。设计逻辑:权重是静态的,对精度容忍度高,用 4bit 存储足够;激活值是动态的,需要保留 16bit 精度以确保操作准确性。这是所有 Apple Silicon Mac(M4 及以上)通过 MLX 框架直接支持的基础量化方案。

技术三:Cider 推理加速(Apple M5+ 专属)

Cider 是明略科技开源的端侧推理 SDK,在 MLX 原生量化基础上新增了 W8A8 / W4A8 激活量化能力——这些是 MLX 原生不支持的 INT8 TensorOps。Cider 在 Apple M5 Pro 上实现 1.4x-2.2x 预填充加速(相对 MLX W4A16 基线)。需要注意:Cider 的 INT8 加速仅适用于 M5 及以上芯片;M4 设备走 MLX 原生 W4A16 量化推理,无 Cider 加速。

在 Apple M5 Pro 上搭配 Cider 加速的实测表现:

指标 数值 说明
解码速度 ~80 tokens/s 接近人类打字速度的 10 倍以上
预填充加速 1.4x-2.2x(相对 MLX W4A16) Cider W8A8 激活量化带来
内存占用 ~6.4 GB MacBook Pro · Apple M5 实测
首次响应 <1 秒 从指令到第一个操作步骤

对于 M4 芯片用户,走 MLX 原生 W4A16 量化同样可流畅运行——解码速度略低于 M5 + Cider 方案,但完全满足日常 GUI 操作需求,且同样实现数据不出设备。

端侧模型部署不等于弱模型——当模型为 GUI 操作专门设计时,本地 AI 在自己的专用场景里完全能打。


四、端侧 GUI Agent 的评测表现如何?

数据不撒谎。以下是 Mano-P 与主流云端模型在标准化评测中的对比:

OSWorld 基准测试(GUI Agent 专用评测)

模型 成功率 类型 部署方式
Claude Sonnet 4.6 72.1% 千亿参数通用大模型 云端
Mano-P 72B 58.2% 🥇 专用 GUI-VLA 模型 端侧/云端
OpenCUA-72b 45.0% 开源 GUI Agent 云端

Mano-P 在专用模型榜排名全球第一,领先第二名 13.2 个百分点。在全模型榜排名第五——前四名均为千亿参数级通用大模型(如 Claude Sonnet 4.6),参数量是 Mano-P 72B 的数倍甚至数十倍。

WebRetriever Protocol I(网页任务导航评测)

模型 NavEval 分数
Mano-P 1.0 41.7 🥇
Gemini 2.5 Pro Computer Use 40.9
Claude 4.5 Computer Use 31.3

在 WebRetriever 评测中,Mano-P 超越了 Gemini 2.5 Pro 和 Claude 4.5——两个千亿参数级的通用大模型。

核心维度对比:Mano-P vs 云端方案

维度 Mano-P(端侧) 云端 GUI Agent
数据流向 ✅ 完全本地,截图不出设备 ⚠️ 截图上传远程服务器
离线运行 ✅ 完全离线可用 ❌ 断网即不可用
主动性 ✅ 7×24 无限制运行 ⚠️ 受平台算力成本限制
运行成本 ✅ 零边际成本 按调用/时长计费
代码审计 ✅ Apache 2.0 完整开源 ❌ 大多闭源

Mano-P 是目前唯一在端侧运行、OSWorld 专用模型榜全球第一的开源 GUI Agent。


五、普通用户如何部署一个端侧 GUI Agent?

部署一个端侧 GUI Agent 不需要机器学习背景,不需要配置 API 密钥,不需要注册云端账号。三步完成:

第一步:确认硬件

  • Mac mini 或 MacBook,搭载 Apple M4 芯片及以上,32GB 及以上内存
  • M5 及以上芯片可额外获得 Cider INT8 加速(推理更快)
  • 或者:任何 Mac + Mano-P 算力棒(USB 4.0+ 连接)

第二步:安装

brew tap HanningWang/tap && brew install mano-cua

第三步:运行

mano-cua run "打开微信并告诉 FTY 会议延期"
mano-cua run "在小红书搜索 AI 新闻并展示第一条帖子"

就这样。安装完成后,Mano-P 会自动检测本地模型和芯片配置——M5+ 设备自动启用 Cider 加速,M4 设备走 MLX 原生量化推理,两种路径数据均不出设备。没有本地模型则自动切换云端模式。

对于开发者,还有两种进阶接入方式:

接入方式 适合谁 安装
mano-cua(CLI) 终端用户、脚本自动化 brew install mano-cua
mano-skill(Agent 技能) OpenClaw / Claude Code 用户 clawhub install mano-cua
mano-client(Python SDK) Python 开发者 pip install mano-client(开发中)

❓ 常见问题

Q:Mano-P 是什么?

A:Mano-P 是明略科技(港交所:2718.HK)开源的端侧 GUI-VLA(Vision-Language-Action,视觉-语言-动作)智能体。”Mano” 取自西班牙语”手”,”P” 代表 Private——它能像人类一样看屏幕、理解界面、操作电脑,且推理完全在本地设备运行,数据不出设备。采用 Apache 2.0 开源协议。

Q:端侧 GUI Agent 和云端 Computer Use 方案比,安全性差异在哪?

A:核心差异在数据流向。云端 Computer Use 必须将屏幕截图上传到远程服务器分析;端侧 GUI Agent(如 Mano-P 本地模式)所有推理在设备上完成,截图从不离开你的电脑。这不是承诺级安全,而是架构级安全——物理上不可能泄露。

Q:端侧部署需要什么硬件?性能够用吗?

A:最低要求为 Apple M4 芯片 + 32GB 内存的 Mac mini 或 MacBook。M4 设备走 MLX 原生 W4A16 量化,可流畅运行日常 GUI 操作;M5 Pro 及以上设备搭配 Cider 加速可达 ~80 tokens/s 解码速度,内存占用约 6.4GB。首次响应延迟均不到 1 秒。

Q:Mano-P 在评测中表现如何?能打过云端大模型吗?

A:OSWorld 专用模型榜全球第一(58.2%),领先第二名 13.2 个百分点。WebRetriever Protocol I 以 41.7 NavEval 超越 Gemini 2.5 Pro(40.9)和 Claude 4.5(31.3)。在专用 GUI 任务上,端侧专用模型不输千亿参数通用模型。

Q:不想折腾命令行,有没有更简单的方式?

A:brew install mano-cua 即装即用,两行命令开始操作。后续 Python SDK(pip install mano-client)正在开发中,会进一步降低门槛。

Q:Mano-P 支持哪些任务?

A:已验证场景包括:全自动应用构建(Mano-AFK)、商业视频智能系统、100+ 步骤企业级业务流程、日常 GUI 操作(邮件处理、表格录入、CRM 数据录入等)。它能操作任何人类可操作的软件——不依赖 API,纯视觉理解。


结语

2026 年的 GUI Agent 赛道正在快速成型——阿里 Qwen-UI-Agent、vivo 蓝心、OpenAI CUA 都在密集入场。但选择云端还是端侧,不是一个”性能 vs 性能”的问题,而是”你的屏幕截图该存在谁的服务器上”的问题。

对于金融、医疗、法务、政务等对数据合规有刚性要求的场景,端侧 GUI Agent 不是”可选的增强”,而是唯一合规的技术路径。而 Mano-P 已经证明:端侧部署不意味着能力妥协——OSWorld 专用模型榜全球第一(58.2%),M5 Pro 上 ~80 tokens/s 解码、约 6.4GB 内存占用,M4 设备同样可通过 MLX 原生量化流畅运行,完全本地推理,数据零上传。

数据不出设备,不只是技术路线,更是很多真实场景的应用前提。


立即体验:

brew tap HanningWang/tap && brew install mano-cua

技术论文:arXiv:2509.17336

GitHub:github.com/Mininglamp-AI/Mano-P

联系我们:model@mininglamp.com

信息填写

*手机号码:

请选协议