8.1
深览指数
科技虎嗅·AIGC从0到1··AI 生成

Agent 手机最难的一步:让概率模型接管确定性世界

文章深入探讨了Agent手机的核心挑战:如何让概率性的大模型在身份、权限、支付、应用生态等高度确定的现实世界中安全、可靠地执行任务。作者提出,Agent手机的本质是重写移动操作系统的执行模型,从App中心转向Task中心,并系统性地拆解了任务链路、四大基础对象(Task/Capability/Memory/Policy)、混合架构、商业化分账等关键问题。文章特别强调,Agent手机的成败不在于演示功能,而在于能否将一次真实委托变成一个可信、可审计、可追责的系统过程。适合对AI Agent、移动操作系统演进、产品架构有深度兴趣的读者。原文 ↗

核心观点
  • Agent手机最困难的核心挑战是:让概率性的AI模型,在身份、权限、支付、应用生态和责任边界都很确定的现实世界里,安全地执行任务。
  • Agent手机的本质是重写移动操作系统的执行模型,从管理App、窗口等对象的“App中心”,转向管理任务、能力、记忆和策略的“Task中心”。
  1. 01手机成为Agent关键设备是因为它同时拥有用户上下文(生活现场)、身份执行入口(SIM卡、支付等)和大部分服务的按钮,是个人数字生活里权限最密集的设备。
  2. 02文章提出Agent手机需要管理的四个一等对象:Task(任务状态机)、Capability(可被系统调用的应用动作)、Memory(工作记忆、情景记忆、程序性经验)、Policy(综合用户授权、安全状态、监管等规则的治理边界)。
  3. 03技术的终局大概率是混合架构:模型负责理解意图和拆分任务(项目经理),系统API负责高价值高风险操作(确定性接口),GUI Agent仅作为无标准接口时的受限兜底。
  4. 04Agent手机的可靠性不能仅用任务成功率衡量,还应关注多余操作率、越界率、恢复率和交接质量(卡住时用户能否快速理解上下文)。
  5. 05商业分账应基于任务收据,遵循三条原则:不操纵推荐、不按调用次数一刀切、不将用户上下文变为默认货币。
  6. 061. 应用方担心自己从完整产品被压缩成后台的一项能力,丧失品牌、数据和交易关系。2. 区分责任边界(谁该为Agent的误操作负责)是让企业接受Agent的前提。
反方 / 局限
  • GUI Agent虽然演示进展快,但并非主干道,其面临界面改版、弹窗、验证码、人机校验等诸多的不确定性,会模糊责任边界。
  • API路线需应用方主动开放,会导致平台困境:开放太少Agent体验做不起来,开放太多可能把App降格为后台服务,失去议价能力。
  • 文章暗示了Agent手机可能带来的风险,包括提示注入攻击、权限聚合带来的集中风险,以及代理责任归属不清的问题,需要新的保险与争议处理机制。
21 分钟 · 4 卡片 · 10 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问