阿里千问在云栖大会上发布手机 Agent 方案「Qwen Intelligence」

阿里千问在云栖大会上发布手机 Agent 方案「Qwen Intelligence」

手机上的任务是有状态的:工具有依赖和权限,每一步都会改数据,用户往往不把偏好说全,执行中还要看反馈再改计划。通用对话模型盖不住这件事。Qwen Intelligence 的做法是按职责拆开,不做全能助手,方案落成三件可交付的能力:规划、执行、创作,并同时公开配套评测。
https://qwenintelligence.com

# 三个 Agent

Mobile Planner Agent,规划层。 把一句话拆成可执行步骤,编排工具,并在中途改计划。例如「周一去上海出差」会拆成订票、订酒店、写日历、排行程;航班取消后再改签。技术上是「模型 × Harness」闭环:模型负责理解、规划和决策,Harness 管状态、记忆和技能。记忆分两层,工作记忆跟当前任务走,长期记忆把经验收成用户画像。
https://github.com/Tongyi-MAI/Qwen-Planner-Agent

Mobile-Use Agent,执行层。 能走接口就走接口:MCP、API、DeepLink、CLI;没有接口再退回看屏幕、点界面。敏感动作有边界:高风险请求拒绝,付款和删除交给用户确认,发评论一类动作交还用户。
https://tongyi-mai.github.io/Qwen-UI-Agent/

Mobile Creative Agent,创作层。 用户说话,规划模型先把它收成明确指令,再出可直接用的图,例如一句话生成排好版的复古日记。发布说明称,蒸馏和强化学习把生成从 100 步压到 8 步,首图约 3 秒,大约比主要竞品快一倍。
https://arxiv.org/abs/2608.16887

# 四套基准各量什么

MobilePA-Bench - 有状态的工具规划:工具调用、记忆、技能、子 Agent 协作
MobileWorld - 云端环境里的长程、跨应用执行,含向用户澄清和 MCP 工具
MobileWorld-Real - 真机、真实账号和网络下的日常任务
MobileWorld-Safety - 风险场景下会不会做出不安全动作



分类