模型:从回答问题到持续执行
理解自然语言目标、操作网页并处理异常;支持轮询和定时任务,能够在用户离开后继续执行,并通过主动下行提醒反馈进展或结果。
小微、豆包、阶跃、通义等已能完成对话、检索和部分工具调用,但多数体验仍由用户发起,复杂任务成功率、跨天持续性和主动下行尚未形成稳定认知。
差异不在“能不能调用模型”,而在是否把模型变成可持续运行的任务系统。
本文主要回答五个问题:Muse是怎么火的?它有哪些能力?这些能力是否真的新、如何验证?它为什么在美国成立?中国市场更可能走向什么形态?
Muse的爆发不是单一广告事件,而是“广告导入—榜单确权—生活化案例—战略升级”的连续传播路径。
| 时间 | 市场事件 | 真实图片证据 | 传播作用 |
|---|---|---|---|
| 9月8日 | Muse正式发布 美国、加拿大开放;公布云端电脑、浏览器、长期目标、邮件、购物和日程能力。 | ![]() | 完成产品定义:它不是聊天机器人,而是“个人事务Agent”。 |
| 9月9日 | Meta开始内部广告导流 Facebook、Instagram等产品开始推广Muse。 | ![]() | 借助已有用户网络降低获客成本。 |
| 9月8—17日 | Sensor Tower估算下载约280万,平均日环比增长55%。 | ![]() | 说明在Connect和大规模外部投放前,产品已有自然增长。 |
| 9月18日 | 登顶美国App Store免费榜 | ![]() | App Store榜单把产品从科技圈推向大众市场,并提供“权威感”。 |
| 9月19日 | 登顶Google Play | ![]() | 证明增长不只是iOS或单一平台现象。 |
| 9月18—22日 | 生活化案例成为传播中心 省钱、取消订阅、争议账单、退款、比价等案例被反复传播。 | ![]() | 用户开始理解“它能帮我减少损失”,而不是“它会做复杂研究”。 |
| 9月22日 | Muse进入广告支出最高的十大品牌。 | ![]() | 增长进入规模化营销阶段。 |
| 9月23日 | Meta Connect战略升级 公布AI眼镜、Mac操作、专属邮箱、更多连接器和视频交互规划。 | ![]() | Muse从热门App升级为Meta的个人AI与硬件入口。 |
| 9月26日 | 独立实测暴露任务边界 购物任务仅部分成功;另有实测出现支付链接失败,需要人工接管浏览器。 | ![]() | 市场开始从“它很火”转向“它到底可靠不可靠”。 |
Muse的传播路径不是“广告把它买火”,而是“广告让用户看见,榜单让用户相信,生活案例让用户愿意分享,Connect让市场相信它可能成为入口”。
这一章不按“购物、订票、写邮件”拆,而是抽象成五个底层能力,再与Manus、Instinct、Codex等产品对照。
| 能力维度 | Muse表现 | Muse之前的代表 | 判断 |
|---|---|---|---|
| 1. 个人理解与人格化 | 记住偏好、关系、约束和长期目标;用Avatar、建议卡和自然语言降低学习门槛。 | ChatGPT Memory、Personal AI、Manus Projects | 技术不新;Muse把“记忆”包装成了生活助理关系。 |
| 2. 长期委托与主动管理 | 把目标拆成计划;App关闭后继续运行;根据邮件、日历或价格变化提醒用户。 | Manus Automations、ChatGPT Tasks、Codex Goals | 技术已有;差异在于管理对象从工作项目迁移到生活。 |
| 3. 跨服务执行 | 通过浏览器、邮箱、日历、购物和支付完成任务。 | Manus Browser Operator、OpenClaw、Operator | 技术已有;Muse强化个人账户和消费闭环。 |
| 4. 安全与授权 | Sentinel、凭证隔离、细粒度权限、高风险动作确认和一次性支付卡。 | 企业Agent安全、RPA审批、Human-in-the-loop | 工程整合更完整,但不是全新的Agent范式。 |
| 5. 多终端与硬件入口 | App、Web、WhatsApp;未来进入AI眼镜,并扩展语音和电话。 | Siri、Gemini、Codex移动端、Manus移动端 | 移动端不新;Muse更强调随身、人格化和硬件陪伴。 |
统一使用“个人理解、长期委托、跨服务执行、安全授权、多终端入口”五个维度,判断各类Agent是否已经形成产品能力。
| 产品/路线 | 个人理解与人格化 | 长期委托与主动管理 | 跨服务执行 | 安全与授权 | 多终端与硬件入口 |
|---|---|---|---|---|---|
| Muse | 具备记忆偏好、关系与长期目标,并通过Avatar形成陪伴感。 | 具备轮询、定时任务、后台执行和主动下行提醒。 | 具备浏览器、邮箱、日历、购物、预约和支付。 | 具备Sentinel、凭证隔离、分级授权与关键确认。 | 具备App、Web、WhatsApp、Avatar及AI眼镜规划。 |
| Manus/Cue | 部分具备具备项目和身份上下文,生活画像仍有限。 | 具备自动化、定时任务和云端后台运行。 | 具备云电脑、浏览器、邮箱、电话和钱包。 | 部分具备有凭证与沙箱机制,消费级验证仍少。 | 部分具备Web和移动端为主,硬件入口较弱。 |
| Instinct | 部分具备围绕日常事务,但长期人格化证据有限。 | 部分具备可以持续跟进,主动管理能力仍待验证。 | 部分具备通过短信、电话和电脑推进任务。 | 部分具备透明度与安全授权机制尚未充分验证。 | 具备直接使用手机和电脑,强调“无新界面”。 |
| Codex | 部分具备有记忆与项目上下文,但面向工程任务。 | 具备Goals、任务、后台运行与持续执行。 | 具备在终端、代码库、云环境和GitHub中执行。 | 具备工作区隔离、审批和权限边界完整。 | 部分具备桌面与移动控制面,缺少消费硬件入口。 |
| Today AI | 部分具备理解日程、邮件和个人工作流。 | 具备主动简报、日程管理和流程跟进。 | 部分具备邮箱、日历、文件、飞书和钉钉。 | 部分具备应用授权较完整,支付和跨平台能力有限。 | 部分具备App和通知入口,无OS级硬件入口。 |
| AI手机/OS Agent | 部分具备掌握设备状态,但长期人格化仍弱。 | 部分具备有系统提醒和自动化,复杂委托仍有限。 | 具备系统权限和跨App操作能力最深。 | 具备系统级权限、确认机制和设备安全能力。 | 具备OS、通知、屏幕、语音与硬件入口。 |
这里不再机械套用服务分类,而是根据你提供的实测截图,按“用户交给Muse什么事—它实际推进到哪一步—卡在哪里”来判断服务能力。
| 具体Query | 服务场景 | 实测结果 | 是否办成 | 服务总结 |
|---|---|---|---|---|
| “我想买Diptyque杜桑,帮我全网比价哪个更便宜。” | 商品比价 | 先澄清具体香型,再尝试天猫、京东、得物和海外渠道。国内平台受登录限制,部分网页也出现崩溃;最终给出官方价格、历史低价和风险判断。 | 部分办成 | 能完成搜索、汇总和判断,但无法保证覆盖所有渠道,也没有推进到可靠购买闭环。 |
| “帮我预约一下明天晚上Viana Barcelona 8点钟,两位。” | 餐厅预约 | 结合用户行程确认餐厅、日期、时区和人数,进入官网完成预约,并返回预订人、保留时间和确认邮件信息。 | 办成 | 开放网页上的预约可以形成真实结果;验证码或设备验证出现时仍可能需要用户接管。 |
| “你先帮我把入境卡填了吧。” | 表单代办 | 读取用户提供的护照信息,进入入境卡网站填写并提交,最终返回入境卡号和二维码。 | 办成 | 结构化表单代办可完成,但需要用户提供敏感材料,并在验证或最终提交环节确认。 |
| “你去看一下我的中国银行支出短信,再看看相册里的账单,帮我整理账单。” | 财务记账 | 明确表示不能直接读取手机银行短信和相册,只能处理用户主动复制或上传的内容。 | 未办成 | 缺少手机私域数据权限,无法自动获取财务流水;只能退化为手动上传后的记账助手。 |
| “那你帮我去Google Maps上搜搜这里附近的餐厅?” | 本地生活搜索 | 完成地图搜索,返回附近餐厅、评分、评价数量、距离和营业信息,并提醒小样本高分的可信度有限。 | 办成 | 公开地图信息的搜索和筛选成熟,但结果质量依赖地图覆盖和评价数据。 |
| “我想吃个外卖,能帮我点附近评分好的吗?能用Uber Eats帮我点吗?” | 外卖下单 | 可以搜索餐厅并询问地址,但确认广州不支持Uber Eats;同时缺少对应账号和支付能力,未进入下单闭环。 | 未办成 | 能做需求理解和服务搜索,但地域、账户、支付与本地平台生态决定交易是否真正可完成。 |






入境卡成功截图涉及护照、邮箱和入境凭证等敏感信息,因此仅保留测试结论,不在公开页面展示原图。
Muse的市场意义不在于它创造了全新的Agent技术,而在于它让同一套能力第一次以“管理个人生活”的方式被大众看见。
美国大量服务仍然散落在不同网站、邮箱、电话和表单中。Muse通过云端浏览器把这些服务临时集中到一个对话入口里,不要求每个商家主动为它开发API。
| 核心能力 | 解释 | Muse目前的优势 | 尚未证明的部分 |
|---|---|---|---|
| 模型 | 理解任务、操作页面、处理异常和持续执行。 | 针对现实世界Agent任务和浏览器执行优化。 | GUI速度、复杂任务成功率和异常恢复。 |
| 服务 | 连接邮件、地图、购物、预订、支付等真实服务。 | 通过浏览器覆盖大量未主动接入的网页服务。 | 服务范围、地域覆盖和长期合作生态。 |
| 权限 | 读取账户、调用服务、跨App执行和完成支付。 | 拥有云端电脑、浏览器、连接器和安全授权架构。 | 用户是否愿意长期授权,以及高风险任务的可控性。 |
| 个人上下文 | 理解关系、偏好、历史、长期目标和现实状态。 | 通过记忆、Meta账户和人格化界面建立连续关系。 | 数据飞轮是否能转化为长期成功率,而不只是保存聊天记录。 |
中国并不是没有Muse式Personal Agent,而是四项核心能力早已分散在超级App、手机系统和服务平台中,只是尚未被整合成一个有传播力的“个人管家”产品。
把Muse与中国市场放在同一套能力框架下,结论不是“模式不适合中国”,而是模型、服务、权限和个人上下文四项条件早已分散存在于超级App、手机系统和各类Agent产品中。真正缺的是把这些能力整合成跨平台、主动服务、对结果负责的个人管家体验。
理解自然语言目标、操作网页并处理异常;支持轮询和定时任务,能够在用户离开后继续执行,并通过主动下行提醒反馈进展或结果。
小微、豆包、阶跃、通义等已能完成对话、检索和部分工具调用,但多数体验仍由用户发起,复杂任务成功率、跨天持续性和主动下行尚未形成稳定认知。
差异不在“能不能调用模型”,而在是否把模型变成可持续运行的任务系统。
用云端浏览器连接分散的邮件、地图、购物、预约和支付服务,不要求每个商家先开发专用接口。
微信、支付宝、美团、淘宝、携程等已在各自App内形成服务闭环,服务供给并不缺;但能力被切在不同平台和入口里。
中国市场不是服务不足,而是缺少一个能替用户跨平台统筹生活的统一Agent入口。
通过云端电脑、浏览器、连接器和确认机制执行跨网站操作;关键动作保留用户接管和确认。
手机系统、支付平台和超级App拥有更深的登录态、支付和通知权限,但通常封闭在平台内部,第三方Agent难以跨平台调用。
中国拥有更深的权限资源,却更难把权限开放给一个跨平台的第三方个人Agent。
通过记忆、账户和人格化界面持续积累偏好、关系与长期目标,让Agent更像一个会跟进的个人助理。
微信拥有聊天关系,支付宝拥有支付记录,手机系统拥有通知、位置和设备状态;但上下文被平台切割,主动读取私密信息又容易引发用户反感。
中国并非没有个人上下文,而是“可用”与“可被用户接受地调用”之间仍有隐私鸿沟。
识别长期未使用会员、重复扣费和即将发生的自动续费;先提醒用户并说明扣费依据,经确认后再进入取消或退款流程。
处理门票、保洁、维修、医院和政务等预约;结合日历、订单和到期事项主动提醒,无空位时继续寻找替代方案。
全文最终收敛为三个判断:Muse为什么火、它真正让用户感知到了什么,以及Personal Agent最终会以什么形态竞争。
Muse的机会来自美国服务的分散;中国的机会来自超级App和手机系统中已经存在、但尚未被真正组织起来的个人上下文。
Muse不是因为“能点外卖”而火,而是因为它让用户看到:Agent可以替我发现损失、追回权益、处理麻烦事务,并持续跟进结果。
Personal Agent的竞争最终不是“谁能调用更多服务”,而是“谁能把模型、服务、权限和个人上下文同时变成用户可感知的真实结果”。