豆包手机助手消费者版发布,AI 键按下去是交权
豆包手机助手消费者版今天正式发布了。上一版技术预览版评测时,它已经能替人横跨不同应用操作,钻进几百条消息的群里把文件挨个下载、分类、打包再发给同事。消费者版要回答的是另一个问题,普通人愿不愿意每天用它。
它新增了一枚独立的 AI 键,用来更快调用各种操作。长按可以唤起豆包助手,双击进入实时视频对话,即使手机停在锁屏界面,也可以直接问天气这类通用信息。涉及敏感操作时,这颗键可以结合指纹验证,确认手机是否获得了继续执行的授权。

「操作手机」能力继续以 Beta 版保留,并存在一定的能力限制。
另一项升级是个人 Context 和记忆能力。豆包手机获得授权后可以读取更多手机里的信息,用户也能通过语音、按键、手势和截图,随时把有用的信息存进记忆,让 Agent 在行动前更懂你。
AI 键的不同在于按键背后连着谁
给 AI 加实体键不算新鲜设计。过去几年,不少手机把电源键、侧边键或独立按键绑给 AI,通常负责打开语音助手、启动识屏、进入相机,或者唤起一个集合了各种 AI 功能的页面。
这台手机的键不是又给 AI 腾了个物理位置,它按键背后连接的对象变了。你可以按下去问一个问题,也可以交代一项需要继续执行的任务。豆包手机助手能调用日历、文件、录音和已接入的第三方服务,在后台继续工作,不打扰你当前用手机做别的事。
这颗键启动的是一次行动,同时也是 Agent 与用户之间的一次权力交接。按下时用户交出目标,并决定手机可以替自己走到哪一步。指纹验证就落在这个位置上,它不是解锁手机的动作,是授权 Agent 继续往前走的动作。
另一个变化是不用再重新描述屏幕。传统语音助手经常要求用户复述屏幕内容,或者先截图再上传。按下 AI 键之后,当前屏幕直接成为模型理解问题的上下文。
测试里举了几个例子。刷到一只狗直接问这是什么品种、适不适合新手养,助手识别犬种后结合运动量、性格、掉毛情况和饲养难度给建议,全程不用退出应用。打开一篇论文让它总结,它能识别屏幕里的内容并提炼核心概念,不用手动复制文字或切换应用。看到影视片段问演员和角色,它除了认人还能找到具体场景,把演员、角色、作品和剧情串起来。
屏幕信息也能直接变成任务输入。展示浴室墙面后问「我想装一个免打孔的洗漱用品置物架,这面墙大概有 30 厘米空隙,有没有防锈、极简的商品推荐」,它结合墙面情况给出建议。
记忆带来的连续上下文
用一段时间之后,结合记忆处理本地信息确实很顺手。想找之前某场发布会提到的模型参数和数据,直接让它从录音里找,马上就能拿到,比重新搜一遍快。有些信息只在本地有,比如出差前登记 EVUS 需要护照美签页,让它从相册里把填写所需的资料单独提取出来,办完还可以手动存进记忆,下次出差不用从头找。
个人 AI 终端最大的价值由这些连续的上下文构成。模型掌握的信息越完整,对用户意图和偏好的判断越准,也就越接近一个了解长期工作和生活的助手。
这种能力同时对隐私提出了更高要求。哪些本机信息可以调用、哪些个人偏好可以保存,豆包手机助手的记忆功能建立在用户知情和主动授权的基础上,用户也能查看、修改和删除已经保存的记忆。
局限也得说清楚。「操作手机」还是 Beta,进入某些模式后暂时无法同时使用其他助手工具,需要退出当前模式再调用。复杂任务串起来做的时候,中间会因此出现断点。
手机这次想越过哪条线
过去十多年,智能手机的核心交互逻辑几乎没变过,都是人给指令、机器执行。Agent 开始改变这种分工,手机第一次有机会越过「提供工具」这条边界,开始代表用户行动。
这个变化的分量比它看起来大。工具是被动的,用户得知道要用哪个、怎么用;代表用户行动意味着它得自己判断该调什么、走到哪一步停。权限设计和记忆机制就是这条线的两个支点,一个管它能做什么,一个管它有多懂你。
真正的考验在日常使用里。技术演示能让所有人眼前一亮,但一款助手要留下来,靠的是三个月之后用户还在不在按那颗键。
你觉得手机该替你做多少决定,这种授权你会给到哪一档?
作者提示含AI生成内容。
