在系统级AI成为手机新赛道的背景下,一场对主流国产AI助手的深度横评显得尤为重要。通过设计多场景、高难度的实测任务,此次评测揭示了小爱同学、小艺、YOYO等AI的真实水平与实用边界,为消费者提供了超越宣传口号的客观参考。
智能速览
小艺需二次唤醒,但跨应用能力最强,获评本轮测试MVP。
小爱同学表现超预期,在应用内深度操作上优势凸显。
YOYO在打车等特定场景表现出色,但整体进展缓慢令人失望。
小布与小V功能较为基础,多数情况下仅能充当应用启动器。
当前手机AI在复杂任务执行上普遍存在短板,离全面自动化尚有距离。
精华内容
理论宣传终须实践检验。通过一系列从基础到高阶的实操任务,可以清晰地看到各家AI助手在理解力、执行力与智能化程度上的真实差异。
基础能力大考
在唤醒方式上,小艺较为特别,直接唤醒表现平平,需通过“小艺帮帮忙”启动第二形态,但优势在于可后台运行。其他四家唤醒方式则较为常规。自动批图测试中,小布和小V与悠悠表现相似,只能理解“消除路人”等特定指令,且只能操作一次。小爱和同学则能响应更广泛的操作,表现出更好的灵活性。AI通话环节,YOYO表现机械,小爱则难以抓住重点,小艺虽显生硬但能清晰传达信息,小布表现相对正常,但整体水平均未达预期。
跨应用执行挑战
跨应用连续打开任务中,差距显著。小艺成功打开8个应用,表现最佳;小爱打开2个后便中止;小米打开1个后即表示任务完成。OPPO的小布则完全无法理解指令,误以为是分屏操作。在打车场景,YOYO表现最佳,能逐步筛选并取消不符合条件的选项,像一个细致的助理。小爱、小布和小V则只能呼叫默认车辆,无法进行个性化设置。点外卖方面,YOYO仅擅长点饮料,点主食会推送无关选项。小爱虽有一定失败率,但能理解指令并在外卖平台搜索并加购。小艺在“小艺帮帮忙”模式下能进行更深度的操作,但交互步骤繁琐。
购物与日常任务
面对“购买5公斤单价不超过6元大米”的复杂指令,各家AI表现均不理想。小艺能提取关键信息并筛选,但结果不准确;小爱能理解需求,并跳转至淘宝按价格排序,后续需用户手动操作;YOYO则无法执行。在应用签到等日常任务上,小爱和小艺表现突出,能精准完成贴吧、携程等应用的签到,甚至能执行“搜索指定贴吧并关注签到”的复合指令。其他三家则大多停留在打开应用阶段,无法完成后续操作。
应用内深度交互
在更考验智能化水平的应用内操作中,差距进一步拉大。测试要求跳过广告、在指定博文下评论,小爱和小艺均能清晰完成指令,其中小艺在信息处理上更胜一筹。小爱甚至掌握了“长按一键三连”的专属技能。在最高难度的发朋友圈任务中,所有AI均因微信的限制而失败。但在发小红书笔记任务中,小艺和小爱再次成为仅有的成功者。小艺采用教科书式流程,从相册选材、剪辑、配乐到分享一气呵成;小爱则直接在小红书应用内完成操作,尽管素材选择略显随意,但核心功能已实现。