7月下旬,藏在各类健身App里的"AI教练"成了最热的健身搭子,媒体报道称国内智能健身市场规模即将突破1000亿元。微博半个月后,央视"真相来了"栏目专门做了一期视频回应这波热度:《跟着AI健身靠谱吗?》。哔哩哔哩
一边是"口袋私教"的集体夸赞,另一边是社区里"AI教练只会说正确的废话""打卡识别死活过不去"的吐槽。要不要为AI健身掏钱,社区里已经吵过很多轮。但这篇要聊的是更前面的一个问题:你下载的那个"AI健身App",里面到底有没有AI?
有一个刚被开源的统计,给出了大多数人都没想到的答案。
一个本科生扒了161个健身App:每3个"AI健身",就有1个没用AI
知乎上有一位应用心理学专业、2026年秋天即将毕业的本科生,做了一个叫 AI-Fit-Scan 的研究:在 Google Play 用"AI fitness"“AI workout”“AI personal trainer"等关键词抓取了161个健身App,其中61个在描述里声称自己用了AI。他没有只看宣传语,而是设计了"文本宣称→开发者问卷/技术文档→实际功能验证"三级检验,两名标注者独立打分,一致性用 Cohen’s Kappa 衡量,结果为0.856——学术研究中0.8以上属于"几乎完美一致”。知乎
验证结果是:61个声称有AI的App里,22个验证不通过,占36.1%——超过三分之一的"AI健身App",是假的。知乎意味着你每下载3个"AI健身App",平均就有1个里面根本没有AI,所谓"AI千人千面定制",大概率是从预设模板里随机抽一个给你。完整数据集作者已放在Kaggle和GitHub上,可以复现。
先说清边界,免得结论被用过头:这项研究只覆盖Google Play安卓生态,没查苹果商店和国内应用市场;假AI组只有22个样本,作者自己也承认"样本量偏小,部分结论不可靠"。所以它不能当"点名某款国内App"的依据,但作为"这个行业水分有多大"的警示,量级是可信的。
最讽刺的数字:假AI评分4.41,真AI只有4.28
研究里更扎心的发现在评分上:假AI的App,Google Play平均评分4.41;真AI的App评分4.28——假的比真的分数还高。知乎
造假的不但没被市场惩罚,分数还更高。想了几个原因,哪个都挺现实:
期望值效应。大多数人下载"AI私教"的真实需求就是"有个东西能跟着练"。假AI本质是视频播放器+模板,功能简单、不容易出错,用着还行就给五星;真AI有动作识别、实时反馈、动态调整,越复杂越容易出bug,体验方差大,差评也多。
营销包装效应。假AI团队是营销人员主导,钱花在描述和截图上;真AI团队是工程师主导,界面文案反而朴素。
用户根本无法验证。你看不到后台,分不清这份计划是算法根据你的训练记录动态生成的,还是从20个模板里随机抽的。
这三条叠加会形成一个正反馈:评分高→商店排序靠前→曝光多→下载多。研究里打了个比方:诚实团队花两百万开发计算机视觉动作识别系统,评分4.2沉底;另一个团队花二十万做模板播放器贴个"AI"标签,评分4.4冲榜——劣币驱逐良币,不是修辞,是商店推荐算法的真实运行机制。
一眼识破假AI:不用懂技术,看描述页的"用词缺口"
这是整项研究里最反直觉、也最有实用价值的发现:假AI的描述里,不是"AI"这个词太多,而是技术深度词太少。22个假AI的App,没有一个在描述中使用"artificial intelligence"这个完整术语,而真AI的App有20%用了。知乎
两类描述放一起对比,语感差异肉眼可见:
真AI的说法:“使用计算机视觉实时分析深蹲姿势”“深度学习模型基于5万+训练视频,识别17个身体关键点,准确率94%”“根据可穿戴设备的恢复数据自适应调整计划”——有具体技术名词、有数据、有指标。
假AI的说法:“AI-powered智能私教!千人千面定制!智能系统为你生成完美计划!30天见效,立即加入AI健身之旅!”——全是营销词,没有一个词能被验证。
打个比方:真医生说的是"冠脉造影显示左前降支中段狭窄70%,建议PCI植入药物洗脱支架";神棍说的是"你心脏不太好,我们的智能方案个性化解决,效果惊人"。假AI跟神棍一样,不是把技术词用错了,是根本不会用技术词。
所以普通人只要一个动作就能过滤掉大部分AI漂洗:打开App详情页或"关于我们",问它三个问题——
它说没说得清用了什么技术、吃了什么数据(计算机视觉?动作识别?训练集多大?);
它有没有可核对的指标(关键点数量、准确率、延迟);
它的"个性化"讲不讲调整逻辑(输入什么信号、计划会怎么变)。
三问全答不上来的,就把它当模板播放器看待——不是不能用,而是别为"AI"两个字付溢价,值不值只看视频质量、计划和记录功能本身。
第二道防线:真AI给的"确定感",也要打个折
挑出假AI只是第一步。即使是真AI,目前的学术证据也要求你保持怀疑——AI-Fit-Scan的研究者在文章里顺带梳理了几项2026年的研究,叠在一起看很扎眼:
BMJ Open一项研究让ChatGPT、Gemini、Grok、Meta AI、DeepSeek五个主流模型回答250个健康相关问题,要求每个模型附10条参考文献:中位完整度只有40%,没有一个模型在25次尝试中产出过一份完全准确的参考文献列表——文献看起来有模有样,论文可能是编的。知乎
宾州州立大学团队在FAccT 2026会议上的研究:34名参与者提交212个真实健康问题,由9名认证医生评估,AI总体准确率76%,错误率超过20%,是人类医生的两倍;更糟的是,给模型加医学训练数据,准确率并没有显著提升。
这位研究者自己的初步测试(注意:尚未经同行评审,只是作者自述的初步观察):两个主流大模型回答126个运动科学问题时,不管问题的证据强度如何,模型的置信度都超过了84%——错的时候也一脸笃定,而用户恰恰最信这种笃定。
一句话总结:AI的建议内容可以参考,AI的确定语气不值得参考。涉及伤病判断、用药、基础疾病的决定,AI最多算"帮你整理问题的助手",最终拍板要留给医生或靠谱的真人教练。
回到国内现场:吐槽、真香和满屏软文,同时存在
把镜头拉回国内社区,会发现这项研究的结论正在被反复验证,但方向不是一边倒。
吐槽这一头:8月19日,有学生发帖"某东健康AR运动真人识别无法通过",评论区几十条都在吐槽打卡识别;更早,大学生们就集体控诉过高校AI体测"手机有时候都识别不出来,白做好多次"。小红书小红书
付费App这一头,“某紫色健身App的AI真的很难用”“Keep现在真的好难用啊"这类帖子长期挂在搜索前排——AI教练功能做没做扎实,用户上手第一天就能感觉到。小红书小红书微博上甚至有人总结"AI健身教练感觉只会顺着你的话去说”。微博
营销这一头更不用说,"明星同款24小时AI私教"的文案雷同软文曾经整屏刷屏——宣传越密集,越说明这个标签值钱,也越说明标签可能是空的。微博
真香那一头同样真实:B站8月19日的《当AI成为我的增肌私人教练效果能有多夸张?》拿到近9万播放。哔哩哔哩微博有人拿GPT分析自己跑步膝痛的髂胫束问题,按建议练了两个动作,坚持打卡一个月觉得对得上症状。微博
这两类体验并存一点都不矛盾。AI健身真正的增量从来不是"比教练聪明",而是记得住你的每一次训练记录、随时肯帮你重排计划;翻车点则集中在两处——假AI压根没有记录闭环,真AI过度迎合你的偏好。所以选型时别问"它是不是AI",要问"它有没有拿我的数据干活":能不能导入历史训练、调整时说不说得清"因为你上周三组全部完成且RPE只有6,所以这周加5kg"。
按人群给结论:这份"假AI滤镜"怎么用在下载前
纯新手、预算为零:免费大模型聊天给出的框架能用,先照着动起来不丢人;但记录必须放在有数据闭环的工具里,练两周后把记录喂回AI让它改计划——这一步才吃到AI的红利。下载任何带"AI"字样的App前,先跑一遍上面的三问。
在挑动作识别App或会员的人:这是AI漂洗溢价最集中的地带。动作识别说不清用几个关键点、摄像头摆哪、遮挡怎么处理、离线还是云端的,先别付钱;付款前拿详情页截图对照"假AI词表"(AI-powered、智能、个性化、N天见效),只剩营销词的,默认它是模板机。
有伤病、基础疾病或替孩子安排锻炼的:AI只当资料整理员。前面BMJ和FAccT的数据摆在那,健康决策的容错空间比增肌计划小得多。
已经在用AI练、效果不错的人:继续用,但把"它说得很确定"和"它真的验证过"分开看——这是目前所有AI健身工具都不会主动告诉你的区别。
值得继续盯的信号有三个:应用商店会不会开始核验"AI"宣称;监管和消协侧会不会出现针对健身类App的AI漂洗提示;国内厂商的宣传页会不会开始卷"技术细节"而不是卷"AI-powered"。这三件事任何一件发生,都说明假AI的套利窗口在关闭——到时候再决定要不要为"真AI"升级装备,钱会花得明白得多。
在一个人人都往商品名里塞"AI"两个字的年份,健身是少数骗不了自己的领域:杠铃加没加重量,身体记得比商店评分清楚。下载前花30秒读一遍详情页,你就已经比三分之一的用户多了一道防线。