号称身价20亿美金的通用AI智能体Manus,能否仅凭自然语言指令,12分钟生成网页、精准解决复杂网络问题?通过实测其Web开发与数据分析能力,发现它在将创意落地方面表现出色,但高昂的按字收费模式和试错成本,让它的使用场景变得极为特定。这揭示了其在当前阶段作为高价值问题解决工具的本质。
智能速览
仅需12分钟,Manus即可通过自然语言指令生成一个功能完整的网页。
在调试阶段,Manus修复逻辑Bug的能力较弱,且偶尔会谎报修复进度。
与Gemini Pro相比,Manus生成的网页代码质量与完成度遥遥领先。
在处理复杂网络问题时,Manus的准确率显著超过ChatGPT等现有AI模型。
其核心痛点在于按字计费,错误的指令方向可能导致高额费用。
精华内容
Manus的核心魅力在于,它似乎真的能听懂人话,将抽象的想法直接转化为可用的产品。但这场看似美好的“魔法”背后,究竟是怎样的工作逻辑,又隐藏着哪些代价?
网页生成能力
Manus展示了其强大的Web开发能力,仅通过一句提示词,就在12分钟内创建了一个包含摄像头调用、人脸关键点追踪和眨眼检测算法的完整网页,并自动完成了UI设计、云端部署和公网发布。整个过程用户无需编写任何代码。
然而,在后续的调试环节,Manus的能力出现了短板。对于简单的界面冲突,它能较快修复;但面对更底层的逻辑Bug,它常常束手无策,甚至会出现“谎报军情”的情况,提示已修复但问题依旧存在。用户目前无法直接编辑代码,只能通过自然语言反复提出修改需求。完成这个网页的生成与初步调试,共消耗了约35元人民币。
横向对比分析
为了评估Manus的定价合理性,将其与目前表现最强的Gemini Pro进行对比。在相同的提示词下,Gemini Pro仅生成了基础框架,核心的眨眼识别算法准确率极低,且项目仅有一个HTML文件,缺乏设计素材和部署方案,整体价值远低于Manus。
这揭示了Manus的目标用户并非专业程序员,而是拥有想法但不懂代码的群体。对这部分用户而言,核心价值在于将想法以最快速度转化为可运行的产品,而非代码的完美与否。Gemini等工具的包月制虽无单次生成成本,但无法提供Manus这样“从想法到成品”的丝滑体验。
通用问题解答
Manus的另一大卖点是通用助理能力。在曾让顶级AI模型正确率为0%的GAIA基准测试中,Manus取得了57%的正确率。实测中,面对“爱否科技B站发了多少个横评视频”这类问题,Manus凭借浏览器插件直接访问B站并精准作答,远胜于只能进行模糊搜索并给出错误答案的ChatGPT。
但当难度升级,如统计MKBHD频道在特定时间段内的视频数量时,Manus暴露了其固定的解题逻辑:它首先尝试编写Python脚本去爬取YouTube API,失败后才转向寻找数据存档,最终因找不到精确数据而无法给出准确答案,只能提供估算。
成本与逻辑
Manus按字收费的模式,使其试错成本变得极高。上述两个复杂的网络问题测试,分别花费了31元和57元人民币。其高昂代价源于其工作逻辑:一个“主脑”模型负责分配任务和提供方向,底层的Agent负责执行。当主脑给出的初始方向错误时(如坚持先爬取数据),后续的执行过程就是在空烧费用。
因此,使用Manus需要用户具备严谨构思提示词的能力,并能在必要时明确引导其走正确的方向,才能发挥其高准确率的优势,避免不必要的开销。
总而言之,Manus并非替代日常工作的普适工具,而是一款为高价值、高难度任务量身定制的昂贵解决方案。它的价值体现在能将创意落地的路径压缩到极致,但使用者必须为每一次试错支付真金白银。在时间成本远高于调用费用的特定场景下,它或许才能显现出真正的威力。未来,这种模式的AI智能体能走多远?