一场别开生面的AI竞赛在《我的世界》中展开,挑战模型们识别各种抽象和具象的像素建筑。通过对比豆包、千问和DeepSeek的猜测过程与结果,可以清晰地看到当前主流AI在图像理解、知识储备和逻辑推理上的差异,为选择合适的AI工具提供了有趣的参考视角。
智能速览
豆包成功识别出QQ企鹅,赢得比赛。
DeepSeek不仅猜对刷石机,还解释了其工作原理。
千问的回答充满想象力,但准确率有待提高。
测试内容涵盖经典MC装置到抽象人物像素画。
面对抽象的霍金像素画,AI需要提示词才能准确识别。
精华内容
这场AI竞赛设置了四个不同难度的关卡,从现实建筑复刻到经典游戏道具,再到抽象人物肖像。让我们看看豆包、千问和DeepSeek在这些挑战中的具体表现。
抽象建筑挑战
第一个挑战是一个模仿世贸中心双子塔的抽象建筑。豆包虽然猜到了双子塔,但关联了过于具体的事件,获得1分。千问的猜测则天马行空,认为是“中世纪与蒸汽朋克融合的冒险地图”,展现了其想象力,但在准确性上有所欠缺。此环节暴露了AI在解读高度风格化和抽象视觉信息时的困难。
MC知识对决
第二项测试是《我的世界》中的经典刷石机。豆包准确说出其名称“十字刷石机”,显示出对游戏特定知识的掌握。DeepSeek更进一步,不仅猜对物品,还详细解释了岩浆与水相遇生成原石的原理,逻辑推理能力突出。这个环节表明,在结构化、有明确规则的场景下,AI表现非常出色。
抽象肖像识别
第三个挑战是一幅极为抽象的斯蒂芬·霍金像素画。在没有提示的情况下,所有AI都未能猜中。在得到“残疾的科学家”这一关键线索后,豆包成功锁定了霍金的身份。DeepSeek在第一轮就因接近答案获得0.5分,而千问则错误地猜成了爱因斯坦。这证明对于高度抽象的图像,有效的提示信息对引导AI至关重要。
终极身份辨认
最后一题是用极简方块构建的QQ企鹅,分值高达3分。千问将其误认为迪士尼的唐老鸭,DeepSeek则联想到了《超级马力欧64》中的企鹅角色。豆包准确识别出这是腾讯QQ的经典形象,凭借这一关键得分赢得了整场比赛。这展现了豆包在识别特定文化符号和商业IP方面的优势。
这场趣味竞赛揭示了不同AI模型的优势与短板:豆包在识别具体事物和文化符号上更胜一筹,DeepSeek擅长逻辑推理和原理解释,千问则更具创造性。未来AI在理解抽象和复杂视觉信息上能达到怎样的高度,值得期待。
关键评论
豆包被称赞为‘概念神’,其识别能力令人惊讶。
有评论对DeepSeek能识别图像感到意外,打破了其‘只能看文字’的印象。
有网友分析,豆包可能依赖实时数据,而DeepSeek更依赖已有知识库。
对于最后的QQ企鹅,许多网友凭直觉猜出了正确答案。