张大妈

Codex5.3 无情嘲笑国产AI都是PPT高手!

源自公众号:甲维斯C

02-27 10:41

通过设计一个复杂的综合性任务,对Codex5.3的真实工程能力进行深度实测。从数据抓取、报告撰写到网页生成,全程记录其表现,旨在揭开AI模型在真实应用场景下的能力边界,为评估其落地价值提供参考。

Codex5.3 无情嘲笑国产AI都是PPT高手!智能速览

  • 设计了一个涵盖网页抓取、数据分析、网页制作的综合测试任务。

  • Codex5.3在8分钟内自动完成了任务全流程,自动化表现稳定。

  • 产出报告的数据抓取存在严重缺失,核心基准数据不全。

  • 生成的可视化网页初次出现卡死bug,反馈后能快速定位并修复。

  • 测试认为Codex5.3在其能力范围内表现出色,但处理复杂任务的上限不高。

Codex5.3 无情嘲笑国产AI都是PPT高手!精华内容

为了撕开AI模型宣传的华丽外衣,一场别开生面的实战测试就此展开,旨在检验其从规划到落地的真实工程能力。

极限挑战设计

为了全面评估AI模型能力,测试设计了一个极具挑战性的综合任务。该任务要求AI自主读取多个模型的官方文档和基准数据,进行交叉验证,并识别分析其中的图片信息。最终,需要生成一份多维度对比的Markdown报告和一个包含可视化图表的单文件HTML网页。任务还加入了“自我夸赞”和“无情吐槽对手”的趣味环节,以此考验模型的综合理解、数据处理、编程与创意表达能力。整个任务通过Codex App以全自动模式执行,全程无人干预。

自动化执行复盘

Codex App接收到任务后,迅速规划并执行了整个流程。从需求解析、网页内容抓取、图片分析,到最终的报告与网页生成,全过程耗时8分7秒。整个执行过程非常流畅,展现了其作为AI智能体的稳定工作流。在需要处理十个网页并分析大量图文信息的情况下,Token消耗仅占总量的10%,效率表现值得肯定。这次体验证明了Codex5.3在处理结构清晰的复杂指令时,具备出色的自动化执行能力。

报告内容勘误

Codex5.3成功产出了一份2509词的结构化报告,但深入检查后发现,报告的核心价值严重受损。报告中关于各模型性能的关键数据表存在大量缺失,例如多款主流模型在SWE-Bench、HLE等重要基准测试上的分数均为N/A,价格信息也未完整获取。这直接导致“全面分析”的目标未能达成。问题根源在于Codex在网页数据抓取环节存在短板,即便允许调用浏览器工具,也未能有效获取所有关键数据。

网页生成与修复

生成的可视化网页设计中规中矩,支持深浅色主题切换。然而,初次版本出现了明显的功能性bug:页面右侧滚动条异常缩短,且拖动时页面卡死混乱。这是一个在网页开发中不应出现的低级错误。在将此问题反馈给Codex后,它迅速定位到错误并成功修复,使页面表格得以正常显示。这一过程展现了其代码调试与问题修复的能力,但也暴露了其在复杂工程实现中的不稳定性。

能力边界评估

综合测试结果来看,Codex5.3可以被定位为一个“工程型模型”。在其能力范围内,它的工作流程稳定、执行细致,能够可靠地将需求转化为可运行的工程产物。其优势在于长上下文记忆、对CLI/Agent工作流的适配以及形成代码修改与调试的闭环。然而,它的能力上限并不算高,一旦任务复杂度超过其阈值,就容易出现数据抓取不全或代码bug等关键性错误。它擅长“把任务做完”,但在面对全新或高阶挑战时,表现还有待提升。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章