张大妈

中门对狙!Claude Opus 4.6和GPT-5.3 Codex同时发布,这下真的AI春晚了。

源自公众号:数字生命卡兹克

02-17 14:32

Anthropic与OpenAI在同一天发布了新一代模型Claude Opus 4.6与GPT-5.3 Codex,上演了一场精彩的“中门对狙”。这不仅是一次简单的技术更新,更关乎未来生产力的工具选择。通过深入分析跑分数据、核心功能与实际应用场景,可以清晰地看到两大巨头的技术路径差异与各自的领先优势,为用户提供了宝贵的决策参考。

中门对狙!Claude Opus 4.6和GPT-5.3 Codex同时发布,这下真的AI春晚了。智能速览

  • Claude Opus 4.6首次具备100万token上下文,并在大海捞针测试中取得76%的优异表现。

  • Claude推出Agent Teams功能,允许多个AI代理协同工作,提升复杂任务处理效率。

  • GPT-5.3 Codex是首个参与自身开发的AI模型,可能加速AI技术的迭代进程。

  • 在统一基准Terminal-Bench 2.0中,GPT-5.3 Codex以77.3%的得分超越Claude Opus 4.6的65.4%。

  • 两大模型均在Agent化方向上快速演进,旨在实现更全面的电脑操作与任务自动化。

中门对狙!Claude Opus 4.6和GPT-5.3 Codex同时发布,这下真的AI春晚了。精华内容

两大AI巨头同日发布新一代模型,这不仅是一场技术的对决,更关乎未来生产力的选择。从跑分到实用功能,逐一拆解二者差异,才能看清谁更胜一筹。

Claude 全面进化

Claude Opus 4.6带来了多项重磅升级,其中最受关注的是100万token的上下文窗口。这不仅仅是容量的增加,更重要的是其实用性。在MRCR v2的大海捞针测试中,Opus 4.6在100万token内寻找8个信息的准确率达到76%,远超Sonnet 4.5的18.5%,有效解决了上下文腐烂问题。

此外,模型的输出上限提升至128K,并新增了上下文压缩功能,使AI能执行更长时间的任务而不会中断。新增的自适应思考和精力控制功能,则让用户可以在速度、成本和质量之间进行更灵活的平衡,根据问题复杂度自动或手动调整思考深度。

Agent Teams 协作

Anthropic在Claude Code中推出了革命性的Agent Teams功能。与传统单个代理或子代理不同,Agent Teams允许启动一个团队负责人,协调多个团队成员独立工作并直接通信。例如,在进行代码审查时,可以同时启动前端、后端和数据库代理,它们可以并行分析并相互沟通发现的问题。

这种模式适用于需要团队成员共享发现、相互挑战和自主协调的复杂场景。同时,Claude在B端生态持续发力,发布了Claude in Excel和Claude in PowerPoint插件,将强大的AI能力深度集成到办公软件中,进一步提升了生产力工具的智能化水平。

GPT 自我迭代

GPT-5.3 Codex最引人注目的特点是,它成为了第一个在自身创造过程中发挥重要作用的模型。OpenAI团队在开发过程中,使用早期版本的模型来调试训练流程、管理部署和评估测试结果。

这个“AI参与自身开发”的里程碑事件,可能预示着AI技术将以更快的速度进化。在性能方面,GPT-5.3 Codex在编程能力上表现突出。在与Claude Opus 4.6对齐的Terminal-Bench 2.0基准测试中,其得分达到77.3%,领先11.9个百分点。同时,模型效率大幅提升,完成相同任务所需的令牌数不到5.2-Codex的一半,且单令牌速度快25%以上。

跑分对比解析

直接对比两家模型的跑分需要谨慎,因为它们在许多基准上使用了不同的版本和评估方法。例如,在OSWorld测试中,Claude报告的是原版分数(72.7%),而GPT报告的是更严格的OSWorld-Verified分数(64.7%)。在SWE-bench测试中,Claude使用的是Verified子集(80.8%),而GPT使用的是更复杂的Pro Public版(56.8%)。

尽管GPT的表面分数有时较低,但其测试基准的含金量和难度更高。结合实际开发体验,尤其是在解决BUG和编程难点上,GPT-5.3 Codex可能依然保持着微弱的优势。此外,其平台稳定性和不封号的特点,也为用户提供了更可靠的使用保障。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章