阿里Qwen3.7-Max登顶SWE-Pro,编程能力国产第一全球前十

源自49位全网作者

05-26 16:15

内容由AI生成

精选参考来源

1. 520,遇见国产「新模王」Qwen3.7-Max!

2. 国产编程模型迎来新王?阿里Qwen3.6-Plus让我重新思考AI写代码这件事

3. 阿里出手!骨折价打包Qwen,Kimi,GLM!一键对接Claude Code!

4. 【AI前沿】Google IO 与 Qwen 3.7 Max:模型战争没有结束,只是战场变成了 Agent 基础设施

5. 国产AI新王登基!Qwen3.6-Max-Preview亮相

6. 【Qwen3.7-Max登场,智能体时代核心基座模型来了】快速阅读:Qwen3.7-Max 正式发布,旨在成为智能体时代的基座模型。它在编程、通用智能体及高难度推理任务上表现出色,甚至在长达 35 小时的自主内核优化实验中,实现了 10 倍的性能提升。Qwen3.7-Max 来了。它不再只是个聊天窗口,更像是一个能接手复杂工程的数字员工。在编程智能体测试中,它在 SWE-Pro 等多个维度拿到了领先分数,甚至能像资深工程师一样处理多文件工程。有意思的是它在“长程任务”上的表现。很多人担心模型跑久了会“断片”或者逻辑漂移,但它在长达 35 小时的自主内核优化实验里,通过上千次工具调用,硬是把一个从未见过的硬件平台算子优化了 10 倍。这种在未知环境里的泛化能力,大概是它最硬核的地方。有网友提到,现在的模型如果只会“一本正经胡说八道”那是没用的,能说“我不知道”才叫靠谱。Qwen3.7-Max 在设计上更强调这种稳定性,通过强化学习监控奖励作弊,确保它在长周期任务中不会为了完成任务而“投机取巧”。不过,这种能力也带来了一个现实问题:随着模型越来越像“人”,它对算力的胃口也越来越大。对于想要在本地跑起这种级别的智能体的开发者来说,内存和带宽可能很快会成为新的瓶颈。它现在通过阿里云百炼提供 API,支持保留思维链,这对于构建复杂的智能体工作流非常关键。qwen.ai/blog?id=qwen3.7

7. Qwen3.7-Max效果如何?在哪些方面有提升?

8. 阿里云今天发布了Qwen3.6-Max-Preview。权威三方评测榜单Artificial Analysis显示,Qwen3.6-Max-Preview性能表现超过GLM5.1、MiniMax-M2.7等模型,登顶最佳国产模型。该模型是新一代千问旗舰模型的早期预览版,拥有更强的世界知识和指令遵循能力,并在智能体编程任务中性能显著提升。

9. 太猛了,这次程序员,要被打下来了。阿里刚发布的Qwen3.6-Plus(图一),我第一时间去试了下,得出一个结论:[强]【普通人,也能自己搞系统了】[强]有3个点我觉得非常诱人:(图二)编程能力国产第一,直接对标Claude,国产第一次在“写代码”这件事上,打到全球一线。(图三)价格打到2元/百万tokens,试错成本直线下降。以前做个功能要几十块钱,现在几块钱就能试。(图四)支持100万token的长文了,我让他读了松松云的后台功能,基本一口气能读完。(图五)然后我立马干了件事:在阿里百炼后台用Qwen3.6-Plus重做了公司官网首页,从设计 → 到代码 → 到修改,全程没写一行代码!真的,只要规矩给他定好,Qwen3.6-Plus不到3分钟,页面直接跑出来,这应该是体会过最快的编程模型了。对阿里来说:我感觉他不想只卖API了,估计以后也要搞什么编程工具。随着Qwen3.6-Plus发布,阿里好像已经成了生态闭环了。从大模型、到百炼、到千问APP,开发者一旦用顺手,迁移成本极高。对创业者来说:既然价格这么便宜了,我肯定要把公司的后台系统从3.2升级到8.0了。还有一些老程序、老网站,能升的全都升级一遍。比如就官网首页,全是用Qwen3.6-Plus做的。以前搞个系统升级得求爷爷告奶奶找技术,现在不用了。在这个时代,不怕你会写代码,就怕你只会写代码。如果AI能干完程序员80%的活,你觉得剩下的20%价值在哪里?

10. 阿里千问3.7-Max让AI给国产芯片自己写驱动,跑出10倍提速

11. 国产新模王Qwen3.7-Max,海外开发者已经沸腾了

12. 阿里Qwen3.7-Max实测

13. 阿里发布新一代千问旗舰模型Qwen3.7-Max 登顶最佳国产模型

14. Qwen3.7-Max,我觉得应该叫Ultra,很强

15. 千问 3.7:一个 AI 连续自主编程 35 小时之后

16. 千问3.7不声不响干了件大事

17. 阿里Qwen 3.7 Max登顶全球编程大模型榜单

18. Qwen3.7-Max正式上线:Agent能力登顶国产第一

19. 推理提速10倍编程反超Claude 3 Opus:阿里千问3.7模型评测

20. 千问3.7登顶国产第一 自主优化芯片性能提10倍

21. 与 Claude4.7 掰手腕!阿里旗舰大模型 Qwen3.7-Max 来了,7个实测,很丝滑

22. 阿里新模型 - Qwen3.7:面向智能体时代的新一代旗舰大模型

23. 520,遇见国产「新模王」Qwen3.7-Max!

24. 硬刚GPT5.5、Claude4.6!千问3.7-Max,国产AI代理能力弯道超车

25. 阿里通义大模型负责人周靖人:Qwen3.7核心能力突破,解锁实用新场景

26. 国产第一全球第五,阿里千问发布Qwen3.7-Max,编程推理智能体全面领先竞品

27. 通义千问Qwen3.7有多强?Arena全球第13!preserve_thinking让AI Agent不再失忆

28. 阿里千问登顶国产第一,AI编程进入35小时自主时代

29. Qwen3.7-Max和Claude我各测了10小时,这个差距让我意外

30. 智能体编程新突破!千问3.7旗舰模型全新亮相

31. 国产大模型杀疯了!通义千问 Qwen3.7 预览版上线!数学/编程杀入全球前10

32. 阿里发布千问旗舰模型Qwen3.7-Max

33. 35小时智能体自主进化!千问旗舰模型Qwen3.7-Max发布

34. 阿里千问发布Qwen3.7-Max:35小时自主编程,Arena国产第一

35. Qwen3.7-Max发布:35小时不睡觉干活,这模型有点东西

36. 阿里Qwen3.7-Max模型发布,在盲测总榜中,位列国产模型第一!

37. 差2分追平Claude Opus,Qwen3.6 Plus价格只要零头:国产大模型写代码历史性逼近最强对手

38. 阿里Qwen3.7太牛!国产AI全球排名第13,4分钟破解奥数难题!

39. 千问正式接入Qwen3.7-Max 免费开放体验

40. 🚨千问推出轻量级开源语言模型。阿里千问团队发布了开源模型 Qwen3-Coder-Next,专为编码代理和本地开发设计。 这个模型基于 Qwen3-Next-80B-A3B-Base,采用混合注意力加 MoE 架构。 总参数 80B,活跃参数只有 3B。 推理成本低,但实际表现突出。 在 SWE-Bench Pro 基准上,Qwen3-Coder-Next 得分接近 44%。 从官方图表看,它位于帕累托图前沿上方,超过 GLM-4.7(32B 活跃)、DeepSeek-V3.2(37B 活跃)和 Kimi K2.5(32B 活跃)。 甚至接近 Claude-Sonnet-4.5,落后 Claude-Opus-4.5 不多。 训练重点放在代理能力上。 他们收集 800K 个可验证编码任务,配上可执行环境。 模型经过持续预训练、代理轨迹监督微调,还有领域专家训练和蒸馏。 强调长时序推理、工具调用和执行错误恢复。 实际测试中,使用 SWE-Agent 框架,SWE-Bench Verified 得分超过 70%。 多语言和多轮任务也保持竞争力。 模型支持 OpenClaw、Qwen Code、Claude Code、浏览器操作、Cline 等多种代理工具。 适合本地运行和开发场景。 现在已在 Hugging Face 和 ModelScope 开源,还有技术报告可读。 #AI编程助手 #AI工具 #AI代理 #千问 #开源模型

41. Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview 首发亮相

42. 千问接入全新一代大模型Qwen3.7-Max

43. 阿里千问大模型Qwen3.7-Max-Preview登陆Arena AI,多项能力跻身全球前列

44. 阿里千问3.7:位列权威大模型榜单全球第五、国产第一

45. Qwen3.7-Max-Preview 首发亮相 Arena AI

46. 说实话提前拿到Qwen3.7-Max内测,最让我意外的不是它推理变强了!

47. Qwen3.7冲进前排

48. Qwen3-Coder-Next 证明:能“自愈”的 AI 才是真正的程序员

49. Qwen3.7 Preview 这波有点猛

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章