阿里Qwen3.7-Max编程能力全球第二,国产模型首进第一梯队

源自66位全网作者

05-28 18:25

内容由AI生成

精选参考来源

1. 520,遇见国产「新模王」Qwen3.7-Max!

2. 「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?

3. 刚刚,中国AI闯入全球编程前二!前面只剩Claude

4. 阿里新一代大语言模型Qwen3.6-Plus正式发布。较之上一代模型,千问3.6整体性能提升明显,尤其是编程Coding能力、智能体Agent能力和工具调用能力都实现了全面跃升,同时深度适配主流Agent框架,释放模型在开放环境中完成复杂任务的新潜力。

5. 【AI前沿】Google IO 与 Qwen 3.7 Max:模型战争没有结束,只是战场变成了 Agent 基础设施

6. 【Qwen3.7-Max登场,智能体时代核心基座模型来了】快速阅读:Qwen3.7-Max 正式发布,旨在成为智能体时代的基座模型。它在编程、通用智能体及高难度推理任务上表现出色,甚至在长达 35 小时的自主内核优化实验中,实现了 10 倍的性能提升。Qwen3.7-Max 来了。它不再只是个聊天窗口,更像是一个能接手复杂工程的数字员工。在编程智能体测试中,它在 SWE-Pro 等多个维度拿到了领先分数,甚至能像资深工程师一样处理多文件工程。有意思的是它在“长程任务”上的表现。很多人担心模型跑久了会“断片”或者逻辑漂移,但它在长达 35 小时的自主内核优化实验里,通过上千次工具调用,硬是把一个从未见过的硬件平台算子优化了 10 倍。这种在未知环境里的泛化能力,大概是它最硬核的地方。有网友提到,现在的模型如果只会“一本正经胡说八道”那是没用的,能说“我不知道”才叫靠谱。Qwen3.7-Max 在设计上更强调这种稳定性,通过强化学习监控奖励作弊,确保它在长周期任务中不会为了完成任务而“投机取巧”。不过,这种能力也带来了一个现实问题:随着模型越来越像“人”,它对算力的胃口也越来越大。对于想要在本地跑起这种级别的智能体的开发者来说,内存和带宽可能很快会成为新的瓶颈。它现在通过阿里云百炼提供 API,支持保留思维链,这对于构建复杂的智能体工作流非常关键。qwen.ai/blog?id=qwen3.7

7. Qwen3.7-Max效果如何?在哪些方面有提升?

8. 阿里今天发了Qwen3.6-Max-Preview,跑分确实挺好看。📮编程上SciCode 47分、SWE-bench Pro 57.3分,已经咬住Claude 4.5 Opus了,部分benchmark还反超。Agent工具调用、知识问答这些可量化的能力,国产模型追赶速度真的快——一个月前大家还说差距半年,现在再说已经是几周。(Claude 最新是 4.7 Opus📮但我自己用下来最在意的那个维度——语言能力,跑分图上看不出来。我写文案、改稿子、做创意性表达这些场景,Qwen系列的输出跟Claude比还是有差距。不是错字不是语病,是那种说不出哪里不对但读起来就是没那味儿的感觉——比喻生硬、节奏一板一眼、该留白的地方填满了、该收束的地方又散掉了。这种「味儿」,不会在任何一张benchmark表格里出现。📮文科生的分数其实比理科生难评价多了。数学98分和93分,98确实就是比93强,这个差别是客观的。但文学创作不一样。有时候98分的作文反而读起来不如93分的,因为那5分可能是在「规范性」上加的,而减掉的是「个性」。现在AI的跑分体系,本质上在奖励前者——可检测、可复现、可量化。所以当一个模型在跑分上全面超越对手,但你读它写的东西总觉得少点什么——这不一定是你的错觉。📮还有一个角度是应用层。我最近在用的是智谱GLM 5.1,跑分上也挺猛,编程能力已经跟Claude一个档。但我用下来最大的问题是会话长度——聊着聊着就得开新窗口,Claude里一个项目能滚十几天不断,GLM里一两天就顶到头了。这不一定是模型架构的问题,更像是产品工程层面的取舍——上下文窗口、长会话稳定性、工具调用时的记忆保持,这些不是benchmark分数能解决的。国产模型在「底座」上已经追得很近,但在「产品打磨」这一层,跟Claude、ChatGPT这种迭代三四年的老产品比,还有6到12个月的差距。📮所以我的判断是——理科生的分数我信了,文科生的分数我再观望,工程师的活还没做完。Qwen3.6-Max正式版和GLM下一代出来再试试。现在这个阶段,跑分看着热闹,但你真的把它放进日常工作流里用一个月🌚还得是 Gemini 和 Claude 香

9. DeepSeek V4 网页端《原神×我的世界》融合小游戏代码测试:拳打 ChatGPT,脚踢 Gemini,硬刚 Claude

10. 国产AI新王登基!Qwen3.6-Max-Preview亮相

11. 太猛了,这次程序员,要被打下来了。阿里刚发布的Qwen3.6-Plus(图一),我第一时间去试了下,得出一个结论:[强]【普通人,也能自己搞系统了】[强]有3个点我觉得非常诱人:(图二)编程能力国产第一,直接对标Claude,国产第一次在“写代码”这件事上,打到全球一线。(图三)价格打到2元/百万tokens,试错成本直线下降。以前做个功能要几十块钱,现在几块钱就能试。(图四)支持100万token的长文了,我让他读了松松云的后台功能,基本一口气能读完。(图五)然后我立马干了件事:在阿里百炼后台用Qwen3.6-Plus重做了公司官网首页,从设计 → 到代码 → 到修改,全程没写一行代码!真的,只要规矩给他定好,Qwen3.6-Plus不到3分钟,页面直接跑出来,这应该是体会过最快的编程模型了。对阿里来说:我感觉他不想只卖API了,估计以后也要搞什么编程工具。随着Qwen3.6-Plus发布,阿里好像已经成了生态闭环了。从大模型、到百炼、到千问APP,开发者一旦用顺手,迁移成本极高。对创业者来说:既然价格这么便宜了,我肯定要把公司的后台系统从3.2升级到8.0了。还有一些老程序、老网站,能升的全都升级一遍。比如就官网首页,全是用Qwen3.6-Plus做的。以前搞个系统升级得求爷爷告奶奶找技术,现在不用了。在这个时代,不怕你会写代码,就怕你只会写代码。如果AI能干完程序员80%的活,你觉得剩下的20%价值在哪里?

12. 阿里云今天发布了Qwen3.6-Max-Preview。权威三方评测榜单Artificial Analysis显示,Qwen3.6-Max-Preview性能表现超过GLM5.1、MiniMax-M2.7等模型,登顶最佳国产模型。该模型是新一代千问旗舰模型的早期预览版,拥有更强的世界知识和指令遵循能力,并在智能体编程任务中性能显著提升。

13. 中国AI干翻GPT了?Qwen3.7-Max编程冲到全球第二

14. 国产第一:阿里 Qwen3.7-Max 模型 AI 编程能力超 Claude Opus 4.6

15. 阿里千问3.7:位列权威大模型榜单全球第五、国产第一

16. 千问3.7冲编程榜全球第二,1541分仅次Claude

17. 国产登顶!Qwen3.7-Max 编程能力超 Claude Opus 4.6,全球第四

18. Qwen3.7-Max,我觉得应该叫Ultra,很强

19. 国产模型登顶全球第二!阿里千问击败GPT

20. Qwen3.7-Max杀入全球盲测前六,连续35小时自主编程实现10倍性能优化

21. 千问3.7-Max Code Arena登顶第二——但我更在意那个没上新闻的35小时

22. 阿里 Qwen3.7-Max 编程干翻 GPT-5.5,全球第二!

23. 阿里 Qwen3.7-Max 编程能力荣获全球登顶第二!Code Arena 1541 分,仅次 Claude

24. 史上首次!阿里巴巴Qwen3.7-Max大模型跻身全球编程榜前四,仅次于Claude Code

25. 推理提速10倍编程反超Claude 3 Opus:阿里千问3.7模型评测

26. 中国AI编程干翻GPT-5.5!阿里Qwen3.7-Max跃升全球第二!

27. 阿里理工男发飙!Qwen3.7-Max编程能力全球第二,狂虐GPT-5.5

28. 阿里Qwen3.7-Max编程全球第二,超越GPT-5.5

29. 千问3.7-Max实测:国产大模型能替代ChatGPT了吗

30. 编程权威榜单:千问3.7仅次于Claude,阿里全球第二

31. 阿里Qwen 3.7 Max登顶全球编程大模型榜单

32. 阿里发布新一代千问旗舰模型Qwen3.7-Max

33. 阿里 Qwen3.7-Max 编程能力全球登顶第二!Code Arena 1541 分,仅次 Claude,35 小时自主任务刷新生产力上限

34. 国产大模型新旗舰!千问Qwen3.7-Max杀疯了:编程顶流、自主奋战35小时、多项屠榜

35. 阿里千问登顶国产第一,AI编程进入35小时自主时代

36. 阿里Qwen3.7-Max模型AI编程能力登顶国产第一

37. Code Arena放榜,千问3.7编程能力位列全球第二

38. 千问接入全新一代大模型Qwen3.7-Max

39. 千问3.7闯进Claude主场了

40. 与 Claude4.7 掰手腕!阿里旗舰大模型 Qwen3.7-Max 来了,7个实测,很丝滑

41. 重磅突破!阿里大模型登顶全球第二,编程实力碾压多款国际大模型

42. 阿里千问3.7-Max发布,国产登顶全球盲测,35小时完成自主进化

43. 通义千问Qwen3.7杀进全球前十五 国产大模型再创新高

44. 阿里Qwen3.7-Max编程超越GPT-5.5,国产AI全球第二,唯一突破1540分!

45. 再创佳绩!阿里通义千问Qwen3.7-Max编程能力超越Claude Opus 4.6!

46. AI编程工具选型:Qwen3.7-Max vs Claude C

47. 1541分!阿里 Qwen3.7-Max编程力登顶国产第一 全球仅次 Claude

48. 阿里Qwen3.7-Max模型AI编程能力超Claude Opus 4.6

49. 所有人盯着Gemini 3.5,千问3.7悄悄秒了🫰

50. 千问3.7:智能体时代的编码利器

51. Qwen3.7预览版来了,国产大模型首次登顶Arena

52. 阿里 Qwen3.7-Max 发布,编程能力全面超越 Claude Opus 4.6

53. 通义千问Qwen3.7有多强?Arena全球第13!preserve_thinking让AI Agent不再失忆

54. 全球榜单杀入前五,千问3.7即将发布

55. 全球东西方争夺编程王冠出现新形势

56. 阿里千问3.7 Max炸场!实测提升巨大,直接冲上Arena全球13名!在数学、编码等硬核赛道,阿里已进入全球 Top 10

57. 千问 3.7:一个 AI 连续自主编程 35 小时之后

58. Qwen3.7发布,三款大模型横评

59. Qwen3.7-Max模型抢先体验

60. 智能体编程新突破!千问3.7旗舰模型全新亮相

61. Qwen3.7-Max-Preview 首发亮相 Arena AI

62. 阿里Qwen3.7炸裂发布!国产AI终于硬气了一回

63. 阿里千问最强智能体模型Qwen3.7-Max发布

64. 千问发布Qwen3.7-Max 致力成为全能的智能体基座

65. Qwen3.7! 就在今天!

66. 国产大模型第一了!千问3.7-Max直追GPT和Claude,还配了自研芯片

5
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章