张大妈

千问3.7编程实测:长程任务碾压GPT,但这些场景千万别用

源自95位全网作者

05-26 16:27

内容由AI生成

精选参考来源

1. 520,遇见国产「新模王」Qwen3.7-Max!

2. #千问Qwen3.5大模型发布#真正的卷王出现了,就在刚刚,阿里正式发布全新一代大模型千问Qwen3.5-Plus。这次核心更新在于采用了Mamba混合注意力机制(SSM-Transformer) + 稀疏MoE架构,总参数3970亿但仅激活170亿参数,显存占用降低60%,推理吞吐量最高提升19倍。举个例子,传统大模型就像人工翻整墙档案,你每问一个新问题,都要把前面所有档案重新翻一遍核对关系,内容越长,翻得越慢,越到后面越卡。 纯Mamba机制则像只记档案摘要,翻得极快,但细节容易丢,关键信息可能漏看。 而Qwen3.5-Plus的混合注意力,就是摘要+精准抽查一起上:速度跟得上,细节不丢失,长文本、复杂推理又快又准。 这才是真·技术内卷,大模型体验又要上一个台阶了。#how i ai##过个有ai年# 千问qwen3.5大模型发布

3. Claude Opus 4.6 刚发布就用 Claude Code 写项目,有哪些要注意的吗?

4. Claude Opus 4.6一天内被超两次,这次来自国产模型

5. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说

6. 千问是什么?答案正在风中飘荡

7. 阿里云重写了云#阿里 #阿里云 #千问

8. 刚刚,千问App把谷歌和OpenAI的「付费绝活」塞进了手机,还免费?

9. AI春节档最强杀手锏来了!千问3.5除夕强势亮相,开源SOTA、性价比之王

10. 正面硬刚Gemini 3 Pro,阿里开源Qwen3.5-Plus|甲子光年

11. AI编程大战正式开打! Claude vs GPT同一天放大招,不是比谁代码写得好,而是AI开始自己组队当项目经理了。#大咖观察 #红衣聊AI #编程 #ChatGPT

12. 谁才是最强王者?ChatGPT5.5、Claude 4.7、Deepseek V4、Qwen 3.6 编程实测见真章!| 零度解说

13. 刚刚,阿里端出春节「硬菜」千问 3.5!我让它做了个拜年网页,结果出乎意料

14. 阿里新一代大语言模型Qwen3.6-Plus正式发布。较之上一代模型,千问3.6整体性能提升明显,尤其是编程Coding能力、智能体Agent能力和工具调用能力都实现了全面跃升,同时深度适配主流Agent框架,释放模型在开放环境中完成复杂任务的新潜力。

15. 盘点一周AI大事(5月24日)|最强AI同声传译 Codex再进化,电脑息屏也能远程派活 OpenAI新模型数学界80年猜想 Google发布AI科学家 AI Co-Scientist Google推出多模态大模型Gemini Omni Google升级AI画布Stitch Agent 阿里发布国产最强大模型Qwen3.7-Max 阿里开源直播试穿模型FashionChameleon 字节开源多模态模型Lance Odyssey 连发世界模型Starchild-1 Agora-1 研究员开源室内设计世界模型PanoWorld Longcat开源最强数字人模型LongCat-Video-Avatar 1.5 Meta发布最强配音模型WavFlow 研究员开源最强语音识别模型Mega-ASR 阿里发布实时翻译语音模型Qwen3.5 LiveTranslate #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

16. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

17. 太猛了,这次程序员,要被打下来了。阿里刚发布的Qwen3.6-Plus(图一),我第一时间去试了下,得出一个结论:[强]【普通人,也能自己搞系统了】[强]有3个点我觉得非常诱人:(图二)编程能力国产第一,直接对标Claude,国产第一次在“写代码”这件事上,打到全球一线。(图三)价格打到2元/百万tokens,试错成本直线下降。以前做个功能要几十块钱,现在几块钱就能试。(图四)支持100万token的长文了,我让他读了松松云的后台功能,基本一口气能读完。(图五)然后我立马干了件事:在阿里百炼后台用Qwen3.6-Plus重做了公司官网首页,从设计 → 到代码 → 到修改,全程没写一行代码!真的,只要规矩给他定好,Qwen3.6-Plus不到3分钟,页面直接跑出来,这应该是体会过最快的编程模型了。对阿里来说:我感觉他不想只卖API了,估计以后也要搞什么编程工具。随着Qwen3.6-Plus发布,阿里好像已经成了生态闭环了。从大模型、到百炼、到千问APP,开发者一旦用顺手,迁移成本极高。对创业者来说:既然价格这么便宜了,我肯定要把公司的后台系统从3.2升级到8.0了。还有一些老程序、老网站,能升的全都升级一遍。比如就官网首页,全是用Qwen3.6-Plus做的。以前搞个系统升级得求爷爷告奶奶找技术,现在不用了。在这个时代,不怕你会写代码,就怕你只会写代码。如果AI能干完程序员80%的活,你觉得剩下的20%价值在哪里?

18. claude opus 4.7发布了,相较于 sonnet4.6和opus4.6,有什么提升的地方?

19. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

20. 「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?

21. Sonnet 4.6深夜爆更,逆袭Opus!Claude春节大礼,全球软件股又崩了

22. 国产编程模型迎来新王?阿里Qwen3.6-Plus让我重新思考AI写代码这件事

23. “Agent(智能体)时代”毫无争议,但今年,Agent“蜂群”来了,是时候拉开身位了!年初,ClaudeCode 推出Agent"蜂群"工程样板——16个AI Agent并行协作,两周内完成了传统需要37年开发的C编译器项目。同期,红杉、Gartner、麦肯锡报告称:企业管理走向以AI为中枢,Agent协作猛增,将成企业管理发展的大势。但玩过这套的都明白,长程记忆抽风,任务拆解拉垮,调度、安全掉链子,N多细节都是难以跨越的鸿沟!所以,今天在“阿里云峰会”看到无论是芯片、模型、云计算,都在围绕着Agent蜂群做精细优化。比如,阿里云为大规模并发推理做足准备,Qwen3.7在Harness工程、任务规划、长程调度、自我纠错上打磨,真武M890自研芯片,更在并行计算架构上下足功夫……要知道,在AI的世界,哪怕5%的针对性调整,都能带来百分之几十的性能提升!这一切都是为了未来Agent蜂群高强度、高并发的在线工作,铺设充分的水电煤,这才是芯片、大模型、云计算、智能体全栈大厂该有的“大巧不工”。没对比,没伤害!几天前,另一大厂的年度AI战略的峰会,只见Agent旧概念,却只字不提蜂群,失焦“巨大新趋势”,拉完了或许,习惯性“猛猛入局,快速出局”真是它躲不开的命运。无论如何,今年,一切都变了,2026年不仅是Agent大年,更是Agent“蜂群”大年。谁能搞定它,谁就能力有所逮、业有所成。当然,对咱们普通人,也是如此。

24. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

25. 阿里正式发布新一代基模千问3.5

26. Qwen3.6-Max-Preview发布。据官方消息,较早前推出的Qwen3.6-Plus,此次发布的预览版Qwen3.6-Max-Preview模型,在智能体编程、世界知识和指令遵循方面均显著提升:在SWE-bench Pro、Terminal-Bench 2.0、SkillsBench、QwenClawBench、QwenWebBench和SciCode等六项主要编程基准上,预览模型取得最佳表现。同时在世界知识(SuperGPQA、QwenChineseBench)和指令遵循(ToolcallFormatIFBench)方面也斩获新高。

27. GPT-5.4 从 25.6 万个词元增加到 100 万个词元时,检索准确率下降了 54%。Opus 4.6 下降了 15%。现在,各大人工智能实验室都声称拥有百万级令牌上下文窗口。GPT-5.4 八天前发布时就宣称拥有百万级令牌上下文窗口。Gemini 3.1 Pro 也已经实现了这一目标。但是,规格表上的数字和实际可用的数字却是两回事。此图表使用 OpenAI 自家的基准测试工具 MRCR v2。它将 8 条相同的信息隐藏在一段庞大的对话中,并要求模型找到其中一条特定的信息。这本质上是对“能否在 75 万字的文本中找到所需信息”的压力测试。在 25.6 万代币的情况下,各模型的准确率相当接近。Opus 4.6 的准确率为 91.9%,Sonnet 4.6 为 90.6%,GPT-5.4 为 79.3%(根据图表脚注,平均值取自 12.8 万至 25.6 万代币)。但当代币数量增加到 100 万时,各模型的准确率曲线就出现了显著差异。GPT-5.4 的准确率骤降至 36.6%,正确率约为三分之一。Gemini 3.1 Pro 的准确率也降至 25.9%。Opus 4.6 的准确率则保持在 78.3%。研究人员称之为“上下文腐化”。Chroma 在 2025 年测试了 18 个前沿模型,发现随着输入长度的增加,每个模型的性能都下降了。大多数模型的性能呈指数级衰减,而 Opus 几乎不受影响。接下来是定价问题。今天的公告彻底取消了长上下文溢价。现在,一个 90 万个代币的 Opus 4.6 请求与一个 9 千个代币的请求的单价相同,即每百万个代币 5 美元/25 美元。而 GPT-5.4 对超过 27.2 万个代币的请求仍然收取 2 倍输入费用和 1.5 倍输出费用。也就是说,你为了一个在完整上下文中只有大约三分之一的概率能正确检索信息的模型支付了更高的费用。对于任何构建需要运行数小时、处理数百页法律文件或在单个会话中加载整个代码库的代理程序的人来说,唯一重要的数字是模型是否真的能找到你输入的内容。当令牌数量达到 100 万时,这些模型之间的差距就变得非常大了。

28. 【AI前沿】Google IO 与 Qwen 3.7 Max:模型战争没有结束,只是战场变成了 Agent 基础设施

29. 中国AI“三杰”密集升级,原生Agent能力再获突破 1月26日至27日,阿里通义千问、月之暗面Kimi、DeepSeek三大头部玩家接连推出重磅模型更新,集体强化原生智能体(Agent)与多模态能力,被视为国产大模型从“会聊天”向“真办事”加速跃迁的标志性事件。 阿里云于1月26日正式发布千问旗舰推理模型Qwen3-Max-Thinking。该模型总参数量超万亿(1T),预训练数据量高达36T Tokens,创下阿里单次迭代纪录。核心亮点在于原生Agent能力大幅增强,支持自主调用工具、拆解复杂任务,并在HLE等基准测试中刷新多项SOTA(State-of-the-Art)纪录。开发者可在QwenChat免费体验,企业通过阿里云百炼平台调用API,千问APP即将全面接入。 次日(1月27日),月之暗面静默推送Kimi K2.5开源模型。该模型采用原生多模态架构(支持图文视频输入),参数规模达万亿级MoE(混合专家),激活参数320亿。在Agent任务、代码生成、多模态处理等领域表现突出,最重磅创新是引入“Agent集群”机制:面对复杂需求,主模型可即时调度数十至上百个专业“分身”,并行处理高达1500次工具调用,实现“一人成军”的高效协作。该功能上线24小时内登顶全球多个开源榜单,海外讨论量超1.7万,热度超越OpenAI近期工具发布。 同日,DeepSeek团队开源DeepSeek-OCR 2模型。该模型采用创新DeepEncoder V2视觉编码技术,更接近人类阅读逻辑,能动态重排图像部分,提升对复杂版式文档、表格、公式等的理解精度,显著补强Agent在真实业务文档处理中的“眼睛”短板,支持更可靠的端到端自动化。 业内观点认为,此轮“三杰”更新虽发布时间略有先后,但整体形成“饱和式”爆发效应,凸显中国AI竞争已从参数规模转向“办事效率”和“工具调用”实战。开源生态加速渗透,国产模型在Hugging Face下载量持续领跑全球。 展望2026年,随着记忆机制、多智能体协作等技术迭代,中国AI Agent有望在电商、办公、医疗等真实场景大规模落地。专家强调,技术虽迅猛,但胜负关键在于谁能更快将能力转化为千行百业的实际价值,让“AI办事”成为日常常态。

30. 【Qwen3.7-Max登场,智能体时代核心基座模型来了】快速阅读:Qwen3.7-Max 正式发布,旨在成为智能体时代的基座模型。它在编程、通用智能体及高难度推理任务上表现出色,甚至在长达 35 小时的自主内核优化实验中,实现了 10 倍的性能提升。Qwen3.7-Max 来了。它不再只是个聊天窗口,更像是一个能接手复杂工程的数字员工。在编程智能体测试中,它在 SWE-Pro 等多个维度拿到了领先分数,甚至能像资深工程师一样处理多文件工程。有意思的是它在“长程任务”上的表现。很多人担心模型跑久了会“断片”或者逻辑漂移,但它在长达 35 小时的自主内核优化实验里,通过上千次工具调用,硬是把一个从未见过的硬件平台算子优化了 10 倍。这种在未知环境里的泛化能力,大概是它最硬核的地方。有网友提到,现在的模型如果只会“一本正经胡说八道”那是没用的,能说“我不知道”才叫靠谱。Qwen3.7-Max 在设计上更强调这种稳定性,通过强化学习监控奖励作弊,确保它在长周期任务中不会为了完成任务而“投机取巧”。不过,这种能力也带来了一个现实问题:随着模型越来越像“人”,它对算力的胃口也越来越大。对于想要在本地跑起这种级别的智能体的开发者来说,内存和带宽可能很快会成为新的瓶颈。它现在通过阿里云百炼提供 API,支持保留思维链,这对于构建复杂的智能体工作流非常关键。qwen.ai/blog?id=qwen3.7

31. 千问3.5是阿里AI的“大一统”时刻

32. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格

33. 如何评价 3 月 30 日发布的 Qwen3.5-Omni 的性能表现?

34. 大摩中国CIO调查:B端对千问和阿里云兴趣显著增加,预计三年内千问超越DeepSeek

35. 千问正式发布Qwen3.7-Max,重新定义AI Agent基座

36. 阿里千问 Qwen3.7-Max 发布!

37. Qwen3.7-Max 发布:国产大模型开始进入“长程 Agent”主战场

38. 国产第一全球第五,阿里千问发布Qwen3.7-Max,编程推理智能体全面领先竞品

39. 我用 Qwen 3.7 从 0-1 用 AI 搓了一款武侠 RPG 游戏,绝了!

40. 阿里发布千问Qwen3.7-Max模型:国产最佳,可全自主完成35小时长程任务

41. 阿里发布Qwen3.7-Max:登顶国产最强模型,35小时自主优化内核

42. 推理提速10倍编程反超Claude 3 Opus:阿里千问3.7模型评测

43. 阿里发布新一代千问旗舰模型Qwen3.7-Max,登顶最佳国产模型

44. 阿里发布千问旗舰模型Qwen3.7-Max

45. 国产新模王Qwen3.7-Max,海外开发者已经沸腾了

46. 国产第一?阿里千问Qwen3.7-Max发布,性能逼近GPT最强版

47. 阿里千问最强智能体模型Qwen3.7-Max发布

48. 千问发布Qwen3.7-Max 致力成为全能的智能体基座

49. 千问3.7不声不响干了件大事

50. 阿里千问最强智能体模型 Qwen3.7-Max 发布

51. 同时叫板Opus 4.7和GPT-5.5!Qwen3.7-Max深度拆解:国产智能体基座模型是否真的站起来了?

52. 三个月连更三版后,Qwen3.7-Max好像更会干活了

53. 智能体编程新突破!千问3.7旗舰模型全新亮相

54. 35小时智能体自主进化!千问旗舰模型Qwen3.7-Max发布

55. 国产第一!阿里千问旗舰模型Qwen3.7-Max发布:全自主完成35小时任务

56. 阿里Qwen3.7-Max发布!35小时自主优化,性能提升10倍!

57. Qwen3.7-Max 测评,通义万亿参数模型能否站稳国模第一梯队, 真实水平,编程、推理、稳定性全面拆解

58. Qwen两大模型coding实测翻车:35B竟不如30B?参数设置才是关键

59. 阿里Qwen 3.7 Max登顶全球编程大模型榜单

60. 阿里Qwen3.7-Max实测

61. 【历史性时刻】阿里王炸qwen3.7,国产第一模型诞生,,推理超越 Claude-Opus4.6!

62. 通义 Qwen3.7-Max 发布:AI Agent 开始能连续干活 35 小时

63. Qwen3.7-Max 上线模力方舟:面向 Agent 时代的新一代旗舰模型

64. 硬刚GPT5.5、Claude4.6!千问3.7-Max,国产AI代理能力弯道超车

65. Qwen3.7-Max太牛了,接入当红炸子鸡Hermes超详细评测教程来了!

66. 阿里千问发布Qwen3.7-Max:35小时自主编程,Arena国产第一

67. Qwen3.7-Max登场,智能体时代核心基座模型来了

68. 说实话提前拿到Qwen3.7-Max内测,最让我意外的不是它推理变强了!

69. 阿里云代理商:通义千问Qwen3.7-Max全面对比GPT-5、Claude

70. 阿里发布新一代千问旗舰模型Qwen3.7-Max 登顶最佳国产模型

71. 对标国际旗舰!阿里云通义千问Qwen3.7-Max功能详解与落地教程

72. Qwen 3.7 免费使用指南:哪些真免费,哪些只是试用?

73. Qwen3.7-Max 测评

74. 通义千问发布 Qwen3.7-Max!面向智能体时代的全能基座来了

75. 阿里通义大模型负责人周靖人:Qwen3.7核心能力突破,解锁实用新场景

76. 国产AI智能体逆袭!千问Qwen3.7-Max发布,多项性能超越国际顶尖

77. 阿里云通义千问发布Qwen3.7:国产大模型再进化

78. Qwen3.7进了全球文本榜前15,国产模型第一次没掉队,靠啥撑住的

79. Qwen3.7-Max 评测出炉:这次中国模型真的摸到天花板了

80. 阿里Qwen3.7-Max发布:Arena盲测国产第一,全球前列

81. 阿里千问登顶国产第一,AI编程进入35小时自主时代

82. 阿里终局AI落地!Qwen3.7-Max强势登场,35小时长程自主任务,重新定义AI生产力

83. 分享最新Qwen3整合包,单机最好用的模型,8G显存可用,8B,14B双模型可选。

84. 刚刚,阿里巴巴发布新一代旗舰模型Qwen3.7-Max

85. 与 Claude4.7 掰手腕!阿里旗舰大模型 Qwen3.7-Max 来了,7个实测,很丝滑

86. Qwen3.7-Max正式上线:Agent能力登顶国产第一

87. 阿里新模型 - Qwen3.7:面向智能体时代的新一代旗舰大模型

88. 千问接入全新一代大模型Qwen3.7-Max

89. 千问云上线Qwen3.7-Max,支持API与Token Plan调用!

90. Qwen3.7 编程实测!打得过Gemini 3.5吗?

91. 千问3.7:智能体时代的编码利器

92. 阿里Qwen3.7炸裂发布!国产AI终于硬气了一回

93. Qwen3.7-Max零代码帮我写了个LLM手撕APP

94. 全平台同步更新!阿里千问上线Qwen3.7-Max,智能体能力全面进阶

95. MindSpore Model Agent 实战笔记001:用 failure-agent 修复 Qwen3 在 Ascend A2 上的 dtype 与 shape 问题

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章