上周AI领域迎来多项重磅更新,开源模型与闭源模型同步发力。阿里Qwen 3.5与MiniMax M2.5相继开源,智谱GLM-5和字节SEED 2.0系列发布,Google Gemini 3和OpenAI GPT 5.3 Codex也带来重要更新。这些进步不仅体现在参数规模的提升,更在推理速度、成本控制和专业任务表现上实现了突破。
智能速览
阿里开源Qwen 3.5,397B参数支持201种语言
MiniMax M2.5编程助手成本降至每小时1美元
智谱GLM-5上下文窗口扩展至200K
字节跳动发布SEED 2.0系列三个尺寸模型
Gemini 3 DeepThink模式在数学推理上表现突出
精华内容
开源模型的性能逼近甚至超越部分闭源模型,开发成本大幅下降,这标志着AI行业正进入更加开放和竞争的新阶段。
开源大模型突破
阿里Quant团队开源了Qwen 3.5,这是一个原生多模态模型,总参数量达到397B,激活参数17B。架构采用Gated Delta Networks与混合专家系统,优化了运行速度和延迟。语言支持从原来的范围扩展到201种,包括各种方言。该模型作为统一的视觉语言基础模型,使用万亿级多模态Token进行早期融合训练。
MiniMax发布了M2.5开源模型,定位为高性价比编程助手。在SWE Bench Verified基准测试中获得80.2%的成绩。推理速度可达每秒100个token,满负荷运行一小时成本约1美元;若降到每秒50个token,成本仅需0.3美元,相比上一代M2.1快了37%。
国产模型性能提升
智谱AI发布GLM-5,专门面向复杂工程和长周期Agent任务。上下文窗口扩展至200K,最大输出128K,可一次性生成大量代码或文档。参数量从上一代的355B升至744B,激活参数40B,预训练数据量达28.5万亿token。性能方面,SWE Bench Verified得分77.8,Terminal Bench 2.0得分56.2。
字节跳动公布SEED 2.0系列,分为Pro、Light、Mini三个尺寸,都面向通用Agent场景。官方强调在真实长对话任务中的稳定推进能力,能力涵盖多模态理解、指令遵循、Agent协作等模块。SEED 2.0 Pro在MMLU Pro上得分87.4,纯文本无工具模式32.4,数学测评AIME 2026为94.2,AIME 2025高达98.3。
海外巨头更新
Google更新Gemini 3,推出DeepThink推理模式。官方数据显示,在Humanities’ Last Exam无工具模式下得分48.4%,ARCAGI为84.6%,编程测试Code for CC Law达到3455分。DeepMind专门发文介绍DeepThink在数学和科学发现上的应用,在IMO Proof Bench Advanced上,随着推理算力增加,最高可达90%准确率。
OpenAI发布GPT 5.3 Codex Spark,专注实时编程场景的低延迟响应。官方数据称每秒可处理超过1000个token,往返开销降低80%,首token时间缩短一半。同时,ChatGPT上线Lockdown Mode,将提示词注入列为关键风险,为高风险用户提供安全模式,禁用部分工具能力并限制网页浏览。
开发者工具演进
Cursor发布Composer 1.5更新,主要改进多文件编辑的稳定性和可控性,减少长任务中的上下文飘移问题。这种改进在日常使用中体验差异明显。
前GitHub CEO Thomas Dohmke的Intel平台完成6000万美元种子轮融资,估值3亿美元,首发开源命令行工具CheckPoints。该工具能将AI生成代码的指令和推理过程与代码一起保存,便于后续代码审查和审计,目前支持Cloud Code和Gemini CLI。
Google开源Gemini Skills仓库,将面向Gemini API的常用能力封装成可复用技能模块,包括网页访问、代码执行、记忆等功能,开发者可直接用于构建Agent工作流。
AI技术正以前所未有的速度迭代,开源模型的性能提升和成本下降为开发者带来更多选择。各大厂商在特定领域的深耕也让模型能力更加专业化。未来,随着推理模式的优化和工具链的完善,AI将在更多实际场景中发挥价值。