这是一次面向工程落地的深度实测,聚焦大模型在真实系统级任务中的表现。Qwen3.5在无代码模板、无参考实现的前提下,自主完成高性能向量数据库开发,QPS达1405,较Kimi-K2.5提升4.8倍,关键在于其对IVF参数的自主调优能力,展现出罕见的系统级工程直觉。
智能速览
Qwen3.5在VectorDB Bench测试中QPS达1405,是Kimi-K2.5的4.8倍、GLM-5的25倍
首次实现有限轮次内自主探索最优IVF聚类参数(K=2048, nprobe=30),单次查询仅扫描约15000条数据
前端建模能力提升明显,大象牙膏、鞭炮爆炸等复杂物理效果可正确生成
空间理解仍是短板,陀飞轮机芯齿轮设计未达物理合理性要求
指令遵循率达85.9%,略低于Gemini-3.0-Pro的90.6%,主要失分于加速曲线公式执行
Agent综合得分为668.43,仅次于GLM-5,支撑其在后端编程任务中稳定输出
精华内容
当大模型不再只写Demo,而是真正参与系统级性能优化——它需要理解硬件特性、权衡算法复杂度、迭代调参并验证结果。Qwen3.5在这场硬核测试中交出了超出预期的答案。
后端破局
VectorDB Bench测试要求模型仅凭提示词,从零实现一个支持100万向量检索的高性能数据库,且限定使用4核CPU与AVX512F指令集。Qwen3.5最终实现QPS 1405,而Kimi-K2.5为292,GLM-5仅56。该性能并非源于算法独创,三者均采用IVF倒排索引,差异核心在于参数配置:Qwen3.5自主选定K=2048、nprobe=30,使单次查询平均扫描15000条向量;Kimi-K2.5采用K=200、nprobe=15,需扫描约75000条,理论计算量比值为4.9:1,与实测性能比高度吻合。
这一结果表明,Qwen3.5已具备在约束条件下进行工程级权衡的能力——它不仅知道‘用什么’,更清楚‘怎么配’才能逼近硬件极限。
相比之下,GLM-5仍依赖暴力搜索,在百万量级数据下QPS天然受限,凸显Qwen3.5在大规模向量检索场景中的工程适配优势。
前端进化
前端编程测试中,Qwen3.5在大象牙膏实验里首次准确建模三角烧瓶几何结构与反应流体动力学路径,粒子轨迹连续性与气泡膨胀速率符合化学常识;鞭炮连锁爆炸测试中,火焰传播延迟、碎片飞散角分布及光影衰减曲线均呈现合理物理响应。
多模态能力带来新交互范式:模型可直接解析网站录屏视频,识别DOM结构、CSS样式与JavaScript行为逻辑,并生成功能一致的克隆页面。实测中,某电商首页录屏输入后,Qwen3.5输出HTML+CSS+JS完整代码,关键交互(如加入购物车弹窗、图片懒加载)均可运行。
但空间推理短板依然显著:在陀飞轮机芯测试中,齿轮齿数、啮合角度与擒纵叉摆幅关系未能满足机械传动基本约束,生成的三维模型存在齿形干涉与动力传递断点,说明其对刚体运动学与精密机构建模的理解尚未穿透表层描述。
Agent协同
硅基骑手测试评估模型作为智能体完成多步骤任务链的能力,Qwen3.5得分668.43,仅次于GLM-5的738.69,显著高于Kimi-K2.5的582.11。该分数反映其在任务分解、工具调用、错误恢复三环节的稳定性:在‘部署向量库→压测→分析热点→优化AVX指令→重测’全流程中,失败率低于12%,且能根据perf报告自动定位到分支预测失败热点并提出循环展开方案。
值得注意的是,其Agent能力与后端表现呈强正相关——668.43分对应VectorDB Bench中7轮内收敛至最优参数,而Kimi-K2.5在相同轮次下仍在K=512与K=1024间震荡。这印证了系统级任务对长程规划与反馈闭环能力的刚性需求。
不过,当前Agent输出存在格式瑕疵:约8%的任务中漏写Markdown语法标记,5%将思考过程误输出至
长文局限
256K上下文召回测试显示表面优异:给定原文时召回准确率为99.1%。但控制变量实验揭示深层问题——当移除原文、仅提供四选一干扰项时,模型蒙对率高达75.6%。该数值远超随机概率(25%),说明其并非基于语义理解作答,而是通过模式匹配或统计偏好选择高频选项。
这一现象导致长文本推理类任务可信度归零:例如在技术文档摘要任务中,模型可能复述训练数据中高频出现的句式结构,而非真正归纳段落主旨。对比来看,Gemini-3.0-Pro在同条件下的蒙对率为31.2%,更接近随机水平,其召回结果因而具备更高语义可靠性。
因此,Qwen3.5的长上下文能力适用于信息定位类任务(如‘找出第三章提到的API参数’),但不适用于需深度推理的摘要、论证或跨段落逻辑推演。
Qwen3.5标志着国产大模型从‘能写代码’迈向‘懂系统优化’的关键跃迁。其后端编程能力已具备替代初级工程师完成性能敏感模块开发的潜力,但在空间建模与长文本语义一致性上仍有明显提升空间。当硬件感知、算法调优与任务闭环能力持续增强,大模型能否真正成为系统架构师的协作者?这个问题的答案,或许就藏在下一次迭代的参数搜索空间里。
关键评论
大模型同质化严重,各家出的东西都差不多
国内大模型编程能力目前是什么排位?必须开会员才强?
@千问@通义实验室@千问大模型有问题要抓紧优化