张大妈

Step-3.5-Flash-Q4在AI MAX+ 395的使用体验

源自UP主:防爆键盘

02-12 12:10

针对197B参数的巨型模型Step-3.5-Flash-Q4,在AIMAX+ 395上的实测显示,其并非全能选手。尽管编程能力表现不佳,但它意外地在文本生成(小作文)方面展现出卓越实力,为拥有顶级本地硬件的用户提供了一个高度专精的写作解决方案。

Step-3.5-Flash-Q4在AI MAX+ 395的使用体验智能速览

  • 该模型量化后体积巨大,运行需占用超过100GB的显存。

  • 编程能力表现欠佳,生成的代码项目存在功能性缺陷。

  • 核心优势在于强大的中文长文写作能力,优于社区微调模型。

  • 在32K上下文长度内,生成速度可稳定在20-30 token/s。

  • 存在工具调用时的模板泄露BUG,但不影响核心功能。

Step-3.5-Flash-Q4在AI MAX+ 395的使用体验精华内容

作为一款参数量高达197B的巨型模型,Step-3.5-Flash在本地部署的门槛极高,其实际性能表现与理想是否存在差距?它在特定领域的突出能力,又是否值得为其庞大的体积买单?

硬件门槛与性能表现

Step-3.5-Flash的Q4_K_S量化版本模型文件大小约为114GB,在Linux系统下通过llama.cpp运行时,实际显存占用高达109GB至120GB。这对硬件提出了苛刻要求,测试平台AIMAX+ 395提供了122GB的显存才得以流畅运行。在Windows系统下,可能需要96GB独立显存配合16GB共享内存才能加载64K上下文的模型。

速度方面,Vulkan后端在输出速度上更具优势,而ROCm后端的预填充速度稍快,但后者对于日常使用的提升感知不强。总体而言,模型规模对硬件的压力较大,影响了综合体验。

编程能力实地测试

在编程能力的多轮测试中,该模型表现不佳。当被要求制作一个弹幕射击游戏时,生成的代码存在鼠标操作逻辑诡异、难度设计不合理等问题,导致游戏几乎无法正常进行。在太阳系模拟系统的项目中,输出的结果同样显得诡异且不符合物理常识。

在泡泡龙游戏的测试中,生成的项目更是完全没有可玩性,与其他模型(如千问Coder)能够生成可玩版本的表现形成鲜明对比。综合来看,其编程能力明显逊于专门的代码模型,不适合作为本地编程助手使用。

意外的写作专长

尽管在编程和通用知识问答上表现平平,但该模型在文本生成,尤其是撰写“小作文”方面展现出惊人实力。其生成内容的质量和连贯性被认为超越了多数社区微调模型,在本地模型中属于顶尖水平。

这一突出优点使其定位非常清晰:一个为有大量本地写作需求的用户准备的专用工具。对于追求高质量文本生成且拥有顶级硬件配置的用户来说,这一特性极具吸引力,使其在众多大模型中找到了独特的生态位。

其他问题与总结

测试中还发现,当前版本的llama.cpp在处理该模型的工具调用(MCP)时存在一个模板问题,偶尔会在输出中泄露内部标签,虽然不影响工具调用的成功执行,但影响了输出的纯净度。此外,该模型存在容易陷入死循环的BUG,稳定性有待进一步优化。

综合来看,社区对其“高智能”的宣传可能有所夸大。其巨大的体积和偏科严重的能力,使其应用场景受限,更像是一个实验性或专精化的产品,而非一个普适的智能助手。

Step-3.5-Flash并非传统意义上的全能大模型,而是一个特点鲜明的“偏科生”。它用巨大的硬件开销,换取了在本地写作领域的顶尖表现,为特定用户群体提供了极具价值的解决方案。它的出现也引出一个思考:未来的本地大模型,是否会朝着更加专精化的方向发展?

Step-3.5-Flash-Q4在AI MAX+ 395的使用体验关键评论

  • 有用户期待DeepSeek即将发布的200B模型,可能更适合这类高端硬件。

  • 有观点认为官方量化版本迟迟未发布,预示着模型表现不会太惊艳。

  • 有用户反馈模型存在死循环BUG,认为当前版本尚不稳定,建议更新后再测。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章