12GB显存跑125B大模型,代价是64GB内存和量化降智
源自183位全网作者
09:53
精选参考来源
1
我测试了 Qwen3.8 Flash Next 的 11 种标准 GGUF 量化方法,从 Q4 到 Q1。在这些单轮、非代理式评估中,我测试的每种标准 GGUF 都保留了 BF16 准确率的 >95%。甚至 IQ1 模型的表现也出人意料地好。令牌效率的下降则更加明显。在相同工作负载下,量化模型生成的输出令牌数量比 BF16 多出 14% 到 157%。因此,对于这些非代理式评估,准确率本身显示出相对较少的下降,而令牌效率则给我们提供了更强的信号,表明量化正在影响模型。剩下的问题是,这如何转化为长代理式轨迹。我现在正在运行这些评估(但不是针对所有模型),并将于下周发布结果。详情:网页链接…(一如既往,不要将这些结果解读为排名)网页链接
2
本地跑qwen3.8 flash next IQ4 45个token左右,效果相对于qwen3.8 27B还是有不小的提升。90G的模型文件把所有资源都吃满了,我这套设备能运行模型的天花板了。qwen3.8 flash next是125B Moe模型,工作时激活6B,面向下一代qwen的架构。在复杂任务,长上下文上,flash明显优于27B。
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹