如果显卡算力不行,但又需要用本地模型,可以考虑纯 CPU 推理。我试了一下用 ThinkPad X1 Carbon Gen 13 跑 Qwen3.5-35B-A3B-Q4_K_M.gguf 也能有 14 t/s 的速度。注意 llama.cpp 的参数要加上 -t 8 和 -ngl 0。
源自新浪微博:tombkeeper
03-21 13:36
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹