23. 实操演示,如何在本地有限的硬件上跑尽可能强的模型。 llama.cpp 配置参数解释:
--no-mmap 只影响模型加载速度,小模型不用加,大模型加更稳,不卡死。
-ngl 层数,调低可以让你跑更大模型,但影响速度。27B的IQ4模型本机测试31层最优解。
-ot 指定层数可以将FFN 超大模块,强制放回 CPU 跑,避免KV 缓存放不下,长上下文直接崩,让显存刚好压在 15.5GB 安全线
* 'chcp 65001':设置 UTF-8 编码(适合表情符号/特殊字符)。无特殊用途。
* 上下文大小('-c'):66,000。 大概比64k多一点,预留给小龙虾窗口。
* GPU 层数('-ngl'):29 层。我的16G显卡最快其实可以开到31层,但会占满显存,导致我玩不了游戏了,这里自己权衡。当然不同模型层数不一样,自己查资料一点点试。
* 将特定层卸载给CPU(“-ot”):使用正则表达式强制特定块(27-30)到CPU。这是针对16GB显存卡(RTX 5060 Ti 16G)的高度优化,以防止内存不足(OOM)。
* 线('-t'):5. 这里大概逻辑是CPU核心数减1,还是留给自己打游戏。
* 闪光注意('--flash-attn'):启用。
* 缓存 RAM('--cache-ram'):32768(32GB)。 这里不要学我,我是内存多到没地方用,实际4G足够了。
* 内存映射(“--no-mmap”):禁用(强制加载到内存)。
值友7654321
那得试试
校验提示文案
gsonovb
校验提示文案
值友7654321
那得试试
校验提示文案
gsonovb
校验提示文案