NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用
一、llama3介绍
LLama3是今年新推出的大模型,有80亿参数和700亿参数量版本,被称之为“史上最强开源大模型”,性能据说可以对标GPT-4。我目前已上手深度体验2个多月了,感觉对日常生活和写作有一定的参考意义,还没玩过的朋友可以来体验下。

本文介绍的是Llama3本地中文大模型,不需要接入网络,支持Windows、Linux、Mac三个平台,我分享的傻瓜包在Windows下基本无需配置即可使用,很适合部署到windows电脑或者Windows NAS上,方便随时使用,不像其他AI那样需要联网、注册账号等等。只是它对硬件配置有一定要求,太低端的处理器运行起来比较吃力,不需要显卡,

二、llama3配置和使用
把下载下来的傻瓜包解压缩放到硬盘里,直接双击运行Start_windows即可。前端是text-generation-webui,需要Python等运行环境,我这里已经全部配置好了,无需任何下载更新,不需要加速,直接运行就好。注意考虑到在NAS上运行的缘故,此包选择了CPU运算,有中高端独显的朋友建议下载原始安装包。

运行后终端出现如图中的网址就说明运行成功,按住CTRL键点击网址即可打开,也可以网址复制到浏览器打开:

点击顶上的Model,在Model下拉选项框里选择Llama3-8B-Chinese-Chat-q8-v2,点击右边的Load加载模型,其他选项不要动。以后有了新的模型也可以直接放在Model目录下。

模型加载很快,一般只需要几秒中,如图返回命令行窗口,显示Loaded字样表示模型加载成功,如果有问题会显示错误信息:

点击顶上的Chat,右边的Mode选择Chat-Instruct:

使用时在下方的输入栏里输入问题,点击右边的Generate,稍待片刻就可以收到回答,可接着上一个问题进行连续对话,是不是超级简单?

此时可以去之前的命令行窗口查看进度和算力,复杂一点的问题会出现进度条,简单点的问题一般会立即给出答案,具体要看CPU运算能力:

不提问时几乎是不占用系统资源的,不把终端窗口关掉即可。可以利用这个特性让它一直在NAS或者后台运行,在局域网里把网址保存到浏览器收藏夹里方便随时访问。局域网访问Web UI默认是没有开启的,需要点击Session、勾选Listen、点击ApplyFlags/extensions and restart,然后就可以在局域网里用http://NAS局域网IP:7860访问了。需要在外网访问家里的本地大模型的话在路由器里做个端口转发,或者用花生壳之类的内网穿透工具,不需要局域网和远程访问的话不需要做上述设置。

拓展玩法还有很多,有兴趣的朋友可以自行研究,比如自行调教训练、加载其他模型、逻辑推理脚本、换中文前端等等。
三、llama3体验报告
先说说运行效率。现在的本地AI一般需要用到中高端显卡进行运算,用CPU运算效率普遍偏低。我在E3-1260L、AMD R7-5700U、i7-12700F、赛扬J4125、N5105上做过测试,都可以正常运行,其中J4125、N5105处理速度较慢,在我看来属于不适合运行,除非你能长时间等待;AMD R7 5700U以上就属于可运行级别了,视问题难度,一般在十几秒到几分钟之间,运算时CPU占用率会达到100%。这里说的难度是有时候你觉得简单的问题但对AI来说特别难,即使在i7-12700F上也有需要几分钟才能解答的问题。

关于准确度和回答的严谨度,个人认为大多数时候用于参考是没有任何问题的,语言理解能力还可以,支持连续对话,但回答需要你自己校对一下,因为偶尔会出现一些低级错误,比如下图我问三国里郭嘉和诸葛亮谁更厉害,AI居然回答说郭嘉是钞位名将刘备的谋士,估计是数据源出了问题,毕竟是本地模型嘛。

傻瓜包在评论区,需要的朋友可自行下载。

校验提示文案
校验提示文案
校验提示文案
哪怕是 n5105 这种机器 cpu 推理时占用都不会满。一般单通道 ddr5 用 1.5B 小模型每秒钟可以出 5 个词。使用 gpu 也是,都是卡在显存带宽上,一般看快慢就是看显存带宽。3090 和 4090 显存带宽差不多,所以吐词的速度差不多。
大模型一般来讲至少要到 30B 以上才有应用价值,一般模型用 4bit 量化以上就可以了。30B 的 4bit 量化大概就是 30x0.65=19G 上下,需要有 20 多的内存装进去。这个也基本上是 cpu 的极限了。快的 4 通道内存大概估计也会有个 10 个词每秒上下吧。
开源的不差的,但是至少要到 70B 以上的模型,qwen2 72B,llama 3.1 70B 对普通来讲就够用了。llama 3.1 405B 和 chatgpt4 感觉差不多,前者可能还稍好一点。这个可能就是要买贵点的显卡组一下了。同样的也是受限于显存带宽,慢的要命。
校验提示文案
Llama.generate: prefix-match hit
Output generated in 19.63 seconds (2.55 tokens/s, 50 tokens, context 81, seed 872981281)
Llama.generate: prefix-match hit
Output generated in 10.40 seconds (2.88 tokens/s, 30 tokens, context 81, seed 1402303897)
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
Llama.generate: prefix-match hit
Output generated in 19.63 seconds (2.55 tokens/s, 50 tokens, context 81, seed 872981281)
Llama.generate: prefix-match hit
Output generated in 10.40 seconds (2.88 tokens/s, 30 tokens, context 81, seed 1402303897)
校验提示文案
哪怕是 n5105 这种机器 cpu 推理时占用都不会满。一般单通道 ddr5 用 1.5B 小模型每秒钟可以出 5 个词。使用 gpu 也是,都是卡在显存带宽上,一般看快慢就是看显存带宽。3090 和 4090 显存带宽差不多,所以吐词的速度差不多。
大模型一般来讲至少要到 30B 以上才有应用价值,一般模型用 4bit 量化以上就可以了。30B 的 4bit 量化大概就是 30x0.65=19G 上下,需要有 20 多的内存装进去。这个也基本上是 cpu 的极限了。快的 4 通道内存大概估计也会有个 10 个词每秒上下吧。
开源的不差的,但是至少要到 70B 以上的模型,qwen2 72B,llama 3.1 70B 对普通来讲就够用了。llama 3.1 405B 和 chatgpt4 感觉差不多,前者可能还稍好一点。这个可能就是要买贵点的显卡组一下了。同样的也是受限于显存带宽,慢的要命。
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案