NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用
一、llama3介绍
LLama3是今年新推出的大模型,有80亿参数和700亿参数量版本,被称之为“史上最强开源大模型”,性能据说可以对标GPT-4。我目前已上手深度体验2个多月了,感觉对日常生活和写作有一定的参考意义,还没玩过的朋友可以来体验下。

本文介绍的是Llama3本地中文大模型,不需要接入网络,支持Windows、Linux、Mac三个平台,我分享的傻瓜包在Windows下基本无需配置即可使用,很适合部署到windows电脑或者Windows NAS上,方便随时使用,不像其他AI那样需要联网、注册账号等等。只是它对硬件配置有一定要求,太低端的处理器运行起来比较吃力,不需要显卡,

二、llama3配置和使用
把下载下来的傻瓜包解压缩放到硬盘里,直接双击运行Start_windows即可。前端是text-generation-webui,需要Python等运行环境,我这里已经全部配置好了,无需任何下载更新,不需要加速,直接运行就好。注意考虑到在NAS上运行的缘故,此包选择了CPU运算,有中高端独显的朋友建议下载原始安装包。

运行后终端出现如图中的网址就说明运行成功,按住CTRL键点击网址即可打开,也可以网址复制到浏览器打开:

点击顶上的Model,在Model下拉选项框里选择Llama3-8B-Chinese-Chat-q8-v2,点击右边的Load加载模型,其他选项不要动。以后有了新的模型也可以直接放在Model目录下。

模型加载很快,一般只需要几秒中,如图返回命令行窗口,显示Loaded字样表示模型加载成功,如果有问题会显示错误信息:

点击顶上的Chat,右边的Mode选择Chat-Instruct:

使用时在下方的输入栏里输入问题,点击右边的Generate,稍待片刻就可以收到回答,可接着上一个问题进行连续对话,是不是超级简单?

此时可以去之前的命令行窗口查看进度和算力,复杂一点的问题会出现进度条,简单点的问题一般会立即给出答案,具体要看CPU运算能力:

不提问时几乎是不占用系统资源的,不把终端窗口关掉即可。可以利用这个特性让它一直在NAS或者后台运行,在局域网里把网址保存到浏览器收藏夹里方便随时访问。局域网访问Web UI默认是没有开启的,需要点击Session、勾选Listen、点击ApplyFlags/extensions and restart,然后就可以在局域网里用http://NAS局域网IP:7860访问了。需要在外网访问家里的本地大模型的话在路由器里做个端口转发,或者用花生壳之类的内网穿透工具,不需要局域网和远程访问的话不需要做上述设置。

拓展玩法还有很多,有兴趣的朋友可以自行研究,比如自行调教训练、加载其他模型、逻辑推理脚本、换中文前端等等。
三、llama3体验报告
先说说运行效率。现在的本地AI一般需要用到中高端显卡进行运算,用CPU运算效率普遍偏低。我在E3-1260L、AMD R7-5700U、i7-12700F、赛扬J4125、N5105上做过测试,都可以正常运行,其中J4125、N5105处理速度较慢,在我看来属于不适合运行,除非你能长时间等待;AMD R7 5700U以上就属于可运行级别了,视问题难度,一般在十几秒到几分钟之间,运算时CPU占用率会达到100%。这里说的难度是有时候你觉得简单的问题但对AI来说特别难,即使在i7-12700F上也有需要几分钟才能解答的问题。

关于准确度和回答的严谨度,个人认为大多数时候用于参考是没有任何问题的,语言理解能力还可以,支持连续对话,但回答需要你自己校对一下,因为偶尔会出现一些低级错误,比如下图我问三国里郭嘉和诸葛亮谁更厉害,AI居然回答说郭嘉是钞位名将刘备的谋士,估计是数据源出了问题,毕竟是本地模型嘛。

傻瓜包在评论区,需要的朋友可自行下载。

真真梦
校验提示文案
上古长白山
校验提示文案
值友1766358556
校验提示文案
kitkats
哪怕是 n5105 这种机器 cpu 推理时占用都不会满。一般单通道 ddr5 用 1.5B 小模型每秒钟可以出 5 个词。使用 gpu 也是,都是卡在显存带宽上,一般看快慢就是看显存带宽。3090 和 4090 显存带宽差不多,所以吐词的速度差不多。
大模型一般来讲至少要到 30B 以上才有应用价值,一般模型用 4bit 量化以上就可以了。30B 的 4bit 量化大概就是 30x0.65=19G 上下,需要有 20 多的内存装进去。这个也基本上是 cpu 的极限了。快的 4 通道内存大概估计也会有个 10 个词每秒上下吧。
开源的不差的,但是至少要到 70B 以上的模型,qwen2 72B,llama 3.1 70B 对普通来讲就够用了。llama 3.1 405B 和 chatgpt4 感觉差不多,前者可能还稍好一点。这个可能就是要买贵点的显卡组一下了。同样的也是受限于显存带宽,慢的要命。
校验提示文案
betiitt
Llama.generate: prefix-match hit
Output generated in 19.63 seconds (2.55 tokens/s, 50 tokens, context 81, seed 872981281)
Llama.generate: prefix-match hit
Output generated in 10.40 seconds (2.88 tokens/s, 30 tokens, context 81, seed 1402303897)
校验提示文案
懒洋阳
校验提示文案
快来吃口冷翔
校验提示文案
qwerty1988
校验提示文案
值友2848703935
校验提示文案
KC熊朗布
校验提示文案
即是
校验提示文案
vcta
校验提示文案
stonewuxi
校验提示文案
值友9814724229
校验提示文案
叫我彩虹兄
校验提示文案
aHaaDaM
校验提示文案
天天签到是种病
校验提示文案
fengpan584
校验提示文案
值友7315125982
校验提示文案
NTMD
校验提示文案
betiitt
Llama.generate: prefix-match hit
Output generated in 19.63 seconds (2.55 tokens/s, 50 tokens, context 81, seed 872981281)
Llama.generate: prefix-match hit
Output generated in 10.40 seconds (2.88 tokens/s, 30 tokens, context 81, seed 1402303897)
校验提示文案
kitkats
哪怕是 n5105 这种机器 cpu 推理时占用都不会满。一般单通道 ddr5 用 1.5B 小模型每秒钟可以出 5 个词。使用 gpu 也是,都是卡在显存带宽上,一般看快慢就是看显存带宽。3090 和 4090 显存带宽差不多,所以吐词的速度差不多。
大模型一般来讲至少要到 30B 以上才有应用价值,一般模型用 4bit 量化以上就可以了。30B 的 4bit 量化大概就是 30x0.65=19G 上下,需要有 20 多的内存装进去。这个也基本上是 cpu 的极限了。快的 4 通道内存大概估计也会有个 10 个词每秒上下吧。
开源的不差的,但是至少要到 70B 以上的模型,qwen2 72B,llama 3.1 70B 对普通来讲就够用了。llama 3.1 405B 和 chatgpt4 感觉差不多,前者可能还稍好一点。这个可能就是要买贵点的显卡组一下了。同样的也是受限于显存带宽,慢的要命。
校验提示文案
值友6017893194
校验提示文案
ZhaoCrow
校验提示文案
值友2848703935
校验提示文案
皂滑挊人
校验提示文案
蓝调薅羊毛
校验提示文案
叫我彩虹兄
校验提示文案
值友9814724229
校验提示文案
stonewuxi
校验提示文案
著名有钱妞
校验提示文案
vcta
校验提示文案
dimanche4sc
校验提示文案
天天签到是种病
校验提示文案
NTMD
校验提示文案
值友7315125982
校验提示文案
值友1766358556
校验提示文案
qwerty1988
校验提示文案
上古长白山
校验提示文案
fengpan584
校验提示文案