NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

2024-07-14 14:36:12 44点赞 257收藏 56评论

一、llama3介绍

LLama3是今年新推出的大模型,有80亿参数和700亿参数量版本,被称之为“史上最强开源大模型”,性能据说可以对标GPT-4。我目前已上手深度体验2个多月了,感觉对日常生活和写作有一定的参考意义,还没玩过的朋友可以来体验下。

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

本文介绍的是Llama3本地中文大模型,不需要接入网络,支持Windows、Linux、Mac三个平台,我分享的傻瓜包在Windows下基本无需配置即可使用,很适合部署到windows电脑或者Windows NAS上,方便随时使用,不像其他AI那样需要联网、注册账号等等。只是它对硬件配置有一定要求,太低端的处理器运行起来比较吃力,不需要显卡

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

二、llama3配置和使用

把下载下来的傻瓜包解压缩放到硬盘里,直接双击运行Start_windows即可。前端是text-generation-webui,需要Python等运行环境,我这里已经全部配置好了,无需任何下载更新,不需要加速,直接运行就好。注意考虑到在NAS上运行的缘故,此包选择了CPU运算,有中高端独显的朋友建议下载原始安装包。

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

运行后终端出现如图中的网址就说明运行成功,按住CTRL键点击网址即可打开,也可以网址复制到浏览器打开:

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

点击顶上的Model,在Model下拉选项框里选择Llama3-8B-Chinese-Chat-q8-v2,点击右边的Load加载模型,其他选项不要动。以后有了新的模型也可以直接放在Model目录下。

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

模型加载很快,一般只需要几秒中,如图返回命令行窗口,显示Loaded字样表示模型加载成功,如果有问题会显示错误信息:

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

点击顶上的Chat,右边的Mode选择Chat-Instruct:

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

使用时在下方的输入栏里输入问题,点击右边的Generate,稍待片刻就可以收到回答,可接着上一个问题进行连续对话,是不是超级简单?

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

此时可以去之前的命令行窗口查看进度和算力,复杂一点的问题会出现进度条,简单点的问题一般会立即给出答案,具体要看CPU运算能力:

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

不提问时几乎是不占用系统资源的,不把终端窗口关掉即可。可以利用这个特性让它一直在NAS或者后台运行,在局域网里把网址保存到浏览器收藏夹里方便随时访问。局域网访问Web UI默认是没有开启的,需要点击Session、勾选Listen、点击ApplyFlags/extensions and restart,然后就可以在局域网里用http://NAS局域网IP:7860访问了。需要在外网访问家里的本地大模型的话在路由器里做个端口转发,或者用花生壳之类的内网穿透工具,不需要局域网和远程访问的话不需要做上述设置。

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

拓展玩法还有很多,有兴趣的朋友可以自行研究,比如自行调教训练、加载其他模型、逻辑推理脚本、换中文前端等等。

三、llama3体验报告

先说说运行效率。现在的本地AI一般需要用到中高端显卡进行运算,用CPU运算效率普遍偏低。我在E3-1260L、AMD R7-5700U、i7-12700F、赛扬J4125、N5105上做过测试,都可以正常运行,其中J4125、N5105处理速度较慢,在我看来属于不适合运行,除非你能长时间等待;AMD R7 5700U以上就属于可运行级别了,视问题难度,一般在十几秒到几分钟之间,运算时CPU占用率会达到100%。这里说的难度是有时候你觉得简单的问题但对AI来说特别难,即使在i7-12700F上也有需要几分钟才能解答的问题。

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

关于准确度和回答的严谨度,个人认为大多数时候用于参考是没有任何问题的,语言理解能力还可以,支持连续对话,但回答需要你自己校对一下,因为偶尔会出现一些低级错误,比如下图我问三国里郭嘉和诸葛亮谁更厉害,AI居然回答说郭嘉是钞位名将刘备的谋士,估计是数据源出了问题,毕竟是本地模型嘛。

NAS部署llama3本地中文AI大模型,Windows NAS专属!超简单傻瓜包~电脑也可以用

傻瓜包在评论区,需要的朋友可自行下载。

展开 收起
56评论

  • 精彩
  • 最新
  • 置顶 下载链接:去看看

    校验提示文案

    提交
  • 别听这个瞎扯,nas部署本地大模型内存不够。llama3至少得超过8GB内存,而且英伟达显卡才是本地大模型的关键。

    校验提示文案

    提交
    [苦恼] [苦恼] 到底谁在瞎扯

    校验提示文案

    提交
    我NAS内存32G [抽烟] [抽烟]

    校验提示文案

    提交
    还有1条回复
    收起所有回复
  • 跑过qianwen2 1.5b的,只能说4核低频以下就别为难CPU了,出来的速度很慢,而且这种小模型也不太聪明。。。

    校验提示文案

    提交
    这个是80亿参数大模型,语言能力还可以,很多国内AI都用它套壳了

    校验提示文案

    提交
    收起所有回复
  • 大家都有误区,其实大模型跑的快慢和 cpu 关系并不是太大。一般就是卡在内存带宽上。

    哪怕是 n5105 这种机器 cpu 推理时占用都不会满。一般单通道 ddr5 用 1.5B 小模型每秒钟可以出 5 个词。使用 gpu 也是,都是卡在显存带宽上,一般看快慢就是看显存带宽。3090 和 4090 显存带宽差不多,所以吐词的速度差不多。

    大模型一般来讲至少要到 30B 以上才有应用价值,一般模型用 4bit 量化以上就可以了。30B 的 4bit 量化大概就是 30x0.65=19G 上下,需要有 20 多的内存装进去。这个也基本上是 cpu 的极限了。快的 4 通道内存大概估计也会有个 10 个词每秒上下吧。

    开源的不差的,但是至少要到 70B 以上的模型,qwen2 72B,llama 3.1 70B 对普通来讲就够用了。llama 3.1 405B 和 chatgpt4 感觉差不多,前者可能还稍好一点。这个可能就是要买贵点的显卡组一下了。同样的也是受限于显存带宽,慢的要命。

    校验提示文案

    提交
    跑70B显卡得64G显存,内存64G,对U要求反而不高

    校验提示文案

    提交
    收起所有回复
  • 确实不行,Output generated in 37.82 seconds (0.32 tokens/s, 12 tokens, context 62, seed 1288769737)
    Llama.generate: prefix-match hit
    Output generated in 19.63 seconds (2.55 tokens/s, 50 tokens, context 81, seed 872981281)
    Llama.generate: prefix-match hit
    Output generated in 10.40 seconds (2.88 tokens/s, 30 tokens, context 81, seed 1402303897)

    校验提示文案

    提交
  • 这软文不行 卡成ppt 毫无意义

    校验提示文案

    提交
    这是文字大模型,怎么个卡成ppt法 [倒地]

    校验提示文案

    提交
    咋不是ppt 回复速度慢的一批

    校验提示文案

    提交
    还有2条回复
    收起所有回复
  • 为何要为难cpu,并且还是nas u [皱眉]

    校验提示文案

    提交
    花钱买来就是干活的 [高兴]

    校验提示文案

    提交
    收起所有回复
  • 这种开源llm没有使用价值

    校验提示文案

    提交
    6,你做个有价值的 [吐血]

    校验提示文案

    提交
    唉,,,

    校验提示文案

    提交
    收起所有回复
  • 毫无意义的文章。nas根本提供不了跑llm需要的算力。

    校验提示文案

    提交
    你才没意思,没见我写的是windows nas专属,电脑也能跑?你眼里只有那些低性能的nas是吧

    校验提示文案

    提交
    没有gpu加持,高性能电脑跑起来都很慢。我用64核心server部署过性能还不如一块2080。你这些就呵呵呵。

    校验提示文案

    提交
    还有1条回复
    收起所有回复
  • 模型选大一点nas很难跑动,直接部署在主力机上吧

    校验提示文案

    提交
    嗯,中高配置windows nas适合跑

    校验提示文案

    提交
    看了看自己n5105的nas,还是别为难它了 [喜极而泣] [喜极而泣]

    校验提示文案

    提交
    收起所有回复
  • 怎么训练呢

    校验提示文案

    提交
    训练属进阶操作了,可以去b站看看视频

    校验提示文案

    提交
    收起所有回复
  • 求下载链接

    校验提示文案

    提交
    置顶帖有

    校验提示文案

    提交
    收起所有回复
  • 没有外网接口的纯局域网能运行吗?和有互联网的有区别吗?

    校验提示文案

    提交
    不需要任何网络,联网那种是在他的服务器运行

    校验提示文案

    提交
    收起所有回复
  • 求教这怎么搞?! [喜极而泣]

    校验提示文案

    提交
    没遇到过,看提醒好像是目录问题?

    校验提示文案

    提交
    解压后整个文件夹放到D盘根目录了。 [大囧]

    校验提示文案

    提交
    还有2条回复
    收起所有回复
  • 我就用套壳的,美观还方便

    校验提示文案

    提交
    所以你上次说你那个ai让它写点代码都写不出来

    校验提示文案

    提交
    收起所有回复
  • 有机会试一下

    校验提示文案

    提交
  • ollama3,32g内存,跑超大的模型会卡住,只能跑一些小规模的。

    校验提示文案

    提交
  • 这配置还可以,不知道系统用起来怎么样?

    校验提示文案

    提交
  • 没有价值 玩具

    校验提示文案

    提交
  • 范老师说跑本地大模型要32G

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
257
扫一下,分享更方便,购买更轻松