机械革命无界14X(R7-8845HS/Radeon 780M)上运行大模型。

2024-09-14 16:05:20 9点赞 73收藏 32评论

前几天趁着以旧换的补贴搞一台机械革命无界14X,之前买过一台众颜火影U4,7840HS,U4和8845HS一样都是Radeon 780m的GPU,之前就在那台机器上折腾到一半后来没时间,刚好无界14X到手就接着折腾。

AMD现在在AI方面有很多技术,啥子iGPU,APU,NPU眼花缭乱,框架就又是有好几种。
像是这个RyzenAI框架,
https://ryzenai.docs.amd.com
https://github.com/amd/RyzenAI-SW

还有图形框架Vulkan
https://www.vulkan.org/
https://www.amd.com/en/products/graphics/ecosystems/vulkan.html

对于不想折腾的人就直接下载一个LM Studio就可以直接运行,LM Studio采用了Vulkan框架结

https://lmstudio.ai/ryzenai

机械革命无界14X(R7-8845HS/Radeon 780M)上运行大模型。

下载好模型记得在模型设置上把GPU带上就可以了

机械革命无界14X(R7-8845HS/Radeon 780M)上运行大模型。

但是不知道为什么速度不是特别理想,在Qwen2 7B模型下只有10+token/s

机械革命无界14X(R7-8845HS/Radeon 780M)上运行大模型。

于是想换成Ollama的ROCm方式看看效果会不会好一点。

由于Ollama没有支持780mGPU的gfx1103的版本库,所以采用了第三方的https://github.com/likelovewant/ollama-for-amd/

根据Wiki介绍以为直接下载就好了但是加载模型时候会报错,作者没有说明需要安装VC运行环境库。

time=2024-09-13T15:05:04.820+08:00 level=ERROR source=sched.go:456 msg="error loading llama server" error="llama runnerprocess has terminated: exit status 0xc0000005"

这个问题搞了半天,因为是依赖ROCm所以又把HIP安装了不同的版本 (https://www.amd.com/en/developer/resources/rocm-hub/hip-sdk.html)。又认为是驱动不行,又更新驱动,搞半天都不行。

后来单独运行这行命令能够成功,那就明确了不是HIP和驱动的问题。
ollama-windows-amd64_for_amdlibollamarunnersrocm_v6.1ollama_llama_server.exe --model C:Usersxxx.ollamamodelsblobssha256-8de95da68dc485c0889c205384c24642f83ca18d089559c977ffc6a3972a71a8 --ctx-size 8192 --batch-size 512 --embedding --log-disable --n-gpu-layers 25 --parallel 4 --port 55978

最后把整个ollama-windows-amd64_for_amdlibollama目录下的vc环境文件拷贝到ROCm_v6.1的目录下,就可以运行了。之前在众颜火影U4能顺利运行的原因应该是安装过别的软件时顺带安装了VC运行环境。

首先启动ollama服务器 .ollama.exe serve

机械革命无界14X(R7-8845HS/Radeon 780M)上运行大模型。

然后再开一个窗口启动加载模型 .ollama.exe run qwen2:7b 等待Send a message提示出来就可以输入Prompt了。

机械革命无界14X(R7-8845HS/Radeon 780M)上运行大模型。

当然也可以采用别代UI的App 比如 https://chatboxai.app/ 简单设置好本地的ollama服务器地址就可以使用了

机械革命无界14X(R7-8845HS/Radeon 780M)上运行大模型。机械革命无界14X(R7-8845HS/Radeon 780M)上运行大模型。

这样两种方法都可以运行了,还没有来得及比较是LM Studio采用的Vulkan框架速度快?还是Ollama采用的ROCm框架?但是我自己比较喜欢Ollama轻量一些所以肉眼看上去速度更快一些,并且下载模型速度快也不需要挂梯子,并且LM Studio下载模型还需要用Hugingface的镜像站hf-mirror.com


作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
32评论

  • 精彩
  • 最新
  • 请教一下“最后把整个ollama-windows-amd64_for_amdlibollama目录下的vc环境文件拷贝到ROCm_v6.1的目录下,就可以运行了。”这里的ollama和ROCm_v6.1的文件夹路径能告诉一下吗,卡在这一步,尝试了几遍没成功。

    校验提示文案

    提交
    才看到信息,现在最新的包都不行吗?

    校验提示文案

    提交
    收起所有回复
  • 您的 AMD 780M iGPU 使用定制版 Ollama (ROCm 6.4) 运行 DeepSeek-V2 Lite 8B 模型的实际生成速度约为 12.48 Tokens/秒。 机械师8745i830

    校验提示文案

    提交
    已经很好了

    校验提示文案

    提交
    收起所有回复
  • 轻薄本那个散热,还是放过它吧

    校验提示文案

    提交
    适当玩玩还行

    校验提示文案

    提交
    收起所有回复
  • 这跟笔记本有啥关系?都是远程资源跑模型

    校验提示文案

    提交
    这个模型放本地跑的

    校验提示文案

    提交
    收起所有回复
  • 大佬,如果用带独显的笔记本跑这个是不是要好很多,这个跑在本地的和联网的gpt4o那些区别大吗

    校验提示文案

    提交
    本地可以跑很多模型,最新的Llama3.1 70B不比ChatGPT 4o差,当然具体要看在什么方面。

    校验提示文案

    提交
    收起所有回复
  • 为什么不用N卡笔记本电脑呢?笔记本显卡都8g有点不够意思。

    校验提示文案

    提交
    因为这个便宜,以后有需要可以升32G,挪16G给显存。

    校验提示文案

    提交
    应该不行,bios显存是有限制的。6800就是只能8g

    校验提示文案

    提交
    还有9条回复
    收起所有回复
  • 大佬,可以出个视频教一下吗

    校验提示文案

    提交
    先凑合看吧,有啥问题来问我,录视频好麻烦

    校验提示文案

    提交
    摸索了一下午配好了,端侧的模型能力有点弱

    校验提示文案

    提交
    还有1条回复
    收起所有回复
  • 笔记本质量怎么样,稳定性,散热?

    校验提示文案

    提交
    才到手还没怎么好好试

    校验提示文案

    提交
    收起所有回复
  • 我晕,以为打开了知乎或者csdn

    校验提示文案

    提交
    都是一回事哈哈哈

    校验提示文案

    提交
    收起所有回复
  • 你好,请问你速度有变快吗,我设置之前是11tok/s,设置完了是12-13tok/s,基本没变化。

    校验提示文案

    提交
    有变化,能到15-20左右

    校验提示文案

    提交
    收起所有回复
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
挂件

迪云

Ta还没有介绍自己

关注 打赏
最新文章 热门文章
73
扫一下,分享更方便,购买更轻松