张大妈

Hugging Face正式收购llama.cpp团队,打通开源大模型本地部署全链路

源自7位全网作者

04-28 14:00

精选参考来源

1
失衡的乌托邦:Meta的开源AI路线是如何遭遇滑铁卢的【硅谷101】
2
在线使用和部署大语言模型(LLM)经常面临硬件资源限制,不同模型对CPU、RAM、GPU的需求差别巨大,挑选合适模型既费时又费力。有个超实用的开源工具——llmfit(GitHub:github.com/AlexsJones/llmfit),能自动检测你电脑的CPU、内存和GPU配置,结合模型参数和量化信息,智能评估数百款主流模型(Meta Llama、Mistral、Qwen、DeepSeek、Llama.cpp等)在你本地硬件上的运行适配度、速度和质量,帮你快速找到最适合你机器的模型。主要功能:- 自动硬件检测(支持多GPU,NVIDIA、AMD、Intel Arc、Apple Silicon等)- 模型Fit评分,覆盖质量、速度、内存匹配度和上下文长度四维度综合评估- 支持多量化策略自动选择,以找到最高质量的量化模型- 交互式终端UI和经典CLI,操作简单直观- 计划模式估算不同模型配置对硬件需求,方便硬件升级规划- 支持本地多种运行时集成,如Ollama、llama.cpp和MLX- 多平台支持:Linux、macOS(Intel/Apple Silicon)、Windows安装方便,macOS/Linux一条命令即可启用,也支持通过cargo源码构建。内置了超过200款模型数据库,且支持自动更新。无论是AI研究者,开发者,还是AI爱好者,都能用它一键找到真正适合自己电脑的模型,极大提升体验。强烈推荐!#AI创造营##人工智能#
全部
来源
内容由AI生成

精选参考来源

1. 失衡的乌托邦:Meta的开源AI路线是如何遭遇滑铁卢的【硅谷101】

2. 在线使用和部署大语言模型(LLM)经常面临硬件资源限制,不同模型对CPU、RAM、GPU的需求差别巨大,挑选合适模型既费时又费力。有个超实用的开源工具——llmfit(GitHub:github.com/AlexsJones/llmfit),能自动检测你电脑的CPU、内存和GPU配置,结合模型参数和量化信息,智能评估数百款主流模型(Meta Llama、Mistral、Qwen、DeepSeek、Llama.cpp等)在你本地硬件上的运行适配度、速度和质量,帮你快速找到最适合你机器的模型。主要功能:- 自动硬件检测(支持多GPU,NVIDIA、AMD、Intel Arc、Apple Silicon等)- 模型Fit评分,覆盖质量、速度、内存匹配度和上下文长度四维度综合评估- 支持多量化策略自动选择,以找到最高质量的量化模型- 交互式终端UI和经典CLI,操作简单直观- 计划模式估算不同模型配置对硬件需求,方便硬件升级规划- 支持本地多种运行时集成,如Ollama、llama.cpp和MLX- 多平台支持:Linux、macOS(Intel/Apple Silicon)、Windows安装方便,macOS/Linux一条命令即可启用,也支持通过cargo源码构建。内置了超过200款模型数据库,且支持自动更新。无论是AI研究者,开发者,还是AI爱好者,都能用它一键找到真正适合自己电脑的模型,极大提升体验。强烈推荐!#AI创造营##人工智能#

3. 【跑本地模型,换个工具性能提升30%】快速导读:一篇在技术圈引起热议的帖子,揭示了一个普遍的误解:很多人以为自己电脑跑本地大模型卡顿是硬件不行,但大量一线玩家的真实经验是,仅仅把启动器从流行的Ollama换成更底层的llama.cpp,性能就能白拿30%以上的提升。你以为的硬件瓶颈,很可能只是工具瓶颈。---一个用户说,他起初用Ollama跑模型,体验很差,让他一度确信“我的电脑根本带不动更大的模型”——直到他换用llama.cpp,发现性能暴涨,原来电脑完全跑得动。这几乎是每个折腾本地模型的玩家都会经历的“旅程”。你以为在自己的MacBook或Windows笔记本上跑个9B(90亿参数)的模型,速度慢、响应迟钝是正常的,毕竟硬件有限。其实,一个正在被越来越多资深玩家确认的事实是:Ollama为了提供极致的便利性,牺牲了部分性能。它像一个精装修的样板间,拎包入住,但承重墙不是最优的。而llama.cpp是那个毛坯房,需要自己动手,却能挖出硬件的全部潜力。讨论中,不止一位用户报告,从Ollama切换到llama.cpp后,同一个模型、同一台机器,性能直接提升了30%。这个差异的背后,是封装带来的开销。Ollama本质上是在llama.cpp外面套了一层壳,负责模型管理、API服务等。这层“中间商”在带来便利的同时,也吃掉了性能。对于那些只想快速体验的用户,Ollama依然是最佳选择。但如果你开始严肃地将本地模型用于实际工作流——比如像原帖作者那样,用它来驱动一个自动化Agent系统处理文件、调用工具——那30%的性能就不是小事了。它决定了你的Agent是“可用”还是“好用”。一个有趣的现象是,许多人正是在Ollama上碰壁,才最终转向llama.cpp,并惊讶地发现自己的机器原来这么能打。所以,如果你也觉得自己的电脑跑本地模型力不从心,甚至因此放弃了尝试更大、更强的模型。不妨先问自己一个问题:限制你的,真的是那块显卡或那点内存吗?还是那个你以为最方便的工具?---简评:这再次验证了一个反直觉的道理:在任何前沿领域,最流行、最易上手的工具,往往不是性能最好的那个。它为你降低了入门门槛,但也悄悄给你设置了认知天花板。真正的“信息差”优势,往往藏在那些需要你多折腾一步的选项里。---ref: www.reddit.com/r/LocalLLaMA/comments/1rll349/ran_qwen_35_9b_on_m1_pro_16gb_as_an_actual_agent#AI创造营##人工智能#

4. 前面讲的用 6G 显存的 GTX 1660 Ti 跑 Qwen3.5-35B-A3B-Q4_K_M.gguf 速度能达到 21 t/s ~ 25 t/s 的这个实验(网页链接),有人问是不是用这个机器跑别的模型也可以。首先,并不能因为 35B 的 Qwen3.5-35B-A3B 在这个机器上能跑,所以认为 27B 的 Qwen3.5-27B 肯定也可以。实际上即使 Qwen3.5-9B 跑起来也很慢,只有 6 t/s。这主要是因为 Qwen3.5-35B-A3B 是 MoE 模型,激活参数只有 3B。也就是说,对显存较小机器来说,Qwen3.5-35B-A3B 是 Qwen3.5 系列中最适合的。另外,总参数 30B 激活参数 3B 的 GLM-4.7-Flash-Q4_K_M 也量化到 Q4,同样用 llama.cpp 在这台机器上的速度大约 13 t/s。Qwen3.5 的速度更快可能和它用了混合注意力设计、软件优化更好等因素等有关。所以,不仅在 Qwen3.5 系列中,而是在当前所有模型中,Qwen3.5-35B-A3B 可能都是小显存机器跑大模型的最优解。如果你有类似硬件,想体验一下,但对技术了解不多,可以参考下面的最简化尝试步骤(假设你的操作系统是 Windows):1、下载 llama.cppgithub.com/ggml-org/llama.cpp/releases/download/b8352/llama-b8352-bin-win-cuda-12.4-x64.zipgithub.com/ggml-org/llama.cpp/releases/download/b8352/cudart-llama-bin-win-cuda-12.4-x64.zip把两个压缩包解开,文件放进同一个目录。假设该目录名字是 llama。2、下载 Qwen3.5-35B-A3B-Q4_K_M.ggufhuggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF/resolve/main/Qwen3.5-35B-A3B-Q4_K_M.gguf?download=true建议存放在固态硬盘而不是机械硬盘上,这会直接影响接下来加载模型的速度。3、在命令行执行 llama 目录中的 llama-cli:llama-cli -m Qwen3.5-35B-A3B-Q4_K_M.gguf

5. Hugging Face收购Llama.cpp,弥补推理短板

6. 本地AI大事件

7. 神级项目llama.cpp,今天被Hugging Face收编了

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章