5台Mac mini4集群跑大模型!性能逆天,才200W

2024-12-01 12:54:59 102点赞 381收藏 136评论

在机器学习模型的运行中,任务的并行处理能力至关重要。传统的中央处理器(CPU)在处理并行任务方面效率较低,因此在CPU上运行模型速度较慢。相比之下,图形处理器(GPU)擅长并行处理,因此被广泛用于加速机器学习任务。

然而,专用的高性能GPU,如NVIDIA的RTX 4090,虽然性能强大,但价格昂贵且功耗高。这促使消费者寻找更具成本效益的替代方案。苹果的Apple Silicon架构,如M3系列芯片,提供了强大的性能和能效,成为在家中运行本地大型语言模型(LLM)的可行选择。

值得注意的是,Apple Silicon的统一内存架构(Unified Memory)允许CPU和GPU共享内存资源。例如,配备64GB统一内存的Mac Mini,提供的内存容量远超许多高端GPU,如RTX 4090的24GB显存。这使得Apple Silicon设备能够处理更大的模型,而无需昂贵的专业硬件

为了进一步优化Apple Silicon设备上的机器学习性能,苹果推出了MLX框架。该框架专为Apple Silicon设计,利用其统一内存架构和硬件特性,提供类似于NVIDIA CUDA的功能。在某些基准测试中,MLX在Apple Silicon设备上的表现优于其他框架,如PyTorch。

此外,项目EXO允许用户将多台设备(如iPhoneiPad、Android、Mac等)整合成一个强大的AI集群。通过动态模型分区和自动设备发现,EXO能够在家用设备上运行大型AI模型,降低对昂贵GPU的依赖。

5台Mac mini4集群跑大模型!性能逆天,才200W

单机性能测试

1. 基础版M4 Mac Mini

小模型(1B参数,Llama 3.21B):约 73 tokens/秒,表现不错。

中型模型(Quen 2.5 Coder 7B):约 21 tokens/秒

大型模型(32B):约 8 tokens/秒,速度明显下降。

2. M4 Pro Mac Mini

小模型(1B参数,Llama 3.21B):约 100 tokens/秒,优于基础版M4。

中型模型(Quen 2.5 Coder 7B):约 16 tokens/秒

大型模型(32B):约 12 tokens/秒

分布式集群性能测试

1. 两台基础版M4 Mac Mini(通过Thunderbolt连接):

小模型(1B参数,Llama 3.21B)

未优化连接:约 45 tokens/秒(比单机更差,受通信开销影响)。

优化连接:约 95 tokens/秒,速度明显提升。

2. 五台设备的集群(两台M4 Pro + 三台M4)

小模型(1B参数,Llama 3.21B):约 74 tokens/秒,与单机相近,集群未显著提升性能。

中型模型(Quen 2.5 Coder 7B):约 12-16 tokens/秒

大型模型(32B):约 16 tokens/秒,运行变慢但能支持更大模型。

功耗

1. 单台设备功耗

基础版M4:约 50W

M4 Pro:约 87W

2. 五台设备集群功耗

总功耗约 200W,比高端GPU方案(如RTX 4090)低得多。

总结的成绩与结论

1. 小模型:单台M4 Pro性能优于两台基础版M4。

2. 大模型支持:分布式集群可以运行更大模型(如32B和70B),但通信开销导致速度未显著提高。

3. 功耗与成本优势

与RTX 4090相比,Apple Silicon设备具有更低的功耗和初始成本。

在家运行小模型,Apple Silicon设备是高性价比选择。

最终结论是,单台高性能设备(如M4 Pro或更高配置的MacBook Pro)可能更适合普通用户,而分布式集群技术虽然有潜力,但在当前阶段实际效益有限。

展开 收起
136评论

  • 精彩
  • 最新
  • 如果一直跑,普通家庭功耗还真是瓶颈,必定我4090跑模型训练,一个月跑了2000块电费也有过。

    校验提示文案

    提交
    电脑放到公司 [害羞]

    校验提示文案

    提交
    问题是,公司电费也是我交啊,商电还更贵

    校验提示文案

    提交
    还有28条回复
    收起所有回复
  • 同样32B也就10来token,直接一台配置拉满的m4 pro mini功效比较高,才不到100w,价格跟5台base mini差不多,还省位置。结论:mini不适合跑大型模型 [皱眉]

    校验提示文案

    提交
    100万?

    校验提示文案

    提交
    100瓦…

    校验提示文案

    提交
    还有4条回复
    收起所有回复
  • 用 mac 跑大模型,最大的问题是当 prompt 长度很长的时候,它的处理时间会非常长,比如我用 mac studio 2 192g 顶配版, 所花时间几乎是 3090 的 6 到 10 倍, 输出 token 时会好些,不过也比 3090 慢 1 倍。

    校验提示文案

    提交
    你是说first tokens时间比较长?

    校验提示文案

    提交
    收起所有回复
  • 不懂,关键如何高效的联机……

    校验提示文案

    提交
    都有雷电5

    校验提示文案

    提交
    是啊,如何连接没有说明啊。。
    而且多台设备,要用菊花链连接吗?

    校验提示文案

    提交
    收起所有回复
  • 中型模型,m4 pro 比如 m4 ?

    校验提示文案

    提交
    差别不大,如果真的LLM还是建议m4max

    校验提示文案

    提交
    明年就出ultra了 [邪恶]

    校验提示文案

    提交
    收起所有回复
  • 马斯克的Gork免费了。

    校验提示文案

    提交
    啥意思

    校验提示文案

    提交
    然后呢,这种部署本地的一般都是有针对性的

    校验提示文案

    提交
    收起所有回复
  • 问一嘴,你们自己搭建大模型主要用来干啥?线上大模型不能满足要求吗

    校验提示文案

    提交
    肯定是垂直领域的,需要自己整合。线上的更贵

    校验提示文案

    提交
    主要是数据保密性

    校验提示文案

    提交
    还有2条回复
    收起所有回复
  • m系列能耗比真nb

    校验提示文案

    提交
  • 苹果跑ai这么厉害,明年川普怕是得禁止mac出口了。

    校验提示文案

    提交
  • 限制太多,价格不低,还是玩魔改2080ti吧

    校验提示文案

    提交
    2080每秒多少个token?

    校验提示文案

    提交
    双卡跑qwen2.5-coder-32b-instruct-gguf或者类似规格的模型每秒10token左右,显卡利用率不高,想来是双卡通信拖累了性能,作为对比,单4090可以跑到接近30token(bpw不同,不过bpw对速度似乎影响不大)

    校验提示文案

    提交
    还有4条回复
    收起所有回复
  • 还以为是200万 结果是200瓦

    校验提示文案

    提交
  • 比用专业的卡便宜多了

    校验提示文案

    提交
  • 我像知道花这么多钱跑大模型是怎么赚钱的

    校验提示文案

    提交
    人赚不到认知以外的钱,咱们只有羡慕的份

    校验提示文案

    提交
    我朋友他们公司有这个需求,第三方公司收费50w……

    校验提示文案

    提交
    收起所有回复
  • 没说怎么连,这个好像是外网做了一个测试

    校验提示文案

    提交
  • [傻笑] 出二手喊我

    校验提示文案

    提交
    哈哈哈,我也想要

    校验提示文案

    提交
    收起所有回复
  • 所有模型都可以吗?

    校验提示文案

    提交
    是,也不是。 苹果有自己运行框架,大部分开源模型都是基于N卡生成,因此要想在苹果上用,需要下载苹果上的量化模型,有些大模型会官方提供苹果版本,如果没有需要自己转换或看第三方提供的。

    校验提示文案

    提交
    好的

    校验提示文案

    提交
    还有1条回复
    收起所有回复
  • 满大街都是免费的claude sonnet,o1 preview,我要你这qwen,llama有何用?还要自己搭进去电费设备,就算跑的起来也不是一个层次的东西 [皱眉]

    校验提示文案

    提交
    当然是收割投资人和客户了 [邪恶]

    校验提示文案

    提交
    2018那几年搞区块链,政府拨钱,我们这里开洗脚城老板都投资成立区块链公司,开了半年,做了一个没有人用的app,赚了几百万补贴直接倒闭。这一波大模型堪比上次的区块链

    校验提示文案

    提交
    收起所有回复
  • Macmini来晚了,早几年矿老板让你们都抢不到

    校验提示文案

    提交
  • 等m4 ultra

    校验提示文案

    提交
  • 问题在于五台价格也不少了,考虑到一台64G高配要3W多,价格也不便宜

    校验提示文案

    提交
    干这种事儿,不是价格为唯一标准了,至少从算力上来说,m4 mini的集群在同价位上要强很多

    校验提示文案

    提交
    你们拿算力用来干嘛

    校验提示文案

    提交
    还有4条回复
    收起所有回复
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
381
扫一下,分享更方便,购买更轻松