真武M890如何降低AI推理的算力成本?

源自102位全网作者

05-22 11:18

精选参考来源

1
黄仁勋喊出“推理拐点”,边缘推理的机会窗口打开了吗
2
很多人还是忽视了 Deepseek 对国产算力卡的巨大拉动作用Deepseek 这家公司对我们真的是国运级,而且连续带来了两次国运级突破!第一次是 R1,告诉全世界:中国人即使算力受限,也可以做出顶级的世界大模型直接破解了美国企图力大飞砖,利用算力限制,在 AI 上卡死我们的想法第二次就是 V4,在计算成本上把国产 AI 卡,特别是昇腾 950,带得飞起来Deepseek V4 训练是离不开 NVIDIA 计算卡的,这点我们必须要承认但是晟腾 950 已经部分参与到了V4的训练,并且可以100%承接推理的需求,这一点特别关键一个大模型的训练当然要消耗很多的算力,但是之前囤积的计算卡,还远没有到捉襟见肘的地步现在大家都已经开始 AI 实用化,拼的就是你能用多低的成本给用户提供多大规模的服务这里面有两个关键,成本要低,服务承载量要大成本低靠的是什么呢?靠的是 Deepseek V4 原生的 FP4 能力,就是把推理精度降下去,换取更高的算力比如原来有一张卡,它的 FP16 算力只有 500T;那么在理论上把精度降低到 FP8,算力可以直接蹦到 1000T;如果更狠一点,把精度降到 FP4,那么算力甚至可以蹦到 2000T!那大家之前为什么不做呢?因为降精度很有可能把模型干崩了训练的时候容易崩溃,导致几百万、几千万美金的成本直接打水漂;推理的时候,也就是给用户服务的时候,更加容易出现幻觉等不稳定的毛病,也会崩溃之前整个行业一般做到 FP8 就不敢再动了,再动就会严重影响整个训练和推理的体验只有一些开源的 AI 模型网站上,为了在PC这种小算力平台上部署,大家才会用 FP4 或者 INT4 做量化Deepseek V4 这次比较狠的地方,就是原生的 FP4 推理,非常好的控制了训练和推理过程的质量在精度暴跌的情况之下,依然可以非常精准的控制模型,这是真正的 AI 屠龙术而偏偏美国这次想卖的 H200,它的架构原生是不支持 FP4 的(要到下一代B300芯片才支持)并不是说不能运行,模型一样可以跑,只不过必须要反转到 FP8 模式,这就导致H200 跑模型推理的时候,用 FP4 毫无性能增益但是昇腾 950 却因为支持FP4,运行 V4 的时候可以凭空多出一倍的算力这就导致我国对于 H200 的需求量大大减低:训练的时候,我们确实还离不开 NV但是训练算力现在已经不是大头,Deepseek 都可以靠库存的 N 卡训练出一个 V4;其他家要是训不出来,那纯粹是水平问题现在最重要的是推理,是如何让 AI 来服务更多的用户,不要人用多了就卡死了既然在推理端,Deepseek V4这样的大模型可以用昇腾 950 干出一个吓死所有人的低价,那你买 H200 回来不就等于是赔钱吗?所以不买 H200 并不是一个强硬的政治主张,是有背后极其现实的经济利益以前离不开你,是因为你太强了,国产芯片完全没法用现在我用国产芯片反而推理成本更便宜,Token 单价轻松砍掉 80%,那我还买个锤子?
全部
来源
内容由AI生成

精选参考来源

1. 黄仁勋喊出“推理拐点”,边缘推理的机会窗口打开了吗

2. 很多人还是忽视了 Deepseek 对国产算力卡的巨大拉动作用Deepseek 这家公司对我们真的是国运级,而且连续带来了两次国运级突破!第一次是 R1,告诉全世界:中国人即使算力受限,也可以做出顶级的世界大模型直接破解了美国企图力大飞砖,利用算力限制,在 AI 上卡死我们的想法第二次就是 V4,在计算成本上把国产 AI 卡,特别是昇腾 950,带得飞起来Deepseek V4 训练是离不开 NVIDIA 计算卡的,这点我们必须要承认但是晟腾 950 已经部分参与到了V4的训练,并且可以100%承接推理的需求,这一点特别关键一个大模型的训练当然要消耗很多的算力,但是之前囤积的计算卡,还远没有到捉襟见肘的地步现在大家都已经开始 AI 实用化,拼的就是你能用多低的成本给用户提供多大规模的服务这里面有两个关键,成本要低,服务承载量要大成本低靠的是什么呢?靠的是 Deepseek V4 原生的 FP4 能力,就是把推理精度降下去,换取更高的算力比如原来有一张卡,它的 FP16 算力只有 500T;那么在理论上把精度降低到 FP8,算力可以直接蹦到 1000T;如果更狠一点,把精度降到 FP4,那么算力甚至可以蹦到 2000T!那大家之前为什么不做呢?因为降精度很有可能把模型干崩了训练的时候容易崩溃,导致几百万、几千万美金的成本直接打水漂;推理的时候,也就是给用户服务的时候,更加容易出现幻觉等不稳定的毛病,也会崩溃之前整个行业一般做到 FP8 就不敢再动了,再动就会严重影响整个训练和推理的体验只有一些开源的 AI 模型网站上,为了在PC这种小算力平台上部署,大家才会用 FP4 或者 INT4 做量化Deepseek V4 这次比较狠的地方,就是原生的 FP4 推理,非常好的控制了训练和推理过程的质量在精度暴跌的情况之下,依然可以非常精准的控制模型,这是真正的 AI 屠龙术而偏偏美国这次想卖的 H200,它的架构原生是不支持 FP4 的(要到下一代B300芯片才支持)并不是说不能运行,模型一样可以跑,只不过必须要反转到 FP8 模式,这就导致H200 跑模型推理的时候,用 FP4 毫无性能增益但是昇腾 950 却因为支持FP4,运行 V4 的时候可以凭空多出一倍的算力这就导致我国对于 H200 的需求量大大减低:训练的时候,我们确实还离不开 NV但是训练算力现在已经不是大头,Deepseek 都可以靠库存的 N 卡训练出一个 V4;其他家要是训不出来,那纯粹是水平问题现在最重要的是推理,是如何让 AI 来服务更多的用户,不要人用多了就卡死了既然在推理端,Deepseek V4这样的大模型可以用昇腾 950 干出一个吓死所有人的低价,那你买 H200 回来不就等于是赔钱吗?所以不买 H200 并不是一个强硬的政治主张,是有背后极其现实的经济利益以前离不开你,是因为你太强了,国产芯片完全没法用现在我用国产芯片反而推理成本更便宜,Token 单价轻松砍掉 80%,那我还买个锤子?

3. AI大神的焦虑:自己是研究工作的瓶颈,Token用得不够多#AI #人工智能 #卡帕西 #Agent #算力

4. #千问Qwen3.5大模型发布#千问 Qwen3.5 是采用极致稀疏 MoE 架构在保持超强性能的同时,显存占用降低 60%,推理效率大幅提升,部署成本显著下降。模型支持最高 256K 超长上下文,让长文本处理变的更加的轻松有效率了!原生多模态统一也是Qwen3.5的特点之一,也是目前国内外大模型的发展的主要趋势,模型在图文、视频理解能力全面升级,精准解析图表、文档与复杂视觉内容。实现了一个入口实现多种属性。Qwen3.5对于中小企业特别友好, 很大程度上降低了企业运营成本,可以让中小企业得到高效、普惠、全能的运营工具。不再因为高昂的费用而排斥企业去追逐AI。#过个有AI年##HOW I AI#

5. 狙击推理时代!英伟达200亿美元收购Groq,能否巩固AI帝国护城河?

6. 当海外开发者还在为Gemini3 Flash惊叹时,小米开源大模型MiMo-V2-Flash横空出世,直接被老外吹成“Gemini平替”!它以309B参数实现2.6倍推理加速,延迟仅为DeepSeek-V3.2的一小部分,却在通用基准测试中性能相当。最让开发者疯狂的是,它不仅免费开源,推理成本还低至闭源竞品的2.5%,中国开源大模型的实力,这次真的让海外刮目相看

7. 【推理效率狂飙19倍!#千问3.5成本仅为谷歌大模型5%#】千问3.5凭什么做到成本仅为谷歌的1/18?答案是底层架构的全面革新。全新MoE架构,3970亿参数仅激活170亿,推理吞吐量最高提升19倍,部署显存降低60%。技术上的“斤斤计较”,才有了价格上的“大大方方”。#有AI的春节有什么不一样# 引力科普的微博视频

8. #阿里发布性能比肩英伟达H20的芯片#阿里推出的“真武810E”AI芯片,不仅性能强劲,还通过与云计算和大模型的结合,帮助企业降低了算力成本,直接把AI算力的门槛拉低。不用承担高额成本,也能用上顶尖算力,AI创业、转型都更轻松了

9. 今天在2026阿里云峰会上,阿里发布基于平头哥新一代AI芯片真武M890的128卡超节点服务器,搭载互联芯片ICN Switch 1.0,通信时延低至百纳秒级。国内CSP厂商做自己ASIC的不只是阿里一家,未来会有越来越多的厂商做自己的AI ASIC。

10. #DeepSeek新模型有多猛# DeepSeek V3.1发布,6850亿参数量仅激活370亿,计算成本降90%。性能超GPT-4o,中文问答准度89.3%。岚图汽车、江苏银行已应用,未来将突破多模态,推理成本再降50%。#微博声浪计划##听见微博# 凯文思考的微博音频

11. qwen3.6 确实强,已经达到上一代claude 4.5的水平,我又使用了一个opus的蒸馏版。现在用Q8量化本地生产级开完全代替了付费大模型。以我的使用量,全年节省2000美元的token成本,且不需要看anthropic的脸色还得特么科学上网。这就是我为什么可以决策买rtxpro6000的一个基本ROI核算。这张卡8000多美元,仅靠编程的token消耗,固定资产折旧就拉平成本了。且不说有了这个免费的神器以后我的本地token使用量将远远超过定额,以及各种其他模型本地AI的能力就白送了。 以往的经验看,我个人的节奏比行业快一年左右,也就是说明年中期,大部分在线烧token的中小公司都会转向本地部署AI服务器,将OPEX 费用支出转化成CAPEX 资本支出。在显卡这一块,保值率和耐用度远超一般服务器。比如rtxpro6000这张卡的折旧摊销可以拉到八年。虽然单价高,但是赚钱的。 面向中型以下企业的全套本地AI coding硬件选型规划,模型部署调优,软件开发环境配置集成,部署流水线,质量门禁控制,团队编程AI化治理,AI工程管理经验,完全可以指导企业全面向低成本可持续AI编程转型。重要的是可以实现完全离线,使大量隔离开发环境具备接近在线编程的应用能力,安全合规,成本可控。现在啥都敢往AI上甩真是无知者无畏。 硬件层级:中型企业 AI 编程服务器整机 / 硬件精准选型、算力资源配比 模型层级:蒸馏、Q8 量化、本地部署、性能调优 工程层级:开发环境集成、部署流水线、质量门禁、代码规范 管理层级:团队 AI 编程流程治理、AI 工程管理体系 合规层级:纯离线私有化部署方案,适配隔离内网开发 有人可能会问,你这套体系比原生的大型来强嘛。我可以肯定地告诉你,绝对比原生大模型强,因为两者根本不是一个维度的东西。我这是整体解决方案,原生大模型在我这里只是一个infra的能力底座,有什么资格与我相提并论?发动机再牛逼也不能自己跑。 有咨询需求的老板,可以联系。

12. 全球开发者集结上海:比起炫技,他们更想捅破那层“落地窗户纸”|甲子光年

13. 神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!

14. 花15分钟搭一套国产AI系统,把Clawdbot巨额token成本干到0

15. 5月初权威算力行业专项分析白皮书正式对外发布,精准锚定2026年全球AI算力底层赛道核心变革拐点,算力市场底层逻辑迎来根本性重构。行业重心全面脱离前期高投入、高能耗、重资本的大模型专项训练单一赛道,全域转向低成本、高适配、规模化落地的AI常态化大规模推理刚需场景。伴随全行业AI智能代理(AI Agents)加速渗透千行百业,政企端、产业端、消费端全链路落地节奏提速,企业算力采购布局逻辑同步务实调整,不再盲目扎堆重金迭代全新底座大模型,核心诉求聚焦轻量化部署、低功耗运维、高效能常态化推理落地,压降算力综合使用成本、提升模型全域适配效率成为核心考核指标。产能端供给侧突发结构性失衡,韩国两大头部半导体巨头集中倾斜核心晶圆产能,全力保障AI算力配套高带宽内存(HBM)订单交付,直接挤压通用存储产能空间,导致民用级普通DRAM内存、NAND固态闪存现货供给持续偏紧,供需错配直接拉动5月初全球服务器专用内存现货价格短期异动上行,全链路硬件配套成本小幅波动。供需倒逼产业链快速迭代补位,英伟达、华为等全球头部核心芯片厂商快速响应市场刚需,敲定2026年二季度集中投产上新计划,专项推出深度适配推理场景、功耗优化拉满、并发算力强化的新一代定制化算力架构,精准承接全域推理算力缺口,稳住全产业链算力供给底盘。

16. 不买会员,一期学会轻薄本跑大模型!

17. 给大家说一个新东西:HBF(High Bandwidth Flash,高带宽闪存)。这东西为什么冒出来?一句话——推理太贵了。现在做 AI 的都知道,HBM 是标配。比如 NVIDIA 的 H100、B200 这一类卡,核心旁边堆着 HBM,带宽极高,专门解决“内存喂不饱算力”的问题。没有它,大模型根本跑不动。但问题也很明显:HBM 贵,而且容量上不去。你想在一台机器上多跑几个模型,或者挂一个超大模型,显存很快就顶满,成本更是夸张。于是存储厂商开始推一个新方向:HBF。简单理解,就是把 3D NAND 往“更高带宽、更近封装”方向改造,试图卡在 HBM 和传统 SSD 之间,做一个中间层。现在在积极推动这个方向的,基本都是存储大厂:三星,海力士,镁光,闪迪他们的逻辑也很清晰:未来 AI 不只是训练,而是大规模推理。推理拼的是成本、功耗和容量。如果什么都靠 HBM,容量上不去,而且也来不及生产。所以市场急需一个东西——比 SSD 快很多,但比 HBM 便宜很多。HBF 就是在这个背景下被推到台前的。它不会取代 HBM。HBM 还是算力核心的“心脏”。但在超大规模推理集群、或者端侧模型场景里,确实可能成为一个缓冲层,让更多模型能“装得下、跑得起”。如果说前两年是“拼训练规模”的时代,那么现在明显进入“拼推理成本”的阶段了。这一波如果启动了,模型的推理成本可能大降,以后大家养虾自由就不是梦了。。

18. 阿里平头哥突然上线了一款AI训推一体芯片:真武810E。我看了一下总结几个点如下:1)自研并行计算架构和片间互联,自研软件栈;2)显存96G HBM2e,片间互联带宽700GB/s;阿里说这颗芯片已经用在了qwen的大模型训练和推理上面,在阿里云多个万卡集群上也有部署。从这个规格来看,这款真武810E的整体性能超过了英伟达A800和大多数国产GPU。有报道说性能甚至强于A100。难怪阿里看不上其他的国产GPU,自己做得挺好。早点分拆上市吧平头哥。

19. 用科技行业的黑话说:LLM 的护城河,本质是智商(Intelligence)。“用过了就回不去”的效应非常明显。春节砸钱推广能短暂占据非早期采用者(Late Majority),但回报短暂(聪明的模型可以迅速转移用户),且ROI 可疑(低净值用户潜在回报无法抵消聪明的模型的推理成本,RLHF 价值也可疑)。要知道 Apps 根本不同的地方在于,因为 LLM 的推理成本,用户扩张的边际成本并不是 0 。这种推广的 LTV(用户生命周期价值)> CAC(获客成本)+ 长期推理成本的公式?大概率破产。这波推广本质上是大型互联网公司在 AI 时代的一次‘路径依赖’(Path Dependence)的症状发作。。。而 Apps 时代的 “流量入口逻辑”(Traffic Entry Logic)已经过时,超大规模云端模型的逻辑是 SOTA(State of the Art),能力强就是最大的流量入口。

20. 性能提升15倍!?摩尔线程国产新显卡和AI算力本,能成么?

21. #阿里发布性能比肩英伟达H20的芯片# 阿里还真是出息了啊,真武810E要是性能真的能打到英伟达H20的水平。那可真的是国产算力的重大突破啊。这标志国产AI芯片在高端训推领域具备与国际主流产品抗衡的能力,缓解对H20等出口管制芯片的依赖。避开与CUDA生态正面竞争,走“芯云一体+成本能效+规模化部署”路线,更契合国内企业需求。虽然在显存和带宽上仍有差距,且生态成熟度上仍有不足,训练量也有明显不足。在极致密度部署场下灵活性较弱。但终究是有了重大突破。再接再厉吧!

22. 云涨 Token 涨,DeepSeek 偏降价?其他的企业集体上调 AI 算力价格,行业 Token 成本普涨之际,DeepSeek V4 却逆势降价,V4-Flash 输出价低至 2 元 / 百万 Token,仅为竞品的 1/40,上演价格反向操作,DeepSeek的底气在哪里?系统方面,DeepSeek通过稀疏注意力革命,在同样是百万 Token 场景下,推理算力需求降至前代 10%-27%,KV Cache 占用仅 7%-10%,这就让长文本成本不升反降。V4-Pro 1.6T 参数仅激活 49B,V4-Flash 284B 参数仅激活 13B,避免 全参数计算浪费,算力利用率拉满。小模型继承大模型能力,推理成本再降 50%。在硬件方面,DeepSeek 率先全栈适配华为昇腾 950,从 CUDA 迁移至 CANN 框架。国产芯片单卡推理性能为英伟达 H20 的 2.87 倍,采购成本更低。芯模协同优化,训练推理成本较海外方案降低 70%-85%,直接对冲云厂商涨价影响。市场方面,2026 年是AI智能体落地元年,Token 消耗呈指数级增长,低成本是规模化关键。DeepSeek 采用了V4-Flash 低价走量,V4-Pro 走高端市场的市场价格策略。开源吸引开发者,降低企业落地门槛,是能够快速抢占市场份额的。DeepSeek 逆势降价,是国产 AI 摆脱海外依赖、靠技术定义成本的里程碑。这场降价,本质是国产 AI 的成本革命与话语权争夺。

23. 重磅利好!新主线!阿里、腾讯上调 AI 开支预算预算,利好哪些具体?相关概念股核心有哪些?#AI算力行情##AI算力产业# 一、事件核心解读腾讯、阿里集体宣布下半年加大AI资本开支,本质是国内互联网巨头AI基建进入“加速期”,重点利好三大方向:1. 算力基建(服务器/IDC/液冷):最直接受益,巨头扩产带来硬件订单爆发2. 国产AI芯片/算力国产化:腾讯明确“更多国产芯片投入”,阿里力推平头哥生态3. 云服务与AI应用生态:巨头算力扩张后,将带动大模型、行业AI应用落地二、核心利好板块与标的1. 服务器与IDC(最直接受益)• 浪潮信息(000977):腾讯、阿里双巨头核心服务器供应商,为腾讯元宝提供超50%算力,拿下阿里新增机柜50%以上订单,液冷技术领先。• 华勤技术(603296):腾讯云战略级合作伙伴,提供NVL32架构液冷服务器,占腾讯AI服务器订单30%以上;同时适配阿里平头哥芯片服务器。• 数据港(603881):阿里云定制化IDC核心供应商,营收80%以上来自阿里,独家承建张北、河源两大智算中心,承接腾讯元宝约30%推理算力。• 奥飞数据(300738):国内IDC龙头,深度绑定阿里、腾讯数据中心项目,受益算力需求扩容。2. 液冷与电源配套(算力高密化刚需)• 英维克(002837):阿里数据中心液冷方案市占率超40%,腾讯智算中心核心温控供应商,高功率液冷适配高密度AI集群。• 科华数据(002335):腾讯数据中心液冷与微模块核心供应商,获腾讯“最佳绿色算力平台”认证,为混元模型提供算力支撑。• 中恒电气(002364):阿里HVDC电源主供商,适配平头哥AI服务器,受益数据中心电源升级。3. 国产AI芯片与算力国产化• 海光信息(688041):国产DCU芯片龙头,适配腾讯混元模型训练与推理,腾讯明确增加国产芯片使用,订单弹性大。• 寒武纪(688256):思元系列推理芯片适配阿里、腾讯大模型推理场景,与平头哥生态协同推进。• 平头哥生态伙伴:宝德计算机(002236)首批倚天服务器合作方,深度参与阿里AI服务器推广。4. 云服务与AI应用生态• 腾讯生态:金山办公(688111)WPS AI接入混元大模型、微盟集团(02013.HK)企业微信AI应用、腾讯云生态伙伴• 阿里生态:恒生电子(600570)金融AI、税友股份(603171)财税AI、冷芸科技(688309)工业AI等阿里云行业应用伙伴三、一句话总结与重点跟踪核心主线是“算力基建+国产替代”,优先关注!!#金晨 眼泪把面膜冲没了#

24. 黄仁勋可能真的开始疯狂自救了,AI算力的游戏规则变了! 对中国来说,这反而是一个窗口期。#红衣聊AI #黄仁勋 #英伟达 #芯片 #大有学问

25. 本地AI哪家强?统一内存大横评!

26. Anthropic的CFO:收入有望在2027年超越美国科技7巨头,我们是怎么做到的,我们在焦虑什么#Anthropic #AI大模型 #算力 #AGI #AI基础设施

27. #为什么AI大厂开始卖Token#Token是大模型处理信息的最小单元,其消耗与算力消耗、电力成本直接挂钩,是按效用付费的最公平口径。AI从对话工具转向Agent与企业系统,工作量呈指数级爆发,按Token计费能精准匹配算力消耗,实现成本可控。同时,价格分层加剧:轻量模型低至135元/亿Token,旗舰模型则达数万元,形成差异化竞争。Token计费将主导通用场景与标准化服务,但并非绝对唯一。对高并发、低门槛的轻量应用,Token模式效率最高;而对复杂行业定制、私有部署或长期订阅场景,包年制/包量制仍有优势。此外,随着算力成本优化与缓存技术普及,部分场景可能出现价格阶梯或免费额度,以平衡普惠与商业化。Token不仅是计费单位,更可能成为AI时代的数字货币,承载价值尺度与流通手段功能。中国凭借绿电与算力基建,正以低成本Token重塑全球AI成本结构。未来,Token计费将与混合模式并存,共同构建AI商业化的多元生态。#how i ai# 为什么ai大厂开始卖token

28. 【别搞错了,生产级AI Agent的核心根本不是AI,而是分布式系统】 快速导读:大多数人以为构建Agent就是“Prompt+工具”的循环,这是一种危险的误解。一旦涉及真实用户、高并发和容错,Agent就从一个AI问题,变成了经典的分布式系统工程问题。这解释了为什么大量Agent项目最终都只是个玩具。 --- 很多人觉得,构建AI Agent无非就是把Prompt和工具扔进一个循环里。这个假设很合理,但它根本就不是生产环境的架构。 你的Agent一旦需要知道自己在跟谁说话、需要保持状态、处理并发请求、执行敏感操作,以及在工具调用失败后幸存下来——它就不再是一个“LLM+工具”的简单组合,而蜕变成了一个不折不扣的分布式系统。 构建Agent本身是简单部分,市面上有无数框架帮你搞定。真正的难点在于“运行时”——那个包裹着Agent、让它能在真实世界里可靠工作的系统。这才是所谓的“智能体软件工程(Agentic Software Engineering)”。 构建Agent是AI工程,但在生产中运行它是软件工程。这套工程体系由六根支柱撑起:持久性、隔离性、治理、状态、扩展性和可组合性。每一个都指向经典的分布式系统难题,比如数据隔离失败就是数据泄露,而服务过载则意味着你继承了所有第三方API的速率限制和延迟。 这解释了为什么那么多Agent项目最终都像个漂亮的玩具,却无法成为可靠的产品。AI行业还没有完全吸取过去几十年我们在构建可靠分布式系统中学到的教训。 最终,能把这套软件工程的纪律内化到团队血液里的,会交付出伟大的产品。而那些继续把Agent当作脚本对待的,会继续与成功失之交臂。 --- 简评: 一针见血。AI圈的热潮让很多人忘了,再聪明的“大脑”也需要一个强壮的“身体”才能在现实世界里行动。这篇文章把焦点从算法和模型,拉回到了决定产品生死的工程纪律上。当你的Agent需要审批、回滚、保证用户数据隔离时,你面对的就不是一个AI问题,而是对你软件工程成熟度的拷问。 --- ref: x.com/ashpreetbedi/status/2028176285575594465 #AI创造营##人工智能#

29. 【硬核教程】教你搭建Mac AI集群!4台M3 Ultra,运行万亿参数大模型!

30. 反直觉:前沿模型虽然贵,但反而更好卖#AI #大模型 #芯片 #ChatGPT #Token

31. GPU利用率不到15%,AI产业最大的浪费正在被这家公司改写|甲子光年

32. #阿里发布性能比肩英伟达H20的芯片#阿里平头哥推出的真武810E芯片属于全栈自研的高端AI芯片,不仅打破了国外巨头在高端算力领域的垄断,更成为国内AI发展的重要推力。真武810E是一款训推一体的高性能AI芯片,搭载平头哥自研并行计算架构与ICN片间互联技术,单卡配备96GB HBM2e内存,片间互联带宽高达700GB/s,可灵活组建万卡级集群,性能比肩英伟达H20,超越主流国产GPU及英伟达A800,已实现规模化商用。与普通芯片不同,它兼顾AI训练与推理需求,覆盖多领域应用,且软硬件全自研,彻底摆脱对外技术依赖。国内高端AI算力依赖进口,制约了大模型研发与产业落地,而这款芯片填补了国产高端AI芯片的结构性缺口,提供了高性价比的国产化算力选择,降低了企业用算成本,同时其芯云一体模式,为AI产业提供了芯片+加云加模型的一体化解决方案,加速AI技术在各行业的落地应用。阿里芯片的突破并不意味着我国芯片已能自给自足。国内芯片产业在制造工艺、部分核心零部件等领域仍有短板,真武810E的突破是重要进展,标志着国产AI芯片跻身全球第一梯队,为国内AI发展注入强劲动力。但国产芯片的前行之路仍任重道远,但全产业链自主可控仍需长期攻坚,它是国产芯片崛起的缩影,而非终点。在主流大模型适配性上,真武810E表现突出。它已大规模应用于阿里千问大模型的训推环节,深度适配主流AI框架,提供统一编程接口,开发者无需修改代码即可实现模型迁移,同时兼容多模态模型及自动驾驶等领域的主流模型,适配性与易用性大幅提升,为大模型迭代提供了强劲算力支撑。#秒懂热点就用智搜# 阿里发布性能比肩英伟达h20的芯片

33. #阿里发布性能比肩英伟达H20的芯片# 告诉大家一个实实在在的利好消息,特别是搞开发和创业的朋友。阿里自研的真武810E芯片终于亮相了,这意味着啥,意味着以后用AI算力可能会便宜很多。据说这芯片性能直接对标英伟达H20,关键是把模型、云和芯片全打通了,没了中间商赚差价,算力成本肯定断崖式下跌。以前那些昂贵的算力现在能变成咱们人人用得起的工具,中小企业转型的门槛一下子就低了。这就叫技术普惠,这种能帮大家省钱提效的事,必须支持一下。

34. #科技先锋官# 2026年AI代理预测将成为驱动产业效率革新的核心力量,也因此被业界定义为AI代理年。企业无需专业团队即可快速部署,让AI代理高端配置变为普惠工具,企业级需求的爆发成为核心推力。数据显示,2026年全球AI代理市场规模预计达85亿美元,企业级应用覆盖将超10万家。过去AI多聚焦单一基础场景,而AI代理可自主理解目标、规划流程并执行复杂任务,在客服、销售、运维等领域大幅提升效率,这种一站式解决能力精准匹配了企业降本增效的核心诉求。随着算力租赁模式成熟与国产芯片技术突破,2026年企业AI算力成本较上年再降40%。以往中小企业因百万级训练成本望而却步,如今通过按需租用模式,算力投入门槛降至传统模式的1/10,加上动态扩缩容技术提升资源利用率,即使是中小微企业也能负担AI代理应用,为市场爆发奠定了基础。AI代理已突破早期对话局限,具备多模态交互、上下文理解与跨系统集成能力。依托检索增强生成与自主学习技术,其任务处理准确率超95%,可无缝对接企业CRM、订单系统等核心平台。MaaS模式将复杂技术封装为标准化服务。#AI创造营##AI创作热点##一分钟视频创作季# 种斌Marco的微博视频

35. 国产芯片也能跑AI视频实时生成了,商汤Seko 2.0揭秘幕后黑科技

36. deepseek是4月24日发布V4的,两个版本,flash和pro。day0能适配的芯片就是华为昇腾、寒武纪。day1宣布适配的是英伟达。除此之外,25日,day1,海光、沐曦、摩尔线程、昆仑芯、平头哥真武、天数智芯根据智源研究院的FlagOS宣布flash版本的全量适配和推理部署。flash版本是比较容易适配的,单卡小集群就能跑,对硬件要求低,所以这些AI芯片入手比较快,但是真正考验人的是pro版本的适配。越快能适配pro版本,才说明1)技术能力强;2)是deepseek的核心朋友圈(能提前抢跑)。我查了下最新的情况,目前能适配Pro的国产芯片有:海光、摩尔线程、壁仞科技。(根据官方号自己宣布的)

37. 4年烧光5000亿!「星际之门」怎么搞这么多钱,又要怎么烧光它?【柴知道】

38. 这次春节AI大战,国产模型与国产芯片第一次,双向奔赴! #春节世界观察 #新年囤点专业货 #燃起来了大国重器 #大咖观察 #红衣聊AI

39. 17000 token/s,比B200快48倍!Taalas AI 芯片能否颠覆英伟达GPU?

40. #deepseekv4要发布了吗#作为新一代旗舰模型,V4预计在代码能力、长文本理解、推理速度上全面升级,还深度优化国产算力协同,效率更高、成本更低。这次优先适配国产硬件,也意味着国产AI生态再进一步,正式版值得期待。#how i ai##过个有ai年#

41. 阿里的平头哥最新的AI芯片M890综合能力超过A100了。换句话说,跟英伟达的距离拉近到了三代以内。平头哥的路线图是M890之后,27、28两年分别发布V900和J900。估计是对标Hopper和Blackwell的产品。目前是按照2倍英伟达的产品迭代速度在追赶。只要fab跟得上,中国解决AI芯片是时间问题。

42. #微博声浪计划##听见微博# Anthropic以年化收入300亿碾压OpenAI,15个月增长30倍创纪录。其80%收入来自企业客户,变现效率为OpenAI8倍,多云架构降成本。OpenAI面临C端免费用户占比高、推理成本侵蚀利润问题。行业竞争转向企业场景,格局生变。 种斌Marco的微博音频

43. 蓝戟 Intel Arc Pro B70 TF评测:32 GB大显存,推理神卡?

44. #微博声浪计划##听见微博# 阿里真武芯片曝光,平头哥推出的真武810E采用自主架构,单卡96GB HBM2e内存,性能与英伟达H20同梯队,功耗低150W。阿里AI黄金三角实现全栈自研,规模化落地降低大模型训练成本超30%,但面临生态与供应链挑战。 乖乖Show的微博音频

45. 售价34999微星EdgeXpert小主机,AI性能干翻RTX5090D?

46. 黄仁勋最新访谈:AI时代,软件没有价值了吗?很多企业在用AI上都踩了大坑#黄仁勋 #软件 #智能体 #Openclaw #龙虾

47. 算力王冠易主! #零距离看懂财经 #2026经济风向标 #财经 #芯片

48. 谷歌论文,干崩存储?#谷歌 #存储芯片 #Google #Deepseek #AI推理

49. #国产芯片好消息不断#最近国产芯片圈真的杀疯了!先是阿里平头哥放大招,“真武M890”AI芯片刚发布,性能翻了快三倍,还亮出了到2028年的路线图,出货量已经破了56万片。华为这边更炸——任正非罕见亮相《新闻联播》,带大家第一次走进了华为的“芯片基础技术研究实验室”!这可是麒麟、昇腾、鲲鹏的源头研发阵地,从底层搞原创突破。存储这边也是双喜临门:长江存储启动上市辅导,长鑫科技恢复IPO审核。从AI算力到存储芯片,国产芯这次是真的全线突围了! 科技事儿的微博视频

50. 推理需求暴增,SRAM 如何解决 GPU 不够用的问题?

51. 最强国产移动显卡?摩尔线程 AIBOOK 测评

52. “AI弃子”CPU逆风翻盘:英特尔、AMD与ARM意料之外的一场胜利【硅谷101】

53. 微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】

54. 戴密斯:AI最大的瓶颈是算力,AI公司的差距会拉大#谷歌 #戴密斯哈萨比斯 #DeepMind #新药研发 #算力

55. DeepSeek V4直接弃用英伟达CUDA,全栈迁移华为昇腾,推理性能干翻英伟达H20近3倍,速度狂飙35倍,这是国产AI摆脱卡脖子的关键一步,巨头纷纷入局适配,国产替代集群已然成型。过去国产AI全靠英伟达生态,囤芯片看脸色,迁移成本高到离谱,利润大量外流,创新被牢牢限制。如今终于有了更多的选择,国产AI可以甩开膀子加油干了!#一分钟精选视频扶持计划##专业视频创作季##AI创造营##科技先锋官# 种斌Marco的微博视频

56. 【中国信通院正式启动DeepSeek V4国产化适配测试工作】中国信通院今天宣布,正式启动DeepSeek V4国产化适配测试,推动模型与国产软硬件深度协同、加速产业落地。本次测试依托工信部重点实验室与AISHPerf基准体系开展,覆盖芯片、服务器、一体机、集群、开发工具链、智算平台等全栈AI软硬件产品,聚焦DeepSeek V4全系列模型的推理、微调流程。评测从适配易用性、功能完备性、优化效果、性能、成本五大维度评估,并新增长序列处理、代码能力、智能体调用成功率、任务拆解等专项指标,形成立体化评测体系。DeepSeek V4发布当日已实现多家国产硬件Day-0适配,标志国产AI软硬件进入同频迭代阶段。本次测试将客观验证适配水平,强化国产算力支撑,加快构建自主可控AI生态。DeepSeek V4包含V4-Pro(旗舰版)与V4-Flash(轻量版)双版本,两大版本均原生支持100万Token超长上下文(约75万字),采用自研DSA稀疏注意力机制,百万上下文推理成本降低70%,显存占用减少40%。V4-Pro:总参数达1.6万亿,激活参数49B,主打顶级性能上限,对标GPT-5、Claude Opus等全球顶尖闭源模型,适配复杂推理、代码生成、科研计算等高难度任务。V4-Flash:总参数284B,激活参数13B,主打高效低成本,推理能力接近Pro版,速度更快、价格更低,适合日常交互、内容创作、企业轻量化部署等场景。

57. 阿里自研芯片大突破!10万卡真武PPU落地,国产算力硬核崛起 里程碑时刻!阿里平头哥自研的真武PPU,已有超10万卡部署在阿里云公共云,服务30+家主流车企与智驾公司,国产AI芯片规模化商用再下一城。 这不是简单的芯片出货,而是全栈自研硬实力的证明:芯片自研:平头哥打造,性能对标国际高端AI芯片,打破海外垄断;云芯一体:真武PPU+阿里云+千问大模型,形成完整技术闭环,训推效率拉满;场景落地:从智驾研发到AI大模型训练,覆盖核心高景气赛道,已累计交付超47万片。 从“缺芯少魂”到“自研自强”,10万卡是起点,更是中国科技突围的底气。国产算力替代加速,硬科技的黄金时代,才刚刚开始!本文提示:个人观点,仅供交流,不构成投资建议!理财有风险,投资需谨慎!

58. 云计算调价潮来袭!腾讯云宣布AI算力服务等涨价5%!

59. 阿里亮出Agent超级地基!首发真武M890,甩出128卡超节点算力王炸

60. 阿里亮剑Agentic时代算力!平头哥真武M890问世。

61. 阿里云发布Agent全栈架构

62. 平头哥AI芯片真武M890首次亮相,性能提升至3倍!已出货56万片!

63. 产融先锋丨行云集成电路

64. 大模型推理慢,不是算力不够,而是“搬不动”

65. 显存不够用?看MIT英伟达如何解决32B大模型推理难题!

66. SSD AI 应用

67. 从显存瓶颈到推理革命

68. 平头哥AI芯片真武M890首次亮相

69. 真武M890只是开胃菜!阿里平头哥首曝路线图

70. 阿里云峰会

71. 阿里平头哥发布真武M890 AI芯片及ICN Switch互联芯片

72. 阿里平头哥公布AI芯片规划,真武GPU已出货56万片

73. 性能飙升3倍!阿里平头哥真武M890亮剑,国产算力硬刚英伟达H200

74. 平头哥发布新一代AI芯片真武M890,性能提升至3倍

75. 从10元到1元,AI推理成本大跳水,智能体商业化加速

76. 硬核投研】放弃“训推一体”的红海,曦望Sunrise如何用“极致推理”重写AI算力损益表?

77. 训推一体 AI 服务器:算力利用率提升至88%

78. 平头哥发布新一代AI芯片真武M890,性能提升至3倍

79. 阿里平头哥真武M890亮相 144GB显存加持 三倍性能碾压英伟达H20

80. 国产AI推理芯片产业链DeepSeek V4催化国产替代加速,寒武纪Q1净利暴涨185%

81. 阿里平头哥AI芯片真武M890和ICN Switch互联芯片发布,构筑磐久AL 128超级点服务器

82. 百纳秒超低时延!阿里真武M890刷新纪录 128卡超节点服务器畅跑大模型与Agent

83. 大模型如何提高推理效率

84. 三倍性能碾压英伟达H20!阿里平头哥真武M890重磅登场

85. 阿里发布基于新一代真武芯片的超节点服务器,可支持海量Agent并发推理

86. 阿里发布基于新一代真武芯片的超节点服务器 可支持海量Agent并发推理

87. 阿里发布基于真武M890芯片的128卡超节点服务器

88. 面向Agentic时代,阿里云重构“芯-云-模型-推理”全栈技术体系

89. 开源AI大模型性能翻倍 推理成本直降60%

90. 木头姐:AI 训练和推理成本正以惊人速度下降

91. 阿里平头哥发布新一代AI芯片真武M890 性能提升至3倍

92. 平头哥AI芯片真武M890首次亮相,性能提升至3倍

93. 百纳秒超低时延! 阿里云峰会重磅发布平头哥真武M890芯片!性能是前一代的3倍!

94. 阿里平头哥AI芯片真武M890首次亮相:性能提升至3倍

95. 平头哥AI芯片真武M890首次亮相 性能提升至3倍

96. AI推理负载:挑战、硬件优化与通用优化全景图

97. 阿里发布基于新一代真武芯片的超节点服务器

98. 推理成本暴涨 15 倍!大模型规模化落地的核心密码,都在这份信通院 2026 重磅报告里

99. 大模型推理优化关键技术及应用实践研究报告(2026年)

100. 推理芯片:AI普及的关键钥匙,成本决胜未来

101. LLM生产推理架构设计与优化实战

102. 推理时代来了:两个200亿重塑芯片格局,推理占比20%→80%

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章