英伟达黑帽大会开源cuFile API,SSD当显存减卡顿

源自21位全网作者

14:06

内容由AI生成

精选参考来源

1. 塞入满血DeepSeek V4 Flash:无限Token!两台英伟达电脑“交火”,有多强?

2. #显卡全面封仓##显卡价格大涨原因#英伟达涨价通知引发显卡工厂封仓,渠道惜售致价格暴涨。RTX 5070涨至6000元以上,5080近1.2万元,日均涨幅500-1000元,多平台下架。深层原因是AI需求挤占HBM显存产能,挤压了显卡所用GDDR供应,成本传导至终端。预计涨价周期至少持续一年,非刚需建议暂缓购买。央视财经的微博视频

3. SpaceX称正与英伟达合作,共同开发Starmind AI1卫星计算载荷,直接将数据中心级AI算力部署至太空卫星平台,依托星链星座搭建全球首个规模化太空算力基础设施。单颗Starmind卫星核心算力硬件全部由英伟达定制供应,整机搭载Rubin旗舰GPU搭配Vera高性能CPU组成加速计算架构,适配大模型推理、遥感影像处理、航天器自主调度等高负载AI任务。卫星不再将原始遥感、探测数据全部回传地面,在轨即可完成数据筛选、解析与特征提取,大幅压缩星地传输带宽占用与数据处理时延。卫星部署于太阳同步轨道,可依靠太阳能电池板实现近乎不间断供电,规避地面数据中心昼夜供电、气候限电、土地资源紧张等痛点。双方合作实现优势互补,SpaceX提供低成本入轨、卫星平台运维、星链全域通信链路支撑,英伟达输出成熟CUDA算力生态、航天级AI加速模组软硬件方案。

4. “榨”出硅的极限:怎么让GPU不“闲着”?|与SGLang、RadixArk深聊AI Infra技术与千亿美元市场

5. 【显存容量才是硬通货?AMD MI355X 挑战英伟达 Blackwell】推理服务商 Wafer.ai 发布报告称,在运行 2.8T 参数的 Kimi K3 模型时,AMD MI355X 凭借 288GB 显存实现了单机 TP8 运行,而英伟达 B200 则因显存不足必须跨节点部署。由于避开了跨节点通信的性能损耗,AMD 在单节点吞吐量和性价比上表现惊人,每美元 Token 产出远超 B200 方案。这并非 AMD 在算力架构上的纯胜,而是“显存溢出”时代的错位竞争。当模型大到单卡塞不下,显存容量就成了比算力更宽的护城河。不过,业内对 $2.50/小时的租赁价格普遍存疑,认为这更像是一场基于特定折扣的营销秀。在 Open Weights 时代,硬件选型已从“买最强算力”转向“买最适配显存”。虽然 ROCm 仍需通过“补丁”来对齐 MLA 等算子,但软件生态的鸿沟正在被 AI 辅助的优化手段快速填平。

6. #DeepSeek冲击英伟达# 国产大模型DeepSeek-R1发布,直接让英伟达单日暴跌近17%,市值一夜蒸发约4.3万亿元人民币,创下美股史上最大单日个股蒸发纪录。几个值得关注的点:· DeepSeek-R1用不到600万美元训练成本,性能却媲美OpenAI o1,API价格低了90%以上· 英伟达单日跌16.86%,市值蒸发5888亿美元,相当于3个AMD的体量· 华尔街开始质疑:微软、Meta等巨头每年砸千亿搞AI基建,是不是花冤枉钱了?· OpenAI CEO罕见“认错”,称公司在开源问题上“站在历史错误的一边”这事最狠的地方在于——DeepSeek用的还是受出口管制的H800芯片,不是最顶级的。算法效率一旦追上,堆算力的逻辑就被打破了。你觉得这是AI泡沫的转折点,还是英伟达的一次短期震荡?#DeepSeek##微博AI创作季#

7. 4 GB 显存也能碰 8B 微调了。Soup 把冻结的基座模型留在内存或 NVMe,每次只送一层进 GPU;官方在 RTX 3050 Laptop 上跑 Llama-3.1-8B-Instruct + NF4,峰值占用 3.32 GB,并称结果和常规驻留运行 bit-exact。v0.72.4 又把这套方式扩到 DPO、ORPO、SimPO 和 KTO。交换条件写得挺清楚。DPO 每步读取层栈的次数是监督微调的 1.52 倍;GRPO 和 PPO 暂不支持,因为逐 token 生成会反复读层,没法摊薄。项目仍在 beta,更适合愿意用时间换显存的本地实验。仓库:网页链接

8. 彻底解放CPU!英伟达正式发布SCADA技术:让显卡直连硬盘 读写性能暴涨5倍

9. AI推理开始给“上下文”配专用SSD:ScaleFlux瞄准英伟达CMX等KV Cache存储场景

10. SSD给AI当显存?铠侠332层堆叠,正在改写存储规则

11. ‼️#英伟达最新架构主线:推理按Prefill/Decode解耦、单卡不再一刀切堆HBM、BOM从''存储堆料''转向''光互联+分级存储'' 1️⃣减存储:Prefill 侧曾推 Rubin CPX(GDDR7 96–128GB 替代 HBM4,成本降 50%+,GTC 2026 已暂撤路线);Rubin Ultra 主线 HBM4 从 288GB→192GB;CPU SOCAMM 192GB→96GB;KV Cache 经 BlueField-4/CMX 卸载到本地 SSD/NAND 层,HBM 只留热数据 2️⃣增光互联:机柜间 NVL72→NVL576 放大 Scale-up 域,跨机架用 NPO/CPO 替可插拔光模块;Spectrum-X 硅光 CPO 交换机 2026 年量产交付,功耗降约 70% 3️⃣行情映射:省下的 HBM BOM 转投 switch tray/光引擎 → 8/3 夜 CPO 强、HBM 弱,8/4 A股光模三杰大涨;韩股 KOSPI 8/3 跌 5.1%,海力士/三星跌超 8%,直接触发是 Rubin Ultra 降配传闻+大摩喊存储涨价见顶+下游拒接涨价 4️⃣英伟达把每卡最贵HBM换成阶段适配内存+CPO光互联,存储链重定价、光通信重估值 机构观点,仅供参考!!

12. 大模型分层加载提速60%!一张图看懂xNVMe如何解决LLM本地加载慢痛点

13. 4GB显存真的跑动2.8T模型了!AirLLM把显存难题甩给了SSD

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章