你的GPU跑得慢,真凶竟是SIMT架构下的分支发散——选对计算架构才能榨干性能

源自42位全网作者

04-16 14:27

精选参考来源

1
英伟达“护城河”要塌了?但这次是老黄自己动的手【X.PIN】
2
三星电子成功开发自主GPU... 扩展AI生态系统据确认,三星电子计划于2027年推出搭载自主研发图形处理单元(GPU)的应用处理器(AP)“Exynos 2800”(暂定名)。GPU是一种负责图形处理和人工智能(AI)计算的芯片,被视为决定AI手机等设备性能的关键半导体。三星电子计划将搭载自主GPU的Exynos AP的应用范围扩展至设备端AI平台——如智能眼镜、自动驾驶车辆软件以及人形机器人——以提升产品竞争力。据半导体行业25日消息,三星电子系统LSI事业部计划到2027年开发出使用自主架构设计的GPU,并将其应用于AP“Exynos 2800”。架构是指GPU执行计算的方法,而设计则是将这种计算方法落实到半导体中的任务。全球仅有极少数公司,如Nvidia、AMD、Intel和高通,能够使用自主架构设计GPU。目前,系统LSI事业部已成功将使用合作伙伴美国AMD架构的自研GPU安装到最近发布的Galaxy S26用AP“Exynos 2600”上。AP是一种系统级芯片(SoC),充当电子设备的“大脑”,包含GPU、中央处理器(CPU)、调制解调器芯片以及控制它们的接口。三星电子着手内部化移动GPU,是因为在AI时代,负责设备内图形和AI计算任务的GPU重要性日益增加。GPU利用“并行计算”的优势,能够同时处理多项任务,是绘制屏幕上几乎所有可见内容的半导体。它处理AP内的视频播放、图像合成/生成等任务,还扮演AP上搭载的神经处理单元(NPU)计算的“辅助AI加速器”角色。这也是Nvidia将GPU作为AI加速器关键组件的原因。一位半导体行业人士解释称:“三星要扩展设备端AI设备生态系统,必须及时获得针对特定设备的GPU供应,”并补充道:“尤其是,与自家软件实现完美的‘优化’需求极大。”成功开发自主GPU架构和设计,被视为公司跻身无可争议的AI半导体专业无晶圆厂(专注于半导体设计)公司行列。以自主GPU开发为跳板,三星电子还计划扩展应用特定集成电路(ASIC)业务,该业务类似于美国博通,为外部客户设计芯片。过去2至3年,三星电子美国半导体部门最努力招聘的工程师是图形处理单元(GPU)专家。基本年薪标准为3亿至4亿韩元,外加奖金,而拥有经验和专长的资深工程师年薪超过5亿至10亿韩元。最近,被视为世界级GPU专家的前AMD副总裁John Rayfield以这种方式加入三星。这种非常规待遇有其原因。过去,GPU仅限于智能手机中的图像处理和游戏运行角色。三星直到2021年也依赖英国Arm。随着AI时代的开启,它已成为设备内实现生成式AI的不可或缺芯片。三星电子判断不能依赖外部来源,于是与美国AMD启动技术合作,并最近获得“GPU独立”的信心。这就是决定于2027年推出搭载自主GPU的应用处理器(AP)“Exynos 2800”(暂定名)的背景。○ 相当于2-3粒米大小的先进芯片据半导体行业25日消息,GPU大致分为AI数据中心用服务器型、PC用桌面型以及智能手机用超小型移动型。Nvidia控制服务器市场约90%,而苹果和高通等公司拥有智能手机等移动产品的自主技术。三星基于通用GPU无法完全实现AI功能的判断,决定内部化GPU。即使通用GPU自身性能出色,但由于需跨各种品牌和设备运行,无法与三星软件实现完美的“优化”。由于功能需适应各种任务,在芯片运行过程中会浪费电力和计算能力。另一方面,使用自主GPU可针对三星所需特定任务和功能进行专业化。这就是过去使用Nvidia AI加速器的谷歌、亚马逊和Meta等大科技公司着手内部化AI加速器的背景。由于移动GPU无法连接服务器且需依赖电池运行,“低功耗”是基础,还需高难度技术如“实时图像处理”。特别是,图像处理、游戏运行和AI计算等多样功能必须容纳在相当于2-3粒米大小(10-30㎟)的芯片中。三星逐步开发了游戏机(游戏专用计算机)和桌面等中大型设备的GPU。随后,通过实现低功耗和软件优化,全面启动GPU技术内部化尝试。据悉,2017年建立的美国三星系统半导体研究基地“SARC/ACL(Samsung Austin Research Center/Advanced Computing Lab)”在自主GPU开发中发挥了关键作用。○ 应用于智能汽车和人形机器人通过充当设备“大脑”的AP集成,移动GPU可应用于所有无需互联网连接即可独立运行的AI设备类型。例如,自动驾驶车辆需以高达100fps(每秒帧数)处理来自5-6个摄像头和10-20个传感器的实时信息。这相当于每秒眨眼100次。即使在识别行人、交通灯或车道时稍有延迟,也可能导致大规模致命事故,因此需要此类高性能GPU。机器人如果GPU无法正常运行也会瘫痪。这是因为机器人中的GPU负责通过摄像头接收的信息转换为图像的“认知功能”。从AI手机起步,三星计划向其设想的AI生态系统主要平台——如智能眼镜、自动驾驶车辆信息娱乐系统以及人形机器人——推广搭载自主GPU芯片的AP供应。积累业绩后,将全面启动根据客户订单创建“定制芯片”的应用特定集成电路(ASIC)业务。三星电子系统LSI事业部有望成为“第二个博通”或“第二个Marvell”。一位半导体行业人士预测:“最近,在三星晶圆代工之后,包括无晶圆厂在内的系统半导体业务正常化正在加速,”并补充道:“自主GPU开发的成功,将成为系统LSI事业部跻身世界级无晶圆厂公司行列的起点。”
全部
来源
内容由AI生成

精选参考来源

1. 英伟达“护城河”要塌了?但这次是老黄自己动的手【X.PIN】

2. 三星电子成功开发自主GPU... 扩展AI生态系统据确认,三星电子计划于2027年推出搭载自主研发图形处理单元(GPU)的应用处理器(AP)“Exynos 2800”(暂定名)。GPU是一种负责图形处理和人工智能(AI)计算的芯片,被视为决定AI手机等设备性能的关键半导体。三星电子计划将搭载自主GPU的Exynos AP的应用范围扩展至设备端AI平台——如智能眼镜、自动驾驶车辆软件以及人形机器人——以提升产品竞争力。据半导体行业25日消息,三星电子系统LSI事业部计划到2027年开发出使用自主架构设计的GPU,并将其应用于AP“Exynos 2800”。架构是指GPU执行计算的方法,而设计则是将这种计算方法落实到半导体中的任务。全球仅有极少数公司,如Nvidia、AMD、Intel和高通,能够使用自主架构设计GPU。目前,系统LSI事业部已成功将使用合作伙伴美国AMD架构的自研GPU安装到最近发布的Galaxy S26用AP“Exynos 2600”上。AP是一种系统级芯片(SoC),充当电子设备的“大脑”,包含GPU、中央处理器(CPU)、调制解调器芯片以及控制它们的接口。三星电子着手内部化移动GPU,是因为在AI时代,负责设备内图形和AI计算任务的GPU重要性日益增加。GPU利用“并行计算”的优势,能够同时处理多项任务,是绘制屏幕上几乎所有可见内容的半导体。它处理AP内的视频播放、图像合成/生成等任务,还扮演AP上搭载的神经处理单元(NPU)计算的“辅助AI加速器”角色。这也是Nvidia将GPU作为AI加速器关键组件的原因。一位半导体行业人士解释称:“三星要扩展设备端AI设备生态系统,必须及时获得针对特定设备的GPU供应,”并补充道:“尤其是,与自家软件实现完美的‘优化’需求极大。”成功开发自主GPU架构和设计,被视为公司跻身无可争议的AI半导体专业无晶圆厂(专注于半导体设计)公司行列。以自主GPU开发为跳板,三星电子还计划扩展应用特定集成电路(ASIC)业务,该业务类似于美国博通,为外部客户设计芯片。过去2至3年,三星电子美国半导体部门最努力招聘的工程师是图形处理单元(GPU)专家。基本年薪标准为3亿至4亿韩元,外加奖金,而拥有经验和专长的资深工程师年薪超过5亿至10亿韩元。最近,被视为世界级GPU专家的前AMD副总裁John Rayfield以这种方式加入三星。这种非常规待遇有其原因。过去,GPU仅限于智能手机中的图像处理和游戏运行角色。三星直到2021年也依赖英国Arm。随着AI时代的开启,它已成为设备内实现生成式AI的不可或缺芯片。三星电子判断不能依赖外部来源,于是与美国AMD启动技术合作,并最近获得“GPU独立”的信心。这就是决定于2027年推出搭载自主GPU的应用处理器(AP)“Exynos 2800”(暂定名)的背景。○ 相当于2-3粒米大小的先进芯片据半导体行业25日消息,GPU大致分为AI数据中心用服务器型、PC用桌面型以及智能手机用超小型移动型。Nvidia控制服务器市场约90%,而苹果和高通等公司拥有智能手机等移动产品的自主技术。三星基于通用GPU无法完全实现AI功能的判断,决定内部化GPU。即使通用GPU自身性能出色,但由于需跨各种品牌和设备运行,无法与三星软件实现完美的“优化”。由于功能需适应各种任务,在芯片运行过程中会浪费电力和计算能力。另一方面,使用自主GPU可针对三星所需特定任务和功能进行专业化。这就是过去使用Nvidia AI加速器的谷歌、亚马逊和Meta等大科技公司着手内部化AI加速器的背景。由于移动GPU无法连接服务器且需依赖电池运行,“低功耗”是基础,还需高难度技术如“实时图像处理”。特别是,图像处理、游戏运行和AI计算等多样功能必须容纳在相当于2-3粒米大小(10-30㎟)的芯片中。三星逐步开发了游戏机(游戏专用计算机)和桌面等中大型设备的GPU。随后,通过实现低功耗和软件优化,全面启动GPU技术内部化尝试。据悉,2017年建立的美国三星系统半导体研究基地“SARC/ACL(Samsung Austin Research Center/Advanced Computing Lab)”在自主GPU开发中发挥了关键作用。○ 应用于智能汽车和人形机器人通过充当设备“大脑”的AP集成,移动GPU可应用于所有无需互联网连接即可独立运行的AI设备类型。例如,自动驾驶车辆需以高达100fps(每秒帧数)处理来自5-6个摄像头和10-20个传感器的实时信息。这相当于每秒眨眼100次。即使在识别行人、交通灯或车道时稍有延迟,也可能导致大规模致命事故,因此需要此类高性能GPU。机器人如果GPU无法正常运行也会瘫痪。这是因为机器人中的GPU负责通过摄像头接收的信息转换为图像的“认知功能”。从AI手机起步,三星计划向其设想的AI生态系统主要平台——如智能眼镜、自动驾驶车辆信息娱乐系统以及人形机器人——推广搭载自主GPU芯片的AP供应。积累业绩后,将全面启动根据客户订单创建“定制芯片”的应用特定集成电路(ASIC)业务。三星电子系统LSI事业部有望成为“第二个博通”或“第二个Marvell”。一位半导体行业人士预测:“最近,在三星晶圆代工之后,包括无晶圆厂在内的系统半导体业务正常化正在加速,”并补充道:“自主GPU开发的成功,将成为系统LSI事业部跻身世界级无晶圆厂公司行列的起点。”

3. 为什么 AI 需要 GPU 和 TPU:理解大语言模型背后的硬件

4. 英伟达护城河被AI攻破,字节清华CUDA Agent,让人人能搓CUDA内核

5. 英伟达周末双炸!CUDA二十年最大更新,顺手屠榜AGI比赛

6. 一个真实的 AI 系统不止是一个模型,而是一整套 AI StackAI 是由四个维度组成的体系:1) 大规模数据2) 大规模模型(算法、架构)3) 大规模算力(GPU/TPU/ASIC)4) 大规模工具链(框架、MLOps、数据流水线)模型只是其中一个环节。系统工程也是一个难题。1. 数据:模型性能的物理极限数据质量是模型上限,而模型结构只能决定模型接近“上限”的速度。从工程视角看,数据的挑战分四类:1)标注质量(噪声、偏差、错误)2)数据覆盖度(out-of-domain 问题)3)数据更新频率(drift 问题)4)数据安全性(投毒攻击、反向推断)这意味着一个强模型往往并不只是因为结构先进,也是因为:1)数据更干净2)样本数量更大3)训练流程更标准化4)监控体系更完善2 算力:并行计算与“矩阵乘法时代”模型训练的底层本质是批量矩阵乘法。为什么是 GPU 和 TPU,而不是CPU?1)矩阵乘法天然适合数据并行。2)GPU/TPU 的带宽与片上并行度远超 CPU。3)AI 计算重 IO、重内存带宽,CPU 的流水线结构效率太低。AI 的性能增长,大部分不是算法进步,而是硬件进步。这在工程中体现为:1)裁剪(pruning)2)量化(quantization)3)蒸馏(distillation)4)低精度训练(FP16/bfloat16/INT8)这些都直接针对硬件瓶颈。3 工具链:MLOps 变成真正的关键MLOps 的价值在于管理一个事实:模型不是一次训练,而是持续训练、持续部署、持续监控的系统。模型退化的几种来源:1)数据分布漂移(Data Drift)2)概念漂移(Concept Drift)3)标签老化4)环境变化5)攻击者有意干扰这意味着需要完整系统:1)数据流水线2)自动评估3)监控指标(漂移、性能、置信度)4)自动 retraining5)在线实验(A/B、canary)6)安全防护(adversarial robustness)AI 模型交付 = 软件交付 + 数据交付 + 训练流程交付 + 芯片资源调度。这已经完全超出了“发布一个模型”所能描述的复杂度。#微博兴趣创作计划# #ai创造营#

7. 刚刚,英伟达CUDA迎来史上最大更新!

8. Aalto大学CS-E4580《Programming Parallel Computers》课程现今所有计算机都具备强大的并行处理能力:多核CPU、多执行单元、宽向量操作和流水线技术让数百条算术指令能同时进行。但如果程序员忽视这些并行机会,99%以上的计算资源将白白浪费。在现代4核Intel CPU上,未经优化的传统串行代码仅能利用约0.6%的多核性能。经过多轮优化,单核性能提升42倍,全核性能提升151倍,说明仅靠多线程远远不够,真正的性能提升需要深入理解硬件特性和并行编程技巧。除了CPU,现代GPU作为另一种极具潜力的并行计算资源,已从图形处理专用硬件转变为通用计算平台。但典型的C++程序却几乎完全未利用GPU能力,程序员必须主动编写针对GPU的代码,掌握关键概念和工具才能发挥其威力。本课程旨在让并行编程变得简单易行,成为日常开发的自然部分。我们不仅讲实用技巧,还深入解析编译器生成的汇编代码和CPU执行机制,帮助你预测代码性能,揭开硬件性能优化的神秘面纱。课程适合具备良好编程基础及C/C++经验的开发者,不要求并行计算或GPU知识。从理论到实践,助你全面掌握现代并行计算的核心要义,提升性能关键应用的开发效率。更多详情请见 ppc.cs.aalto.fi

9. 蚂蚁集团基于 Velox 构建流批一体向量化引擎 Flex 的实践与探索

10. 一个开源 CUDA 教程github.com/infatoshi/cuda-course本课程用来帮助习惯于 Python/PyTorch 的深度学习从业者理解底层 GPU 编程,并为理解如 Karpathy 的 llm.c 等项目打下基础。不同于传统的 CUDA 课程(通常侧重于物理模拟或通用并行计算),这门课非常针对深度学习。它明确讨论了 PyTorch 生态、Triton 语言以及如何编写 PyTorch 的 CUDA 扩展。对于 AI 工程师来说,这种上下文非常宝贵。#科技先锋官##AI创造营#

11. SIMT和SIMD有什么区别

12. simt和simd的本质区别是啥

13. 拆解 CUDA 线程架构

14. CPU性能优化—向量化并行加速

15. NVIDIA cuTile 技术深度解析及生态兼容性研究

16. 从 SIMT 到 Tile-Based

17. 从线程束分化理解cuda线程模型

18. 并行编程实战—CUDA warp的分歧效应

19. 没有基础,也能看懂CUDA底层原理

20. 【全集】CUDA编程速成课 中英字幕 1080P

21. 初识cuda编程

22. CUDA 中基本概念理解(Thread、warps、CTA、调度执行过程)

23. CUDA推理加速技术

24. 每个程序员都应该了解的GPU工作原理:从硬件到架构

25. 复杂计算的CPU和并行计算的GPU,究竟谁是未来?

26. 从指令集到应用层:openEuler在x86与ARM架构下的SIMD优化实战

27. Rust中的SIMD指令优化:从原理到实践

28. 25_GPU_architectures

29. 分析CUDA Tile后,对官方文档中实现方式的思考

30. 并行计算 (一) 理解GPU并行计算:从SIMT到Warp

31. 深度对比:华为昇腾 Ascend950 (DaVinci arch35) vs NVIDIA SM_90 微架构

32. GPGPU处理器设计学习(2)——线程分支

33. GPGPU处理器设计学习(3)——线程块调度与线程束调度

34. 从PTX到SASS:揭秘NVIDIA GPGPU数据并行的底层加速密码

35. 【翻译】SIMD < SIMT < SMT

36. SIMD in the GPU world

37. AI基础设施揭秘:GPU并行计算的五层架构

38. 详解并行技术SIMD、SIMT、SPMD

39. GPU加速的秘密:SIMT、Warp与高性能计算深度解析

40. cuda入门

41. 每日GitHub精选:用15个文件构建GPU,从零看懂并行计算原理

42. GPU多模型多流并行方法和收益

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章