开源3D视觉大模型:普通开发者如何低成本高效生成3D内容

源自96位全网作者

05-31 13:11

内容由AI生成

精选参考来源

1. AI公司“卷”向3D打印赛道:生成只是开始,打印才是终局

2. ICLR'26开源 | 1000+FPS!Mobile-GS:3D高斯泼溅轻量化新范式,首次在移动设备部署!

3. 在昨天的NVIDIA GTC 2026上,詹锟代表理想发布了下一代自动驾驶基座模型MindVLA-o1。我们在底层实现了一个核心突破:原生3D ViT——真正的三维视觉编码器。我们在尝试解答一个问题:人类开车看上去没那么难,每个普通人都能把车开得又快又稳,但全世界最顶尖的企业砸了几千亿进去,自动驾驶仍然进展缓慢。问题到底出在哪?我们一直在教AI做成年人的事,但从来没让它当过小孩。人类在0到6岁的阶段学会了走路,学会了扔球、接球。看起来只是简单的动作,但实际上已经帮助孩子建立了对三维物理空间的理解。这就是为什么我们能精准测距、稳定驾驶,因为“3D预训练”6岁前就完成了。但今天所有的端到端系统本质上都是“看2D视频学开车”,更像是一个人坐在电脑前看了十万小时行车记录仪,然后直接上路。它有了智能,但离人类的智能程度差得远。过去我们和行业使用的BEV把世界从俯视角拍扁,丢失了高度信息;OCC确实是3D的,但缺失了语义信息。物理AI缺的不是更大的模型、更多的数据,而是一个能真正理解3D世界的视觉基础。3D ViT解决了这个问题。不再是从2D“还原”3D,而是让模型一开始就工作在真实的三维世界里。以高分辨率多视角视觉为核心,在编码阶段直接完成对3D空间几何和语义的统一理解——空间结构、位置关系、语义信息,一次完成。模型不只是看见画面,而是理解世界,既知道它在哪,也知道它是什么。在这个体系下,激光雷达的角色变了。它不再是感知的核心,而更像一把高精度的尺子,为视觉提供几何标定和近场空间约束。真正决定感知上限的,不是传感器的物理线数,而是模型的表征能力。在统一建模下,3D ViT可以稳定感知并推理到500米以上的空间范围。这件事以前不是没人想做,是做不到,因为3D ViT对车端推理算力提出了极高的要求。我们自研的马赫芯片,单颗有效算力是上一代的3倍,能把这套架构真正放进车里。有了3D ViT打底,MindVLA-o1把空间理解、思考推理、驾驶行为统一在一个模型里。不光看见世界,还能在隐空间里模拟未来几秒的场景变化,想清楚再开。我们把这种能力称之为多模态思考。我们也已经进行了验证,这套基座模型不只是为自动驾驶设计的。同一套VLA基座模型,能开车,也能控制机器人,它正在逐渐演化成一个通用的物理世界智能体。自动驾驶,只是物理AI的一个起点。

4. 【苹果开源】1张照片秒变可进入的3D场景!Mac/Windows 部署教程全解析 | XR游戏和应用体验

5. AI 3D大模型平台VAST完成5000万美元A轮融资

6. 对话 VAST 曹炎培:AI 3D生成从好看到好用还差几步?

7. 2026年3D打印人形机器人可能要火!稚晖君开源启元Q1

8. Meta 开源王炸!SAM 3D 正式发布!任何照片、视频都能秒变真实 3D,这个 AI 太离谱了|零度解说

9. AI建模这么离谱?一张图直出高质量3D模型!

10. 加速2.67倍+精度无损!中科院开源Fast-SAM3D:免训练的3D重建加速框架

11. 盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI

12. 在线3D建模和CAD编程总是需要高效且灵活的工具来满足复杂设计需求。开源项目 build123d 是一个基于 Python 的参数化边界表示(BREP)建模框架,底层用的是强大的 Open Cascade 几何内核。它通过简洁的 Pythonic 接口,让设计师和工程师能够用代码精准构建适合3D打印、CNC加工、激光切割等制造业的模型。主要功能亮点包括:- 提供明确的1D、2D、3D几何类和丰富的操作符,支持代数式建模,代码更加可读与组合;- 支持无状态的代数模式与有状态的Builder模式,满足不同设计习惯;- 丰富的几何构造能力:线段、圆弧、圆形、矩形、孔、倒角、圆角等;- 可导入SVG、STEP等多种格式,方便与其他CAD软件互通;- 输出STL、STEP格式,便于3D打印和传统CAM加工;- 代码严格符合Python标准,支持类型提示,易于扩展和维护。安装简单:直接使用pip安装即可```pip install build123d```官网文档和示例丰富,上手极快,适合工程师、设计师和开发人员用代码实现复杂的CAD设计思路。GitHub:github.com/gumyr/build123d#PythonCAD# #3D打印# #开源项目# #智能制造#

13. ICLR'26高分开源 | Depth Anything 3:新一代3D视觉模型,位姿精度超VGGT 35.7%!

14. 微软开源的40亿参数3D生成模型TRELLIS.2引发行业关注,破解了长期困扰3D生成领域的精度与效率难题,为工业级3D资产创作提供了全新路径。传统3D生成要么依赖体素导致边缘锯齿,要么采用隐式场难以处理复杂结构。TRELLIS.2的双格点O-Voxel结构,既保留了像素级计算便利,又能精准还原锐利边缘与嵌套、镂空等复杂拓扑,无论是机械零件的精密内腔还是植物轻薄花瓣,都能完美复现,解决了开放表面、非流形几何的建模痛点。3D数据的庞大体积一直制约高分辨率生成,TRELLIS.2通过16倍空间压缩的稀疏压缩变分自编码器,智能识别物体活跃区域,跳过空白区域计算,将1024分辨率资产的潜变量令牌压缩至9.6K,在极致压缩的同时几乎无视觉退化,为40亿参数模型的高效运行释放了算力空间。不同于传统贴图式上色,该模型直接生成基础色、金属度、粗糙度等完整物理渲染参数,生成资产可直接适配虚幻引擎等工业工具,在不同光照下呈现真实物理反馈,避免了多视角色彩不一致问题。TRELLIS.2在H100显卡上3秒即可生成512³分辨率资产,最高支持1536³超高清输出,且在权威测试集上的几何精度与视觉质量全面超越主流竞品。其开源不仅降低了高精度3D创作门槛,更通过底层技术革新,推动AI 3D生成从实验级迈向工业级应用。#AI创造营##AI创作热点##科技先锋官##AI生活指南# 种斌Marco的微博视频

15. 【AI工具】为什么你生成模型很怪?分享几个AI建模技巧

16. 对话宋亚宸:从 3D 生成到世界模型,VAST想搭一套「可交互世界」的底座

17. 字节跳动AI生成3D模型新突破,Seed3D 2.0发布

18. 【教程】1秒1张图,2D图片变3D场景!Apple开源新算法

19. AI生成3D模型进入可编辑时代, Hyper3D 发布重大更新

20. #普通人怎么用Ai# 这几天想定做一个连接件,本来是在研究 Blender自己画图,都特么开始从0看教学视频了。后来一看特么Ai不是可以生成3D打印模型文件么,但很多Ai软件不能直接生成,或者生成的修改也麻烦而且一个聊天窗口里面不能可视化。后来发现还有更简单的,直接生成设计软件可用的代码,复制粘贴进去,搞定。还学个屁的自己画图啊。 (当然这种只适合简单的模型,复杂了描述起来麻烦,Ai 也理解不了)

21. 【#零态洞察百态##苹果新模型1秒让照片变3D##苹果开源新型AI模型#】科技媒体 9to5Mac 昨日(12 月 17 日)发布博文,报道称苹果公司开源名为 SHARP 的新型 AI 模型,该技术能在一秒内将单张 2D 照片转换为逼真的 3D 场景。#苹果回应AppStore新增广告位#苹果发布名为《一秒内实现清晰的单目视图合成》(Sharp Monocular View Synthesis in Less Than a Second)论文,详细介绍了如何训练模型,在接收用户输入的一张普通 2D 照片后,能在一秒钟内重建出具有真实物理比例的 3D 场景。与需要数分钟甚至数小时处理的传统方案相比,SHARP 将合成速度提升了三个数量级,实现了近乎实时的 3D 转换体验。在技术原理上,SHARP 采用了先进的 3D 高斯泼溅技术(3D Gaussian Splatting)。简单来说,它将 3D 场景视为无数个带有颜色和光影信息的“模糊光团”(高斯球)。(IT之家)study875的微博视频

22. AI都能自己操作3D打印机了!钉钉悟空 接入3D打印工作流测试

23. VIGA,能够生成3D/4D场景的AI智能体。 给定图片,无需人工介入,无需训练,即可生成对应的3D/4D场景。 该项目旨在通过编写可编辑的图形程序来重构图像。该系统利用交替多模态推理机制,在生成者与验证者两种角色间切换,形成写代码、运行渲染、对比差异及修改完善的闭环。通过这种自我修正的循环和不断演进的上下文记忆,VIGA 能够处理 3D 场景重建、动态物理模拟以及 2D 文档排版等多种任务。 论文:arxiv.org/abs/2601.11109 #HOW I AI# #科技# http://t.cn/AXqXOcXP

24. 有人说DeepSeek+剪映是王炸?我深度使用下来发现,DeepSeek+任何项目都是王炸,这个月我会做一个挑战,教所有AI小白使用DeepSeek组合AI工具。1. DeepSeek + Kimi = 一键生成PPT2. DeepSeek + 剪映 = 批量生成短视频3. DeepSeek + Otter = 一键转会议记录4. DeepSeek + 即梦 = 生成设计海报5. DeepSeek + Notion = 生成文本笔记库6. DeepSeek + Cline = AI辅助编程7. DeepSeek +扣子Coze = 搭建智能体8. DeepSeek + tripo = 生成3D模型9. DeepSeek + X-Mind = 一键绘制思维导图10. DeepSeek + 数字人 = 生成口播视频

25. 生物细胞3D建模常常需要切换多个工具,三维渲染软件处理模型展示,AI生成工具创建细胞结构,还要额外的交互面板查看细节,来回切换颇为麻烦。3DCellForge 把细胞探索所需的功能全部整合到一起,提供了AI驱动的交互式3D细胞生成与探索工作室。不仅有流畅的WebGL细胞查看器,支持拖拽旋转、缩放和器官细节面板,还能通过图像转3D生成真实细胞模型,支持GLB导出、截图和离线缓存。GitHub:github.com/huangserva/3DCellForge主要功能:- 交互式3D细胞查看器,支持React Three Fiber实时渲染和轨道控制;- 图像转3D生成,支持Tripo云端、Hunyuan3D本地和浏览器深度图多种模式;- 器官细节卡片、显微镜视图、比较面板、笔记和图库管理;- GLB/GLTF模型导入导出、截图功能和本地缓存,支持离线演示;- 多平台浏览器运行,集成Vite快速开发,无需复杂环境配置;- 安全API密钥管理,后端Node服务处理生成任务,前端零暴露。支持 Web 浏览器直接运行,通过 npm install 和 npm run dev 即可本地启动,适合生物研究者和教育工作者使用。#AI创造营##人工智能#

26. 无限重建!上交开源InfiniteVGGT:打破长序列3D视觉几何估计显存瓶颈

27. #深圳一公司发巨额年终奖#【#豆包送出6666台拓竹3D打印机#】“千门万户曈曈日,总把新桃换旧符。”中国人的年味里,总少不了寄托愿景的物件。从桃符到年画,这些物件之所以珍贵,正是因为它们承载了特定的祈盼。 今年春节,这种祈盼有了更特别的安放之处。输入一句新春祝福,不仅能生成电子画作,还能直接转化成手中的实物模型。结合了人工智能与3D打印技术的拜年新方式,更为节日增添了一份崭新的仪式感。 这是近期拓竹科技(以下简称拓竹)与豆包大模型合作推出的“新春限定3D祝福”功能。用户仅需在拓竹旗下的内容模型平台(MakerWorld)抽取或输入祝福语,豆包大模型即可将其转化为独一无二的图片,并进一步生成可供3D打印的模型文件。 豆包与拓竹科技的合作更延伸到了春晚互动环节。2月16日,豆包App将配合春晚开启锦囊抽奖。在当晚的多轮互动中,6666台拓竹3D打印机也作为前沿科技代表入选。(新京报)

28. 3.6k stars!在 Mac 上运行视觉大模型?mlx-vlm 让这件事超简单!

29. VisionChina 2026 直击|工业视觉大模型爆发

30. 大模型赋能

31. 用大模型写Blender代码直接生成3D房间!输入俯视图就能出效果 【计算机视觉】【3D生成】

32. 腾讯开源混元3D世界模型2.0

33. 开源项目SceneMaker

34. 开源3D城市模型 map3d

35. 刚刚,腾讯最新世界模型开源!一句话造出3D世界,兼容游戏引擎

36. 李飞飞世界模型“杀手锏”开源!网页3D大场景秒开,手机畅跑1亿点云

37. 开源项目获18k星!AI直接控制Blender做3D建模

38. 一张图像变3D模型,源码+模型开源,开源免费!

39. 一句话造3D世界!腾讯混元3D世界模型2.0开源,游戏开发颠覆变革

40. 腾讯混元3D世界模型2.0开源!手机可跑亿级粒子,3D生成革命来了

41. 腾讯开源混元3D世界模型2.0,3D生成赛道进入工业级可用阶段

42. [CVPR 2026 Highlight] SpatialScore: 迈向空间智能的全面评估

43. 游戏圈炸了!用AI直接造一个可玩的关卡

44. 动态|一句话生成3D游戏?腾讯多模态重磅上新!混元世界模型2.0开源,3D关卡随心造

45. 微软开源TRELLIS

46. 微软Trellis-mac: 4B 参数顶级开源图像转3D生成模型

47. 不用建模!3个AI一键生成3D模型工具推荐

48. 腾讯混元3D世界模型2.0开源

49. 从"捏物体"到"造世界"

50. 一句话造3D世界!腾讯混元3D世界模型2.0开源,AI造世界落地游戏仿真

51. 手绘草图直接变工业级3D模型 ,还能自己喂数据训练专属AI

52. NVIDIA新AI直接生成带纹理的3D模型,不用建模软件,比以前的方法强太多了

53. 混元3D惊雷!0基础小白也能“无中生有”,3分钟生成高精度3D模型

54. AI颠覆3D建模,你说一句话,它生成一个3D模型

55. 文字描述生成3D模型!开源Text-to-CAD🔥

56. 腾讯混元3D世界模型 2.0(HY-World 2.0)详解

57. 建模师要失业?字节跳动推出3D生成模型,几何及纹理材质生成SOTA

58. ERNIE-Image 开源 SOTA !消费级显卡搞定顶级渲染、高密度文本绘图 - 哔哩哔哩

59. 逆天网站!上传图片自动转3D模型! 家人们,3D建模的门槛今天彻底塌了! 以前学Blender几个月,做一个模型几天… 现在用 Meshy 上传一张普通照片 AI直接给你吐出一个细节拉满的3D模型 还支持导出+3D打印! 小白秒变建模大神🎮 — ✨ 核心功能一览 ✅ 照片/插画/网图都能转3D 上传任意图片→AI自动生成高精度3D白模 ✅ 智能贴图与纹理优化 一键点击,AI自动调整网格与材质质感 ✅ 支持多种格式导出 模型可直接用于渲染、游戏引擎或3D打印 ✅ 适用场景超广 从个人手办创作到游戏场景搭建,全部能搞定 — 🚀 操作指南(30秒上手) 访问Meshy官网 上传清晰度高、细节完整的图片 (实物照片/AI绘画/设计稿均可) 等待几秒,生成3D白模 在界面中优化贴图与纹理 导出所需格式,或直接送去3D打印 ⚠️ 注意:图片清晰度决定模型细节,建议使用高清图源 — 💡 你可以用它来: ▪️ 将喜欢的角色图做成实体手办 ▪️ 为独立游戏快速生成场景资产 ▪️ 把产品设计草图转为可演示的3D模型 ▪️ 为创意项目快速制作原型道具 #3d建模 #创作人计划 #软件开发 #ai

60. 开源大模型从哪里来:模型平台、代码仓库与权重文件的工程化理解(本地部署的模型必看)

61. 让 VLM 学会用工具做空间推理

62. 百度放出 ERNIE-Image,国产开源文生图多了个新选择

63. 腾讯混元3D世界模型2.0开源 构建开放3D数字生态

64. 苹果开源新模型!一秒钟让照片变3D世界

65. 腾讯混元3D 3.1全球上线:8视图重建,支持每日20次免费生成与API

66. 腾讯发布并开源混元世界模型 2.0,一句话造出3D世界,兼容游戏引擎!

67. 亲测3种玩法:零基础用AI一分钟生成3D模型

68. ComfyUI 实践指南:手把手教你玩转 ERNIE-Image!

69. 腾讯混元3D世界模型2.0发布:无缝对接游戏工作流

70. 中山大学3D时空AILab 陈一平团队发布3DCity-LLM:面向城市理解的多模态三维大型语言模型

71. 本地部署大模型怎么选?一文看懂几大本地部署大模型方式的区别

72. 试试现在的AI 3D建模工具如何?Hi3D、Tripo、Meshy、混元、Rodin 大比拼 - 哔哩哔哩

73. 突破 2D 限制!Think3D 开源,将 3D 重建接入视觉大模型思维链

74. 🔥图片自动生成3D模型!可以渲染导出打印

75. 苹果开源高斯泼溅黑科技,引爆海外社区,一秒图片生成3D场景,盘点首波实测案例,网友:被低估的苹果世界模型

76. 突破 2D 限制!Think3D 开源,将 3D 重建接入视觉大模型思维链,VLM 空间推理性能显著提升

77. 腾讯推出混元3D AI大模型

78. 全球*先的AI 3D模型生成器,小白也能做3D建模! 已创建超过7000万个作品,无论是图片转模型还是文字生成模型,这里都能实现。 生成模型结构完整,纹理清晰,比实拍还精致。 过去3D建模师花几个小时手搓的模型,现在小白几分钟就能搞定,实现手办自由。#免费3D建模工具 #3D模型工具#ai工具测评#ai工具 #Meshy

79. 这么哇塞的世界模型,竟然是开源的!

80. 零基础秒出3D模型!这个建模宝藏网站直接封神了! 第30期,Meshy。这是一个小白也能快速上手的3D建模神器。它主要有图片生成模型、文本生成模型、文本生成图像功能、3D转视频等功能。它是一款小白能快速上手的3D建模软件,能够图像转3D模型,文本转3D,是不错的3D模型生成器,3D模型工具,AI 3D 建模,游戏建模,游戏资产生成器等。 #3D建模软件 #图像转3D模型 #AI工具测评 #MeshyAI #文本转3D

81. 一句话生成3D游戏?腾讯混元世界模型2.0开源

82. 在线教程丨微软开源3D生成模型TRELLIS.2,3秒生成全纹理资产

83. 【2026】免费3D AI真的能干掉付费工具吗?老司机实测深度拆解

84. 1月16日AI日报|抢先看!混元3D Studio 1.2!笔刷涂抹实现模型拆件!基模升级混元3D V3.1!FLUX.2 [klein] 亚秒级实现图像生成与编辑。

85. ERNIE-Image-Turbo - 百度开源文生图神器,海报、漫画、PPT图轻松生成 一键整合包下载

86. 3 秒上手,一句话生成3D模型!小白也能吊打老手 第9期 & 这是一个大幅降低3D建模门槛的宝藏工具。 无论是随手涂鸦,一张普通照片,或者是一句话,配合新版香蕉模型,都能快速生成精美的3D模型。 你甚至还可以一次性提供一堆参考图转3D,大幅提升工作效率。关键是在有遇到着急建模或者送礼物的时候,马上就能派上用场#AI工具 #3D建模 #3d打印 #文本转3D #3d建模教程视频

87. 3分钟学习大模型(LLM)基础 - 10 | 开源大模型与本地部署(Local Deployment)

88. 教程上新丨微软开源3D生成模型TRELLIS.2,3秒生成高分辨率的全纹理资产 - 哔哩哔哩

89. # AI建模教程:用Hi3D把2D图转3D模型,零基础低成本还能当副业

90. 我转行大模型在看的几个开源项目。。学习大模型就看开源就够了,之后分享相关的开源落地项目(rag,agent,多模态,推理,后训练等) 0.转行大模型学习路线 github.com/adongwanai/AgentGuide 1. 吴恩达大模型系列课程中文版 github.com/datawhalechina/llm-cookbook 2. 从零开始的大语言模型原理与实践教程 github.com/datawhalechina/happy-llm 3.《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调(全参数/Lora)、部署国内外开源大模型(LLM)/多模态大模型(MLLM)教程 github.com/datawhalechina/self-llm 4. 一份入门AI/LLM大模型的逐步指南,包含教程和演示代码,带你从API走进本地大模型部署和微调,代码文件会提供Kaggle或Colab在线版本 github.com/Hoper-J/AI-Guide-and-Demos-zh_CN 5. 《动手学大模型》系列编程实践教程 (含PPT、实验手册和视频),由上海交通大学2024年春季《人工智能安全技术》课程(NIS3353)讲义拓展而来(教师:张倬胜),旨在提供大模型相关的入门编程参考。本教程属公益性质、完全免费。通过简单实践,帮助同学们快速入门大模型,更好地开展课程设计或学术研究,主题包括数学推理、GUI Agent、大模型对齐等github.com/Lordog/dive-into-llms/ #互联网大厂 #转行大模型 #大模型实战#ai新星计划 #我要上热门🔥

91. 8B小身材,释放大能量!ERNIE-Image开源!

92. 图读文献 | SpatialLM

93. ICLR 2026|变长视觉Token调度加速大模型3D影像理解

94. SpatialBot 引入深度图增强空间理解

95. ERNIE-Image 8B开源:8B参数实现顶级文生图与精准文字渲染

96. 百度文心开源ERNIE-Image 复杂海报与多语言文字渲染能力全面升级

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章