当前位置:
AIGC文章详情

张大妈

24GB显存≠长上下文自由:7900XTX跑大模型的真实瓶颈在这

源自33位全网作者

05-23 12:52

内容由AI生成

精选参考来源

1. 多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。记者实测中发现,DeepSeek在问答中称自身支持上下文1M,可以一次性处理超长文本。(科创板日报)

2. DeepSeek-V4终于更新了!一百万超长上下文,Agent能力大幅增强,能力接近Opus 4.6

3. 8G显存真不够用?爆肝3个月实测18张显卡20款游戏,结果竟然......

4. #DeepSeekV4发布# DeepSeekV4终于发布了,简单总结下:1、双版本发布:推出 DeepSeek-V4-Pro(高性能)和 DeepSeek-V4-Flash(高性价比)两个版本,可按需选择。2、超长上下文:支持 1M token(约百万字) 的上下文长度,能一次性处理海量信息。3、核心能力领先:在 Agent能力、世界知识和推理性能 三方面均达到国内及开源模型的领先水平。4、具体任务表现:V4-Pro版本的代理编码能力接近顶尖闭源模型,在数学、编程等推理任务上超越所有已开源评测的模型。5、技术创新与迁移提醒:采用 DSA稀疏注意力机制 降低长上下文计算成本;原有 deepseek-chat 等模型名3个月后停止使用,需迁移到新名称。

5. 【#零态洞察百态##DeepSeek更新百万Token上下文#】#DeepSeek多终端对齐百万Token# 4月22日消息,今日有大量用户反馈称,DeepSeek官方API已经更新到了与客户端及网页版相同的1M tokens上下文版本,比之前的128k上下文更长。(IT之家) 知氪科技的微博视频

6. DeepSeek模型更新 黄心怡 财联社 多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。《科创板日报》记者实测中发现,DeepSeek在问答中称自身支持上下文1M,可以一次性处理超长文本。记者在提交了超过24万个token的《简爱》小说文档,DeepSeek可以支持识别文档内容。

7. DeepSeek v4全面支持百万上下文 token,这意味着什么?到底有多厉害?

8. #DeepSeekV4发布#DeepSeek刚刚发布了新的V4系列模型,主要有三项比较大的变化:支持百万级上下文、引入混合注意力机制通过压缩Token,百万级上下文需要的推理算力和显存显著下降、性能更高,多项基准刷新开源模型记录的同时Token成本更低。[good] 值得一提的是,V4不具备多模态能力。所以怎么说呢,期待的一年的V4模型,发布后基本符合预期吧。 在AI的浪潮里,大模型也上演着后浪推前浪,年初至今,Seedance 2.0、小米MiMo等国产大模型一个比一个表现出色,在全球掀起了巨大关注。这也应了那句:一支独放不是春,百花齐花春满园。中国大模型加油![耶]

9. 来自AMD的纯白背插?蓝宝石氮动极光系列评测

10. DeepSeek V4 网页端《原神×我的世界》融合小游戏代码测试:拳打 ChatGPT,脚踢 Gemini,硬刚 Claude

11. 【#DeepSeek唯一遗憾无多模态##DeepSeekV4再次开出行业最低价#】DeepSeek今日宣布,拥有百万字超长上下文的deepseek-v4-pro和deepseek-v4-flash两款模型发布并开源,即日起登录官网或官方App即可与最新的DeepSeek-v4对话,探索1M(百万)超长上下文记忆的全新体验。 据官方公布基准测评,在上下文长度、知识、推理及Agent等能力上,DeepSeekv4性能比肩国际顶级闭源模型,达到国际开源模型一流水平。《BUG》栏目对比发现,在API调用价格上,去年以一己之力撬动国内大模型行业降价的DeepSeek,V4版本再次开出了行业“最低价”。 据DeepSeek官方介绍,受限于高端算力,目前Pro的服务吞吐量十分有限,预计下半年昇腾950超节点批量上市后,Pro的价格会大幅下调。 “虽然每百万Tokens调用价格国内模型均未下降太多,但超长上下文长度及不俗的性能,让其极具竞争优势!”有业内人士感慨道:“那个大模型价格屠夫,又回来了!” 遗憾的是,目前v4版本依然是一款纯文本模型,没有太多的文生图、文生视频等多模态能力。(新浪科技 文) “价格屠夫”!DeepSeekV4百万上下文打到2毛,国产卡将腰斩API价格?

12. MiniMax M2.7+OpenClaw实战!AI到底能接管多少工作?

13. 本地AI哪家强?统一内存大横评!

14. GPT5.2亮点解读,OpenAI重夺年度最强 OpenAI甩出王炸GPT5.2,核心基准测试,全面碾压Gemini 3 Pro和Claude Opus4.5,强势夺回地表最强 奥特曼放话GPT5.2不仅是最强通用大模型,还要成为你日常办公的AI合伙人 亮点1、最强视觉能力 亮点2、最强上下文 亮点3、最强办公能力 亮点4、最强编程能力 #AI新星计划 #抖音知识年度大赏 #人工智能 #OpenAI #大模型

15. #DeepSeek下个王炸是什么# DeepSeek2026年的王炸大概率聚焦长上下文与效率优化的深度融合,继2026年初灰度测试百万token上下文模型后,DeepSeek将完善相关技术,依托mHC流形约束超连接与Engram条件记忆模块,解决长序列计算的内存开销问题,实现100万token下的高准确率推理。DeepSeekV4完整版模型的发布应该也是DeepSeek的一个重要的更新,新模型将结合混合专家架构优化,延续DeepSeek低成本高性能的优势,让中小企业也能便捷接入顶尖AI能力。推动开发者共建垂直场景应用;贴合2026年AI从会生成向会行动的进化趋势。#HOW I AI#

16. #微博声浪计划##听见微博# DeepSeek新模型曝光,其新一代旗舰模型V4核心架构MODEL1因GitHub代码更新意外公开。该架构在KV缓存、FP8量化等方面革新,支持百万Token上下文,推理成本仅为GPT-4 Turbo的1/70,预计2026年春节发布,或推动国产大模型效率革命。 铭科技的微博音频

17. #DeepSeek新架构意味着什么#DeepSeek Model 1架构聚焦效率突破,通过KV缓存压缩、稀疏性处理与FP8解码组合,将显存占用直接砍半,推理速度提升30%,搭配Engram记忆机制与VVPA技术,长文本处理精度与效率双优,在16K token语境中仍能精准捕捉关键信息。DeepSeek Model 1架构也意味着国内的大模型也开始摆脱堆参数依赖,转向架构优化与硬件适配的高效路线。DeepSeek Model 1架构证明低成本、高性能可并行实现,有利于行业从性能追赶转向范式创新。Model 1作为DeepSeek V4的工程版,同步适配英伟达新芯片与国产昇腾芯片,强化了技术兼容性。其开源基因与效率优势,将吸引更多开发者与企业接入,进一步巩固DeepSeek在开源社区与产业应用中的影响力。

18. 【#DeepSeek新模型更新#,#DeepSeek新版本灰度测试#】据鞭牛士,DeepSeek可能正在测试新的V4模型。科创板日报2月11日讯,多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。经实测,无论是安卓还是苹果,在手机App端和网页端,用户直接询问“你的上下文是多少”,得到的回答均显示DeepSeek的上下文窗口已达到约100万token。同时,知识歌更新时间也到了2025年5月份。这意味着它能一次性吃透极长的书籍、复杂的代码库或者海量的历史对话,而不会像以前那样聊着聊着就“失忆”。这一数据较此前版本有大幅提升,与目前行业头部模型的上下文容量处于同一水平。结合App版本的更新节奏,有观点认为DeepSeek可能正在为V4模型的正式发布做前期测试。截至发稿,DeepSeek官方尚未就新模型的相关信息发表回应。各位网友,您怎么看?(综合鞭牛士、科创板日报)@东方财经 #DeepSeek更新新模型#

19. 【2300亿参数只激活100亿,MiniMax做到了什么】 MiniMax-M2.5的参数规模终于曝光:总参数2300亿,活跃参数仅100亿。这个数字意味着什么?对于显卡资源有限的开发者来说,这可能是目前性价比最高的本地大模型选择。 MoE架构的精妙之处在于:每个token只调用100亿参数完成计算,但整个2300亿参数库随时待命。你不能只加载100亿参数就跑起来,因为下一个token可能需要完全不同的专家组合。这是一种「按需调用」的智慧,而非简单的模型瘦身。 社区里有人做了个有趣的实验:用gzip压缩模型文件,竟然能减少30%的体积。从信息论角度看,这说明模型内部存在大量冗余。但冗余未必是坏事,就像传统神经网络中的冗余有时反而能提升性能。真正的挑战是:如何在保持推理效率的前提下利用这种压缩潜力? 实测数据相当可观。六张32GB的Mi50显卡跑Q4量化版本,短上下文能达到每秒15个token,150k上下文时降到4.5个token。对于追求无限本地推理的开发者而言,这个速度完全可以接受。有人在单张RX 7900 XTX上跑Q3量化版,也能稳定在每秒12个token。 关于REAP压缩技术,社区讨论颇为热烈。Cerebras团队已经将MiniMax 2.1压缩到139亿参数,质量损失极小。如果能对2.5版本做类似处理,压缩到160亿参数左右,再配合量化,最终可能只需要85到90GB就能跑起来。这对128GB内存的机器来说,意味着还有足够的空间处理长上下文和工具调用。 不过也有用户指出MiniMax系列的一个特点:对非常具体的指令响应不够精准。比如让它只回答「4」,它可能会先输出一大段推理过程。这在某些场景下是优势,在另一些场景下则显得啰嗦。 从GLM需要翻倍参数才能继续进化,到Kimi动辄万亿参数,MiniMax用2300亿参数做到了接近Sonnet的水平。这不是参数军备竞赛的胜利,而是架构设计的胜利。 reddit.com/r/LocalLLaMA/comments/1r35d2x/minimaxai_minimaxm25_has_230b_parameters_and_10b

20. AMD 7900XTX 跑 Qwen3.5-35B 实测:Vulkan 后端狂飙 160+ Token/s!比 ROCm 快 2 倍 AMD ROCm团队在干啥

21. RTX 4090 vs RX 7900 XTX实测:同是24GB显存,AI绘图差距竟达50%?

22. TurboQuant+7900 XTX+Qwen3.5 27B本地大模型+OpenClaw|实现128K长上线文实测实现Token自由

23. 7900 XTX 对决 4070 Ti Super,24GB 显存真能碾压 AI 画图吗

24. 7900xtx+windows 11直驱comfyui 0.12.3

25. AMD7900XTX跑Qwen3.6-35B实测:Vulkan后端狂飙140+Token\u002Fs!比ROCm快1.5倍AMDROCm团队在干啥

26. 2026年本地部署大模型,哪个显卡最好?

27. 基于AMD AI pro R9700+ollama+openwebui的运行本地大模型的实践

28. Qwen3.6 27B-Q4 7900XTX+7900XT 110TG达成

29. RX 7900 XTX vs R9700实测:llama.cpp Vulkan碾压ROCm?双卡vllm

30. AMD显卡跑Qwen3.5-27B,解码速度2.25倍暴涨,只因一个配置文件

31. 7900XTX 跑满 Qwen3.5-35B!每秒 70+ Token 是什么体验?

32. 2026 年 AMD 显卡在Windows 利用 ROCm本地部署 LLM 指南

33. A卡yes么?比N卡跑大模型差在哪?

3
扫一下,分享更方便,购买更轻松
1评论

  • 精彩
  • 最新
  • rocm7.2 llama.cpp相当成熟,为啥要用vulkan?Windows下comfyui + rocm也很流畅,不能用controlnerlt节点这说法简直惊悚。cuda当然有生态优势,速度也确实快人一步,但不代表amd不能玩。

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章