3-bit以下量化大模型根本不能用:这些场景千万别碰

源自102位全网作者

03-28 13:14

精选参考来源

1
#DeepSeekv4要来了吗# 大家还记得去年春最火的三件套吗?今年的春节也马上到,DeepSeekV4要来了,这个很真实了吧。进入灰度测试阶段,也就表明正式版已经不远了。更牛的地方是说,该模型支持 100 万 Token 超长上下文,知识截止日期为 2025 年 5 月。有个尝试的小技巧:“你的上下文长度是多少”,会被告知上下文长度为128K,知识截止日期是24年7月,说明当前为老版本然后切换在手机端再问一下,如果知识库更新到25年5月,那恭喜你,灰测成功。#HOW I AI##过个有AI年#deepseekv4要来了吗
2
【#DeepSeek新模型更新#,#DeepSeek新版本灰度测试#】据鞭牛士,DeepSeek可能正在测试新的V4模型。科创板日报2月11日讯,多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。经实测,无论是安卓还是苹果,在手机App端和网页端,用户直接询问“你的上下文是多少”,得到的回答均显示DeepSeek的上下文窗口已达到约100万token。同时,知识歌更新时间也到了2025年5月份。这意味着它能一次性吃透极长的书籍、复杂的代码库或者海量的历史对话,而不会像以前那样聊着聊着就“失忆”。这一数据较此前版本有大幅提升,与目前行业头部模型的上下文容量处于同一水平。结合App版本的更新节奏,有观点认为DeepSeek可能正在为V4模型的正式发布做前期测试。截至发稿,DeepSeek官方尚未就新模型的相关信息发表回应。各位网友,您怎么看?(综合鞭牛士、科创板日报)@东方财经 #DeepSeek更新新模型#
全部
来源
内容由AI生成

精选参考来源

1. #DeepSeekv4要来了吗# 大家还记得去年春最火的三件套吗?今年的春节也马上到,DeepSeekV4要来了,这个很真实了吧。进入灰度测试阶段,也就表明正式版已经不远了。更牛的地方是说,该模型支持 100 万 Token 超长上下文,知识截止日期为 2025 年 5 月。有个尝试的小技巧:“你的上下文长度是多少”,会被告知上下文长度为128K,知识截止日期是24年7月,说明当前为老版本然后切换在手机端再问一下,如果知识库更新到25年5月,那恭喜你,灰测成功。#HOW I AI##过个有AI年#deepseekv4要来了吗

2. 【#DeepSeek新模型更新#,#DeepSeek新版本灰度测试#】据鞭牛士,DeepSeek可能正在测试新的V4模型。科创板日报2月11日讯,多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。经实测,无论是安卓还是苹果,在手机App端和网页端,用户直接询问“你的上下文是多少”,得到的回答均显示DeepSeek的上下文窗口已达到约100万token。同时,知识歌更新时间也到了2025年5月份。这意味着它能一次性吃透极长的书籍、复杂的代码库或者海量的历史对话,而不会像以前那样聊着聊着就“失忆”。这一数据较此前版本有大幅提升,与目前行业头部模型的上下文容量处于同一水平。结合App版本的更新节奏,有观点认为DeepSeek可能正在为V4模型的正式发布做前期测试。截至发稿,DeepSeek官方尚未就新模型的相关信息发表回应。各位网友,您怎么看?(综合鞭牛士、科创板日报)@东方财经 #DeepSeek更新新模型#

3. GLM-5 逼平 ClaudeOpus4.5,对中国 AI 大模型发展有何意义?

4. 正面硬刚Gemini 3 Pro,阿里开源Qwen3.5-Plus|甲子光年

5. 数据分析常常涉及多表关联、统计测试和复杂的可视化,手动处理不仅费时还容易出错。quelmap 是一个开源的本地数据分析助手,集成了多功能的数据表分析、内置 Python 沙箱和多种大型语言模型(LLM)支持,帮助你快速洞察数据背后的价值。 quelmap 支持同时分析30多张表,处理无限行数据,内置 Lightning-4b 轻量级模型,性能优异且资源占用低。只需 Docker 环境即可一键启动,支持多种 LLM 提供商,灵活运行本地或云端。 主要功能包括: - 多表连接与复杂数据可视化; - 直接运行统计测试,自动生成分析代码; - 内置 Python 沙箱,支持自定义数据处理; - 支持上传 CSV、Excel、SQLite 等多种数据格式; - 灵活切换 Ollama、OpenAI、Anthropic 等不同 LLM 模型; - 支持完全本地运行,保护数据隐私。 非常适合数据科学家、分析师和开发者使用,尤其适合对数据安全和本地计算有较高要求的场景。 GitHub 地址:github.com/quelmap-inc/quelmap 官网:quelmap.com 用简单的步骤即可搭建自己的智能数据分析助手,让数据分析更高效、更智能。

6. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

7. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

8. 【#阿里千问3.5对战Gemini3#】刚刚,阿里正式发布全新一代大模型千问Qwen3.5-Plus。用户可在千问APP、千问PC端体验,点击页面顶部「千问」图标,即可切换模型,体验Qwen3.5-Plus。据悉,千问3.5实现了从纯文本模型到原生多模态模型的代际跃迁。 此次发布的版本总参数为3970亿,激活仅170亿,性能称超过万亿参数的Qwen3-Max模型,部署显存占用降低60%,推理效率大幅提升,最大推理吞吐量可提升至19倍。 Qwen3.5-Plus的API价格每百万Token低至0.8元,仅为Gemini 3pro的1/18。

9. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生

10. #微博声浪计划##听见微博# DeepSeek新模型曝光!V4架构在GitHub意外泄露,春节发布前夕技术细节浮现。新模型采用独立架构,硬件优化使显存降30%以上,支持FP8量化,适配英伟达Blackwell。性能预期百万级上下文处理,API成本或为GPT-4 Turbo的1/70,若兑现将改写国产AI格局。 科技开的微博音频

11. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

12. 智能体上下文工程:为什么文件系统成了AI记忆的最佳载体?

13. 大模型的上下文工程,都说很重要,但相关的研究那么少,对Agent开发有什么影响,有大佬能解释一下吗?

14. 阿里发布千问3.5,性能媲美Gemini 3, Token价格仅为其1/18

15. 节前重磅:开源旗舰模型新SOTA,智谱GLM-4.6问世

16. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

17. 除夕迎「源神」?Qwen3.5以小胜大,捅破性价比天花板,大模型竞赛下半场开始了

18. AI春节档最强杀手锏来了!千问3.5除夕强势亮相,开源SOTA、性价比之王

19. 上交大和辉羲把LLM刻进ROM!推理性能冲2万token/s,GPU时代终结?

20. #Easy同学正在独立开发# 今天学习了下一篇关于上下文工程的论文。看视频比看论文好多了

21. 【华为昇腾 0 Day 适配阿里 Qwen3.5,MindSpeed MM 框架实现 " 开箱即用、快速迭代 "】阿里在 chat.qwen.ai 页面低调上线了 Qwen3.5-Plus 和 Qwen3.5-397B-A17B 两款新模型(均支持文本和多模态任务)。Qwen3.5 Plus 定位为 Qwen 3.5 系列最新大语言模型;Qwen3.5-397B-A17B 定位则是 Qwen3.5 开源系列旗舰大语言模型。华为计算官方昨晚宣布,Qwen3.5 模型一经开源发布,昇腾 0 day 实现基于 MindSpeed MM 在 Atlas 800 A3、Atlas 900 A3SuperPoD 上的训练复现,同时也支持基于 vLLM-Ascend 和 SGLang 在 Atlas 800 A2、Atlas 800 A3 上的高效推理部署。据介绍,基于 FSDP 训练后端的设计,MindSpeed MM 框架大幅缩短了新模型的适配周期,实现了 " 开箱即用、快速迭代 " 的开发体验,为多模态大模型的研究与应用提供了技术支撑。另据阿里云介绍,Qwen3.5 实现了底层模型架构的全面革新,其中,Qwen3.5-Plus 版本总参数为 3970 亿,激活仅 170 亿,性能超过万亿参数的 Qwen3-Max 模型,部署显存占用降低 60%,推理效率大幅提升,最大推理吞吐量可提升至 19 倍。Qwen3.5 在能力、效率与通用性三个维度上推进预训练:能力(Power):在更大规模的视觉-文本语料上训练,并加强中英文、多语言、STEM 与推理数据,采用更严格的过滤,实现跨代持平:Qwen3.5-397B-A17B 与参数量超过 1T 的 Qwen3-Max-Base 表现相当。效率(Efficiency):基于 Qwen3-Next 架构 —— 更高稀疏度的 MoE、Gated DeltaNet + Gated Attention 混合注意力、稳定性优化与多 token 预测。在 32k/256k 上下文长度下,Qwen3.5-397B-A17B 的解码吞吐量分别是 Qwen3-Max 的 8.6 倍 / 19.0 倍,且性能相当。Qwen3.5-397B-A17B 的解码吞吐量分别是 Qwen3-235B-A22B 的 3.5 倍 / 7.2 倍。通用性(Versatility):通过早期文本-视觉融合与扩展的视觉 / STEM / 视频数据实现原生多模态,在相近规模下优于 Qwen3-VL。多语言覆盖从 119 增至 201 种语言 / 方言;25 万词表(vs. 15 万)在多数语言上带来约 10–60% 的编码 / 解码效率提升。vllm 部署指导可参见魔乐社区和 gitcode 社区链接:网页链接网页链接SGLang 部署指导可参见 SGLang 社区链接:网页链接

22. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说

23. #千问Qwen3.5大模型发布#千问 Qwen3.5 是采用极致稀疏 MoE 架构在保持超强性能的同时,显存占用降低 60%,推理效率大幅提升,部署成本显著下降。模型支持最高 256K 超长上下文,让长文本处理变的更加的轻松有效率了!原生多模态统一也是Qwen3.5的特点之一,也是目前国内外大模型的发展的主要趋势,模型在图文、视频理解能力全面升级,精准解析图表、文档与复杂视觉内容。实现了一个入口实现多种属性。Qwen3.5对于中小企业特别友好, 很大程度上降低了企业运营成本,可以让中小企业得到高效、普惠、全能的运营工具。不再因为高昂的费用而排斥企业去追逐AI。#过个有AI年##HOW I AI#

24. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

25. 股价暴涨32%!GLM-5登顶全球开源第一,25分钟一镜到底搓出完整系统

26. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文

27. GLM-5深夜官宣:Pony Alpha身份揭晓,编程能力逼近Claude Opus

28. Qwen3.5 量化:INT4 vs NVFP4 vs FP8 vs BF16我对量化的 Qwen3.5 9B、27B 和 35B 进行了全面评估——全部与 vLLM 兼容。文章:网页链接一些实用建议:- 性能优异的 4 位 Qwen3.5 27B 处理器比 Qwen3.5 9B 处理器性能强得多,而且内存预算也相近。- 注意“INT4”标签:有些 INT4 型号最终会变得几乎和 FP8 版本一样大,因为许多敏感层保持了更高的精度。量化后的 Qwen3.5 模型需要更长的思考时间。因此,虽然模型运行速度更快、内存效率更高,但生成的词元也更多。为了获得最佳质量,首先不要量化线性注意力机制。如有必要,也可以将注意力机制保持在 16 位。Qwen 在其 INT4 版本中也采用了这种策略,效果很好。对于 MoE 模型:不要量化共享专家。我在@verdacloud提供的 B200、H200 和 RTX Pro 6000 GPU 上进行了这些实验(计算赞助)。

29. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)

30. 揭秘GLM-5技术底牌:「异步强化学习框架Slime」成终极杀招

31. #千问Qwen3.5大模型发布#阿里在除夕夜甩出了个王炸——全新大模型千问Qwen3.5开源了,看完参数我直接好家伙: 用了Mamba混合注意力+MoE稀疏专家架构,总参数3970亿,但每次推理只激活170亿,相当于“小身材干大活”,显存占用直接砍半还多,长文本处理速度直接起飞。终于从纯文本模型进化成原生多模态,以后图文交互、复杂任务处理更丝滑。性能直接对标顶级开源产品,关键是部署门槛低了一大截,不管是企业还是个人开发者,都能轻松玩起来。 与其说是发布新模型,不如说是把大模型的“技术普惠”又往前推了一大步。

32. 除夕夜,国产顶流压轴上线,QWEN3.5多模态开源!

33. DeepSeek模型更新 黄心怡 财联社 多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。《科创板日报》记者实测中发现,DeepSeek在问答中称自身支持上下文1M,可以一次性处理超长文本。记者在提交了超过24万个token的《简爱》小说文档,DeepSeek可以支持识别文档内容。

34. 「Github一周热点104期」智谱GLM-5发布,打响春节AI大战模型第一枪

35. 华为AI开发三大颠覆性突破:代码生成、自动测试、Bug修复全搞定!码农福音还是大锤? 华为云码道(CodeArts) 代码智能体公测版今日发布,集代码大模型、IDE、自主开发模式为一体,覆盖代码生成、研发知识问答、单元测试用例生成、专家技能Skills、Codebase代码库索引、规范驱动开发等AI Coding技术,同时接入开源模型GLM-5.0、DeepSeek-V3.2以及华为自研模型,并提供鸿蒙的专属模型。 鸿蒙专属模型,纯血鸿蒙应用开发简单,后续鸿蒙APP将爆发,各种鸿蒙APP会填补缺口。对一些公司来说是个机会窗。

36. 2026开年王炸:Qwen3.5震撼发布,一条视频讲清所有玩法...

37. GLM-5深夜登场,这是国产开源模型首次逼平Claude Opus 4.5。

38. GLM-5封神,智谱市值五天翻倍,中国AI火力全开了

39. 国内,只是用 computer use,不用分析项目改代码,其实 Open Code + GLM 4.7 用着比 Claude Code + Claude + Sonnet 4.5 舒服。Claude 这个公司太反华了,调用的确麻烦。。。(其实里面还有中国资本)如果要改代码,那还是后者吧没办法。

40. GPT5.2亮点解读,OpenAI重夺年度最强 OpenAI甩出王炸GPT5.2,核心基准测试,全面碾压Gemini 3 Pro和Claude Opus4.5,强势夺回地表最强 奥特曼放话GPT5.2不仅是最强通用大模型,还要成为你日常办公的AI合伙人 亮点1、最强视觉能力 亮点2、最强上下文 亮点3、最强办公能力 亮点4、最强编程能力 #AI新星计划 #抖音知识年度大赏 #人工智能 #OpenAI #大模型

41. 白嫖顶级AI模型!GLM-4.7 + MiniMax M2.1 免费 API,媲美直连 Claude Code!NVIDIA 限免福利 | 零度解说

42. 没想到今年除夕夜,阿里又整了一波“AI年货”,直接开源新一代千问大模型 Qwen3.5!这次架构上玩了混合注意力机制,还自带视觉理解能力,等于是文本、图片一锅端。开源的规格也够狠,至少 2B 参数的密集模型,外加 35B-A3B MoE 大模型,推理成本下降、效率提升,感觉就是冲着让更多开发者随手用、用得起来的。更有意思的是,Qwen3.5 的代码已经提交到 HuggingFace Transformers,随时可以拉下开干。阿里去年的 Qwen2.5-Max 就是除夕放大招,今年继续延续“春节爆款”策略,这波真的把全球 AI 开源圈的存在感拉满了。#千问Qwen3.5大模型发布#

43. 智谱最强编码模型GLM-4.6发布,性能超DeepSeek-V3.2-Exp

44. #千问Qwen3.5大模型发布# 刚刚,千问正式官宣发布 Qwen3.5,并推出Qwen3.5系列的第一款模型 Qwen3.5-397B-A17B 的开放权重版本。作为原生视觉-语言模型,Qwen3.5-397B-A17B 在推理、编程、智能体能力与多模态理解等全方位基准评估中表现优异,助力开发者与企业显著提升生产力。该模型采用创新的混合架构,将线性注意力(Gated Delta Networks)与稀疏混合专家(MoE)相结合,实现出色的推理效率:总参数量达 3970 亿,每次前向传播仅激活 170 亿参数,在保持能力的同时优化速度与成本。我们还将语言与方言支持从 119 种扩展至 201 种,为全球用户提供更广泛的可用性与更完善的支持!#HOW I AI##过个有AI年#

45. 阿里千问Qwen3.5大模型发布,堪称国产AI开源领域的里程碑式突破。这次不是小版本迭代,而是架构级革新,以3970亿总参数、仅170亿激活参数实现“以小胜大”,性能超越上一代万亿参数模型,推理效率大幅提升、部署成本显著下降。它从纯文本升级为原生多模态,图文理解更自然流畅,中英文与多语言能力全面增强,多项基准测试对标国际顶级闭源模型。同时坚持全面开源、普惠定价,大幅降低企业与开发者使用门槛,让高效AI能力真正走向普及。Qwen3.5用技术实力证明,国产大模型已走向高效、强悍、易用的新阶段,既撑起技术底气,也激活整个AI生态,是今年最有分量的技术献礼。刚刚我还用千问让它用英文写一段祝福语,写得还蛮好的!#千问Qwen3.5大模型发布# #HOW I AI# #过个有AI年#

46. 【在家搭建你自己的AI编程助手:一套完全开源的本地方案】最近有个话题在技术圈子里很火:能不能在家里搭一套本地运行的AI编程助手,完全不依赖云端服务?答案是可以的。有人用OpenCode加上llama.cpp,再配合GLM-4.7 Flash模型,在自己的机器上跑出了相当不错的效果。先说硬件配置。这位开发者用的是三张3090显卡,128GB内存,上下文窗口开到了20万token。听起来配置不低,但实际上很多人用单卡也能跑。有人用4070Ti在5万上下文下跑出45 token每秒,有人用7900 XTX在零上下文时达到120 token每秒。关键在于参数调优和版本选择。这里有个重要提醒:一定要用最新版本的llama.cpp。LM Studio和Ollama虽然底层也是llama.cpp,但版本往往滞后。GLM-4.7 Flash最近有多个修复补丁合并进主分支,用旧版本可能会遇到各种奇怪问题,比如输出循环、工具调用失败等等。说到实际效果,这套方案能做什么?有人让它从一个简单的示例程序出发,自动生成了一个完整的多智能体辩论系统,包含配置文件、代理类、管理器、入口脚本,甚至还自动写了单元测试。整个过程没有人工干预测试部分,模型自己判断需要写测试就写了。当然,本地方案和云端服务还是有差距的。有人测试发现,同样的任务Claude Code几分钟搞定,本地模型可能会卡在某个错误上反复尝试。这不是框架的问题,是模型能力的差异。但换个角度想,这已经是能在消费级硬件上运行的最强开源方案之一了。有个有趣的发现:GLM-4.7 Flash在8bit量化下表现稳定,但4bit量化容易出现循环。这是目前发现的第一个量化精度对输出质量有明显影响的小模型。关于电费的问题,有人算过一笔账。即使用5090显卡全天候满载运行,按美国最贵的电价每度40美分计算,一个月电费大约165美元。大多数人的实际使用强度远低于此,加上平均电价只有一半左右,实际成本可能只有几十美元。最后说说工具选择。OpenCode是一个开源的编程助手框架,可以配置MCP服务器实现向量检索、网页搜索等扩展功能。有人问为什么不直接用Claude Code配本地模型,答案很简单:目标是搭建一套完全开源、完全本地的方案。这不仅是技术选择,也是一种态度。能在自己的机器上运行一个接近商业水准的AI编程助手,这件事本身就值得兴奋。技术进步的速度超出想象,今天的不可能很快就会变成明天的标配。reddit.com/r/LocalLLaMA/comments/1qqpon2/opencode_llamacpp_glm47_flash_claude_code_at_home

47. 【苹果闪存运行大模型技术突破 MacBook打破内存极限】3月20日消息,开发者在搭载M3 Max芯片、48GB内存的MacBook Pro上,成功运行209GB的Qwen3.5-397B超大AI模型,速度超5.5 Token/秒。该技术借鉴苹果闪存运行大模型论文,将模型参数存于NVMe SSD,按需高效传输至内存,依托苹果统一内存架构实现多硬件协同,还精简模型激活参数降低内存需求。核心优化代码由AI助手自动生成,项目已在GitHub开源。榨干MacBook性能:苹果“闪存运行大模型”技术如何打破内存极限

48. GLM-4.7-Flash 量化版来了

49. 智谱GLM-4.7-Flash大模型本地部署完全指南

50. GLM-4.7-Flash 量化版本地部署,1 张 4090 开跑

51. 30B参数的效率革命

52. GLM-4.7-Flash本地部署全攻略

53. 如何评价Qwen3.5的综合性能

54. 除夕夜炸场!Qwen 3.5 正式发布

55. Qwen3.5模型深度评测

56. GLM-4.7震撼发布!开源 MoE 大模型真的能在本地跑起来吗

57. 用 Ollama 跑智谱 GLM-4.7-Flash,本地大模型体验直接拉满

58. Qwen3.5,我用5090跑了14天

59. 被马斯克称为“印象深刻”的Qwen3.5小模型

60. Qwen3.5系列发布四小模型

61. Qwen 3.5 小模型系列震撼发布!

62. GLM-4.7-Flash 开源发布30B 参数、3B 激活的高效 MoE 大模型

63. 3B激活参数碾压20B对手!国产模型GLM-4.7-Flash免费开源

64. Qwen3.5 35B封神!M1 Ultra 64GB RAM实测60 tokens/秒,保姆级调参

65. 马斯克点赞!Qwen3.5小模型实战测评,让你的个人PC上跑出轻量级冠军模型

66. Qwen 3.5 35B-A3B实测M3 Ultra 512GB、RTX Pro 6000、R9700、5090情况

67. 重大突破!Qwen 3.5 0.8B 本地运行,浏览器直接用,太卷了

68. 端侧天花板!Qwen3.5家族强悍系列模型来袭

69. 实测,单卡 4090 + llama.cpp 轻松跑 Claude-Opus-4.6蒸馏版Qwen3.5 27B,46 Token每秒!

70. Qwen 3.5 MoE 来了

71. Qwen3.5本地部署性能炸裂

72. 我用Ollama本地部署了智谱GLM-4.7-Flash,效果比想象中好

73. 30B 级模型新王者?GLM-4.7-Flash 开源了,Ollama 已火速支持

74. 它来了!Qwen3.5开源4个尺寸小模型,从0.8B到9B

75. 10B 是关键!实测揭示大模型 4-bit 量化的安全边界

76. 实测Qwen3.5-397B-A17B

77. 腾讯混元发布HY-1.8B-2Bit端侧模型 实现产业级2Bit量化落地

78. 使用 Unsloth 与 PyTorch QAT 将大模型量化至 4-Bit(且不损失精度)

79. vLLM 部署 Qwen3.5 满血&量化版,并发性能测试,附部署脚本

80. 大模型低比特量化格式之争:整数还是浮点?

81. GLM-4.7-Flash评测:30B级别最强模型,API免费,本地部署指南!

82. 国产芯片大模型推理优化系列(第二期)-Qwen3.5-27B

83. JupyterLab+PyTorch:LoRA+4-bit量化+SFT微调Llama 4医疗推理数据集应用|附代码数据

84. GLM-4.7-Flash 正式开源:30B 混合思考模型,开启轻量化 AI 新时代

85. GLM-4.7-Flash登场,30B 级别最强模型,轻量部署新选择,性能与效率双丰收

86. 1比特极限量化下本地部署GLM4.7并全方位实测! 这几天GLM 4.7可以说是各种刷榜,其强大的代码智能体能力可以说是比肩Claude 4.5 Sonnet。今天各路大神相继放出了量化版让本地部署和使用GLM 4.7成为了可能。今天我们就本地部署一个极限1比特量化的版本,看看其性能和满血版相差多少! #ai新星计划#glm #智谱ai #量化 #大模型评测

87. 256GB顶配Mac实测:本地跑大模型50t/s不幻觉,Qwen3.5即将封神

88. 阿里Qwen3.5-27B实测

89. 大模型低比特量化格式之争:整数还是浮点

90. Qwen3.5 本地部署

91. 🚀开源编程新王诞生,对标Claude Sonnet 4.5?实测GLM-4.7:Coding和Agentic能力直逼Gemini 3和Claude 4.5

92. Qwen3.5实测! 来看贺岁档大模型的实力!

93. GLM-4.7-Flash无审查版发布:30B MoE模型,仅3B激活参数

94. GLM-4.7-Flash 开源技术深度解析:MoE 架构的工程化落地

95. 美格智能高算力AI模组+Qwen3.5,打造端侧最强AI智能体

96. GLM-4.7-Flash实测:30B里的编程黑马

97. M3 Ultra 512G 运行 GLM-4.7 简单实测

98. 智谱AI发布GLM-4.7-Flash:30B级最强模型开源免费

99. ICLR 2026 | 把视频扩散模型压到4bit,还能接近满血效果? QVGen让「超低比特视频生成量化」真正可用

100. GLM-4.7-Flash:30B级MoE模型王者,轻量化部署新选择

101. 除夕夜开源:阿里Qwen3.5技术解析

102. llama.cpp本地部署glm-4.7-flash量化模型学习笔记 - 哔哩哔哩

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章