4090也带不动70B大模型?本地部署的真相是:选对模型比显卡更重要
04-25 08:56
精选参考来源
新浪微博 2026-04-22
新浪微博 2026-04-21
来源
精选参考来源
1. 千问3.6的35B模型非常强,体感上强于gemma4的26b量化,由于gemma4 31b的性能优化没做好所以没法有效测试。从gemma4和qwen3.6的量化测试来看,当模型权重能装载到GPU里,那么推理的tokens工作就由CPU来完成了,GPU负载较低,CPU的计算密度极大。同时内存消耗较高。这也就是说GPU,内存,CPU在AI推理时所进行的workload比重是差不多的,那么CPU的性能就决定了在GPU达标以后的推理性能。所以,这可能给我们一个启示,对于本地推理来说,显存才是王道,架构和GPU算法等技术的影响较小。显卡投资只需要上显存,没必要上先进架构。一句话,如果你玩本地大模型,选择显卡的指标只有一个,显存。 孤鸿泽的微博视频
新浪微博 2026-04-22 00:00:00
2. 【24GB 显存专属!消费级硬件也能跑的顶尖 AI 模型清单】这里有一份针对24GB显存(如RTX 3090/4090或24GB Mac)的实战模型清单,让你在消费级硬件上也能拥有顶尖的AI体验。第一部分:速度与智能的平衡点如果你追求响应速度,MoE(混合专家)架构是首选:- Qwen3.6-35B- Gemma-4-26B-A4B这两款模型在保持极高推理速度的同时,依然拥有出色的逻辑能力。MoE架构的魅力在于它只激活部分参数,让你的显卡在低延迟下跑出工业级的效率。第二部分:极致智能的代名词如果你愿意牺牲一点速度来换取更深邃的思考,请选择密集(Dense)模型:- Qwen3.5-27B- Gemma-4-31B这些模型在编程、推理和复杂指令遵循上表现惊人,足以媲美MiniMax-M2.5等闭源大模型。在速度不是首要考虑因素时,它们就是消费级硬件能触达的智能天花板。第三部分:垂直领域的特种兵- Zeta-2:本地版的Cursor Tab。它专门为代码编辑预测优化,甚至可以在4GB显存上运行,是开发者本地IDE的最佳拍档。- Parakeet-TDT:语音转文字(STT)利器。与其打字,不如直接口述。它能精准转录并放入剪贴板,让你真正实现与AI代理的实时对话。- Hermes-4.3-36B:拒绝拒绝的模型。如果你厌倦了AI繁琐的安全限制,Hermes提供了极致的开放性和 steerability,是目前最懂你的中立助手。工具建议:新手建议从LM Studio开始,它提供了最直观的交互界面;进阶用户可以尝试vLLM或SGLang,以获得更高的吞吐量和更专业的部署体验。x.com/0xSero/status/2046515626143846521模型地址:huggingface.co/google/gemma-4-26B-A4B-ithuggingface.co/Qwen/Qwen3.6-35B-A3Bhuggingface.co/google/gemma-4-31B-ithuggingface.co/Qwen/Qwen3.5-27Bhuggingface.co/zed-industries/zeta-2huggingface.co/nvidia/parakeet-tdt-0.6b-v3huggingface.co/NousResearch/Hermes-4.3-36B
新浪微博 2026-04-21 00:00:00
3. 谷歌Gemma 4深夜突降,31B爆杀20倍巨头!手机跑全血「龙虾」
知乎 2026-04-03 00:00:00
4. 【8GB显存也能训大模型?Unsloth重新定义个人AI硬件边界】快速阅读:Unsloth AI 发布了针对 Gemma 4 的免费训练笔记本,通过优化算法,让仅需 8GB 显存的家用显卡也能实现比以往快 1.5 倍、显存占用降低 50% 的微调任务。这标志着大模型训练正从昂贵的云端集群向个人本地硬件转移。---训练大模型似乎一直是个重型工程,像是在试图用一辆家用轿车去拉动一列货运火车。但 Unsloth AI 现在的做法,更像是给这辆小车换了个超高效的变速箱和轻量化底盘。只要 8GB VRAM,就能在本地跑起 Gemma 4 的微调。这意味着那些躺在抽屉里的 RTX 2070S 甚至老旧的显卡,突然也有了参与这场智能革命的机会。有网友开玩笑说,这听起来像是在客厅里制造 Skynet 的前奏。这种效率的提升不仅仅是数字上的变动。当指令集和内存管理变得如此精简,本地运行大模型的工作负载将变得不可避免。硬件能力的边界正在被重新定义。不过,这种轻量化也有代价。有观点认为,在 8GB 显存的极端约束下,微调出的模型输出能力可能会受到显著限制。这就像是在内存极小的系统上跑精简版操作系统,虽然能动,但指令集总归是残缺的。大家讨论的热点也散落在细节里:LoRA 还是全量参数微调?如何避免灾难性遗忘?甚至有人在尝试将任务分流到 CPU 上。这种技术的演进更像是一个编译器的优化过程。当原本需要昂贵算力支撑的计算图,通过重构和压缩,能够塞进消费级硬件的缓存层时,真正的个人 AI 时代才算真正落了地。现在的疑问是,当我们能用如此廉价的成本去定制模型时,我们究竟会训练出什么?是更懂特定领域的专家,还是仅仅又多了一个堆在硬盘里吃灰的数字标本?GitHub: github.com/unslothai/unslothGuide: unsloth.ai/docs/models/gemma-4/train
新浪微博 2026-04-08 00:00:00
5. 在线使用和部署大语言模型(LLM)经常面临硬件资源限制,不同模型对CPU、RAM、GPU的需求差别巨大,挑选合适模型既费时又费力。有个超实用的开源工具——llmfit(GitHub:github.com/AlexsJones/llmfit),能自动检测你电脑的CPU、内存和GPU配置,结合模型参数和量化信息,智能评估数百款主流模型(Meta Llama、Mistral、Qwen、DeepSeek、Llama.cpp等)在你本地硬件上的运行适配度、速度和质量,帮你快速找到最适合你机器的模型。主要功能:- 自动硬件检测(支持多GPU,NVIDIA、AMD、Intel Arc、Apple Silicon等)- 模型Fit评分,覆盖质量、速度、内存匹配度和上下文长度四维度综合评估- 支持多量化策略自动选择,以找到最高质量的量化模型- 交互式终端UI和经典CLI,操作简单直观- 计划模式估算不同模型配置对硬件需求,方便硬件升级规划- 支持本地多种运行时集成,如Ollama、llama.cpp和MLX- 多平台支持:Linux、macOS(Intel/Apple Silicon)、Windows安装方便,macOS/Linux一条命令即可启用,也支持通过cargo源码构建。内置了超过200款模型数据库,且支持自动更新。无论是AI研究者,开发者,还是AI爱好者,都能用它一键找到真正适合自己电脑的模型,极大提升体验。强烈推荐!#AI创造营##人工智能#
新浪微博 2026-03-05 00:00:00
6. 【Qwen 3.5 397B:最强本地编程模型?】 快速阅读:一位开发者测试了Qwen 3.5 397B模型后认为,它是目前最好的本地编程模型。虽然生成速度较慢(11-15 tokens/秒),但代码质量极高,几乎不需要多轮修复。更令人惊讶的是,使用IQ2_XS量化版本仅需123GB内存就能运行,在极低精度下仍保持了出色的性能。 --- 这个结论来自Reddit LocalLLaMA板块的一次讨论。发帖者称他测试了几乎所有主流的本地大模型——从Qwen系列的122B/35B/27B,到GPT-OSS 120B、StepFun 3.5、MiniMax M2.5,再到Super Nemotron 120B,没有一个在知识储备和代码准确性上能接近397B。 速度慢是个问题。在96GB DDR5内存+48GB显存的配置下,它的生成速度从空白上下文的15 tokens/秒降到10万tokens时的11 tokens/秒。有网友调侃说这是"每个工作日一个token",也有人质疑这种速度是否实用。 但发帖者的逻辑很直接:虽然单次生成慢,但因为代码质量高,不需要反复修改,总体效率反而更高。而且和它的小版本或StepFun 3.5不同,397B的思考过程其实很简洁。 量化技术在这里起了关键作用。AesSedai制作的IQ2_XS量化版本把模型压缩到123GB,相比之下,其他模型即使是更小的参数量也要用IQ4_XS(StepFun 3.5、MiniMax M2.5)或Q6_K(Qwen 3.5 122b/35b/27b)。 这引发了一个有意思的讨论:2bit量化的397B是否比4-6bit量化的122B更好?有网友分享了评测数据——IQ2_XS在MMLU上达到87.86%,GPQA diamond达到82.32%,这个表现远超预期。 有观点认为,对于MoE架构的超大模型,"小模型高精度 vs 大模型低精度"的权衡逻辑已经不适用了。397B的参数空间太大,量化噪声分散后影响有限,路由机制和专家系统仍然有效运作。 硬件门槛确实存在。最经济的方案是两台Strix Halo(约5000美元)或256GB的Mac Studio M3 Ultra(约7000美元)。也有人用192GB DDR5 + 36GB VRAM的配置跑IQ4,速度在6-8 tokens/秒。 评论区出现了两派观点。一派认为在Claude订阅只需每月几十美元的情况下,花7000美元买硬件跑一个"差不多但不完全一样好"的模型不划算。另一派则强调本地部署的价值:完全的控制权、隐私保护、不受服务商限制,以及应对未来可能的政策变化。 有网友提到,如果把这些硬件当作开发机来看,额外成本就没那么夸张了。Strix Halo或Mac Studio本身也是性能不错的工作站,只是顺便能跑大模型而已。 在实际应用中,有人发现MiniMax M2.5在一次性生成代码方面更强,但Qwen 3.5 397B在需要迭代调试的编程框架中表现更智能。也有人提到GLM-5在软件工程任务上仍然是最强的,尽管速度更慢。 一个值得注意的细节:网友测试了TQ1_0量化版本(极端压缩),在3090 + P40 + 48GB DDR5的配置下仍能达到9-10 tokens/秒。虽然TQ1_0通常被认为压缩过度,但实际结果出人意料地好。 还有人用Mac Studio 128GB通过MLX框架运行Q4量化版本,实现了9 tokens/秒的速度。甚至有开发者声称可以在只有6-9GB内存的MacBook Pro上通过SSD卸载的方式运行,虽然速度会慢很多。 关于速度,有网友做了个对比:DeepSeek 3.2在各大API服务商的平均速度在10-25 tokens/秒之间,11-15 tokens/秒其实在可用范围内。关键是任务类型——对于简单的代码补全,速度很重要;但对于复杂的架构设计和多文件重构,质量比速度更关键。 有个反直觉的观点:可能让27B模型做两遍任务,比跑一遍397B更高效。基准测试显示,27B在第二次尝试时就能接近397B的表现。 最后还有一些技术细节。用USB4连接两台机器做分布式推理,实际带宽能达到10Gbps,虽然比理论值低但足够用。通过llama.cpp的rpc-server可以实现负载分割,速度损失约10%。 这场讨论最有意思的地方不是某个模型有多强,而是整个社区在探索"本地AI"的边界时展现出的创造力。从极端量化到分布式推理,从硬件改造到软件优化,每个人都在用自己的方式突破限制。 ref: www.reddit.com/r/LocalLLaMA/comments/1rzaqjn/qwen_35_397b_is_the_best_local_coder_i_have_used #AI创造营##人工智能#
新浪微博 2026-03-22 00:00:00
7. 本地运行大模型常常需要折腾各种框架,内存吃紧、速度慢、还容易被审查过滤,切换工具调试参数超级麻烦。SuperGemma4-26B-Uncensored GGUF v2 把顶级性能全整合到一起,提供最强开源本地AI解决方案。不仅真正无审查(0/100拒绝率)、修复工具调用bug,还超快速度(89.4 tok/s生成)、支持韩文/代码/对话,完美适配Apple Silicon和llama.cpp。Hugging Face:huggingface.co/Jiunsong/supergemma4-26b-uncensored-gguf-v2主要功能:- 真正无审查聊天,0拒绝率,支持敏感查询和自由对话;- 超快推理速度,提示处理222 tok/s,生成89.4 tok/s(Q4_K_M量化16.8GB);- 修复工具调用和分词问题,自然聊天不乱入编码模式;- 高性能韩文/代码/逻辑任务,优于原版Gemma-4 26B;- 支持llama.cpp、Apple M4 Max等本地部署,18-22GB VRAM即可运行;- 嵌入中性聊天模板,避免旧版提示路由bug。支持Web、Mac、Windows多平台,下载GGUF文件直接用llama.cpp运行,适合开发者、研究者和本地AI爱好者。#AI模型##开源大模型##Gemma4#
新浪微博 2026-04-18 00:00:00
8. #一条音频告别2025##微博声浪计划# 小米发布开源大模型MiMo-V2-Flash,总参数3090亿仅激活150亿实现轻量化,在数学竞赛、科学测试等位列开源前两名,软件工程测试第一,性能媲美DeepSeekV3.2。生成速度达150 tokens/秒,推理成本仅为其1/3,支持深度思考与联网搜索,融入澎湃OS,已开放体验。 科技小焱的微博音频
新浪微博 2025-12-17 00:00:00
9. 开源大模型与闭源大模型的差距是在缩小还是在扩大?关键因素是什么?
知乎 2025-12-23 00:00:00
10. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】
哔哩哔哩 2026-03-24 00:00:00
11. 只需三步!14G显存也能跑,腾讯混元video 1.5“小钢炮”本地部署实测
哔哩哔哩 2025-12-15 00:00:00
12. 正面硬刚Gemini 3 Pro,阿里开源Qwen3.5-Plus|甲子光年
微信公众号 2026-02-16 00:00:00
13. #IT技术# #微博兴趣创作计划# 本地部署AI有多爽?断网也能用的开源模型+戴尔工作站,硬件拉满性能不降智~ 搞机工程师的微博视频
新浪微博 2025-11-21 00:00:00
14. 功耗相差40W,性能差距几何?影驰RTX 5080名人堂对比金属大师 评测
微信公众号 2025-12-31 00:00:00
15. 目前唯一破发的显卡?DLSS4.5表现怎么样?用微星RTX 5060TI 8G魔龙OC实测后告诉你答案!
哔哩哔哩 2026-04-10 00:00:00
16. 爆火的 Z-Image 模型!8G 显存能跑,无内容审查、支持NFWS、超高速,本地部署教程!支持(Win/Mac)| 零度解说
哔哩哔哩 2025-12-08 00:00:00
17. 国产版Ollama来了,Clawdbot终于不只属于Mac和英伟达
微信公众号 2026-02-03 00:00:00
18. Ollama 推出一指令安装OpenClaw,免费云端模型直接用,也支持本地模型
微信公众号 2026-03-16 00:00:00
19. ITX装机单风扇显卡首选 七彩虹iGame RTX50 Mini系列显卡怎么样?
微信公众号 2025-12-21 00:00:00
20. 开源是战略,生态是王炸,阿里千问入局AItoC #千问 #大模型
抖音 2025-11-19 00:00:00
21. 单卡双芯 48G 显存!打造 20L 紧凑型 AI 算力怪兽:DeepSeek 70B 实测 19 tokens/s
哔哩哔哩 2026-01-27 00:00:00
22. #谷歌发布Gemma4开源大模型# 谷歌正式推出Gemma 4大模型,包括四种规格的Gemma 4通用模型:高效20亿参数版(E2B)、高效40亿参数版(E4B)、260亿混合专家模型(MoE)与310亿稠密模型(31B)。 在谷歌迄今为止所有的模型中,Gemma 4 是目前最强大的开放权重模型系列,继承了前沿多模态、长上下文和高级推理能力,被谷歌官方称之为是“在逐字节比较下性能最强的”开放模型(Byte for byte, the most capable open models),填补了本地前沿智能的空白,与追求极致性能的 Gemini 云端模型共同构成了完整生态。整体来说,Gemma 4这次所有规模的模型都原生支持处理视频和图像了,在OCR和图表理解方面表现得相当不错。
新浪微博 2026-04-03 00:00:00
23. 事真闹大了。这在全球ai领域里面,已经是核弹级别一样的发明了。不亚于当初deepseek的冲击力。这个大模型直接全面 SOTA!就是这玩意在 LIBERO、CALVIN 这些国际公认的比赛里全是第一,直接把全球几十个模型给干翻了!而且。。。而且。。直接开源了!这个模型更重点的是,能跑在消费级显卡上面,懂行的朋友估计已经头皮发麻了。消费级机器人,真的要来了。还是全球顶级水平。
新浪微博 2026-02-12 00:00:00
24. # 谷歌 DeepMind Gemma 4 重磅发布:Agent Skills 让手机彻底成为本地 AI 代理运行时 # 2026 年 4 月 2 日,Google DeepMind 开发者体验负责人 Omar Sanseviero(@osanseviero)在 X 平台发布重磅消息: As part of the Gemma 4 release, we're launching Agent Skills: an Android app experience where you can import different skills and have Gemma 4 E2B reason and use the skills! Running entirely in the phone, available in the Google PlayStore. Try it now! 随后补充下载链接与官方博客地址。本帖附带 116 秒演示视频,迅速引发全球开发者与 AI 爱好者热议,浏览量已超 16 万次。 同日,Google Developers Blog 发布官方文章《Bring state-of-the-art agentic skills to the edge with Gemma 4》,详细阐述 Gemma 4 模型家族及 Agent Skills 功能。本文基于 X 原始帖文(含完整视频演示)与官方博客全文内容无损完整呈现,深度拆解技术细节、演示案例、实现原理、开发者生态及行业意义,为中文读者提供一篇零信息损失、系统性的技术战略分析。 # 一、Gemma 4 模型家族:开源 Agentic AI 的新基准 # Google DeepMind 于 2026 年 4 月 2 日正式推出 Gemma 4 模型家族,以 Apache 2.0 许可开源。Gemma 4 专为边缘设备与移动场景优化,重新定义了本地硬件上的 AI 能力。 核心亮点(直接来自官方博客): 1. 多步规划与自主行动:无需专门微调,即可实现复杂任务链与自主代理。 2. 离线代码生成与音视频处理:支持 140+ 语言,面向全球开发者。 3. 视觉处理与多模态能力:支持图像、视频处理。 4. Gemma 4 E2B / E4B 变体:专为 Agent Skills 设计,E2B 模型在部分设备上峰值内存占用低于 1.5GB。 开发者可通过 Android AICore Developer Preview 或 Google AI Edge 工具链,在移动、桌面、边缘设备上快速构建代理式(Agentic)应用。 # 二、Agent Skills 核心机制:Google AI Edge Gallery 中的本地代理运行时 # Google AI Edge Gallery 应用已在 Android(Google Play Store)和 iOS(App Store)上线,支持完全本地运行的 AI 体验。今天正式推出 Agent Skills,这是首批在设备上实现多步、自主代理工作流的应用程序,由 Gemma 4 驱动。 Agent Skills 四大核心能力(官方博客原文): 1. 知识库增强(Augment the knowledge base):Gemma 4 可通过技能接入训练数据之外的信息。例如,构建 Wikipedia 技能,让代理回答任何百科问题。 2. 生成丰富交互内容(Produce rich, interactive content):将段落、视频转为摘要、闪卡,或将数据转为交互图表/图形。例如,基于用户语音输入的睡眠日志,技能自动生成每日睡眠与情绪趋势图表。 3. 扩展核心能力(Expand Gemma 4's core capabilities):集成其他模型,如文本转语音、图像生成、音乐合成。例如,上传照片后,技能分析氛围并自动匹配播放完美契合心情的音乐。 4. 端到端复杂工作流(Create comprehensive end-to-end experiences):用户通过与 Gemma 4 的自然语言对话完成多步任务,无需切换多个 App。例如,构建描述动物并播放叫声的完整应用。 技能开发与格式:每个技能本质上是 SKILL.md 文件(含提示词)+ 可选 JS 脚本(运行于隐藏 WebView)。JS 脚本拥有完整 fetch() API,可调用外部服务;原生 Intent 处理邮件、SMS;API Key 通过系统原生对话框输入,永不进入 LLM Prompt,保障隐私与安全。 技能支持 URL 导入、GitHub Discussions 社区分享,或本地 ADB 推送。Google AI Edge Gallery GitHub 仓库(http://t.cn/A6eG1Bp2)提供 /skills 目录模板,开发者可快速创建并在 Discussions 分类下分享技能。 # 三、LiteRT-LM 运行时:极致性能与跨平台支持 # 为让 Gemma 4 在各类设备上高效运行,Google 推出 LiteRT-LM —— 在 LiteRT 基础上新增 GenAI 专用库,集成 XNNPack 与 ML Drift。 关键特性(官方实测数据): - 极致内存优化:Gemma 4 E2B 在部分设备上内存占用 <1.5GB(2-bit / 4-bit 量化 + 内存映射逐层嵌入)。 - 约束解码:确保结构化、可预测输出,适用于生产级工具调用。 - 动态上下文:支持最高 128K 上下文长度,CPU/GPU 动态切换。 - 高性能处理:处理 4000 个输入 token(跨 2 个不同技能)耗时不到 3 秒。 - 边缘设备表现:Raspberry Pi 5 上预填充吞吐量 133 tokens/s,解码 7.6 tokens/s,可用于离线智能家居、语音助手、机器人。 跨平台支持: - 移动端:Android 12+ 与 iOS 17+,CPU/GPU 加速;Android 还可通过 AICore 系统级调用优化后的 Gemma 4。 - 桌面/Web:Windows、Linux、macOS(Metal)、WebGPU。 - IoT/机器人:Raspberry Pi 5、Qualcomm IQ8 NPU。 - 新工具:litert-lm Python 包 + CLI,支持无代码实验、工具调用,适用于 Linux、macOS、Raspberry Pi。 # 四、视频演示与实际体验(116 秒官方演示完整对应) # X 帖附带视频及 Google AI Edge Gallery 应用演示,直观展示 Agent Skills 流畅性: - 技能管理界面:一键导入、开启/关闭、搜索技能。 - Gemma-4-E2B-it 模型(GPU 加速)实时推理与技能调用。 - 演示案例涵盖 Wikipedia 查询、图表生成、照片配乐、动物介绍与叫声播放等,与博客四大能力完全对应。 整个过程100% 本地运行、无需联网、无数据泄露,充分验证“手机即完整 Agent 运行时”的理念。 # 五、开发者生态与开源贡献 # - 技能开发指南:GitHub 仓库提供完整模板与示例。 - 社区分享:通过 GitHub Discussions 提交技能,官方鼓励开发者构建并分享。 - 开源地址:Google AI Edge Gallery 已完全开源(Apache 2.0),支持模型管理、基准测试、Thinking Mode 等功能。 - 贡献与反馈:X 社区已有开发者分享自定义技能、Pixel 设备适配、Mac Mini 加载方案,同时指出部分设备(如 Pixel 10 Pro Fold)偶发兼容性问题,Google 通过 GitHub 快速迭代。 X 回复亮点(部分): - “skills as the app model for on-device AI agents. this is where the unbundling starts.” - “This is basically the Gemini Nano 4 developer preview.” - iOS 用户已可通过 App Store 下载体验。 # 六、战略意义:隐私、安全、普惠与产业重塑 # 1. 隐私革命:所有推理本地完成,敏感数据永不离开设备,特别适合科研、医疗、企业场景。 2. 离线可用性:打破云端依赖,真正实现“随时随地”代理工作流。 3. 开发者普惠:2B\~4B 小模型即可完成复杂任务,Play Store / App Store 一键安装即可体验 SOTA 代理能力。 4. 产业冲击:传统 App 可能被“技能超市”替代;手机从“查询机”升级为“执行机”;边缘 AI 与 Agentic AI 融合,将加速机器人、智能硬件、个人助理爆发。 5. 与云端互补:本地 Gemma 4 可作为 Gemini Nano 4 的开发者预览,未来无缝迁移。 # 七、立即体验与深入阅读 # - Android:Google Play Store 搜索 “Google AI Edge Gallery” 或直接访问 http://t.cn/AXIRZXRS - iOS:App Store 搜索 “Google AI Edge Gallery” 或直接访问 http://t.cn/AXIRZXRK - 开发者:GitHub http://t.cn/A6eG1Bp2 下载源码、构建自定义技能 - 官方博客:http://t.cn/AXIRZXR9 # 总结 # Gemma 4 + Agent Skills 并非简单模型更新,而是移动 AI 的一次范式跃迁。它把“代理”从云端拉到掌心,把“技能”变成可组合的乐高积木,让每一位用户与开发者都能在本地构建属于自己的智能未来。这不仅仅是 Google 的技术里程碑,更是整个边缘智能时代正式开启的信号。 (本文基于 X 原始帖文全文、116 秒官方视频描述及 Google Developers Blog 完整内容撰写) http://t.cn/AXIRZa7v
新浪微博 2026-04-03 00:00:00
25. 128GB内存联想百应NUC,到底能不能玩转“小龙虾”
哔哩哔哩 2026-04-17 00:00:00
26. 内存暴涨,预算加给显卡合理吗?用微星RTX 5070魔龙实测后告诉你答案!
哔哩哔哩 2026-01-20 00:00:00
27. 第一张5070MINI显卡!- 双槽全金属的七彩虹iGame RTX 5070 5060Ti MINI OC装机评测
哔哩哔哩 2025-12-19 00:00:00
28. 删掉 OpenClaw!Hermes Agent 才是真王炸,一键本地部署 +模型接入全教程(避坑指南) | 零度解说
哔哩哔哩 2026-04-11 00:00:00
29. 前面讲的用 6G 显存的 GTX 1660 Ti 跑 Qwen3.5-35B-A3B-Q4_K_M.gguf 速度能达到 21 t/s ~ 25 t/s 的这个实验(网页链接),有人问是不是用这个机器跑别的模型也可以。首先,并不能因为 35B 的 Qwen3.5-35B-A3B 在这个机器上能跑,所以认为 27B 的 Qwen3.5-27B 肯定也可以。实际上即使 Qwen3.5-9B 跑起来也很慢,只有 6 t/s。这主要是因为 Qwen3.5-35B-A3B 是 MoE 模型,激活参数只有 3B。也就是说,对显存较小机器来说,Qwen3.5-35B-A3B 是 Qwen3.5 系列中最适合的。另外,总参数 30B 激活参数 3B 的 GLM-4.7-Flash-Q4_K_M 也量化到 Q4,同样用 llama.cpp 在这台机器上的速度大约 13 t/s。Qwen3.5 的速度更快可能和它用了混合注意力设计、软件优化更好等因素等有关。所以,不仅在 Qwen3.5 系列中,而是在当前所有模型中,Qwen3.5-35B-A3B 可能都是小显存机器跑大模型的最优解。如果你有类似硬件,想体验一下,但对技术了解不多,可以参考下面的最简化尝试步骤(假设你的操作系统是 Windows):1、下载 llama.cppgithub.com/ggml-org/llama.cpp/releases/download/b8352/llama-b8352-bin-win-cuda-12.4-x64.zipgithub.com/ggml-org/llama.cpp/releases/download/b8352/cudart-llama-bin-win-cuda-12.4-x64.zip把两个压缩包解开,文件放进同一个目录。假设该目录名字是 llama。2、下载 Qwen3.5-35B-A3B-Q4_K_M.ggufhuggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF/resolve/main/Qwen3.5-35B-A3B-Q4_K_M.gguf?download=true建议存放在固态硬盘而不是机械硬盘上,这会直接影响接下来加载模型的速度。3、在命令行执行 llama 目录中的 llama-cli:llama-cli -m Qwen3.5-35B-A3B-Q4_K_M.gguf
新浪微博 2026-03-15 00:00:00
30. 在价值5万元的苹果本上部署本地大模型+小龙虾是什么体验?
哔哩哔哩 2026-04-03 00:00:00
31. 昨天谷歌发了 Gemma 4 开放权重模型系列,升级挺猛的。一共四个版本,除了端侧轻量版,还头一回上了 MoE 架构的 26B 模型。全系支持多模态,能看懂图片听懂语音,自带推理思考功能,上下文直接拉到了 25 万。最香的是改用 Apache 2.0 彻底开源了。感觉谷歌这次是真的放开手脚了,那个 26B 单卡就能跑,性价比挺高,可以试着本地部署跑个试试看。#谷歌发布Gemma4开源大模型# #微博跨域计划# #AI创造营#
新浪微博 2026-04-03 00:00:00
32. 跑生成式AI的显卡有没有必要买三风扇的?
知乎 2026-02-16 00:00:00
33. 市值近600亿,大模型公司上市了! #AI #智谱ai
抖音 2026-01-10 00:00:00
34. 显卡市场“疯了”?别慌,还有一张卡很冷静!微星RTX 5060 Ti 8G开箱实测,这次还带来了全新的DLSS 4.5技术加持,让画质与帧数双双”起飞”。
哔哩哔哩 2026-04-18 00:00:00
35. 强又静的颜值显卡!万丽星际 RTX 5070 Ti OC 快速体验
哔哩哔哩 2025-10-30 00:00:00
36. LTX-2 最新开源模型!只需8G显存,即可生成电影级AI大片!太离谱了, 附本地部署教程!| 零度解说
哔哩哔哩 2026-01-19 00:00:00
37. 太爽了!Hermes Agent 发布UI了,本地对接最强开源 Gemma 4 模型+ 微信(免费无需Token)| 零度解说
哔哩哔哩 2026-04-16 00:00:00
38. #雷军公布小米机器人最新进展#小米这个Xiaomi-Robotics-0实在太强了……从架构创新方面,小米用了多模态VLM做“大脑”,负责理解人类指令和空间关系。用多层Diffusion Transformer(DiT)做“小脑”,生成高频、平滑的“动作块”,保证动作精准连贯。所以小米机器人才能既能“听懂话”,又能“动作灵”。目前已经刷新了多项SOTA,真实场景表现非常亮眼。在主流仿真测试(如Libero、CALVIN、SimpleBench)中都取得了优异成绩。在真实物理世界中,能在消费级显卡上实现实时推理,动作连贯、反应灵敏,完成叠积木、叠毛巾等复杂任务。注意是消费级显卡,展示视频我放下面了,实在太精准了。#小米发布机器人基座模型#
新浪微博 2026-02-12 00:00:00
39. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?
知乎 2026-02-16 00:00:00
40. AI2发布了Olmo 3,一套领先的完全开源大型语言模型(LLM)方案,专为推理、对话和工具调用设计。更重要的是,它不仅开放了最终模型权重,还公开了从预训练到后训练的完整训练流程,数据方案和代码,真正实现了训练过程的透明与可定制。Olmo 3家族包括:- Olmo 3-Base(7B、32B参数),具备强大的代码、数学和阅读理解基础能力;- Olmo 3-Instruct(7B),支持多轮对话和工具使用;- Olmo 3-Think(7B、32B),专注于展示推理过程的“思考”模型。核心是32B参数的Olmo 3-Think,定位合理,推理能力大幅领先7B模型,同时仍适合多数用户进行微调和深入研究。训练上,Olmo 3使用了约6万亿标记的Dolma 3预训练数据集和经过强化清洗的后训练数据,特别强调数学、代码和推理能力。其上下文窗口扩展至约65K标记,支持处理完整论文、书籍等长文本。性能表现抢眼:- Olmo 3-Think(32B)是当前最强的完全开源32B推理模型;- Olmo 3-Base领先开源对手Marin、Apertus,并可比肩Qwen 2.5与Gemma 3;- Olmo 3-Instruct(7B)在多项硬核基准上优于Qwen 2.5、Gemma 3和Llama 3.1。配套的Ai2 Playground也升级,新增“思考模式”可实时展示推理过程,“工具调用”支持JSON-schema和Asta平台工具,用户不仅能看模型输出,还能追踪其学习和推理路径,极大提升理解与定制能力。Olmo 3以Apache 2.0协议全面开源,欢迎研究者和开发者深入体验,推动开源AI迈向更高透明度与可控性。正如业内所言,开放训练流程让模型不再是单纯产品,而是协作伙伴,开启后货币经济时代的智能自主计算。✨ Try Olmo 3 in the Ai2 Playground → playground.allenai.org/?utm_source=x&utm_medium=social&utm_campaign=olmo3_launch 💻 Download: huggingface.co/collections/allenai/olmo-3-68e80f043cc0d3c867e7efc6📝 Blog: allenai.org/blog/olmo3?utm_source=x&utm_medium=social&utm_campaign=olmo3_launch📚 Technical report: allenai.org/papers/olmo3?utm_source=x&utm_medium=social&utm_campaign=olmo3_launch真正的开源力量,不只是开放结果,而是开放“如何成就结果”的全貌。未来AI,期待更多这样的透明与共享。
新浪微博 2025-11-22 00:00:00
41. 不买会员,一期学会轻薄本跑大模型!
哔哩哔哩 2026-01-03 00:00:00
42. 本地部署大模型?天选Air2026锐龙AI Max版简单开箱
哔哩哔哩 2026-01-22 00:00:00
43. 零成本跑最强AI!Gemma 4手机本地部署(支持离线+多模态)安卓、iPhone全搞定! | 零度解说
哔哩哔哩 2026-04-07 00:00:00
44. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)
哔哩哔哩 2026-02-09 00:00:00
45. 真正的本地(24小时)在线的AI员工openclaw,天钡NEX395迷你主机本地运行大模型跑openclaw!
哔哩哔哩 2026-03-03 00:00:00
46. #微博发布首个开源大模型#今天的微博真的有AI那味道了。因为微博AI团队开源了仅1.5B参数的VibeThinker模型。亮点一:超低训练成本,仅仅7800美元。(DeepSeek-R1的294万美元)亮点二:数学推理能力强,在AIME2024(80.3分)、AIME2025(74.4分)等基准测试中,超越DeepSeek-R1(671B参数)和Claude Opus 4。想到了一个词“小而美”,微博这可不就是小而美的小模型嘛!
新浪微博 2025-11-13 00:00:00
47. 8G显存真不够用?爆肝3个月实测18张显卡20款游戏,结果竟然......
哔哩哔哩 2026-03-07 00:00:00
48. 售价34999微星EdgeXpert小主机,AI性能干翻RTX5090D?
哔哩哔哩 2025-12-21 00:00:00
49. iPhone本地跑Gemma 4火了,0 token时代还有多远?
微信公众号 2026-04-06 00:00:00
50. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说
哔哩哔哩 2026-03-03 00:00:00
51. Ollama 官方消息:Ollama 0.19 开始使用苹果的 MLX 作为后端,所以能更好地利用统一内存和 GPU 加速,在有 32G 内存的 M5 系列设备上运行 int4 量化的 Qwen3.5-35B-A3B 可以实现预填充 1851 token/s,生成 134 token/s。 tombkeeper的微博视频
新浪微博 2026-04-01 00:00:00
52. 历史性时刻!M芯片Mac支持雷电外接GPU进行AI大模型计算!
哔哩哔哩 2026-04-10 00:00:00
53. 我们把手上这台128G运行内存的M5 Max MacBook Pro也给本地部署上了小龙虾Openclaw,使用的qwen3.5 122b的全能大模型,也给安排转接到了手机和飞书上~ 大家现在用上小龙虾了吗?会用claw做什么工作?
新浪微博 2026-03-10 00:00:00
54. 在M4 Max MacBook Pro上完整跑通了纯本地OpenClaw工作流,模型qwen3.5-35b-a3b四比特量化,~100 token/s,跟在线AI差不多,但我的所有数据和对话都不会离开自己电脑,然后我就成了全世界最后一个知道伊朗出事了的人,恍如隔世 林亦LYi的微博视频
新浪微博 2026-03-01 00:00:00
55. #雷军公布小米机器人最新进展##小米发布机器人基座模型#小米机器人业务再迎重磅突破!正式开源首代机器人VLA大模型Xiaomi-Robotics-0,这也是小米实打实的机器人基座模型。这款模型搭载“大脑+小脑”混合架构,47亿参数兼顾视觉语言理解与实时执行能力,不仅破解了传统VLA模型推理延迟的痛点,能在消费级显卡上实现实时推理,还在三大主流仿真测试和真机实操中表现亮眼,叠毛巾、拆积木等复杂任务都能流畅完成,刷新多项SOTA纪录。从此前雷军预告机器人业务新进展,到如今核心大模型开源落地,小米在具身智能领域的技术布局持续落地,也让机器人从实验室走向实际应用又近了一步。
新浪微博 2026-02-12 00:00:00
56. 10月国内开源模型依旧坚挺,持续汇总!
知乎 2025-10-31 00:00:00
57. 写CUDA到底难在哪?
知乎 2026-01-07 00:00:00
58. #阿里新一代模型Qwen3.5曝光# AI圈春节前再放大招,阿里通义千Qwen3.5即将登场,已HuggingFace提交PR并入Transformers,发布在即。全新混合注意力机制加持,长文本与推理效率全面升级;更支持原生VLM多模态视觉理解,看图理解能力一步到位。开源阵容同样亮眼:2B密集小模型+35B-A3B MoE大模型双路线覆盖,轻量部署与旗舰性能兼顾。从技术架构到生态布局持续领跑,国产开源大模型再迎重磅升级,期待正式上线!
新浪微博 2026-02-09 00:00:00
59. 重磅:小米发布并开源最新MiMo-V2-Flash大模型,总参数量3090亿,活跃参数量150亿,基准测试性能媲美DeepSeek-V3.2,延迟仅为几分之一!生成速度达150 tokens/秒(基于首日版本)。刚试了下生成速度超快,等明天罗福莉详细揭秘
新浪微博 2025-12-16 00:00:00
60. #阿里新一代模型Qwen3.5曝光# 阿里在AI领域又有新动作了,从全球最大AI开源社区HuggingFace来看,阿里新一代模型Qwen3.5并入Transformers已基本坐实,那就意味着阿里千问新一代基座模型发布进入倒计时。全新的混合注意力机制、原生视觉理解能力,以及同时覆盖2B密集模型与35B-A3B MoE模型的开源策略,显示出千问在性能、效率与多模态上的全面升级。很明显,这有望进一步拉高国产大模型的技术上限,也将持续扩大开源生态影响力,对开发者和产业落地都释放出强烈利好信号!!
新浪微博 2026-02-09 00:00:00
61. 到底需不需要部署本地大模型?
今日头条
62. 2026大模型本地部署全攻略
今日头条
63. 从零部署本地大模型|LMStudio傻瓜式上手+llama.cpp命令行教程,隐私离线双保障
知乎
64. Ollama本地部署真相
微信公众号
65. 零基础实战
微信公众号
66. RTX3060本地跑大模型,内存从16G升到48G只花880!PC真实升级记录
什么值得买
67. 本地部署大模型怎么选?一文看懂几大本地部署大模型方式的区别
今日头条
68. RTX 4090封神!Ollama一键部署Gemma 3 27B,Windows用户告别WSL折磨
今日头条
69. B站林粒粒
知乎
70. 星宇智算实测
知乎 2026-03-12 00:00:00
71. AI 大模型显卡要求详解
微信公众号 2026-03-15 00:00:00
72. 不用强显卡!普通电脑也能跑100B大模型
今日头条 2026-04-03 00:00:00
73. 穷鬼如何本地高效部署Agent助手?显卡选型研究
知乎 2026-04-17 00:00:00
74. 16GB老笔记本照样跑大模型!Qwen3.5本地部署实测6 t/s
知乎 2026-04-15 00:00:00
75. Qwen3.6也开源了,Qwen3.6-35B-A3B需要什么配置?如何部署?
知乎 2026-04-18 00:00:00
76. 本地部署大模型,选硬件有哪些坑?
知乎 2026-04-09 00:00:00
77. 消费级显卡12G内存从零训练AI大模型分享
微信公众号 2026-04-02 00:00:00
78. 本地部署大模型需要什么配置?2026年
知乎 2026-03-08 00:00:00
79. 大模型部署入门教程,消费级显卡跑通Qwen3.5-Plus,最低配置部署教程
知乎 2026-02-25 00:00:00
80. 大模型部署全指南——从4GB笔记本到8卡服务器怎么选
微信公众号 2026-04-23 00:00:00
81. Qwen3.5-27B本地部署教程
今日头条 2026-03-29 00:00:00
82. 【万星收藏】2026最全开源大模型微调指南!三行代码+单卡16G,普通人也能微调专属GPT
微信公众号
83. 大模型硬件入门指南
微信公众号
84. 本地跑大模型,显存到底怎么算?
微信公众号
85. 在家跑大模型
微信公众号
86. 颠覆认知!4GB显存跑70B大模型,AirLLM开源了
今日头条
87. 10B 是关键!实测揭示大模型 4-bit 量化的安全边界
微信公众号
88. 苹果OpenELM开源
今日头条
89. LM Studio本地部署大模型,CPU就能玩的本地模型-亲测成功
微信公众号
90. AI模型语言交互 LM Studio v0.3.36-1,这工具终于有图形界面了,不用命令行跑模型
微信公众号
91. Ollama vs LMStudio vs LocalAI 本地运行大模型,Ollama、LM Studio 和 LocalAI 到底该选谁?
抖音
92. Python + Ollama 本地跑大模型
微信公众号
93. Ollama本地大模型配置
今日头条
94. 本地部署大模型神器!Ollama超详细入门指南
小红书
95. Ollama
今日头条
96. 抛弃Ollama!本地大模型引擎实测,vLLM提速5倍更省显存
今日头条
97. 利用ollama部署本地deepseek大模型,并建立自己本地知识库的心得
知乎
98. 本地部署 Qwen3.5 模型
知乎
99. 本地部署 Ollama 完整指南
微信公众号
100. Ollama本地化部署专题①
今日头条 2026-03-21 00:00:00
101. Ollama | 零代码上手Ollama
微信公众号 2026-03-05 00:00:00
102. 大模型推理框架——Ollama
微信公众号 2026-02-25 00:00:00
103. Ollama
知乎 2026-04-17 00:00:00
104. 把大模型装进手机
微信公众号 2026-04-10 00:00:00
105. 2026年3月市场行情,为你独家梳理的本地部署大模型电脑配置指南
今日头条 2026-03-20 00:00:00
106. Ollama 本地大模型硬件选购完全指南
微信公众号 2026-04-20 00:00:00
107. AI开源模型本地部署
什么值得买 2026-03-31 00:00:00
108. 想本地部署千问大模型?云服务器怎么选?先算清楚这笔显存账
今日头条 2026-04-21 00:00:00
109. ollama 本地运行大模型推荐。8g显存适用
今日头条 2026-03-21 00:00:00
110. 网页就能用,干嘛还要部署本地化AI
微信公众号 2025-12-21 00:00:00
111. 小白入门
微信公众号 2025-12-19 00:00:00
112. 爆肝实测!纯CPU跑通Gemma4的260亿参数大模型,7.97token/秒丝滑输出,私人AI的时代彻底爆发!
微信公众号 2026-04-06 00:00:00
113. AI本地部署硬件要求高
什么值得买 2026-03-31 00:00:00
114. 显存焦虑症犯了?12GB显存够不够用?
微信公众号 2026-01-24 00:00:00
115. 显存焦虑症犯了?12GB显存到底还够不够用
微信公众号 2026-01-08 00:00:00
116. 2026年本地部署大模型完整指南,免费跑AI
今日头条 2026-03-18 00:00:00
117. 🎯 大语言模型(LLM)本地部署完全指南
小红书 2026-04-04 00:00:00
118. 最小仅2B!谷歌最强开源模型登场,免费商用,手机就能跑
今日头条 2026-04-03 00:00:00
119. heartmula生成长音乐,12G现存即可运行 受够了给 Suno 和 Udio 充值买积分?AI 音乐生成的规则改变了!🚀
抖音 2026-01-23 00:00:00
120. 超越 Suno?全新开源 AI 模型 HeartMula |超长音频生成|开源免费|12G显存即可运行|comfyUI工作流
哔哩哔哩 2026-01-23 00:00:00
121. 本地安装开源大模型最新王者 Qwen3.5
微信公众号 2026-03-03 00:00:00
122. 大模型微调太难太烧钱?这个开源神器让你训练快2倍,显存省70%
微信公众号 2026-02-13 00:00:00
123. 告别Token焦虑
今日头条 2026-04-16 00:00:00
124. 大模型排行榜2026年
今日头条 2026-04-07 00:00:00
125. 12GB显卡跑31GB大模型?这个开源方案让我重新理解了「硬件瓶颈」
知乎 2026-03-21 00:00:00
126. 9个最好的开源大模型(2026)
今日头条 2026-01-27 00:00:00
127. 2026主流AI大模型全榜单
今日头条 2026-04-14 00:00:00
128. Kimi K2 Thinking 量化之后再量化,模型文件缩水60%,准确率85%,部署教程来了
知乎 2025-11-10 00:00:00
129. 2026年AI大模型本地部署全科普
今日头条 2026-02-10 00:00:00
130. 本地部署大模型必看!大模型部署配置核心参数全解
微信公众号 2026-04-07 00:00:00
131. 1.6万本地部署Qwen大模型!2026实测稳跑,新手照着装就成
今日头条 2026-03-27 00:00:00
132. 本地部署大模型方法,新手不二选择
今日头条 2026-02-26 00:00:00
133. Intel 18GB 显存跑 Qwen3.5-4B,实测 6 个量化版本胜出
微信公众号 2026-04-07 00:00:00
134. 模型量化技术解析
哔哩哔哩 2026-04-22 00:00:00
135. NVFP4 量化感知蒸馏
哔哩哔哩 2026-02-06 00:00:00
136. 模型量化与压缩
微信公众号 2025-12-29 00:00:00
137. Rockchip RK3588 NPU优化技术深度分析(二)__量化技术与混合精度优化
微信公众号 2026-04-12 00:00:00
138. RTX 5090D 大模型部署指南
微信公众号 2026-03-20 00:00:00
139. RTX 5090 跑 Gemma 4 31B,投机解码实测提速 29%
微信公众号 2026-04-14 00:00:00
140. 手写Triton内核实测
哔哩哔哩 2026-04-21 00:00:00
141. 2026年大模型推理加速新趋势
知乎 2026-04-05 00:00:00
142. 2026年开源大语言模型选型指南
今日头条 2026-04-13 00:00:00
143. 2026 开源大模型全景图
微信公众号 2026-04-01 00:00:00
144. GPT-5还没开源,国产大模型已经"卷"到飞起
微信公众号 2026-04-13 00:00:00
145. 大模型推理框架大混战
微信公众号 2026-03-31 00:00:00
146. 2026年主流大语言模型分析
微信公众号 2026-02-25 00:00:00
147. Google Gemma 4开源评测
微信公众号 2026-04-04 00:00:00
148. 2026年9个最好的开源大模型
微信公众号 2026-03-12 00:00:00
149. 国产大模型集体开源,2026年AI彻底平民化
今日头条 2026-02-07 00:00:00
150. 大模型实战指南(2026年新春版)
知乎 2026-03-08 00:00:00
151. 大模型本地部署入门指南
小红书 2026-03-27 00:00:00
152. Ollama × 魔搭社区:超简单的大模型本地部署方案
知乎 2025-11-13 00:00:00
153. 手把手教你本地部署大模型:CUDA与cuDNN环境配置全攻略
知乎 2025-10-29 00:00:00
154. 封神!OllaMan才是Ollama绝配,本地大模型痛点全解决
今日头条 2026-03-28 00:00:00
155. Windows下配置Python环境-从0配置深度学习环境1 - 5060 - 哔哩哔哩
哔哩哔哩 2025-11-26 00:00:00
156. 本地大模型部署新方案:LM Studio+OpenClaw 终结Ollama卡顿难题
微信公众号 2026-04-11 00:00:00
157. CUDA、PyTorch,Windows 环境配置指南(授人以渔版)
今日头条 2025-11-05 00:00:00
158. Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug
知乎 2025-11-01 00:00:00
159. GLM-5.1拿下SOTA,Minimax-M2.7是平替Sonnet,Reddit四月最佳本地模
微信公众号 2026-04-14 00:00:00
160. 8GB显存起跑?Qwen-Image本地部署实测:中文渲染与图层编辑成破局关键
什么值得买 2026-02-14 00:00:00
161. 大模型自主化部署与集成实施方案——大模型本地部署流程
知乎 2025-12-28 00:00:00
162. AI 大模型显卡要求详解:你的电脑能跑吗?2026 最新指南
今日头条 2026-03-16 00:00:00
163. (自用)WSL部署vllm流程
知乎 2025-11-26 00:00:00
164. 2026年开源大模型爆发:性能追平GPT-5,成本低10倍
今日头条 2026-03-29 00:00:00
165. 小白玩转AI大模型应用开发(已完成结)
知乎 2025-12-03 00:00:00
166. 1-bit Bonsai 8B 发布,1.15GB 内存跑出 Llama3 8B 水平
微信公众号 2026-04-06 00:00:00
167. Qwen3.5-Caption-WebUI ,批量图像全自动中文打标,文件夹下所有图片自动反推提示词。禁思考模式,纯净提示词,已开源。
哔哩哔哩 2026-03-09 00:00:00
168. AI实践:大模型部署、算力测算与硬件选型
知乎 2025-11-15 00:00:00
169. 开源模型量化精度 vs 质量损失的大致规律,Q4是甜蜜点
今日头条 2026-03-22 00:00:00
170. Qwen2.5本地AI模型,解压后直接运行无压力,普通用户也能快速部署,无需担心隐私泄露
微信公众号 2026-02-17 00:00:00
171. Ubuntu 手动安装 CUDA 12.1 Toolkit 完整教程
知乎 2025-11-24 00:00:00
172. 微软扔出王炸!100B大模型单CPU就能跑,显卡会降价嘛?
微信公众号 2026-04-04 00:00:00
173. 千元预算搭建本地大模型?手把手教你省钱又强
知乎 2026-03-31 00:00:00
174. 3399元!闲鱼上32G显存V100显卡,这可能是普通人能接触到本地部署AI的正规军之一!
微信公众号 2026-04-03 00:00:00
175. 4GB显存跑70B大模型?
小红书 2026-03-09 00:00:00
176. 使用 Unsloth 与 PyTorch QAT 将大模型量化至 4-Bit(且不损失精度)
知乎 2025-11-22 00:00:00
177. 我通过Ollama部署了自己的本地大模型
知乎 2026-04-21 00:00:00
178. 🎈本地部署阿里千问大模型体验。阿里千问3.5-35B-A3B大模型,我用32GB内存+6GB老显卡试试。先在PowerShell里开终端,加载20GB模型时内存占满到80多,有点勉强。 🖥️加载与测试: 发“你好”时思考好久,响应速度仅26token每秒,不如CMD窗口操作顺手。调大模型参数后,写800字散文,1分钟才出思路,好在输出有900字,速度保持26token每秒。 💡部署成本: 本地部署20GB模型只要初期投入,后续使用比API便宜。不过思考慢、内存需48GB以上才流畅,老显卡体验一般。 不过对数据隐私要求高、想养龙虾低成本调用的朋友,或许值得一试~ #本地部署#大模型#人工智能
抖音 2026-03-18 00:00:00
179. 【独家】大模型开发者必看!这个开源项目让你彻底告别显存焦虑
微信公众号 2026-03-25 00:00:00
180. 如何通过Ollama部署我的本地大模型
微信公众号 2026-04-02 00:00:00
已收藏
去我的收藏夹