6GB显存也能跑大模型?关键不在显存大小,而在带宽与量化兼容性
04-16 13:47
精选参考来源
抖音 2025-11-19
新浪微博 2026-01-27
来源
精选参考来源
1. 开源是战略,生态是王炸,阿里千问入局AItoC #千问 #大模型
抖音 2025-11-19 00:00:00
2. 【216GB显存的廉价显卡阵列,能否跑得动本地大模型?】最近,一位硬件玩家在社区分享了自己的实验项目:用二手Tesla显卡搭建一套总显存达216GB的本地推理服务器。这些二手数据中心显卡价格低廉,显存容量惊人,但问题来了:这些老旧设备并行起来,真能和现代显卡一较高下吗?这位玩家专门开发了一套GPU服务器基准测试工具,打算用数据说话。他的目标很明确:在800美元预算内找到性价比最优的硬件组合,能够流畅运行200亿参数的开源模型,同时兼顾视频处理和语音识别任务。社区里对此褒贬不一。有人泼冷水说,这些老卡推理速度可能连正常阅读速度都达不到。但也有实践派现身说法:用8张P40跑MiniMax M2.1这类MoE模型,每秒25个token,远超阅读速度,完全可用。真正的瓶颈往往不是显卡本身。一位资深玩家指出,很多人成绩不好是因为平台配置拉垮:双通道内存、普通SSD、孱弱的CPU都会严重拖后腿。他把双路X99平台换成单路EPYC后,推理速度直接翻倍。另一个现实问题是提示词处理速度。如果只是像聊天机器人那样对话,问题不大;但一旦用上Cline这类工具,系统提示动辄15000个token,光等待处理就要好几分钟。这时候老卡的短板就暴露无遗了。散热是个大麻烦。Tesla这类被动散热卡塞满机箱,噪音堪比喷气发动机。这位玩家自己设计了一套高静压风冷散热器,用RP2040微控制器根据负载动态调节风速,还在机架上做了专门的进风通道系统。硬件选型上,P40和P100是目前性价比较高的选择。MI50虽然更便宜、显存更大,但对Windows支持欠佳。欧洲地区这些卡价格偏高,一张P40要500美元左右。有玩家表示,用MoE模型配合纯GPU显存加载,推理效果相当不错,一旦调用CPU内存就会断崖式下降。主板方面,双路X99平台如Supermicro X10DRG-Q在二手市场只要200美元左右,提供充足的PCIe通道避免带宽瓶颈。如果升级到X11主板,IPMI还能自动根据GPU温度调节风扇转速。这个项目进展缓慢,作者坦言是因为日常工作占用了大量精力。但从他展示的散热方案、机架进风系统来看,这是一个工程功底扎实的玩家。他计划整合ik_llama.cpp的NCCL多卡并行测试,让基准更有参考价值。本地大模型推理的门槛正在不断降低,廉价硬件方案的可行性边界在哪里,值得持续关注。www.reddit.com/r/LocalLLaMA/comments/1qni356/216gb_vram_on_the_bench_time_to_see_which/
新浪微博 2026-01-27 00:00:00
3. 刚才做了个实验,用一台老机器跑 Qwen 3.5。这台机器有 6G 显存,显卡是 GTX 1660 Ti,内存 32G,内存带宽大约 40 GB/s,跑 Qwen3.5-35B-A3B-Q4_K_M.gguf 输出速度可达到 21 t/s ~ 25 t/s。这个速度对家庭日常使用已经完全可接受了。我做了一些定量和定性的测试,结果还是挺好的,包括我之前提过的编程测试任务(网页链接)——这个测试甚至到今天国内仍有一家公司的最新模型还做不及格——只剩这一家,其它公司都可以了。GTX 1660 Ti 现在只要 700 元。内存虽然涨价了,但两根 16G 的 DDR 4 也就 1400 左右。如果用疫情前的硬件就能跑出这样的效果,那么“家庭智能中心”这样的产品也就变得很现实了。 tombkeeper的微博视频
新浪微博 2026-03-15 00:00:00
4. 【硬核】超聚变128GB 显存的N卡小主机,居然一个游戏都跑不了?
哔哩哔哩 2026-02-11 00:00:00
5. ¥8499起!48G显存的最强核显全能本!?天选Air 2026 锐龙AI Max版首发评测:值得买么?笔记本电脑
哔哩哔哩 2026-01-22 00:00:00
6. 阿里正式发布新一代基模千问3.5
微信公众号 2026-02-16 00:00:00
7. 常规机器学习推理 vs. 大语言模型推理的 5 个关键区别
知乎 2025-11-02 00:00:00
8. 【8GB显存也能训大模型?Unsloth重新定义个人AI硬件边界】快速阅读:Unsloth AI 发布了针对 Gemma 4 的免费训练笔记本,通过优化算法,让仅需 8GB 显存的家用显卡也能实现比以往快 1.5 倍、显存占用降低 50% 的微调任务。这标志着大模型训练正从昂贵的云端集群向个人本地硬件转移。---训练大模型似乎一直是个重型工程,像是在试图用一辆家用轿车去拉动一列货运火车。但 Unsloth AI 现在的做法,更像是给这辆小车换了个超高效的变速箱和轻量化底盘。只要 8GB VRAM,就能在本地跑起 Gemma 4 的微调。这意味着那些躺在抽屉里的 RTX 2070S 甚至老旧的显卡,突然也有了参与这场智能革命的机会。有网友开玩笑说,这听起来像是在客厅里制造 Skynet 的前奏。这种效率的提升不仅仅是数字上的变动。当指令集和内存管理变得如此精简,本地运行大模型的工作负载将变得不可避免。硬件能力的边界正在被重新定义。不过,这种轻量化也有代价。有观点认为,在 8GB 显存的极端约束下,微调出的模型输出能力可能会受到显著限制。这就像是在内存极小的系统上跑精简版操作系统,虽然能动,但指令集总归是残缺的。大家讨论的热点也散落在细节里:LoRA 还是全量参数微调?如何避免灾难性遗忘?甚至有人在尝试将任务分流到 CPU 上。这种技术的演进更像是一个编译器的优化过程。当原本需要昂贵算力支撑的计算图,通过重构和压缩,能够塞进消费级硬件的缓存层时,真正的个人 AI 时代才算真正落了地。现在的疑问是,当我们能用如此廉价的成本去定制模型时,我们究竟会训练出什么?是更懂特定领域的专家,还是仅仅又多了一个堆在硬盘里吃灰的数字标本?GitHub: github.com/unslothai/unslothGuide: unsloth.ai/docs/models/gemma-4/train
新浪微博 2026-04-08 00:00:00
9. 酷睿 Ultra200H 处理器可分配 120GB 显存并运行 120BMoE 模型,这意味着什么?
知乎 2025-11-21 00:00:00
10. Tabby是开源本地优先AI编程助手,核心聚焦代码隐私与离线可用,基于开源大模型(如StarCoder、Code Llama)提供代码补全服务,无需依赖云端服务器,适配注重代码安全的企业、涉密项目开发及无网络环境编程场景。 GitHub:github.com/tabbyML/tabby 主要功能: 1. 全离线运行:模型本地部署,代码数据不泄露至公网,完全保障隐私安全;2. 多IDE兼容:支持VS Code、JetBrains系列IDE等主流开发工具,集成成本低;3. 多语言支持:适配Python、Java、Go等数十种编程语言,覆盖全栈开发需求;4. 轻量高效:资源占用可控,低配设备也能流畅运行,补全响应延迟低于200毫秒;5. 模型灵活切换:支持自定义开源模型接入与微调,适配团队专属代码风格;6. 无商业绑定:开源免费,无功能限制与付费墙,支持二次开发与私有化部署。 无需联网即可使用核心功能,完全规避云端AI工具的数据泄露风险。实际使用中,企业内部项目编码效率提升30%+,可合规使用,是注重隐私安全的开发者与团队的首选AI编程工具。
新浪微博 2025-11-21 00:00:00
11. 单卡双芯 48G 显存!打造 20L 紧凑型 AI 算力怪兽:DeepSeek 70B 实测 19 tokens/s
哔哩哔哩 2026-01-27 00:00:00
12. 别克至境 L7 vs 特斯拉 Model3 重庆 8D 魔鬼路况辅助驾驶实测:R6 飞轮大模型赋能 “逍遥智行”,全场景碾压式领先,合资车逆袭成辅助驾驶新标杆。#大v聊车#上海 AlexCui聊车的微博视频
新浪微博 2025-10-27 00:00:00
13. 告别KV Cache枷锁,将长上下文压入权重,持续学习大模型有希望了?
微信公众号 2026-01-02 00:00:00
14. #千问Qwen3.5大模型发布#真正的卷王出现了,就在刚刚,阿里正式发布全新一代大模型千问Qwen3.5-Plus。这次核心更新在于采用了Mamba混合注意力机制(SSM-Transformer) + 稀疏MoE架构,总参数3970亿但仅激活170亿参数,显存占用降低60%,推理吞吐量最高提升19倍。举个例子,传统大模型就像人工翻整墙档案,你每问一个新问题,都要把前面所有档案重新翻一遍核对关系,内容越长,翻得越慢,越到后面越卡。 纯Mamba机制则像只记档案摘要,翻得极快,但细节容易丢,关键信息可能漏看。 而Qwen3.5-Plus的混合注意力,就是摘要+精准抽查一起上:速度跟得上,细节不丢失,长文本、复杂推理又快又准。 这才是真·技术内卷,大模型体验又要上一个台阶了。#how i ai##过个有ai年# 千问qwen3.5大模型发布
新浪微博 2026-02-16 00:00:00
15. 别再抢显卡了!实测CPU跑大模型,真的太香了...
哔哩哔哩 2025-11-12 00:00:00
16. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?
知乎 2026-02-16 00:00:00
17. 14 核 20 线程 + 16G 大显存,整机 6299?双11后这台 Intel 主机有点离谱…
哔哩哔哩 2025-11-16 00:00:00
18. AI春节档最强杀手锏来了!千问3.5除夕强势亮相,开源SOTA、性价比之王
微信公众号 2026-02-16 00:00:00
19. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文
微信公众号 2026-02-11 00:00:00
20. 【白TV】2025-2026入门显卡PK,拒绝8GB显存——RX9060XT/RX9070GRE/RTX5060Ti/RTX5070,游戏玩家怎么选?
哔哩哔哩 2025-10-17 00:00:00
21. 售价34999微星EdgeXpert小主机,AI性能干翻RTX5090D?
哔哩哔哩 2025-12-21 00:00:00
22. 英特尔宣布首款Xe3P架构显卡!160GB显存,专攻AI推理的GPU!「超极氪」
哔哩哔哩 2025-10-17 00:00:00
23. DeepSeek 下一代模型 V4 将跑在华为芯片上。据 The Information 今天报道,DeepSeek 专门推迟了 V4 的发布时间,花了几个月和华为、寒武纪合作,重写了模型底层代码的部分模块,确保 V4 能在华为最新的昇腾(Ascend)芯片上流畅运行。模型预计未来几周内发布。华为这颗芯片是今年 3 月刚亮相的昇腾 950PR,搭载在 Atlas 350 加速卡上。单卡算力号称是英伟达 H20(目前对华出口合规版本)的 2.87 倍,配备 112GB 显存,内存带宽 1.4 TB/s。更关键的是,它是目前中国唯一支持 FP4 低精度推理的 AI 芯片,FP4 格式能大幅压缩模型对显存的需求,比如一个原本需要 140GB 显存才能跑的 700 亿参数模型,用 FP4 只需要 35GB,同样的硬件能部署更大的模型,或者同时处理更多请求。不过代价也不小:功耗 600W,大约是 H20 的两倍。按行业惯例,AI 公司在发布大模型前会提前把模型给英伟达、AMD 等芯片厂商做性能优化。DeepSeek 这次打破了这个惯例,没有给美国芯片厂商提供 V4 的早期访问权限,而是把机会独家给了华为和寒武纪。The Information 的报道还透露,DeepSeek 目前还在开发两个 V4 变体版本,分别面向不同的能力侧重,同样基于国产芯片。据英国《金融时报》此前报道,DeepSeek 曾尝试用华为昇腾芯片训练推理模型 R2,但遭遇了反复失败,包括稳定性问题、芯片间互联速度慢、软件工具链不成熟等,最终不得不退回英伟达硬件做训练,华为芯片只用于推理。V4 能直接跑在华为芯片上,说明过去这段时间软硬件适配取得了实质进展。对中国 AI 行业来说,这是从"离不开英伟达"到"至少推理环节可以用国产替代"的一步。对开发者而言,如果 V4 的性能确实如传闻所说在长上下文编程任务上能和 Claude、ChatGPT 掰手腕,那未来通过国产算力就能用上前沿模型,不用再担心美国芯片出口管制的影响。
新浪微博 2026-04-04 00:00:00
24. 只需三步!14G显存也能跑,腾讯混元video 1.5“小钢炮”本地部署实测
哔哩哔哩 2025-12-15 00:00:00
25. 【当满屏都是新模型,你该选哪个?Qwen3.5 27B vs 35B-A3B 硬核实测】快速阅读: Qwen3.5同时发布了27B稠密模型和35B-A3B的MoE模型,引发社区关于“哪个更好”的激烈讨论。简单结论是:27B更聪明但更慢,35B-A3B快5倍但“智商”约等于10B稠密模型。16GB显存用户两边都够呛。---这两天模型发布的密度让人喘不过气。有网友说“模型真是下雨一样往下掉”,倒也形象。先说结论:27B稠密模型在智能水平上确实更强。但问题来了,有人在RTX 3090上测出的数据是:35B-A3B跑100 t/s,27B只有20 t/s。五倍的速度差距,足以让很多人重新考虑“更聪明”到底值多少钱。社区里流传着一个估算MoE模型智能水平的公式:√(总参数 × 激活参数)。按这个算法,35B-A3B大约相当于10B稠密模型的智力水平。有观点认为这个公式源自2023年Mixtral时代,现在的MoE架构已经进化太多,公式越来越不准了。但即便往乐观了估,35B-A3B也就是个20B的水平,还是比27B差一截。有人提了个有意思的视角:如果你的主要时间花在等待工具调用返回结果,或者花在给模型打补丁、写各种guardrail上,那速度优势就被抵消了。这话说得挺实在。关于MoE为什么“亏”参数,有网友解释得很清楚:稠密模型整个网络都参与计算,参数之间能产生复杂的干涉模式;MoE每次只激活一小部分专家,虽然“虚拟网络”更大,但失去了那些干涉效应。某种程度上,thinking模式可能对MoE更友好,因为推理过程给了模型机会去调用更多专家。硬件配置方面的反馈比较现实。有网友在RTX 5080 16GB显存上跑27B的Q4_K_M量化,只有7 t/s出头,手动分配55层到GPU后勉强拉到13.5 t/s,但上下文必须限制在16K。还有人直接说“16GB显存对这俩模型都不太友好”。有观点认为16GB显存大概只能跑“90 IQ”难度的任务,24-32GB才是正常人类智能水平。虽然是“napkin math”,但这个直觉可能没错。一个4060笔记本用户分享了自己的配置:8GB显存加32GB内存,跑35B-A3B的MXFP4量化,64K上下文能到29 t/s。这说明MoE在混合offload场景下确实有优势,因为每次只需要把激活的3B参数搬进显存。有个常见误解需要澄清:MoE并不是每轮对话选一次专家就完事了。每一层、每一个token都在重新路由。Mixtral论文里那张彩色的专家激活图应该能说明问题。最后一个数据点:有测试显示27B与122B-A10B的差距,比27B与35B-A3B的差距还小。稠密模型的效率优势在这个参数规模上体现得很明显。---简评:16GB显存用户今天的处境,像极了站在奶茶店发现中杯大杯都超预算的人。 27B太聪明但跑不动,35B跑得欢但不够聪明,两边都是将就。有人说“16GB只能跑90 IQ任务”,虽是玩笑,却戳中真相:不是模型不够好,是你的显卡配不上你的野心。 最讽刺的是那个4060笔记本用户的方案——8G显存+32G内存跑MoE,等于承认显卡已经沦为配角。当模型像雨点一样砸下来,真正的焦虑不是“选哪个”,而是“我的硬件还能撑多久”。显存焦虑,才是这个时代的新型消费主义陷阱。---www.reddit.com/r/LocalLLaMA/comments/1re72h4/qwen35_27b_better_than_35ba3b/
新浪微博 2026-02-27 00:00:00
26. 【16GB显卡玩本地代码生成,到底值不值得折腾?】最近在Reddit上看到一个很有代表性的讨论:一位刚入门本地LLM的用户,用5070Ti(16GB显存)跑Qwen 2.5 Coder 7B,结果发现上下文窗口小得可怜,一个文件就把上下文吃光了。这引发了一场关于“16GB显存搞本地代码生成是否可行”的热烈讨论。先说结论:能用,但需要策略。+ 混合架构是主流方案得到最多认可的做法是“云端规划,本地执行”。先用Claude或ChatGPT做高层设计,让它生成详细的构建计划,包括架构设计、文件结构、执行步骤和边界情况。然后把这个大计划拆成小模块,逐个喂给本地模型实现。这套方法背后的逻辑很实在:规划阶段不涉及敏感数据,可以放心用云端最强模型;真正写代码时涉及数据库连接、业务逻辑、API密钥这些东西,交给本地处理更安心。+ 模型和工具选择16GB显存能跑什么?社区推荐最多的是GPT-OSS 20B,这是个稀疏MoE模型,能完整装进16GB显存,支持128K上下文,推理速度也快。还有人提到Devstral Small 2 24B的Q3_K_M量化版本,配合q4_0的KV缓存,也能撑到接近100K上下文。工具方面,LM Studio被频繁提及,因为可以精细调参,还能起本地API服务。有经验的用户还会结合MCP服务器、向量数据库等工具来扩展能力。+ 真相时刻:天花板在哪里也有很多清醒的声音。有人直言,除非公司明确禁止用云服务,否则本地方案很难匹配云端SOTA模型的效果。特别是现在的Agent工作流动辄需要海量上下文,16GB确实捉襟见肘。一位用户的观察很到位:本地模型在直接提问时还能产出有用的代码片段,但一旦进入自主Agent模式,由于上下文受限、工具定义占用空间等原因,表现会明显下降。+ 适用场景本地方案更适合:写绘图代码、实现辅助函数、调试定位这类“有点烦但不复杂”的任务。对于完整的Vibe Coding流程,当前硬件确实力不从心。有人花几百刀买了两张MI50 32GB,跑Qwen3 30B能到155K上下文和90 token/s,这才算舒适区。说到底,本地LLM是“能用的工具”而非“最强工具”。如果你本身会写代码,把它当个高效助手,省省API费用,完全可行。但如果追求生产力最大化,闭源模型带来的效率提升确实很难忽视。reddit.com/r/LocalLLaMA/comments/1qgwup8/is_local_coding_even_worth_setting_up
新浪微博 2026-01-20 00:00:00
27. 现在可以通过Docker本地运行Unsloth GGUF模型了!无论是Mac还是Windows,只需一行命令,甚至无需写代码,就能轻松启动大型语言模型(LLM)。 这是Unsloth与Docker的合作成果,动态GGUF格式现已开放给所有人。只需执行: docker model run ai/gpt-oss:20B 即可在本地快速运行20亿参数的模型,极大提升开发者体验和效率,推动整个生态向前发展。 这意味着——AI推理不再依赖云端,隐私更有保障,响应更快速,应用场景更广泛。无论你是研究者、开发者还是爱好者,都能轻松接入强大模型,开启自定义和离线AI的新篇章。 此外,社区反馈积极,支持Linux、Nvidia GPU等多种环境,未来兼容性与性能将持续优化。值得关注的是,这种“开箱即用”的体验,正是推动AI民主化的重要一步。 动手试试,体验本地AI的无限可能,告别复杂配置,让AI技术真正触手可及。 详细指南:x.com/UnslothAI/status/1990428016296812595 —— 思考:当AI模型运行不再受限于云端,数据隐私与实时响应成为可能,未来的智能应用将更加个性化和安全。我们正站在AI本地化的风口浪尖,技术普及是推动社会智能化的关键。
新浪微博 2025-11-19 00:00:00
28. 本地AI哪家强?统一内存大横评!
哔哩哔哩 2026-03-13 00:00:00
29. 【熊猫】5000块买啥显卡?24G显存的Arc B60了解一下?
哔哩哔哩 2026-02-10 00:00:00
30. 双卡 48G 显存!最省钱的多卡大显存选择 Arc Pro B60
哔哩哔哩 2026-02-02 00:00:00
31. 前面讲的用 6G 显存的 GTX 1660 Ti 跑 Qwen3.5-35B-A3B-Q4_K_M.gguf 速度能达到 21 t/s ~ 25 t/s 的这个实验(网页链接),有人问是不是用这个机器跑别的模型也可以。首先,并不能因为 35B 的 Qwen3.5-35B-A3B 在这个机器上能跑,所以认为 27B 的 Qwen3.5-27B 肯定也可以。实际上即使 Qwen3.5-9B 跑起来也很慢,只有 6 t/s。这主要是因为 Qwen3.5-35B-A3B 是 MoE 模型,激活参数只有 3B。也就是说,对显存较小机器来说,Qwen3.5-35B-A3B 是 Qwen3.5 系列中最适合的。另外,总参数 30B 激活参数 3B 的 GLM-4.7-Flash-Q4_K_M 也量化到 Q4,同样用 llama.cpp 在这台机器上的速度大约 13 t/s。Qwen3.5 的速度更快可能和它用了混合注意力设计、软件优化更好等因素等有关。所以,不仅在 Qwen3.5 系列中,而是在当前所有模型中,Qwen3.5-35B-A3B 可能都是小显存机器跑大模型的最优解。如果你有类似硬件,想体验一下,但对技术了解不多,可以参考下面的最简化尝试步骤(假设你的操作系统是 Windows):1、下载 llama.cppgithub.com/ggml-org/llama.cpp/releases/download/b8352/llama-b8352-bin-win-cuda-12.4-x64.zipgithub.com/ggml-org/llama.cpp/releases/download/b8352/cudart-llama-bin-win-cuda-12.4-x64.zip把两个压缩包解开,文件放进同一个目录。假设该目录名字是 llama。2、下载 Qwen3.5-35B-A3B-Q4_K_M.ggufhuggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF/resolve/main/Qwen3.5-35B-A3B-Q4_K_M.gguf?download=true建议存放在固态硬盘而不是机械硬盘上,这会直接影响接下来加载模型的速度。3、在命令行执行 llama 目录中的 llama-cli:llama-cli -m Qwen3.5-35B-A3B-Q4_K_M.gguf
新浪微博 2026-03-15 00:00:00
32. 刚才在HuggingFace上看到,Qwen3.5已经提交了并入Transformers的PR。这意味着阿里的新一代基座模型很快就要正式开源了。 这次的Qwen3.5有点意思: 1.混合注意力机制,据说是全新架构; 2.大概率是原生VLM,能看懂图像了; 3.开源包至少包含2B密集模型和35B-A3B的MoE版本。 值得关注的是,这是国内首个混合推理模型。简单说就是把快思考和慢思考结合起来,既有速度又有深度。这种设计在算力消耗上有明显优势,对开发者很友好。 其实从去年Qwen3登顶开源榜就能看出,阿里在模型架构上确实有一套。现在3.5版本继续这个势头,加上智谱唐老师之前预告的DeepSeek-v4、GLM-5也要来,今年二月中国大模型圈要热闹了。开源生态现在越来越重要。模型好不好,最后要看开发者用不用得起来。Qwen3.5这个开源策略很聪明,既展示了技术实力,又能快速建立生态。 不由感叹技术发展真快。去年这个时候大家还在讨论Qwen2.5,现在3.5都要来了。这种迭代速度,对行业是好事,对开发者也是机会。等Qwen3.5正式开源了,咱也上手试试效果。[挤眼]
新浪微博 2026-02-09 00:00:00
33. #千问Qwen3.5大模型发布# 刚刚,千问正式官宣发布 Qwen3.5,并推出Qwen3.5系列的第一款模型 Qwen3.5-397B-A17B 的开放权重版本。作为原生视觉-语言模型,Qwen3.5-397B-A17B 在推理、编程、智能体能力与多模态理解等全方位基准评估中表现优异,助力开发者与企业显著提升生产力。该模型采用创新的混合架构,将线性注意力(Gated Delta Networks)与稀疏混合专家(MoE)相结合,实现出色的推理效率:总参数量达 3970 亿,每次前向传播仅激活 170 亿参数,在保持能力的同时优化速度与成本。我们还将语言与方言支持从 119 种扩展至 201 种,为全球用户提供更广泛的可用性与更完善的支持!#HOW I AI##过个有AI年#
新浪微博 2026-02-16 00:00:00
34. Manus 的上下文工程
知乎 2025-10-18 00:00:00
35. 不买会员,一期学会轻薄本跑大模型!
哔哩哔哩 2026-01-03 00:00:00
36. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说
哔哩哔哩 2026-03-03 00:00:00
37. 自己剪辑和做AI本地算力部署的朋友们,我发现个好东西:INTEL的B70显卡,首先这卡比5080还便宜,并且32G显存巨大,INTEL的视频编解码能力一直很猛,所以作为影视剪辑电脑,这显卡性价比就很高,剪辑性能我们实测是介于5080和5090之间,但价格比5080还便宜不少,显存还大,你说是不是性价比显卡。另外,从本地AI算力部署角度,我们实测了4卡B70,AI运算能力不输4卡4090,但价格和功率低了不少,AI能力很强,并且因为显存大,市面上很多算法和模型都可以部署。我们就准备部署本地AI算力,用AI里抽帧理解我们几PB的原始视频素材,之后就能随意调取为以后AI制作内容所用,这就效率高太多了。并且现在已经有了本地算力的AI视频生成模型,那就不用等在线云端算力了,并且因为B70卡便宜,4卡不够那就16卡,加一起也比4090和5090便宜太多太多了!B70显卡马上就上市了,今天提前测试让我还是很兴奋,想想大量本地算力就爽的很。
新浪微博 2026-03-31 00:00:00
38. 【推理效率狂飙19倍!#千问3.5成本仅为谷歌大模型5%#】千问3.5凭什么做到成本仅为谷歌的1/18?答案是底层架构的全面革新。全新MoE架构,3970亿参数仅激活170亿,推理吞吐量最高提升19倍,部署显存降低60%。技术上的“斤斤计较”,才有了价格上的“大大方方”。#有AI的春节有什么不一样# 引力科普的微博视频
新浪微博 2026-02-16 00:00:00
39. 真正的本地(24小时)在线的AI员工openclaw,天钡NEX395迷你主机本地运行大模型跑openclaw!
哔哩哔哩 2026-03-03 00:00:00
40. 本地AI新神器来了!Llama.cpp全新UI带来极致体验:- 极速流畅,界面美观且隐私安全- 支持150,000+ GGUF模型,一站式调用超方便- 轻松导入PDF、图片、文本,多种格式自由交互- 会话可随时分支编辑,支持多线程聊天与图像处理- 内置数学公式和代码渲染,满足专业需求- 支持JSON Schema约束生成,提升定制化能力安装简单,完全开源,由社区协作打造,彻底释放本地AI潜力。用户纷纷表示,这是真正兼顾隐私与便捷的本地AI升级,告别依赖云端,掌控更自由。资源下载与模型选择请访问 huggingface.co/models?library=gguf&sort=trending ,全部免费。项目由alekgrygier和Llama.cpp团队倾力开发,社区贡献活跃,未来可期。这不仅是一次技术进步,更是本地AI民主化的重要里程碑。让每个人都能轻松拥有强大且私密的智能助理,推动AI普及进程。原文链接:x.com/victormustar/status/1985742628776706151 爱可可-爱生活的微博视频
新浪微博 2025-11-05 00:00:00
41. 7b vl 而已,量化版其实压力不大。mlx-community/Qwen3-VL-8B-Thinking-4bit的用丐版mac mini m4 都能跑起来… //@小众软件:不是,这个带大模型的,需要家中有 GPU 来跑算力啊 //@AlaAIaAlaska:他们不搞我都准备自己用ai写一个(写不写得成另说)
新浪微博 2025-11-16 00:00:00
42. 【硬核教程】教你搭建Mac AI集群!4台M3 Ultra,运行万亿参数大模型!
哔哩哔哩 2026-02-14 00:00:00
43. iPhone本地跑Gemma 4火了,0 token时代还有多远?
微信公众号 2026-04-06 00:00:00
44. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)
哔哩哔哩 2026-02-09 00:00:00
45. 不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?
微信公众号 2026-01-13 00:00:00
46. 如果你想让大型语言模型(LLM)运行得更快、更省钱,这16项技术值得深入掌握:1. 量化(Quantization):通过降低参数精度,减少计算资源消耗和内存占用。2. KV-Cache量化:优化键值缓存的存储效率,提升推理速度。3. 闪存注意力(Flash Attention):高效实现注意力机制,节省显存和计算时间。4. 预测解码(Speculative Decoding):提前预测输出,减少生成延迟。5. LoRA(低秩适配):用低秩矩阵微调模型,降低训练和推理成本。6. 剪枝(Pruning):去除冗余参数,缩减模型规模。7. 知识蒸馏(Knowledge Distillation):用小模型学习大模型知识,实现轻量化。8. 权重共享(Weight Sharing):重复使用参数,减少模型存储需求。9. 稀疏注意力(Sparse Attention):只计算重要部分的注意力,提升效率。10. 批处理与动态批处理(Batching & Dynamic Batching):合理组织输入,最大化硬件利用率。11. 模型服务优化(Model Serving Optimization):提升部署效率,降低延迟。12. 张量并行(Tensor Parallelism):分布计算,支持更大模型推理。13. 流水线并行(Pipeline Parallelism):分阶段处理,提升吞吐量。14. 分页注意力(Paged Attention):分块处理长序列,节省资源。15. 混合精度推理(Mixed Precision Inference):结合高低精度计算,平衡速度与准确度。16. 早停/令牌级剪枝(Early Exit / Token-Level Pruning):动态终止计算,避免不必要的推理。掌握这些技巧,不仅能显著降低模型运行成本,还能提升响应速度,推动大型语言模型更广泛的应用。原文链接:x.com/athleticKoder/status/1979163202844754396
新浪微博 2025-10-18 00:00:00
47. Ollama 推出一指令安装OpenClaw,免费云端模型直接用,也支持本地模型
微信公众号 2026-03-16 00:00:00
48. 首次体验 qwen 3.5 27B dense 在单张 RTX 3090 显卡上的表现。35 tok/s。从 4K 到 300K+ 上下文,速度没有下降。Hermes 4.3 初始速度为 35 tok/s,随着上下文填充,速度降至 15 tok/s。Qwen 密集型保持稳定。MoE 保持 112 tok/s 稳定。速度提升了 3 倍,但每个代币只有 30 亿活跃用户(总用户数为 350 亿)。架构权衡。Q4_K_M 内存占用 16.7GB,原生上下文 262K。在 24GB 显存下,训练时缓存大小突破 376K 后达到上限。尝试使用 262K 的 q8 键值缓存,速度骤降至 11 tok/s。q4_0 键值缓存是最佳选择。必须启用闪存注意力机制。内置推理模式。模型会逐步思考后再给出答案。完整的思维链经受住了第四季度量化分析的考验。超过 1799 条带有自我纠错循环的思维链。仅需一块消费级 GPU 即可运行。只给了它一个提示:“用一个 HTML 文件构建一个实时粒子星系模拟”。3340 个令牌。95 秒。一次性运行。首次加载时运行。完整的推理和代码请见下方视频。如果您想省去数小时的测试时间,以下是最佳配置:llama-server -ngl 99 -c 262144 -fa on --cache-type-k q4_0 --cache-type-v q4_0这只是热身。接下来是章鱼入侵者:10 个文件,3400 多行代码,完全没有控制。提示符 hermes 在 22% 处退出。比预期更令人印象深刻。完整结果即将公布。
新浪微博 2026-03-06 00:00:00
49. Ollama 官方消息:Ollama 0.19 开始使用苹果的 MLX 作为后端,所以能更好地利用统一内存和 GPU 加速,在有 32G 内存的 M5 系列设备上运行 int4 量化的 Qwen3.5-35B-A3B 可以实现预填充 1851 token/s,生成 134 token/s。 tombkeeper的微博视频
新浪微博 2026-04-01 00:00:00
50. Qwen3.5 量化:INT4 vs NVFP4 vs FP8 vs BF16我对量化的 Qwen3.5 9B、27B 和 35B 进行了全面评估——全部与 vLLM 兼容。文章:网页链接一些实用建议:- 性能优异的 4 位 Qwen3.5 27B 处理器比 Qwen3.5 9B 处理器性能强得多,而且内存预算也相近。- 注意“INT4”标签:有些 INT4 型号最终会变得几乎和 FP8 版本一样大,因为许多敏感层保持了更高的精度。量化后的 Qwen3.5 模型需要更长的思考时间。因此,虽然模型运行速度更快、内存效率更高,但生成的词元也更多。为了获得最佳质量,首先不要量化线性注意力机制。如有必要,也可以将注意力机制保持在 16 位。Qwen 在其 INT4 版本中也采用了这种策略,效果很好。对于 MoE 模型:不要量化共享专家。我在@verdacloud提供的 B200、H200 和 RTX Pro 6000 GPU 上进行了这些实验(计算赞助)。
新浪微博 2026-03-14 00:00:00
51. ITX机箱如何装MATX主板?黑色5060Ti Ultra显卡装机分享
哔哩哔哩 2026-03-13 00:00:00
52. 历史性时刻!M芯片Mac支持雷电外接GPU进行AI大模型计算!
哔哩哔哩 2026-04-10 00:00:00
53. 蓝戟 Intel Arc Pro B70 TF评测:32 GB大显存,推理神卡?
知乎 2026-04-09 00:00:00
54. 在树莓派上跑Qwen3-30B-A3B 是一种什么体验?byteshape.com/blogs/Qwen3-30B-A3B-Instruct-2507/这篇文章详细介绍了 ByteShape 团队如何通过其 ShapeLearn 技术优化 Qwen3-30B-A3B-Instruct-2507 模型,使其能在从树莓派到高端 GPU 等不同设备上高效运行。文章认为显存应被视为一种约束条件,在此基础上去优化速度(TPS)与质量之间的权衡,而不是盲目追求更小的文件体积。#科技先锋官#
新浪微博 2026-01-07 00:00:00
55. Airbnb CEO爆料:他们主力用的其实是阿里的Qwen大模型。理由很现实:又快又便宜,还好用。对于OpenAI 的最新模型,他们也在用,但生产环境几乎不上,因为又贵又慢。这直接打破了很多人对硅谷公司技术选型的想象,它们不迷信最贵的 AI,而是看谁真能撑住业务场景。像Qwen这种开源模型,在推理速度和成本控制上有天然优势,对高并发生产环境来说简直是刚需。#ai#
新浪微博 2025-10-22 00:00:00
56. Mac电脑的24GB统一内存到底可以运行多大的大语言模型
微信公众号 2026-03-31 00:00:00
57. 从零安装微软开源BitNet
知乎 2026-03-27 00:00:00
58. Gemma4是真快,30token/s的输出,完全够用
微信公众号 2026-04-14 00:00:00
59. 本地运行大模型的现实边界
哔哩哔哩 2026-01-29 00:00:00
60. 4 核 8GB 入门硬件稳定运行 30B 大模型
知乎 2026-03-26 00:00:00
61. AirLLM
小红书 2026-02-03 00:00:00
62. oLLM 如何在 8GB 3060 Ti 上实现 100k 上下文推理?
微信公众号 2025-10-31 00:00:00
63. 8GB显存跑4.4B推理模型,Prometech搞了个缝合怪
微信公众号 2026-03-15 00:00:00
64. 8GB到24GB显存,每个档位跑什么模型,我帮你问清楚了
微信公众号 2026-04-09 00:00:00
65. 8GB显卡跑405B模型?这个开源神器直接把显存门槛砸了
微信公众号 2026-04-13 00:00:00
66. 在GPU服务器上部署大模型推理服务,常用的开源框架(如vLLM, TensorRT-LLM)如何选择?
知乎 2026-04-13 00:00:00
67. 家里的 8GB 显卡别吃灰了!手把手教你在入门级 GPU 上流畅运行大模型
微信公众号 2026-03-22 00:00:00
68. 端侧 AI 部署实战
知乎 2026-04-05 00:00:00
69. 本地跑大模型,显存到底怎么算?
微信公众号 2026-04-05 00:00:00
70. AI算力冷知识 | No.77
微信公众号 2026-01-05 00:00:00
71. Ollama本地部署真相
微信公众号 2026-03-13 00:00:00
72. 单卡训练千亿模型?MegaTrain 把 GPU 变成了"临时工"
知乎 2026-04-09 00:00:00
73. RTX A6000+RTX 3090!Qwen3.5-122B本地部署成功,50token/s稳跑
今日头条 2026-03-01 00:00:00
74. 不同显寸对应的可运行的模型大小
微信公众号 2025-12-13 00:00:00
75. 什么?大模型部署需要多少显存你都不知道?
知乎 2025-12-08 00:00:00
76. 本地运行AI模型,GPU怎么选?RTX3080瓶颈破解,16GB才是黄金配置
今日头条 2026-04-13 00:00:00
77. 实测|MiniMax Agent 本地化部署全攻略,低显存也能跑
今日头条 2026-02-22 00:00:00
78. RX 7800 XT 16GB显存必看!最佳本地LLM推荐,新手也能拉满GPU性能
今日头条 2026-03-07 00:00:00
79. 8G/12G/16G/24G显卡都能跑啥模型?
小红书 2026-04-09 00:00:00
80. Llama 3 本地部署实录
今日头条 2026-03-10 00:00:00
81. Unsloth 推出Qwen3.5量化GGUF版本
微信公众号 2026-02-18 00:00:00
82. AI研究员必看
微信公众号 2025-11-11 00:00:00
83. 本地大模型显存占用真相
知乎 2026-04-05 00:00:00
84. 从本地到云端
知乎 2025-10-19 00:00:00
85. 【本地部署api】吊打同参数规模?谷歌 Gemma 4 震撼发布,本地运行竟能如此丝滑!
知乎 2026-04-04 00:00:00
86. Google Gemma 4 开源模型适配 RTX 显卡,本地运行智能体 AI 成真
今日头条 2026-04-03 00:00:00
87. 在本地运行 Google Gemma 4
微信公众号 2026-04-14 00:00:00
88. 不花一分钱,在自己电脑上跑最强开源AI——2026年本地大模型部署完全指南
微信公众号 2026-04-10 00:00:00
89. 谷歌 Gemma 4 本地实测|笔记本 + 台式机双平台
微信公众号 2026-04-05 00:00:00
90. Gemma 4 入门
微信公众号 2026-04-07 00:00:00
91. 养龙虾,别再花钱买API了!零成本本地部署Gemma 4,三步打造你的免费私有AI助手
微信公众号 2026-04-09 00:00:00
92. QWen 3.5 为什么这么省显存?即使上下文长度到了100万,显存基本不怎么变
微信公众号 2026-02-27 00:00:00
93. 如何用 4×RTX4090 + AMD EPYC 7B13 跑 Qwen3.5-122B
知乎 2026-04-07 00:00:00
94. AI算法面试题
微信公众号 2026-02-01 00:00:00
95. 显存告急、成本飙升?天翼云HPKV实现推理降本增效!
微信公众号 2026-04-11 00:00:00
96. 1M 上下文不爆显存
知乎 2026-03-22 00:00:00
97. 中科院工程师分享
知乎 2025-11-11 00:00:00
98. 8B以下本地模型到底怎么选?
小红书 2026-01-15 00:00:00
99. 🔥本地大模型部署能力上限对比(结论先行) V100 16G/32G vs RTX 3090 24G vs RTX 4090 24G
知乎 2026-04-13 00:00:00
100. 本地 LLM 部署显卡指南(2026 版)
微信公众号 2026-02-22 00:00:00
101. KV cache|用显存换速度,大模型推理的关键优化
微信公众号 2026-04-01 00:00:00
102. 大模型硬件入门指南
微信公众号 2026-04-09 00:00:00
103. 显存对应大模型指南|多大显存选什么模型,OpenClaw用本地模型,一看就懂
知乎 2026-03-30 00:00:00
104. 突破推理显存瓶颈
微信公众号 2025-12-17 00:00:00
105. 手撕一个大参数模型的量化微调推理,底层代码实现——笔7
微信公众号 2026-01-30 00:00:00
106. 大模型GPU估算懵了?KV/并发/Token全拆解
知乎 2025-10-28 00:00:00
107. 第五讲
知乎 2025-12-22 00:00:00
108. 手把手QLoRA 微调 Qwen-7B-Chat !(附源码)
知乎 2025-11-24 00:00:00
109. 部署70B大模型到底要多大显存?一文算清所有账
知乎 2026-03-26 00:00:00
110. 手机, 电脑本地跑大模型!GitHub 8.8k 星「MiniCPM」开源,8B小参数越级打大模型!
微信公众号 2026-04-03 00:00:00
111. 阿里通义千问Qwen3.5炸场!小模型干翻大模型,手机也能离线跑
今日头条 2026-03-03 00:00:00
112. 手机本地部署大模型?千问Qwen3.5三步装进口袋!已付费
知乎 2026-04-07 00:00:00
113. 五分钟本地部署大模型(实操笔记 不踩坑)
微信公众号 2026-02-13 00:00:00
114. 本地部署大模型真香?数据主权与硬件门槛的现实权衡
什么值得买 2026-02-25 00:00:00
115. 端侧AI入门第2章|硬件怎么选不踩坑?从内存到芯片的完整避坑清单
微信公众号 2026-04-04 00:00:00
116. 告别付费 Token!手把手教你在 Windows 本地满血运行 Qwen3.5-9B(LM Studio 篇)
微信公众号 2026-04-06 00:00:00
117. RTX 3060 就能跑,Qwen3.5-9B-opus
微信公众号 2026-03-16 00:00:00
118. 9B 参数碾压 120B?Qwen3.5-9B 本地部署全指南
微信公众号 2026-04-07 00:00:00
119. 手机端部署离线大模型gemma-4-26b,16G内存完美运行!
微信公众号 2026-04-13 00:00:00
120. 谷歌把Gemma 4装进手机
今日头条 2026-04-09 00:00:00
121. 手机/电脑离线运行AI大模型,0 Token费时代
微信公众号 2026-04-07 00:00:00
122. 浏览器里跑大模型?真能离线用!实测阿里Qwen ,旧电脑手机全搞定
今日头条 2026-03-15 00:00:00
123. i5-10400 集显台式机3步部署本地离线AI大模型(Ollama)
微信公众号 2026-03-29 00:00:00
124. Google LiteRT-LM
微信公众号 2026-04-10 00:00:00
125. 手机离线跑大模型!谷歌Gemma 4 E2B部署指南,手把手教你
微信公众号 2026-04-08 00:00:00
126. 离线跑大模型?Gemma 4 E2B 实测
微信公众号 2026-04-07 00:00:00
127. 本地部署大模型方法,新手不二选择
今日头条 2026-02-26 00:00:00
128. 显存不够?16G显卡驾驭13B模型的计算与优化全指南
知乎 2026-01-19 00:00:00
129. 16G显卡也能调大模型?先搞懂显存消耗的3大核心原因
知乎 2026-01-17 00:00:00
130. 阿里王炸!Z-Image 发布
微信公众号 2025-11-29 00:00:00
131. 显存救星!单卡16GB也能训练26万词表大模型,MaximusLLM开源破局
微信公众号 2026-03-17 00:00:00
132. 国产开源大模型之光
微信公众号 2026-03-14 00:00:00
133. SmolVLM:可端侧部署的VLM
小红书 2026-03-15 00:00:00
134. 还在为大模型部署的显存焦虑?重磅开源项目AirLLM,直接解决痛点!
抖音 2026-04-13 00:00:00
135. 4GB显存笔记本也能跑70B模型!这个神库直接把门槛干到地板
微信公众号 2026-01-31 00:00:00
136. GLM-5.1拿下SOTA,Minimax-M2.7是平替Sonnet,Reddit四月最佳本地模
微信公众号 2026-04-14 00:00:00
137. 只有 12G 显存,也能认真做 LLM 研究吗?这篇长文给了完整路线
微信公众号 2026-04-02 00:00:00
138. 绕过 LTX 桌面版 32GB 显存限制——在少于 24GB 显存上本地运行 | 完整设置教程
哔哩哔哩 2026-03-15 00:00:00
139. Qwen3.5-27B本地部署教程
今日头条 2026-03-29 00:00:00
140. RTX3050(4GB)!低显存也能跑的本地TTS,免费商用+女声直接用
今日头条 2026-04-08 00:00:00
141. 统一内存打破显存墙 实测AMD锐龙AI 解锁本地AI新可能
今日头条 2026-02-18 00:00:00
142. 普通电脑也能跑AI大模型?实测Ollama低配置本地部署攻略
今日头条
143. 十年老电脑跑30B大模型,开源社区的胜利
腾讯网
144. 不用换显卡!大模型微调显存优化实操指南(附代码+效果对比)
145. 跑不动、卡爆、显存炸?这个工具彻底解决本地LLM选择难题,本地跑模型必备!
腾讯网
146. 8GB显存顶不住了?几招优化,让你的老显卡再多撑两年
网易
147. Llama-Factory量化功能上线:4bit训练节省显存高达75%
148. zz基于bitsandbytes的大模型量化的底层逻辑与实战
149. vLLM cpu版可以支持哪些流行的大模型
150. 社区云
151. ghjckjkjkjk 个人主页
152. 如何用低算力芯片做出高算力的体验
153. 6GB显存跑35B大模型,“够用”的门槛到底在哪
腾讯网
154. 不同显寸对应的可运行的模型大小
155. 小白装机求问
156. $英伟达(NVDA)
157. 12GB显卡跑31GB大模型?这个开源方案让我重新理解了「硬件瓶颈」
知乎 2026-03-20 00:00:00
158. 大模型高效推理与部署技术实战:从显存优化到服务化落地
知乎 2026-04-07 00:00:00
159. AI算法面试:如何估算大模型的训练和推理显存
微信公众号 2026-01-26 00:00:00
160. LLM和GPU 显存的关系
知乎 2025-11-19 00:00:00
161. Llama 3/Qwen 2本地化部署: Ollama、vLLM、TensorRT-LLM性能与资源占用深度对比
微信公众号 2025-11-03 00:00:00
162. 对比 Gemini 3、MiniMax M2.5、GPT-5 和 GLM-5 这四款模型的本地部署配置要求与云端API的优缺点
微信公众号 2026-03-20 00:00:00
163. 模型推理时KV Cache显存如何计算,和用户并发有什么关系?
知乎 2025-12-18 00:00:00
164. 1000多块钱的魔改显卡都能干啥?RTX 3060 Laptop GPU(12GB 显存)
今日头条 2025-12-17 00:00:00
165. 谷歌刚刚开源的 Gemma 4,31B 参数干翻 70B 大模型!本地部署教程来了
微信公众号 2026-04-03 00:00:00
166. 如何估算LLM推理和训练所需的显存大小?(一)
知乎 2026-03-12 00:00:00
167. 手把手带你部署本地模型,让你Token自由(小白专属)
知乎 2026-04-12 00:00:00
168. llm时代怎么选电脑
知乎 2026-04-02 00:00:00
169. 选择Qwen2.5-7B-Instruct这个模型
微信公众号 2025-12-31 00:00:00
170. OpenClaw使用本地大模型实录!附3个0成本大模型路子
今日头条 2026-02-14 00:00:00
171. Gemma 4本地跑了3天,说几个真话
微信公众号 2026-04-06 00:00:00
172. Gemma 4本地跑,31B进全球前3
小红书 2026-04-03 00:00:00
173. 不用联网!谷歌Gemma轻量模型,让iPhone本地跑起大模型
微信公众号 2026-04-05 00:00:00
174. 一块5090跑Deepseek 671B满血版?浅析低显存下大模型推理技术
哔哩哔哩 2026-03-14 00:00:00
175. 大模型算法:大模型微调占用显存
微信公众号 2026-03-05 00:00:00
176. Gemma 4本地部署🔥零成本跑AI
小红书 2026-04-06 00:00:00
177. GGUF量化!低配显存流畅跑 Z-Image
微信公众号 2025-12-03 00:00:00
178. 模型显存占用计算
知乎 2026-01-06 00:00:00
179. 8GB显存起跑?Qwen-Image本地部署实测:中文渲染与图层编辑成破局关键
什么值得买 2026-02-14 00:00:00
180. 大模型推理成本与优化技术全景解析:从显存估算到Continuous Batching
知乎 2026-02-23 00:00:00
181. 通义千问3.5发布:高性价比模型的新选择
什么值得买 2026-02-19 00:00:00
182. 开源AI中文闭环,Qwen3-VL-8B 本地反推中文提示词,视频也可以,12G显存可用8bit量化,本地部署全过程。
哔哩哔哩 2025-10-18 00:00:00
183. 8GB显存微调Gemma 4,实测提速1.5倍,还修了4个坑爹Bug
微信公众号 2026-04-09 00:00:00
184. Loongwise解读大模型实训室中显存的计算方法
今日头条 2026-04-01 00:00:00
185. 你的电脑能本地运行大模型吗?这个网站一测便知!【实用网站】
微信公众号 2026-03-18 00:00:00
186. 如何在M4上快速的运行本地LLM
知乎 2026-02-28 00:00:00
187. Z-Image很稳,低显存GGUF模型和工作流!
微信公众号 2025-12-02 00:00:00
188. 模型的显存使用率
知乎 2026-02-04 00:00:00
189. Google把大模型搬进了iPhone——它就是Gemma4!
微信公众号 2026-04-06 00:00:00
190. 学习随笔(8):llm量化推理小知识
知乎 2025-12-26 00:00:00
191. 1-bit Bonsai 8B 发布,1.15GB 内存跑出 Llama3 8B 水平
微信公众号 2026-04-05 00:00:00
192. 多模态扩散模型实战:原理、推理流程与显存优化(量化篇)
知乎 2025-12-26 00:00:00
193. Qwen3.5-9B 实际上是最适合智能体编码的?
小红书 2026-03-16 00:00:00
194. 谷歌Gemma 4本地部署指南
微信公众号 2026-04-09 00:00:00
195. 本地运行大语言模型的四种方法
知乎 2026-03-05 00:00:00
196. 大模型应用:大模型内存与显存深度解析:我们该如何组合匹配模型与显卡.63
知乎 2026-04-04 00:00:00
197. Qwen3.5 本地千问大模型+本地离线知识库
微信公众号 2026-03-18 00:00:00
已收藏
去我的收藏夹