Llama 3.1开源落地指南:从入门到个人AI应用开发

源自166位全网作者

05-31 20:42

内容由AI生成

精选参考来源

1. Devstral 2的Modified MIT许可证限制年收入$240M以上公司使用,这还能叫开源吗?

2. 比小龙虾更安全的AI智能体!NAS部署自托管人工智能助手『Frona』

3. 不联网问 AI?手把手教你用 NAS 搭建完全离线的 AI 知识库助手

4. #深度解析:Google Gemini 3.1 Flash-Lite —— 开启规模化智能新纪元#2026年3月3日,Google 正式发布了 Gemini 3.1 Flash-Lite。作为 Gemini 3 系列中最具性价比、速度最快的模型,它的出现标志着生成式 AI 正在从实验性探索全面转向大规模工业化应用。#1. 核心定义:快如闪电,省如指掌#Gemini 3.1 Flash-Lite 的核心逻辑非常明确:在保持高水平智能的同时,极度优化推理速度与部署成本。关键经济指标包括:输入成本为每 100 万 tokens 仅需 0.25 美元;输出成本为每 100 万 tokens 仅需 1.50 美元。在响应速度方面,相比 2.5 Flash,其首字响应时间(TTFT)快了 2.5 倍,整体吞吐量提升了 45%。#2. 性能基准:Lite 的体量,Pro 的底气#尽管定位为轻量级,但 3.1 Flash-Lite 在多项权威测试中展现了越级的实力,甚至超越了前几代体积更大的模型。在综合智力评估中,它在 Arena.ai Leaderboard 获得了 1432 的 Elo 评分。在专家级推理测试 GPQA Diamond 中准确率达到 86.9%。而在多模态理解测试 MMMU Pro 中得分也高达 76.8%。此外,它在复杂多步任务中的指令遵循能力也表现出色。#3. 技术创新:可自定义的思考层级#这是 3.1 Flash-Lite 最具突破性的功能。Google 在 API 层面赋予了开发者调节模型思考深度的能力。低思考模式适用于高频、简单的任务,如翻译、内容审核和图片打标。模型会以极速响应,最大化节省成本。深度思考模式则适用于复杂逻辑任务,如生成复杂的 SaaS 代理工作流或实时动态仪表盘生成。模型会分配更多计算资源进行推理,确保输出的严谨性。#4. 落地场景:哪些行业将受益?#Gemini 3.1 Flash-Lite 的极低延迟和成本,打通了 AI 规模化落地的最后一步。在实时互动与 UI 生成方面,它能根据实时气象数据、金融波动或用户输入,瞬间生成动态的 UI 界面或模拟器。例如,在电商领域,它可以秒级填充数以百计的商品线框图。对于拥有海量内容的内容审核与治理平台,3.1 Flash-Lite 能够以极低的成本进行全量多模态审核,快速分析图像意图并识别文本风险。在企业级智能代理场景下,早期合作伙伴反馈该模型在处理涉及多步骤、跨工具调用的任务时,表现出了极强的指令粘合力,且运行成本显著降低。#5. 开发者如何获取?#目前该模型的预览版已在 Google AI Studio 开放,开发者可直接通过 Gemini API 调用。同时,它也同步登陆了 Vertex AI,为 Google Cloud 企业客户提供稳定的生产力支持。#总结#Gemini 3.1 Flash-Lite 的发布不仅是 Google 在模型微缩化上的胜利,更是对智能平权的有力推动。它让开发者不再需要在智能与预算之间做单选题。它的使命就是让智能像电力一样,大规模且低成本地流入每一个应用程序中。

5. 【AI技能】传疯了!AI 大神 Karpathy :真正的知识库不是存资料,而是把知识变成一套会自己生长的系统

6. NAS养虾(OpenClaw)对接本地大模型?我用极空间还真跑通了!

7. 聚焦OpenClaw:是什么以及怎么本地部署

8. 12 个小型语言模型在 8 项任务上进行了基准测试,以找到最佳的基础模型进行微调

9. 【译文】Clawdbot向我们展示了个人AI助手的未来图景

10. 最近海外开发者圈子里,确实开始频繁提到中国的开源大模型了,小米 MiMo 也在其中。 OpenRouter 的真实调用数据显示,MiMo-V2-Flash 开源之后,API 使用量一路走高,已经冲到周榜前列,国产模型里更是排在第一。这个榜单不是主观评测,是开发者真用出来的结果,这一点分量不小。 当然,海外评价和调用数据只是参考,但你不得不承认,小米在大模型这条路上,进步是真的快,不少海外开发者直言,MiMo-V2-Flash 在分析能力上已经明显超过同级竞品,尤其是在 Agent 场景下,实用性非常强,不再是演示型智能了 更有意思的是,MiMo-V2-Flash 在海外的讨论热度,甚至不输同期发布的 Gemini 3 Flash。很多人干脆把它当成Gemini 平替,原因也很直接,效果够用,价格极低,而且现在还是免费。 这波不是情绪输出,是全球开发者用脚投票。中国开源大模型,真的开始被认真对待了。

11. mac mini M4(16GB+256GB) 本地跑一个 7b 模型,辅助一些日常任务可行吗?

12. #小米最强大模型开源# 今天一觉睡醒,小米就放了个大的,直接把最强MiMo-V2.5-Pro模型开源,100万亿Token免费送、Agent平台限时免费,对千万开发者来说,简直就是福利。在生成式 AI 狂飙突进的当下,开发者们恰恰最需要真正能落地、好上手、够自由的生产力平台,而MiMo这个模型可以算的上是咱们国内优秀前沿之一的AI大模型,它的Agent能力甚至能够跟Claude Opus 4.6掰手腕。作为原生全模态模型,这一下一开源,一口气适配全球7家芯片平台,其结果和影响不亚于蝴蝶效应,是真的实实在在让开发者打造属于自己的垂直领域创作。把技术的方向盘交给开发者,才能真正的共建生态!

13. 零基础也能学AI编程?Cursor+Python,这本书让你从入门到项目实战!

14. 搭建 Ollama 本地模型,让 Hermes 拥有"备用大脑"

15. 一个视频带你快速盘点2025年GitHub热点项目

16. OpenClaw小龙虾速通攻略:功能用途、同类对比及本地部署

17. 把NAS变成私人AI助手:飞牛NAS本地部署AI大模型教程

18. 【硬核教程】教你搭建Mac AI集群!4台M3 Ultra,运行万亿参数大模型!

19. 开源版的 GPT Image 2,信息图、连续图文、本地部署全拿下|商汤SenseNova U1实测

20. 当海外开发者还在为Gemini3 Flash惊叹时,小米开源大模型MiMo-V2-Flash横空出世,直接被老外吹成“Gemini平替”!它以309B参数实现2.6倍推理加速,延迟仅为DeepSeek-V3.2的一小部分,却在通用基准测试中性能相当。最让开发者疯狂的是,它不仅免费开源,推理成本还低至闭源竞品的2.5%,中国开源大模型的实力,这次真的让海外刮目相看

21. 【保姆级】RAG智能体终极方案:n8n+Google File Search,零门槛搭建高精度RAG工作流!

22. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称模型微调(Fine-tuning)知识点讲解模型微调是指在预训练好的大型基础模型上,使用相对较小规模的标注数据,对模型参数(通常为全部或部分)进行进一步训练,使模型适应特定下游任务。它避免了从零训练的巨大成本,同时保留了预训练学到的通用知识。例如,使用预训练的 Llama 模型,在中文问答数据集上进行微调,通常只需比预训练阶段少得多的数据量,即可显著提升模型在该任务上的表现,而无需重新训练整个模型。例题(单选题)模型微调的核心目的是什么?A选项:让预训练模型适应新任务B选项:从零训练大型模型C选项:删除模型所有参数D选项:以修改模型结构为主要方式进行训练答案与题解答案、题解:见评论区温馨期待期待大家提出宝贵建议,互相交流,收获更大,助教:lxy#AI创造营# #科技风向标# 网页链接

23. 个人知识库相比大模型已有海量知识,是否存在独特价值?如果知识库录入越来越多,假设达到了大模型训练数据的 1/1000, 这时候个人知识库是不是没有意义了?因为它的回答和分析,跟训练后的大模型输出结果也许趋于相同?简单直接的回答是:恰恰相反,你的知识库越大,它的“主权价值”和“差异化价值”反而越高,甚至会成为你相对于通用 LLM 的核心壁垒。以下从几个维度来拆解为什么“趋同”是一个伪命题:1. “1/1000” 的含义:信号密度 vs. 数据总量目前的顶级模型(如 Llama 3 或 GPT-4)训练数据动辄在 15 Trillion (15万亿) tokens 以上。如果你个人的知识库达到了它的 1/1000,那就是 15 Billion (150亿) tokens。- 规模参考: 整个英文维基百科大约只有 40 亿 tokens。- 分析: 如果你拥有一个 150 亿 tokens 的私有知识库,这里面的信息熵(Information Entropy)远高于通用互联网数据。通用模型是“万金油”,它是对全人类平庸知识的最大公约数(Statistical Average);而你的知识库是针对特定研究领域的高精度垂直采样。2. “平均值” vs. “特异性”:逻辑趋同,但结论可能相反即便模型通过训练“见过”你知识库里的某些公开发表的内容,它在输出时也会被大量的通用语料“稀释”。- 平庸的答案: LLM 的预训练权重倾向于给出最稳妥、最符合大众认知的回答。- 你的“Edge”: 你的知识库里包含你个人的 Vibe、你的非共识论据、以及你私有的实验数据。- 结论: 知识库存在的意义不是为了重复 LLM 已有的知识,而是为了校准(Alignment)和对抗(Counter-steering)。当 LLM 的权重倾向于 A 时,你的知识库能通过 RAG 强行将它拉回到更深刻的 B。3. 确定性与“溯源”:解决幻觉的终极手段这是 Karpathy 和 Lex Fridman 都非常看重的一点。- 权重是模糊的: 模型训练完后,知识被揉碎成了概率分布。你无法确定它说出某个观点是基于哪篇论文。- 知识库是精确的: 无论库多大,它始终提供 Citations(引用)。在专业研究中,一个无法溯源的“正确答案”往往是没用的;而一个能够回溯到原始 .md 文件和图片的论证才是真正的资产。4. 动态更新与“时间差”:权重是死的,知识库是活的LLM 的训练数据有 Knowledge Cutoff(知识截止日期)。- 即便是 1/1000 的量级,如果这部分数据是过去 6 个月内产生的、或是你正在进行的实时研究,通用 LLM 的权重里根本不存在这些信息。- 在 Agent Native 的工作流中,知识库是你的 L2 Cache。只要你还在源源不断地产生新 token,你的库就永远领先于模型的权重更新。5. 合成数据的“炼金术”正如你之前提到的“输出原文不直接包含的论据”,当你的库大到一定程度,你其实是在进行更高阶的合成。- LLM 是 CPU,知识库是 RAM: CPU 再强,没有大内存也跑不动复杂的任务。- 反哺训练: 当你的库达到 1/1000 量级,你已经具备了 微调(Finetuning) 一个专属模型的资格。这时候,知识库不再是“没意义”,而是进化成了“种子语料”,让你从“调教 Agent”上升到“训练专属大脑”。总结:如果把通用 LLM 比作一个博学但健忘的教授,你的知识库就是他手边那叠永不磨灭的、带有他个人批注的、且实时更新的精密笔记。教授越博学,那叠笔记反而越珍贵。 因为笔记不再需要记录“1+1=2”这种常识,它会进化到只记录最前沿的、最私密的、最能产生逻辑增量的核心洞察。所以,别担心趋同。当你积累到 1000 个文件甚至更多时,你只会发现通用 LLM 越来越像一个“好用的翻译官或打字员”,而真正的“灵魂和护城河”都在你的 .md 文件里。(附图附带排版,内容相同)

24. 如何评价Karpathy提出的个人知识库的架构?

25. 【#美开发者基于DeepSeek做爆款AI工具# 】#中国大模型开源让世界开发者聚在一起#5月初,一个基于DeepSeek V4开发的智能体DeepSeek-TUI在美国火了,它背后是一名美国独立开发者亨特·鲍恩。为什么一位美国人选择基于DeepSeek开发?@玉渊谭天 独家联系到了他,戳视频看⬇️ 玉渊谭天的微博视频

26. 单卡双芯 48G 显存!打造 20L 紧凑型 AI 算力怪兽:DeepSeek 70B 实测 19 tokens/s

27. LightRAG 是一个简单快速的检索增强生成(RAG)框架,能高效整合大语言模型和知识图谱,实现智能文档查询和多模态检索。LightRAG支持多种存储方案(PostgreSQL、Neo4j、Milvus、OpenSearch等),支持文本、图片、表格、公式等多种数据类型的端到端知识抽取和问答。还提供了丰富的示例代码、Web UI,以及支持OpenAI、Hugging Face、Ollama、Azure OpenAI等多家模型接口。项目亮点:- 灵活配置的多存储架构,适合大规模知识管理;- 深度集成知识图谱构建与编辑,支持实体关系管理、知识图谱可视化;- 支持强大的Reranker提升检索效果;- 新增RAG-Anything,打通多模态文档处理与检索能力;- 丰富文档导入格式、引用功能、缓存管理、Token使用统计;- 还支持Langfuse可观测性监控以及RAGAS自动评价指标。无论是科研研究、企业知识库、还是多模态智能问答应用,LightRAG都提供了极具扩展性且高性能的解决方案。GitHub:github.com/HKUDS/LightRAG#在线智能检索# #知识图谱# #大语言模型# #RAG# #开源项目#

28. 奇思妙想:众所周知,AI Agent 就是倒腾 Markdown。倒腾 Markdown 哪家强?——Obsidian有一种可能,Obsidian 是未来 AI Agent 的宇宙中心。(Obsidian 官方在引入 AI 上极为克制,到目前为止,最激进的举动也只是 Obsidian CLI,让外部 AI 好调用一下)Obsidian 不用拥抱 AI,AI 会拥抱 Obsidian

29. 本地AI哪家强?统一内存大横评!

30. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

31. 在线使用和部署大语言模型(LLM)经常面临硬件资源限制,不同模型对CPU、RAM、GPU的需求差别巨大,挑选合适模型既费时又费力。有个超实用的开源工具——llmfit(GitHub:github.com/AlexsJones/llmfit),能自动检测你电脑的CPU、内存和GPU配置,结合模型参数和量化信息,智能评估数百款主流模型(Meta Llama、Mistral、Qwen、DeepSeek、Llama.cpp等)在你本地硬件上的运行适配度、速度和质量,帮你快速找到最适合你机器的模型。主要功能:- 自动硬件检测(支持多GPU,NVIDIA、AMD、Intel Arc、Apple Silicon等)- 模型Fit评分,覆盖质量、速度、内存匹配度和上下文长度四维度综合评估- 支持多量化策略自动选择,以找到最高质量的量化模型- 交互式终端UI和经典CLI,操作简单直观- 计划模式估算不同模型配置对硬件需求,方便硬件升级规划- 支持本地多种运行时集成,如Ollama、llama.cpp和MLX- 多平台支持:Linux、macOS(Intel/Apple Silicon)、Windows安装方便,macOS/Linux一条命令即可启用,也支持通过cargo源码构建。内置了超过200款模型数据库,且支持自动更新。无论是AI研究者,开发者,还是AI爱好者,都能用它一键找到真正适合自己电脑的模型,极大提升体验。强烈推荐!#AI创造营##人工智能#

32. 用Obsidian+Karpathy方法搭建"不断生长"的知识库系统

33. #微博声浪计划##听见微博# 美开发者基于DeepSeek做爆款工具:DeepSeek-TUI爆火,非科班开发者跨界创新,低成本开发,本土化运营获成功。它证明个人开发者能凭用户洞察打造爆款,推动开源生态降维打击商业工具。 微数码李Sir的微博音频

34. Meta发布Muse Spark:华人天团废墟重建,最恨Llama的果然是小扎自己

35. 横跨大西洋11小时,中国开发者用Mac跑Llama 70 B?评论区吵翻了

36. 不买会员,一期学会轻薄本跑大模型!

37. 别再用 Ollama 了!OpenClaw 秒级响应方案(vLLM + 本地模型)完全免费!| 零度解说

38. 万字长文!小白全面入门Codex手把手教程【附保姆级文档】

39. Qwen3.6“越狱”了!目前最强无审查开源模型!支持本地 Agent,6G 显存都能跑!附部署教程|零度解说

40. 删掉 OpenClaw!Hermes Agent 才是真王炸,一键本地部署 +模型接入全教程(避坑指南) | 零度解说

41. Openclaw小龙虾Windows本地全面部署保姆级教程,接入飞书,让小龙虾随时随地为你工作

42. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格

43. 太爽了!Hermes Agent 发布UI了,本地对接最强开源 Gemma 4 模型+ 微信(免费无需Token)| 零度解说

44. 零成本跑最强AI!Gemma 4手机本地部署(支持离线+多模态)安卓、iPhone全搞定! | 零度解说

45. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)

46. 提速10倍!Mac Mini 本地跑 AI 大模型,OpenClaw + oMLX 加速神器实测效果惊人! | 零度解说

47. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说

48. Google 放大招!Gemini 3.1 Pro 正式发布,推理能力翻倍!免费使用方法来了 | 零度解说

49. 线上微调大模型不想折腾环境配置、参数选型、代码编写?推荐大家试试 unsloth-buddy 这个零门槛的 LLM 微调技能工具。它支持 NVIDIA CUDA GPU 上的 Unsloth 和苹果 Apple Silicon 上的 mlx-tune,本地一站式自动完成环境搭建、LoRA微调(SFT、DPO、GRPO、视觉模型均支持)、效果评测和模型导出。主要特点:- 7步自动化工作流,包含任务调研、数据处理、环境检测、训练、评测、导出;- 智能访谈定制方案,帮你选对模型、训练方法和部署平台;- 支持 Qwen、Llama、Gemma 等主流模型,适配 Ollama、vLLM、HF Hub 等部署;- 苹果 M1~M4 机型友好,甚至能通过 Google Colab 免费云GPU扩展能力;- 可视化实时培训仪表盘,训练曲线一目了然;- 完整开源,MIT协议。不管你是有500条客服问答想做摘要微调,还是复杂多维度调参探索,unsloth-buddy都能带来极致顺滑体验。GitHub:github.com/TYH-labs/unsloth-buddy#AI开发# #大模型微调# #AppleSilicon# #NVIDIACUDA#

50. 使用AI聊天助手经常需要联网、登录账号,还担心隐私泄露和数据被收集,体验总是不够安心。Locally AI 把本地AI运行所需的功能全部集成到iPhone/iPad/Mac上,提供了完全离线的私人AI解决方案。不仅支持Llama 3.2、Gemma 4、Qwen 3等多款大模型,还能图像分析、文本生成,支持Shortcuts自动化,完全无网络、无登录、无数据收集,纯设备本地运行。App Store:网页链接主要功能:- 100%离线运行,无需网络随时随地使用;- 完全隐私保护,无登录、无数据收集,数据永不离开设备;- Apple MLX框架优化,支持M系列芯片超快响应速度;- 多模型支持,包括Llama、Gemma、Qwen、DeepSeek等热门模型;- 智能聊天、图像分析、文本生成,支持复杂问题解答;- 文件附件分析,支持CSV、TXT、代码文件等格式;- Shortcuts集成,可创建强大自动化工作流;- 支持视觉模型,具备图像理解能力。支持iPhone、iPad、Mac多平台,免费下载,881个评价4.8分,适合隐私敏感用户和AI爱好者。#本地AI##离线AI##隐私保护##AppleMLX# 爱可可-爱生活的微博视频

51. 用Claudian!让Claude丝滑接管你的Obsidian知识库

52. Openclaw / Clawdbot 龙虾本地部署小白式安装视频教程

53. github.com/Tencent/WeKnora 腾讯开源的RAG框架:WeKnora(维娜拉) 这是一款基于大语言模型的文档理解与语义检索框架,专为结构复杂、内容异构的文档场景而打造。 框架采用模块化架构,融合多模态预处理、语义向量索引、智能召回与大模型生成推理,构建起高效、可控的文档问答流程。核心检索流程基于 RAG(Retrieval-Augmented Generation) 机制,将上下文相关片段与语言模型结合,实现更高质量的语义回答。 核心特性 🤖 Agent模式:支持ReACT Agent模式,可调用内置工具检索知识库、MCP工具和网络搜索,通过多次迭代和反思给出全面总结报告 🔍 精准理解:支持 PDF、Word、图片等文档的结构化内容提取,统一构建语义视图 🧠 智能推理:借助大语言模型理解文档上下文与用户意图,支持精准问答与多轮对话 📚 多类型知识库:支持FAQ和文档两种类型知识库,支持文件夹导入、URL导入、标签管理和在线录入 🔧 灵活扩展:从解析、嵌入、召回到生成全流程解耦,便于灵活集成与定制扩展 ⚡ 高效检索:混合多种检索策略:关键词、向量、知识图谱,支持跨知识库检索 🌐 网络搜索:支持可扩展的网络搜索引擎,内置DuckDuckGo搜索引擎 🔌 MCP工具集成:支持通过MCP扩展Agent能力,内置uvx、npx启动工具,支持多种传输方式 ⚙️ 对话策略:支持配置Agent模型、普通模式模型、检索阈值和Prompt,精确控制多轮对话行为 🎯 简单易用:直观的Web界面与标准API,零技术门槛快速上手 🔒 安全可控:支持本地化与私有云部署,数据完全自主可控 #科技先锋官#

54. 刚刚,OpenClaw史上最猛更新!AI记忆可自由插拔,开发者等了半年

55. 本地部署大模型?天选Air2026锐龙AI Max版简单开箱

56. OpenAI Codex 彻底免费!Ollama、llama.cpp 接入本地大模型,AI Agent 开始全自动干活!Token 自由真爽!| 零度解说

57. llama.cpp 最新版太强了!本地跑 “无审查模型” 速度暴涨!N卡/A卡/Intel 全支持|零度解说

58. 如何评价Karpathy提出的个人知识库的架构?

59. OpenClaw 爆火的 AI 自动化神器!本地部署 Clawdbot,对接聊天软件!最新教程|零度解说

60. 零成本无限 Token!Hermes + Qwen3.6,本地最强 Agent 组合来了!附部署教程 | 零度解说

61. 前面讲的用 6G 显存的 GTX 1660 Ti 跑 Qwen3.5-35B-A3B-Q4_K_M.gguf 速度能达到 21 t/s ~ 25 t/s 的这个实验(网页链接),有人问是不是用这个机器跑别的模型也可以。首先,并不能因为 35B 的 Qwen3.5-35B-A3B 在这个机器上能跑,所以认为 27B 的 Qwen3.5-27B 肯定也可以。实际上即使 Qwen3.5-9B 跑起来也很慢,只有 6 t/s。这主要是因为 Qwen3.5-35B-A3B 是 MoE 模型,激活参数只有 3B。也就是说,对显存较小机器来说,Qwen3.5-35B-A3B 是 Qwen3.5 系列中最适合的。另外,总参数 30B 激活参数 3B 的 GLM-4.7-Flash-Q4_K_M 也量化到 Q4,同样用 llama.cpp 在这台机器上的速度大约 13 t/s。Qwen3.5 的速度更快可能和它用了混合注意力设计、软件优化更好等因素等有关。所以,不仅在 Qwen3.5 系列中,而是在当前所有模型中,Qwen3.5-35B-A3B 可能都是小显存机器跑大模型的最优解。如果你有类似硬件,想体验一下,但对技术了解不多,可以参考下面的最简化尝试步骤(假设你的操作系统是 Windows):1、下载 llama.cppgithub.com/ggml-org/llama.cpp/releases/download/b8352/llama-b8352-bin-win-cuda-12.4-x64.zipgithub.com/ggml-org/llama.cpp/releases/download/b8352/cudart-llama-bin-win-cuda-12.4-x64.zip把两个压缩包解开,文件放进同一个目录。假设该目录名字是 llama。2、下载 Qwen3.5-35B-A3B-Q4_K_M.ggufhuggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF/resolve/main/Qwen3.5-35B-A3B-Q4_K_M.gguf?download=true建议存放在固态硬盘而不是机械硬盘上,这会直接影响接下来加载模型的速度。3、在命令行执行 llama 目录中的 llama-cli:llama-cli -m Qwen3.5-35B-A3B-Q4_K_M.gguf

62. 在用 Obsidian 想让你的 AI Agent 更聪明一些?推荐你试试开源项目 Obsidian Skills(github.com/kepano/obsidian-skills),它为智能 Agent 搭建了一套强大的技能组合,让它们能熟练操作 Obsidian 的各种核心功能。Obsidian Skills 支持:- 生成和编辑 Obsidian Flavored Markdown(支持 wikilinks、嵌入、标签、属性、callouts等)- 管理和使用 Obsidian Bases,实现视图、过滤、公式和汇总功能- 创建和控制 JSON Canvas 文件,图形化地连接节点、边和分组- 通过 Obsidian CLI 与你的 vault 交互,支持插件和主题开发- 利用 Defuddle 整理网页内容成干净的 Markdown,节省 Token该项目兼容多类智能 Agent 平台如 Claude Code、Codex CLI、OpenCode,安装简便,可以直接通过插件市场一键添加,也支持手动克隆。对开发者和高级用户来说,这套技能集极大扩展了 Obsidian 的自动化与交互能力,助你打造更智能、高效的知识管理助手。快去 GitHub 了解详情,给你的 AI Agent 装上超强 Obsidian 使用力吧!#AI创造营##人工智能#

63. 过去一周我一直都在折腾本地搞个AI写小说,并自动分割文本自动生成不同角色语音最后自动制作多人有声书的项目。我记得前年我做过节目说这是以后AI可以实现的,现在就这么实现了全本地部署,0付费,全隐私。我用来值机的电脑现在要装机也就四五千块最多,而且工作量完全不饱和,可以再加100倍工作量上去,我还在开发各种我的大脑+AI干活的自动程序,包括炒股的、做自媒体的和其他的,来把这台值守干活的电脑工作量喂满。没有用前一个月折腾的小龙虾(openclaw),那个被证明只是给普通人的玩具,我作为快30年经验的资深程序员,还是习惯用标准代码工作流来控制工作的每一个细节都符合我的标准。用到的工具:1、python,2、llama.cpp ,3、qwen3.6的两个模型(27b和35b),都是Q4量化,4、微软edge tts免费服务,5、voxCPM2本地声音克隆 6、网页前端 7、sqlserver数据库硬件:一张2080ti魔改22G显卡#ai##人工智能##ai写小说##ai有声书# 王纯迅有想法的微博视频

64. Ollama 推出一指令安装OpenClaw,免费云端模型直接用,也支持本地模型

65. 有多少人在把 Obsidian 当一个文件夹在用?然后发现巨不好用,得出一个这啥玩意的结论。Obsidian + cc,我个人用下来感觉这简直是创作者福音。首先它是本地知识库,本质上所有的资料你都是本地的,所以信息不会丢失。这类知识库的强大能力在于,可以全自动化关联信息之间的联系,再利用 ai 就可以总结出所有你个人的特点。建议所有人,都要用一下。

66. #OpenClaw大反转# OpenClaw 3.7版本史上最强更新!89项代码提交+200+Bug修复,首发GPT-5.4+Gemini 3.1 Flash双引擎,全新ContextEngine插件接口——上下文管理终于可以自由插拔。创始人Peter放话:这是最猛一次更新。AI Agent最头疼的断片问题终于解决了,不动核心代码就能自定义记忆策略。GitHub星标已破28万,196位贡献者共建。2026了,是时候领养一只永不断片的AI助手了~

67. 如何看待企业自建AI知识库?

68. 【#谷歌发布FunctionGemma#:把 AI 大模型能力“压缩”进手机,以后玩游戏全靠“吼”】谷歌于 12 月 18 日发布公告,宣布推出 FunctionGemma,是基于 Gemma 3 270M 微调的专用模型,目的是将强大的函数调用(Function Calling)能力引入手机等边缘设备。谷歌表示,随着行业从单纯的对话式接口转向主动式智能体(Agent),开发者对模型本地执行任务的需求日益迫切。FunctionGemma 正是为此而生,它不仅继承了 Gemma 系列的轻量化优势,更通过专项微调,让边缘设备(如智能手机和嵌入式系统)无需依赖云端算力,能够精准理解用户指令并调用相应功能。与通用大模型不同,FunctionGemma 专为“定制化”设计。它既能与人类自然对话,也能生成结构化的函数调用代码来指挥计算机。在 Google 进行的“移动操作”(Mobile Actions)测试中,该模型展现了惊人的可塑性:未经微调的基础版本准确率为 58%,而经过针对性微调后,其执行复杂指令(如“明天约午饭并添加到日历”、“帮我把昨天拍的美食发给老妈”)的准确率跃升至 85%。为了在算力和电池受限的边缘设备上流畅运行,FunctionGemma 采用了极致的轻量化设计。它利用 Gemma 的 256k 词表高效处理 JSON 数据和多语言输入,大幅降低了延迟。该模型目前已适配 NVIDIA Jetson Nano 等开发板及主流移动设备,甚至能作为“交通指挥官”,处理简单任务并将复杂逻辑路由至更大的 Gemma 3 27B 模型。为了降低开发门槛,谷歌为 FunctionGemma 构建了广泛的生态支持。开发者现在即可通过 Hugging Face、Kaggle 下载模型,并利用 Unsloth、Keras 或 NVIDIA NeMo 进行微调。在部署方面,该模型全面支持 LiteRT-LM、vLLM、Llama.cpp 和 Ollama 等工具。谷歌还同步发布了 TinyGarden 游戏演示和“移动操作”微调指南,展示了如何用自然语言控制虚拟农场或手机系统设置,帮助开发者快速构建属于自己的私有化、低延迟端侧智能体。(IT之家) 梨视频的微博视频

69. #美开发者基于DeepSeek做爆款工具##中国大模型开源让世界开发者齐聚#看了美国独立开发者用DeepSeek V4做出爆款工具这事,挺有感触的。不是业内大厂背书,就是一个普通海外开发者,自发选用咱们国产大模型做开发,还冲上GitHub热度榜。这已经不是自嗨式宣传了,是全球开发者用实际行动投票。国产大模型不再只局限于国内圈子,靠着开源开放、性价比高、易二次开发的优势,真正融入了全球AI生态。比起榜单上的虚高排名,这种被海外普通开发者认可、拿来落地做产品,这才是实力证明。玉渊谭天的微博视频

70. 盘点一周AI大事(3月22日)|OpenAI红色警报 字节开源AI超级员工DeerFlow 2.0 英伟达开源Agent安全补丁NemoClaw Okara发布AI CMO Junior开源能雇佣的AI员工Junior 清华开源Agent课堂OpenMAIC MiniMax发布最强开源大模型M2.7 Miro开源最强深度研究模型Miro Thinker H1 Unsloth开源AI训练工具Unsloth Studio Google升级AI Studio和Stitch 阿里开源最强影视配音模型Fun-CineForge Google开源最强视频超分模型Spark VSSR 研究员开源最强数字人模型ID-LoRA 研究员开源首个城市级别的世界模型Seoul World Model #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #OpenAI

71. 「Github一周热点110期」Github历史增长最快的项目?

72. OpenClaw国产开源平替!AstrBot迷你主机部署漫谈

73. 如何评价Karpathy提出的个人知识库的架构?

74. 美团 AI 浏览器被指抄袭个人开发者:开源不代表可以白嫖

75. AvatarAI 是一套开源的实时 AI 数字人平台,只需上传一张照片和 5 秒语音,就能克隆声音并与任意面孔实时对话。系统集成 Whisper 语音识别、Claude/GPT-4/Llama 3 多模型对话、XTTS v2 零样本克隆及 MuseTalk 唇同步视频生成,提供完整的端到端对话流与 WebSocket 流式传输。平台支持本地运行或一键部署至 AWS GPU 实例,具备 JWT 鉴权、会话持久化、情感标签与 18 种语言支持,适合构建虚拟主播、在线客服或数字人应用。GitHub:github.com/PunithVT/ai-avatar-system主要功能:- 零样本语音克隆,仅需 5 秒音频即可生成个性化声音;- 实时唇同步视频,MuseTalk 实现 GPU 下 30 FPS 流畅播放;- 多 LLM 后端切换,支持 Claude、GPT-4o、本地 Llama 3;- 句子级流式处理,首句视频块边生成边播放;- Web、Windows、macOS 多端适配,通过 Docker Compose 一键启动。#AI创造营##人工智能#

76. 在线聊天助手想找集成多聊天渠道又能本地私有部署的开源项目?推荐试试 CoPaw! CoPaw 是你个人专属的 AI 助理,支持 DingTalk、Feishu、QQ、Discord、iMessage 等多种聊天应用,多渠道统一管理,轻松扩展功能。不管是部署在本地机器还是云端,都能完美支持,数据和记忆自主掌控,避免信息泄露风险。 主要功能包括: - 多聊天渠道支持,一键连接多平台; - 本地/云端灵活部署,隐私数据安全有保障; - 内置定时任务(cron)和个性化技能,无限扩展可能; - 丰富应用场景:社交热点摘要、邮件日程管理、文件整理、AI 创意草稿、技术新闻跟踪等; - 支持本地大型语言模型(llama.cpp、MLX、Ollama),无需云端 API,也支持主流云 LLM 及自定义技能。 安装超级简单,macOS/Linux/Windows 一行命令自动完成依赖配置,Docker 镜像也支持,适合个人开发者和企业轻松上手。 官网体验:copaw.agentscope.io GitHub:github.com/agentscope-ai/CoPaw 有了 CoPaw,数字生活的每个角落都有 AI 小助手,工作学习生活效率全面升级!快去试试吧~ #AI创造营##人工智能#

77. 【跑本地模型,换个工具性能提升30%】快速导读:一篇在技术圈引起热议的帖子,揭示了一个普遍的误解:很多人以为自己电脑跑本地大模型卡顿是硬件不行,但大量一线玩家的真实经验是,仅仅把启动器从流行的Ollama换成更底层的llama.cpp,性能就能白拿30%以上的提升。你以为的硬件瓶颈,很可能只是工具瓶颈。---一个用户说,他起初用Ollama跑模型,体验很差,让他一度确信“我的电脑根本带不动更大的模型”——直到他换用llama.cpp,发现性能暴涨,原来电脑完全跑得动。这几乎是每个折腾本地模型的玩家都会经历的“旅程”。你以为在自己的MacBook或Windows笔记本上跑个9B(90亿参数)的模型,速度慢、响应迟钝是正常的,毕竟硬件有限。其实,一个正在被越来越多资深玩家确认的事实是:Ollama为了提供极致的便利性,牺牲了部分性能。它像一个精装修的样板间,拎包入住,但承重墙不是最优的。而llama.cpp是那个毛坯房,需要自己动手,却能挖出硬件的全部潜力。讨论中,不止一位用户报告,从Ollama切换到llama.cpp后,同一个模型、同一台机器,性能直接提升了30%。这个差异的背后,是封装带来的开销。Ollama本质上是在llama.cpp外面套了一层壳,负责模型管理、API服务等。这层“中间商”在带来便利的同时,也吃掉了性能。对于那些只想快速体验的用户,Ollama依然是最佳选择。但如果你开始严肃地将本地模型用于实际工作流——比如像原帖作者那样,用它来驱动一个自动化Agent系统处理文件、调用工具——那30%的性能就不是小事了。它决定了你的Agent是“可用”还是“好用”。一个有趣的现象是,许多人正是在Ollama上碰壁,才最终转向llama.cpp,并惊讶地发现自己的机器原来这么能打。所以,如果你也觉得自己的电脑跑本地模型力不从心,甚至因此放弃了尝试更大、更强的模型。不妨先问自己一个问题:限制你的,真的是那块显卡或那点内存吗?还是那个你以为最方便的工具?---简评:这再次验证了一个反直觉的道理:在任何前沿领域,最流行、最易上手的工具,往往不是性能最好的那个。它为你降低了入门门槛,但也悄悄给你设置了认知天花板。真正的“信息差”优势,往往藏在那些需要你多折腾一步的选项里。---ref: www.reddit.com/r/LocalLLaMA/comments/1rll349/ran_qwen_35_9b_on_m1_pro_16gb_as_an_actual_agent#AI创造营##人工智能#

78. 本地运行大模型推理经常需要复杂配置,llama.cpp 通用性强但针对性不足,各种框架兼容性问题层出不穷,调试优化耗时费力。ds4 把 DeepSeek V4 Flash 的本地推理优化到极致,提供了专为 Apple Silicon 的高性能 Metal 推理引擎。不仅支持 100 万 token 超长上下文、高质量思考模式,还提供磁盘 KV 缓存持久化、OpenAI/Anthropic 兼容 API,甚至 2bit 量化在 128GB MacBook 上流畅运行。GitHub:github.com/antirez/ds4主要功能:- Metal 专用 DeepSeek V4 Flash 推理引擎,M3 Max 达 84 t/s;- 100 万 token 上下文窗口 + 超压缩 KV 缓存,支持磁盘持久化;- 兼容 OpenAI/Anthropic API,支持工具调用和 SSE 流式输出;- 2bit/4bit 特殊量化,128GB RAM MacBook 即可运行 284B 参数模型;- 多种思考模式(normal/max),思考长度随问题复杂度自适应;- CLI 交互 + Server 模式,完美适配 coding agent(如 opencode、Pi)。支持 macOS(Metal),make 编译后即可运行,适合开发者、研究者和 AI 爱好者。#DeepSeek##本地大模型##AppleSilicon#

79. 让你的OpenClaw理解图片!极空间OpenClaw图片理解能力部署

80. 1/10Token 消耗干同样的活!Ling-2.6-flash 想帮开发者把 AI 成本打下来

81. 学习新知识时常常需要在多个工具间来回切换,看论文用一个软件,做笔记用另一个,遇到问题还得单独搜索,效率很低。DeepTutor 是香港大学开源的 AI 学习助手,把文档问答、知识可视化、练习生成、深度研究等功能整合到一个平台。上传教材或论文后,系统会构建知识库,支持多轮对话问答并给出带引用的分步解答。还能根据学习进度自动生成练习题,甚至模拟真实考试风格出题。GitHub:github.com/HKUDS/DeepTutor主要功能:- 大规模文档知识问答,支持教材、论文、技术手册等多种格式;- 多智能体协作解题,结合 RAG、网络搜索和代码执行给出分步解答;- 交互式知识可视化,将复杂概念转化为易懂的图解和演示;- 智能练习生成,根据学习水平定制题目,支持模拟真题风格;- 深度研究与文献综述,自动发现知识空白和研究方向;- 个人知识库和笔记本,追踪学习进度并保持上下文记忆。支持 Web 界面使用,通过 Python 和 npm 安装依赖后即可本地运行,适合学生、研究人员和自学者使用。

82. Qwen3.6“越狱”了!目前最强开源模型!支持本地 Agent,6G 显存都能跑!附部署教程|零度解说

83. 盘点一周AI大事(1月11日)|最强人形机器人 OpenAI公布2026研发路线图 DeepSeek被爆2月发布DeepSeek V4 Google推出Veo3驱动的数字人Vids 字节开源换脸视频模型DreamID-V 阿里开源数字人框架HRM2Avatar Lightricks开源顶级视频模型LTX-2 ElevenLabs推出最强语音转录模型Scribe v2 斯坦福开源睡眠分析模型SleepFM 港大发布开源版NotebookLM DeepTutor Razer推出全息AI老婆Project AVA 波士顿动力推出下一代Atlas #抖音知识年终大赏 #前沿科技趋势发布月 #AI新星计划 #AI #机器人

84. 16项测试赢了13项!Gemini 3.1 Pro碾压GPT-5.2和Claude

85. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称AI中RAG检索增强生成知识点讲解检索增强生成(Retrieval-Augmented Generation,RAG)是一种将检索系统与生成模型结合的架构,模型在生成答案前先从外部知识库(如文档、数据库)检索相关内容,再基于检索结果生成响应,从而缓解大语言模型的幻觉问题、提升答案的事实性和时效性。它通常包括检索器(Retriever,如Dense Passage Retrieval)和生成器(Generator,如LLM)两部分。例题(单选题)RAG的主要优势是什么?A选项:结合外部知识减少幻觉提升事实性B选项:取代模型的参数化知识C选项:仅依赖模型内部参数生成D选项:减少模型参数量压缩体积答案与题解答案、题解:见评论区温馨期待期待大家提出宝贵建议,互相交流,收获更大,助教:lxy#AI创造营# #科技风向标# 网页链接

86. 本地免费部署OpenClaw及FreeRide教程:免费调用30+主流大模型指南

87. 两个教学项目:1️⃣从零开始构建 AI 智能体github.com/pguso/ai-agents-from-scratch本仓库教你从基本原理开始,使用本地 LLM 和 node-llama-cpp 构建 AI 代理。通过完成这些示例,你将理解:✨LLM 的基本工作原理✨智能体究竟是什么(LLM + 工具 + 模式)✨不同智能体架构的运作方式✨框架为何做出某些设计选择理念:通过构建学习。深入理解后,再明智地使用框架。2️⃣从零开始构建RAGgithub.com/pguso/rag-from-scratch通过一步步构建RAG(检索增强生成)来解密它的原理。没有黑箱。没有云API。只有清晰的解释、简单的示例和你完全理解的本地代码。这个项目遵循与《从零开始构建 AI 智能体》相同的理念:通过简洁、解释清楚的真实代码,使开发者能够理解先进的AI概念。你将学到:✨RAG到底是什么,以及它为何在知识检索中如此强大。✨嵌入(embeddings)如何工作,如何将文本转化为模型能理解的数字。✨如何构建本地向量数据库,高效地存储和查询文档。✨如何连接所有内容,检索上下文并将其输入到大语言模型(LLM)中以获得有依据的答案。✨如何重新排序和规范化,提高检索精度并减少噪声。✨一步步的代码演示,每个函数都有解释,毫不隐瞒。#科技先锋官#

88. 本地运行大模型推理经常需要复杂的Python环境、Ollama笨重二进制或llama.cpp编译烦恼,依赖多、启动慢、配置麻烦。Shimmy 用一个Rust单二进制搞定一切,提供完全OpenAI API兼容的本地推理服务器,GGUF + SafeTensors支持,免费永远免费。不仅自动发现Hugging Face/Ollama模型,还支持热模型切换、多GPU后端自动检测、MOE混合推理,甚至一键运行70B+大模型。GitHub:github.com/Michael-A-Kuykendall/shimmy主要功能:- 100% OpenAI API兼容,支持/v1/chat/completions等标准接口;- 单二进制~5MB,包含所有GPU后端(CUDA/Vulkan/OpenCL/MLX),无需编译;- 自动模型发现,支持Hugging Face缓存、Ollama目录、LoRA适配器;- MOE CPU/GPU混合推理,消费级硬件跑70B+模型;- 智能GPU自动检测+端口分配,无需任何配置即开即用;- 支持VSCode Copilot、Cursor、Continue.dev等开发工具无缝集成。支持 Windows、Linux、macOS 多平台,一键下载运行,30秒内启动本地AI服务,完美适合开发者本地开发和隐私推理。#AI推理##本地大模型##RustAI#

89. 盘点一周AI大事(1月25日)|Agent进化,24小时打工 开源视频制作Remotion Skills爆火 AI编程开无限画布插件Pencil 爆火 开源个人AI助手Clawdbot爆火,7成24小时给你打工 Claude Excel插件更新 Runway上线最强视频模型Gen 4.5 字节开源视频参考模型OminiTransfer 字节发布最强数字人直播模型FlowACT R1 阿里开源最强文本转语音模型Qwen 3 TTS #AI新星计划 #抖音知识年终大赏 #AI #OpenAI #AIGC

90. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC

91. 不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?

92. llama.cpp 是由 Georgi Gerganov 开发的开源高性能 LLM 推理框架,核心采用纯 C/C++ 编写,无外部依赖。

93. llama_cpp 开源项目推荐

94. 告别云端焦虑

95. 一个 zip 包,llama.cpp 干掉了本地跑大模型最后的门槛

96. llama.cpp 详细技术说明

97. llama.cpp - 让大模型在任何设备上本地运行

98. 本地部署 AI 大模型主流工具 10 维度硬核横评

99. 三步本地跑起大模型

100. 用Ollama本地部署开源大模型,手把手教你跑通第一个AI

101. Ollama + Llama 3 实战

102. 本地部署Llama3大模型!3种最简方法,CPUGPU均可运行

103. 8GB显卡跑405B模型?这个开源神器直接把显存门槛砸了

104. 8G显存跑AI

105. 本地部署AI大模型

106. 想学 LLM 选哪个开源模型?先回答 3 个反向问题再看目标×硬件矩阵

107. OpenClaw接入Llama模型教程

108. 2026年离线AI部署教程

109. Hermes Agent 自进化智能体 本地部署

110. Meta发布Llama 3.1大模型开源生态挑战闭源霸权……

111. 本地大模型部署方案对比 Ollama vs vLLM vs llama.cpp

112. Ollama vs vLLM vs llama.cpp怎么选

113. 我把AI月费从2000压到0,靠的是这个开源工具

114. 本地部署 AI 大模型横评

115. 不想数据上传云端?2026年本地部署AI大模型完全指南

116. OpenCode+Ollama保姆级教程,零成本上手不花冤枉钱

117. Meta 开源 LLaMA-3 70B

118. 2026本地AI神器!一键测电脑能跑哪些大模型,新手零踩坑

119. Llama 3:Meta开源的新一代大语言模型

120. Llama:Meta开源的AI大模型,为何能成为开源社区的宠儿?

121. Llama 3.2:Meta开源的最新轻量级语言模型

122. 千问和Meta的LLaMA 3.1在多语言理解和生成方面的能力对比谁的覆盖面更广?

123. Ollama把本地大模型门槛砍到8G内存

124. 高性能应用服务HAI - Llama3.1一键部署

125. 安卓手机本地运行Llama 3.2 1B大模型实战指南

126. OpenClaw对接Ollama:本地运行Llama3模型完全指南

127. 血赚!OpenClaw本地部署终极版 5分钟搞定,永久免费零隐私泄露,8G电脑就能跑

128. Llama 3 本地部署实录:多大显存的 GPU 才能跑得起?

129. 还在为大模型部署的显存焦虑? 重磅开源项目AirLLM,直接解决痛点! 70B参数模型,4GB显卡就能跑; 现在更狠,8GB显存,直接运行Llama3.1 405B! 核心分层推理技术,无需量化、蒸馏、剪枝, 完整精度保留,大幅降低硬件门槛, 个人开发者、AI爱好者,本地部署大模型, 现在真的人人可及! #抖音科技风向标 #AirLLM #github优质项目 #牛码架构

130. OpenClaw + Ollama 本地部署完全离线AI 代理

131. 课程介绍:Llama3大模型原理代码精讲与部署微调评估实战

132. 5分钟本地部署Ollama+Llama 3,OpenClaw永久免费、零隐私风险

133. Obsidian+Qwen3:2026年最强本地AI知识库搭建指南(Mac版)

134. Llama 3:本地部署,算力自由

135. 颠覆认知!4GB显存跑70B大模型,AirLLM开源实测:普通人能玩的ai

136. ollama 本地运行大模型推荐。8g显存适用

137. Ollama 从0到1完整教程:本地跑小模型 + 云端秒开480B巨兽!(2026最新)

138. Apple M4炸裂实测!24GB内存本地跑70B大模型,RTX 4090被降维打击(附极客部署教程)

139. Ollama+VS Code部署本地LLM,程序员零成本拥有专属AI助手

140. 微调大模型成本降96%?LoRA技术让个人开发者也能玩转大模型!

141. 唐国梁-大模型Llama架构:从理论到实战教程代找 - 哔哩哔哩

142. Karpathy 最新分享:用 LLM 搭建个人知识库,放弃低效RAG,0行向量数据库代码

143. 【万星收藏】2026最全开源大模型微调指南!三行代码+单卡16G,普通人也能微调专属GPT

144. 微调大模型成本降低96%?LoRA技术让个人开发者也能玩转大模型微调!

145. 记录下当下大模型本地化部署过程

146. Llama3大模型原理代码精讲与部署微调评估实战教程学习 - 哔哩哔哩

147. Obsidian 本地 AI 知识库实战指南

148. 【保姆级教程】零成本!本地部署 DeepSeek + AnythingLLM,打造你的专属 AI 第二大脑

149. Obsidian安装:打造AI知识库(workbuddy联动第二篇)

150. 本地第二大脑!把 Llama 接入 Obsidian,大模型在私人笔记库里冲浪

151. 如何用 LLM 构建个人知识库:Andrej Karpathy+LLM+复利工程

152. Ollama Llama3 导出 GGUF 转 HF LLaMA‑Factory 微调全流程

153. 从零玩转本地大模型:人人都能上手的AI部署之:实战 #llama.cpp本地大模型GGUF量化版部署(小满)基础篇

154. Ollama vs vLLM vs llama.cpp终极对比!本地部署大模型到底该选谁?2026最新版

155. 大模型本地部署保姆级教程!三种方法教会你如何搭建!附不用公网IP服务器内网让外网访问简单方案

156. Obsidian+Ollama封神!本地AI自动化笔记,打工人直接省出2小时

157. 一文搞懂Ollama、LM Studio与llama.cpp

158. 五分钟用anything LLM构建个人知识库,RAG知识库安装也这么简单

159. Ollama vs llama.cpp vs vLLM | RTX 3090 实战分析

160. 使用LLaMA-Factory进行LoRA微调实战(一步步演示)-原理源码解析

161. Llama3大模型原理代码精讲与部署微调评估实战 视频教程 下载

162. 个人知识库-RAG-知识图谱-Cherry-Studio

163. 小白玩转AI大模型应用开发(已完成结)

164. 10分钟搭建本地AI助手:开源工具让AI触手可及

165. 开源大模型微调对比:选对模型,让定制化更高效

166. 自己动手,搭建专属AI聊天伴侣 - Llama模型私有化教程

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章