张大妈

新手入门大模型?这5个开源项目照着玩就能懂原理

源自169位全网作者

05-20 10:49

内容由AI生成

精选参考来源

1. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

2. 大模型为什么不会数数?陈小平深入解析大模型的发展和关键问题 | 锚点

3. 这次春节AI大战,国产模型与国产芯片第一次,双向奔赴! #春节世界观察 #新年囤点专业货 #燃起来了大国重器 #大咖观察 #红衣聊AI

4. TW93的新长篇教程:《你不知道的大模型训练:原理、路径与新实践》大佬的前两篇文章《你不知道的 Claude Code:架构、治理与工程实践》、《你不知道的 Agent:原理、架构与工程实践》都很受欢迎。在线阅读:tw93.fun/2026-04-03/llm.html“在写完《你不知道的 Claude Code:架构、治理与工程实践》、《你不知道的 Agent:原理、架构与工程实践》后,我想着继续来写第三篇,这次打算挑战下自己来梳理一下大模型训练到底怎么回事,这篇文章争取让非专业背景的人也能读得懂。2026 年来看大模型效果真正拉开差距的地方,慢慢不再是预训练本身了,而在它更后面的那一大段:后训练、评测、奖励、Agent 训练、蒸馏,每一个步骤都在影响用户实际感受效果。你发现某个模型突然变强了,背后可能是这几块一起优化到位了,而非单一因素导致。下文按大模型训练链路顺序来讲,重点放在厂商怎么通过后半段训练栈来提升最终上线效果。”#How I AI#

5. 麻省理工学霸AI学习法,2天学完一门课,还能顺利通过考试!别再把AI当搜索引擎,快来学一学MIT学霸的AI学习法! #ai #教育 #NotebookLM

6. 大模型的第一性原理:(三)信息论篇

7. 教学项目:SmolML ,一个完全由 Python 从零构建的、功能完整且简洁的机器学习库。地址:github.com/rodmarkun/SmolML你是否曾好奇,像 Scikit-Learn、PyTorch 或 TensorFlow 这样强大的机器学习库内部究竟是如何运作的?神经网络到底是如何学习的?梯度下降是如何实现的?各种数据处理工具是如何工作的?SmolML 是一个功能完整(但简化版)的机器学习库,仅使用纯 Python 和基础模块(collections、random 和 math)构建。没有 NumPy,没有 SciPy,也没有 C++ 扩展。全程纯 Python。其目标是提供一个透明、易理解且具有教育意义的核心机器学习概念实现。#AI创造营#

8. redis的开发者antirez专门 fork 了一个 llama.cpp 用来跑deepseek-v4-flash地址:github.com/antirez/llama.cpp-deepseek-v4-flash视频为其在 M3 Max 128GB 上运行deepseek-v4-flash的 2 位量化模型效果。#AI创造营#

9. 第1个获得数学奥赛金牌的开源模型!DeepSeek新模型获网友盛赞:公开技术文件,了不起!

10. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型

11. 对 AI 和大语言模型感兴趣,想了解它到底是怎么工作的,但一看那些动辄几十亿参数的模型,根本不知道从哪下手。不妨看看 GuppyLM 这个项目,用不到 900 万参数从零训练一个会说话的「小鱼」,五分钟就能跑通整个流程。从数据生成、分词器训练、模型搭建到推理对话,每个环节都能亲手操作一遍,把大模型的神秘感彻底拆开。GitHub:github.com/arman-bd/guppylm主要功能:- 浏览器内运行,无需安装,直接聊天(WebAssembly + ONNX 量化模型);- Colab 一键训练,从数据集到完整 LLM,T4 GPU 5 分钟搞定;- 本地聊天模式,支持 pip 安装 torch + tokenizers,即时对话;- 合成数据集 60K 对话,60 个鱼类主题(食物、水温、气泡、鱼缸生活);- 纯净 Transformer 架构,6 层 384 dim,Vocab 4096,易懂无复杂优化;- 生成鱼视角回应:短句小写,只聊水、食物、光影,拒绝人类抽象概念。支持浏览器、Colab、Python 本地多平台运行,适合 AI 入门者和爱好者上手实验。#AI创造营##大语言模型#

12. 开源大模型与闭源大模型的差距是在缩小还是在扩大?关键因素是什么?

13. Tabby是开源本地优先AI编程助手,核心聚焦代码隐私与离线可用,基于开源大模型(如StarCoder、Code Llama)提供代码补全服务,无需依赖云端服务器,适配注重代码安全的企业、涉密项目开发及无网络环境编程场景。 GitHub:github.com/tabbyML/tabby 主要功能: 1. 全离线运行:模型本地部署,代码数据不泄露至公网,完全保障隐私安全;2. 多IDE兼容:支持VS Code、JetBrains系列IDE等主流开发工具,集成成本低;3. 多语言支持:适配Python、Java、Go等数十种编程语言,覆盖全栈开发需求;4. 轻量高效:资源占用可控,低配设备也能流畅运行,补全响应延迟低于200毫秒;5. 模型灵活切换:支持自定义开源模型接入与微调,适配团队专属代码风格;6. 无商业绑定:开源免费,无功能限制与付费墙,支持二次开发与私有化部署。 无需联网即可使用核心功能,完全规避云端AI工具的数据泄露风险。实际使用中,企业内部项目编码效率提升30%+,可合规使用,是注重隐私安全的开发者与团队的首选AI编程工具。

14. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生

15. AI时代保命符 我们该教孩子什么 OpenAI掌门人山姆奥特曼对自己孩子未来的规划,AI时代到底学什么才不会被淘汰 #ai #教育 #认知

16. 学习AI模型常常需要翻阅各种教程,有的过于浅显只教调用API,有的学术论文密密麻麻公式看不懂,来回切换效率低下。How to Train Your GPT 把从零构建现代LLM的全过程整合到一起,提供了一套零ML基础也能掌握GPT的互动教科书。不仅有12章逐行注释代码(3900+行),用“五岁小孩”比喻讲解Transformer核心,还包含Jupyter Notebook实时运行、完整训练管道,甚至支持从BPE分词到KV缓存推理的全流程。GitHub:github.com/raiyanyahya/how-to-train-your-gpt主要功能:- 零基础互动教程,支持BPE分词、嵌入、RoPE位置编码、注意力机制等逐行实现;- 完整GPT模型构建(151M参数),采用LLaMA式架构:RMSNorm、SwiGLU、Pre-Norm;- 自定义训练管道,包括AdamW优化器、余弦预热、混合精度和梯度累积;- 高级推理引擎,支持KV缓存、温度采样、top-k/p、beam search和重复惩罚;- 配套Jupyter Notebook,每章独立运行,CPU几分钟看模型训练全过程;- 支持实验扩展,如Flash Attention、LoRA微调、MoE等生产级优化。支持Python环境快速启动(pip install torch tiktoken),Web阅读章节+本地运行Notebook,适合Python开发者、学生和工程师自学LLM原理。#AI创造营##大语言模型##Transformer#

17. 4个平均13岁的初中生,拿下黑客松AI原住民特别奖 4个平均13岁的初中生,24小时手搓AI笔记诊断神器,爬数据、训模型、写代码全搞定,拿下AI原住民特别奖!14岁少年临场演讲碾压职场老兵,13岁男孩把AI当空气和水,这就是AI原住民的降维打击。还有脑控轮椅、吹了么、口袋吉他、注意力界面……48小时神仙打架,22岁少年拿走20万大奖。AI时代,创造无门槛。老的从来不是年龄,是好奇心与热情。你最心动哪个项目?评论区聊聊!#ai #黑客松巅峰赛 #黑客松 #初中生 #vibecoding

18. 「Github一周热点112期」DeepSeek V4王者归来,一个项目玩转GPT-Image-2

19. 大模型的第一性原理:(一)统计物理篇

20. 突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长时记忆

21. 把手教你用上开源版Claude Code,Windows系统接入保姆级教程!

22. MiniTorch,一个面向机器学习工程师的 DIY 教学库,旨在帮助他们了解深度学习系统背后的内部概念。它用纯 Python 重新实现的 Torch API,设计简洁、易于阅读、易于测试且可逐步改进。地址: minitorch.github.io/该项目将深度学习系统的构建分解为几个关键模块,涵盖了从基础到高阶的内容: 基础:机器学习编程基础、模块化、测试。 自动微分:导数、标量自动微分、反向传播。 张量:张量操作、广播机制 (Broadcasting)、自动梯度 (Auto-Grad)。 效率:并行计算、操作融合、GPU 编程。 神经网络:卷积层、池化层、多分类问题。该项目最初是为 康奈尔理工学院 (Cornell Tech) 的“机器学习工程”课程开发的。#科技先锋官#

23. 在线使用和部署大语言模型(LLM)经常面临硬件资源限制,不同模型对CPU、RAM、GPU的需求差别巨大,挑选合适模型既费时又费力。有个超实用的开源工具——llmfit(GitHub:github.com/AlexsJones/llmfit),能自动检测你电脑的CPU、内存和GPU配置,结合模型参数和量化信息,智能评估数百款主流模型(Meta Llama、Mistral、Qwen、DeepSeek、Llama.cpp等)在你本地硬件上的运行适配度、速度和质量,帮你快速找到最适合你机器的模型。主要功能:- 自动硬件检测(支持多GPU,NVIDIA、AMD、Intel Arc、Apple Silicon等)- 模型Fit评分,覆盖质量、速度、内存匹配度和上下文长度四维度综合评估- 支持多量化策略自动选择,以找到最高质量的量化模型- 交互式终端UI和经典CLI,操作简单直观- 计划模式估算不同模型配置对硬件需求,方便硬件升级规划- 支持本地多种运行时集成,如Ollama、llama.cpp和MLX- 多平台支持:Linux、macOS(Intel/Apple Silicon)、Windows安装方便,macOS/Linux一条命令即可启用,也支持通过cargo源码构建。内置了超过200款模型数据库,且支持自动更新。无论是AI研究者,开发者,还是AI爱好者,都能用它一键找到真正适合自己电脑的模型,极大提升体验。强烈推荐!#AI创造营##人工智能#

24. Seedance 2.0提示词技巧!零基础上手指南(附提示词)

25. 市值近600亿,大模型公司上市了! #AI #智谱ai

26. 盘点一周AI大事(2月1日)|AI乌托邦魔幻开局 Google上线世界模型Project Genie 阿里开源实时世界模型LingBot-World AI乌托邦社区Moltbook爆火 Chrome升级为AI浏览器 月之暗面发布最强开源大模型Kimi K2.5 Gemini 3 Flash升级视觉能力 腾讯发布最强开源图像模型HunyuanImage 3.0-Instruct 阿里开源Z image Base满血版 OpenMOSS发布最强开源视频模型MOVA MIniMax上线顶级音乐模型MiniMax Music 2.5 英伟达开源天气预测模型Earth-2 #AI新星计划 #前沿科技趋势发布月 #抖音知识年终大赏 #AI #AIGC

27. 一个视频带你快速盘点2025年GitHub热点项目

28. 抖音前沿科技30X30|采访AI超级个体 Gemini 3发布后,这5个开发者给自己的人生装上了外挂。 27年程序员老兵:用AI写出多部长篇小说,一边敲代码一边圆武侠梦 ; 硬核奶爸:手搓本地AI操作系统,把私教装进孩子口袋; AI安全研究员:把AI变成科研副驾,打破思维墙; 有效加速主义者:打造AI全自动分身,让AI替自己看新闻处理琐事; 全栈讲师:降低新手学习门槛,把技术文档自动变成PPT; 本期视频,产品君连线5位GDE谷歌开发者专家,带你拆解AI时代的超级个体,听听他们给普通人的真诚建议。 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #Google

29. Mythos:普通人能自由使用旗舰 AI 的时代,可能要结束了

30. 历史性时刻!M芯片Mac支持雷电外接GPU进行AI大模型计算!

31. 让大模型理解真实医疗视频,全球首个开源技术方案来了!

32. Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了

33. 学习大语言模型(LLM)常常需要翻阅各种资料,Transformer架构论文难懂,训练部署细节零散,还要搜集多模态和微调教程。《The Big Book of LLMs》把LLM全知识体系整合到一本手册,提供从基础到部署的完整指南。不仅详解Attention机制和现代Transformer架构,还覆盖多模态LLM、非Transformer模型、指令微调、模型训练与部署,甚至包括文本生成和分词原理。网站:book.theaiedge.io- 详尽讲解Transformer原论文《Attention Is All You Need》和自注意力改进;- 介绍多模态LLM及超越语言模型的应用;- 剖析LLM文本生成、从词到Token的过程;- 指导指令训练、Scaling训练和Fine-Tuning技巧;- 部署LLMs的最佳实践;- 涵盖非Transformer语言模型前沿。由Meta前ML Tech Lead Damien Benveniste撰写,支持在线阅读,适合AI工程师、研究者和创业者深入掌握LLMs。#AI创造营##大语言模型#

34. 一个试金石,如果一个人连python都学不会,就与编程就没什么关系,赶紧转向应用和业务,别在编程这块浪费时间。Python 是AI的基础门槛,筛的不是语法,是「逻辑底子」,你到底有没有基本的逻辑能力。AI编程是编程的子集,并不是一个独立于编程的东西。 编程语言是严谨的逻辑表达,与计算机沟通的语言。现在大模型是自然语言沟通的渠道,但对逻辑的要求变没变。只是编程的形式变了,内核仍然相同。你可以不用于去研究i++到底有几种写法 +=到底先运算还是先赋值,数据类型到底是列表还是字典。 但将业务需求拆解,翻译成软件结构,系统架构,模块拆分,基线与迭代,质量过程控制,一点都少不了。少了这些,只能是你和大模型一起在疯狂的token消耗中造出来一些满足情绪价值的工业废物。

35. 在做AI项目或者数据分析时,很多人都会遇到这样的问题:实验脚本、数据处理流程和模型输出零散,复现和协作成本很高。 一个非常实用的开源工具Metaflow,它由Netflix开源,专注于管理和执行数据科学和AI工作流,让复杂项目流程变得可控。 开源地址:github.com/Netflix/metaflow 主要功能: 1.支持Python定义工作流,任务依赖清晰; 2.内置版本控制,自动记录数据和模型输出; 3.可与本地或云端资源无缝集成,灵活执行任务; 4.提供图形界面和命令行工具,方便监控和调试; 5.支持大数据和AI项目的批量任务处理; 6.在大模型训练或AI实验中,可管理训练流程、数据管道和结果记录,保证流程可复现、团队协作顺畅。 Metaflow让AI开发者和数据科学家可以专注于模型和算法,而不用担心流程混乱或数据版本问题,是提升大型AI项目管理效率的好帮手。

36. 怎么看待新加坡政府宣布在东南亚语言大模型项目放弃Meta模型,采用阿里的通义千问(Qwen)开源架构?

37. 梦想照进现实!AI大模型全屋智能居然成了?!

38. 回复@用户379154968:不是说不能用,是说学一点会让你用的更好,事半功倍//@用户379154968:什么,还要去了解原理,这么说普通人就不能使用了呗//@宝玉xp:回复@业务员小韩:“猴子得到机关枪”😅//@业务员小韩:提示词背后是大模型与开发工具的原理、能力的理解与应用,用于写代码的话,也是对软件工程的掌握与应用。照搬一堆提示词(还有hook和skill),不知其所以然,和猴子得到机关枪没有本质区别。

39. 【跑本地模型,换个工具性能提升30%】快速导读:一篇在技术圈引起热议的帖子,揭示了一个普遍的误解:很多人以为自己电脑跑本地大模型卡顿是硬件不行,但大量一线玩家的真实经验是,仅仅把启动器从流行的Ollama换成更底层的llama.cpp,性能就能白拿30%以上的提升。你以为的硬件瓶颈,很可能只是工具瓶颈。---一个用户说,他起初用Ollama跑模型,体验很差,让他一度确信“我的电脑根本带不动更大的模型”——直到他换用llama.cpp,发现性能暴涨,原来电脑完全跑得动。这几乎是每个折腾本地模型的玩家都会经历的“旅程”。你以为在自己的MacBook或Windows笔记本上跑个9B(90亿参数)的模型,速度慢、响应迟钝是正常的,毕竟硬件有限。其实,一个正在被越来越多资深玩家确认的事实是:Ollama为了提供极致的便利性,牺牲了部分性能。它像一个精装修的样板间,拎包入住,但承重墙不是最优的。而llama.cpp是那个毛坯房,需要自己动手,却能挖出硬件的全部潜力。讨论中,不止一位用户报告,从Ollama切换到llama.cpp后,同一个模型、同一台机器,性能直接提升了30%。这个差异的背后,是封装带来的开销。Ollama本质上是在llama.cpp外面套了一层壳,负责模型管理、API服务等。这层“中间商”在带来便利的同时,也吃掉了性能。对于那些只想快速体验的用户,Ollama依然是最佳选择。但如果你开始严肃地将本地模型用于实际工作流——比如像原帖作者那样,用它来驱动一个自动化Agent系统处理文件、调用工具——那30%的性能就不是小事了。它决定了你的Agent是“可用”还是“好用”。一个有趣的现象是,许多人正是在Ollama上碰壁,才最终转向llama.cpp,并惊讶地发现自己的机器原来这么能打。所以,如果你也觉得自己的电脑跑本地模型力不从心,甚至因此放弃了尝试更大、更强的模型。不妨先问自己一个问题:限制你的,真的是那块显卡或那点内存吗?还是那个你以为最方便的工具?---简评:这再次验证了一个反直觉的道理:在任何前沿领域,最流行、最易上手的工具,往往不是性能最好的那个。它为你降低了入门门槛,但也悄悄给你设置了认知天花板。真正的“信息差”优势,往往藏在那些需要你多折腾一步的选项里。---ref: www.reddit.com/r/LocalLLaMA/comments/1rll349/ran_qwen_35_9b_on_m1_pro_16gb_as_an_actual_agent#AI创造营##人工智能#

40. Python助力:文档精准分句并调用大模型进行预翻译

41. 学习AI最有效的方法不是花钱买课!而是用AI学习AI(零基础篇)

42. 如何看待「不会用AI的家庭将是新寒门」的观点,AI改变教育模式的当下,该如何在学习中合理使用AI?

43. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能

44. 「Github一周热点105期」Rust 版openclaw,本地语音克隆工具,Qwen3.5, AI 渗透测试系统和精美源码图片生成工具

45. 完了,我做的这只猫开始监视我了…【AI桌宠开源】

46. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能

47. 又来了个OCR模型:混元OCR发布并开源github.com/Tencent-Hunyuan/HunyuanOCRHunyuanOCR是一款基于腾讯混元原生多模态架构的端到端OCR专家模型。仅以1B轻量化参数,便已斩获多项业界SOTA成绩。该模型精通复杂多语种文档解析,同时在文字检测识别、开放字段信息抽取、视频字幕识别、拍照翻译等全场景实用技能中表现出色。✨ 核心特点 💪 轻量化架构:基于混元原生多模态架构与训练策略,打造仅1B参数的OCR专项模型,大幅降低部署成本。 📑 全场景功能:单一模型覆盖文字检测和识别、复杂文档解析、卡证票据字段抽取、字幕提取等OCR经典任务,更支持端到端拍照翻译与文档问答。 🚀 极致易用:深度贯彻大模型"端到端"理念,单一指令、单次推理直达SOTA结果,较业界级联方案更高效便捷。 🌏 多语种支持:支持超过100种语言,在单语种和混合语言场景下均表现出色。#科技先锋官#

48. 5 分钟零代码改造,让 Go 应用自动获得全链路可观测能力

49. 开源大模型与闭源大模型的差距是在缩小还是在扩大?关键因素是什么?

50. Openclaw 龙虾AI 新手指南!如何架设24/7 永远在线的AI 助理?

51. 初学者如何快速入门学会Claude Code ?

52. 把C++写的老项目重构成现代框架?给AI吧我不干了!

53. 「Github一周热点109期」Claude Code被开源, Pretext文本排版引擎, 谷歌最新开源模型和3D建筑编辑器

54. 「Github一周热点104期」智谱GLM-5发布,打响春节AI大战模型第一枪

55. 目前最强OpenClaw安装分享!对接飞书!普通人最该体验的AI Agent项目

56. #科技先锋官# AI 应用的两大隐忧:黑箱与污染如何破解?大模型黑箱导致决策不可控,内容污染引发信息可信度危机。是AI落地的两块绊脚石。近期艾伦研究所与维基百科的新动作,为破解难题提供了新思路。AI黑箱如同不透明的魔法盒,输入数据就能得到结果,却无人知晓内部推理逻辑。医疗 AI 诊断肿瘤无法说明判断依据,招聘模型可能暗藏性别偏见,这些都源于深度学习的复杂参数难以解读。Olmo 3 全栈开源模型,打破了这一困局。其开放从训练到推理的完整技术栈,让开发者能追溯每一步决策链路,为高风险场景的 AI 应用筑牢安全防线。AI内容污染是生成式 AI 批量产出的文本常存在逻辑空洞、信源杂乱等问题。容易造成语病百出, AI 生成错误插图等案例。维基百科发布的AI 写作征兆指南给出了识别方案。过度使用绝对化表述、堆砌边缘信源、句式机械重复等,都是 AI 生成内容的典型特征,帮助编辑快速甄别信息垃圾。解决当下AI存在的弊端,开源透明与规则治理缺一不可。Olmo 3 的开源模式降低了技术门槛,让模型可解释性成为可能;维基百科的识别指南则为内容审核提供了实操工具。虽然这些仅仅是对AI纠错的开始,但是却是让AI真正服务人类的一次进步。#AI创造营##AI生活指南##微博超有用视频大赛# 种斌Marco的微博视频

57. 说个业内偏硬一点的AI大模型未来发展情况。很多大厂都在把大模型纳入自己的开发流程。最近打听到一个项目,使用Vibe Coding的方法,做一个中小型项目的开发,开发时间能缩短至少一半,代码看不懂都行,直接问看过代码的大模型就行。甚至HW,他们目前也在使用仿真脚本(python写的用于效果验证的),都是大模型快速生成消费者怀疑AI是不是泡沫是正常的,C端的AI只是一个搜索引擎、创作者少、变现难。而对大厂来说,AI已经出现生产力革新...

58. Claude Code+DeepSeek V4 Pro安装教程|3步从零装好开始用 | Mac Windows

59. #2月DeepSeek还会发新模型吗#AI圈2月模型的发布和迭代处于一个高峰期!头部厂商扎堆上新大模型,DeepSeek的新模型动态目前其新模型已完成灰度测试,技术储备到位,大概率会在2月正式亮相。根据目前媒体的爆料来看,DeepSeek的新模型主要亮点应该在:1M Token超长上下文,可轻松处理完整长篇文档;Engram条件记忆架构,大幅降低推理成本;强化数学与代码能力三个方面。巩固开源领域优势,同时更新知识库,提升多模态文档理解能力。也是DeepSeek稳稳抓住关注的关键。因为“长上下文+低成本”的差异化优势,精准匹配法律、金融等专业场景,开源属性也贴合开发者与企业需求。#过个有AI年# #HOW I AI#

60. 豆包深度思考大模型上车,实测荣威M7 DMH在广州车展体验了荣威M7 DMH全球首发的“豆包深度思考大模型”。从基础车控到模糊指令,再到识别仪表盘提示,这套车机反应都相当有活人感,来看看效果~#2025广州车展# Eva的科技生活的微博视频

61. 一个大模型的教学项目: GuppyLM ,参数8.7Mgithub.com/arman-bd/guppylm“该项目用来展示训练自己的语言模型并非神秘操作。无需博士学位。无需大型 GPU 集群。只需一个 Colab 笔记本,5 分钟,你就能拥有一个从零构建的可用 LLM——包括数据生成、分词器、模型架构、训练循环和推理。如果你能运行笔记本,就能训练语言模型。它不会生成可以写论文的亿参数模型。但它会准确展示每个环节的工作原理——从原始文本到训练权重再到生成输出——让大型模型不再像黑箱。”GuppyLM 是一个微型语言模型,它假装自己是一条名叫 Guppy 的鱼。它用简短的小写句子谈论水、食物、光照和水族箱生活。它不理解金钱、手机或政治等人类抽象概念——也没有尝试去理解。它从零开始训练,使用 6 万条涵盖 60 个主题的合成对话,在单个 GPU 上约 5 分钟即可运行,并生成足够小的模型,可以在浏览器中运行。#How I AI#

62. 一个不错的Agent教程: 《从零开始构建智能体》——从零开始的智能体原理与实践教程 本教程旨在带领大家深入理解并构建真正的 AI Native Agent。教程将带领你穿透框架表象,从智能体的核心原理出发,深入其核心架构,理解其经典范式,并最终亲手构建起属于自己的多智能体应用。 访问:github.com/datawhalechina/hello-agents #ai创造营# #程序员#

63. Vibe Vibe —— 人人都能学会的 AI 编程(Vibe Coding)指南在线阅读: www.vibevibe.cn/Datawhale的教学项目,这是一份面向零编程基础学习者的 AI 辅助编程系统化教程,从「我有一个想法」到「我做出了一个产品」,让人人都能成为 Builder。本教程分为四大板块,采用渐进式学习路径设计。基础篇:Vibe Coding 启示录(写给所有人的 AI编程入门) (目前完成的基本上是这部分)进阶篇:Vibe Coding 全栈实战教程 (坑)实践篇:分人群项目实战(坑)优质文章篇:精选学习资源(坑)#科技先锋官#

64. 一个新的LLM教学项目:从零开始学习LLM地址:github.com/angelos-p/llm-from-scratch项目作者Angelos Perivolaropoulos是 MLX 的开发人员之一,也是一位经验丰富的机器学习研究员。该项目是一个面向学生和初学者的语言模型学习项目,目标是用尽量清晰简洁的方式带大家走完整个小型大语言模型的构建过程。项目可让学习者亲眼看到一个语言模型如何从随机字符逐步学出词、句子结构和类似莎士比亚的文本。文档中展示了训练早期是乱码,之后出现词语、角色名和句式,最后接近莎士比亚风格;同时也展示了过拟合现象:小数据配大模型时,验证 loss 会先下降后上升等问题。#AI创造营##How I AI#

65. 两个教学项目:1️⃣从零开始构建 AI 智能体github.com/pguso/ai-agents-from-scratch本仓库教你从基本原理开始,使用本地 LLM 和 node-llama-cpp 构建 AI 代理。通过完成这些示例,你将理解:✨LLM 的基本工作原理✨智能体究竟是什么(LLM + 工具 + 模式)✨不同智能体架构的运作方式✨框架为何做出某些设计选择理念:通过构建学习。深入理解后,再明智地使用框架。2️⃣从零开始构建RAGgithub.com/pguso/rag-from-scratch通过一步步构建RAG(检索增强生成)来解密它的原理。没有黑箱。没有云API。只有清晰的解释、简单的示例和你完全理解的本地代码。这个项目遵循与《从零开始构建 AI 智能体》相同的理念:通过简洁、解释清楚的真实代码,使开发者能够理解先进的AI概念。你将学到:✨RAG到底是什么,以及它为何在知识检索中如此强大。✨嵌入(embeddings)如何工作,如何将文本转化为模型能理解的数字。✨如何构建本地向量数据库,高效地存储和查询文档。✨如何连接所有内容,检索上下文并将其输入到大语言模型(LLM)中以获得有依据的答案。✨如何重新排序和规范化,提高检索精度并减少噪声。✨一步步的代码演示,每个函数都有解释,毫不隐瞒。#科技先锋官#

66. 南京大学的公开课《大语言模型基础:从零到一实现之路》地址:github.com/NJUDeepEngine/llm-course-lecture徐经纬老师的课。本课程旨在深入浅出地讲解大语言模型(Large Language Models, LLMs)的基础理论和实践实现。通过"从零到一"的学习路径,你将不仅理解LLM的工作原理,还能亲手实现各个核心组件。🎯 课程目标 理论基础:掌握LLM的数学原理和架构设计 实践能力:从零开始实现LLM的各个组件 工程技能:学习PyTorch、Transformers等主流框架的使用 前沿技术:了解FlashAttention、分布式训练等高级技术#AI创造营#

67. 照着学~大语言模型(LLM)学习路径和资料汇总入门篇:- 了解大语言模型的基础知识和常见术语。- 学会使用编程语言访问 OpenAI API 等常见大语言模型接口。- 面向非专业背景的大模型普及知识。应用篇:- 可以在本地环境搭建开源模型的推理环境。- 大语言模型应用开发框架(如 LangChain、Dify等)。- Prompt 工程、 RAG、Agent 等大模型应用开发范式。深入篇:- 大模型技术原理、训练微调、数据工程、推理优化等。- 大模型应用范式(RAG、Agent等)前沿进展。访问:github.com/ninehills/blog/issues/97#HOW I AI# #程序员#

68. 经常觉得写代码光靠提示不够,想要一个能帮你从零搭建项目、调试、执行代码甚至管理复杂流程的 AI 助手?Goose(github.com/block/goose)是一款本地运行的、可扩展的 AI agent,不仅能写代码,还能执行代码、完成测试,甚至能和外部 API 交互,真正做到自动化工程任务全流程。主要功能:- 从头构建项目,自动生成和运行代码- 调试失败,快速定位修复- 支持多模型配置,优化性能和成本- 无缝集成 MCP 服务器,兼容各种大型语言模型- 提供桌面应用和命令行接口,灵活适配不同开发场景适合开发者、工程师和创新团队,用它加速研发效率,把时间花在创新上,而不是管理琐事。GitHub:github.com/block/goose#AI开发助手# #开源项目# #智能编程#

69. 只需一句话即可创造你的专属智能体 🤖今天 HelloGitHub 给技术小白和想偷懒的开发者们分享一个开源、零代码智能体自动生成平台——Nexent > GitHub 地址:github.com/ModelEngine-Group/nexent这是一款开源的零代码智能体自动生成平台,无需编程基础或复杂的流程图编排,通过自然语言描述需求即可快速创建 AI 智能体。它内置了数据处理引擎,能够自动处理 20 多种文件格式,支持智能体任务规划、决策、执行和 MCP 工具等功能。#GitHub##开源##AI创造营##智能体#

70. 2026 年普通人学习 AI 的方法指南!

71. DeepSeek V4 怎么用?普通人实操教程,在工作生活中发挥价值(附案例)

72. 「Github一周热点110期」Github历史增长最快的项目?

73. //@箭叔JianSu:第二种文档化是必要的,不光是为拆分任务,多agent协同。现在大量的代码由模型生成或者TAB提示来的,工程师对项目代码逐渐陌生。把代码逻辑,重要任务通过文档沉淀下来,用来避免项目代码失控,让AI参与的项目可维护,反正程序员普遍厌恶的写文档,也外包给模型了

74. #DeepSeek开源OCR2新模型#DeepSeek-OCR2这个新模型最近很亮眼,它用了个巧妙的思路:把传统视觉编码换成类似大语言模型的结构,让AI可以像读文字一样“理解”图片里的信息。那这样一来,处理文档、表格的准确率明显提升,识别重复内容更少,对扫描文件和网页的适配也更好了。这背后其实反映出一个趋势:AI和视觉处理技术正在深度融合。未来在手机、工业检测、文档数字化这些领域,能做好“视觉+AI”落地的公司,机会可能会越来越多。

75. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC

76. 回复@三省吾身丶丶:这不是你的问题,昨天有人愤怒地给 ollama 提了一个 issues:Massive difference in speed between Ollama and llama.cpp with qwen3.5:35b!//@三省吾身丶丶:为什么我的 4090 + 64g 这个模型 ollama 只能跑到 20 tokens/s ,一直不知道是哪配置没对

77. 如何系统化地学习AI

78. AI不是魔法一文读懂大模型原理

79. AI 不是魔法

80. 一文搞懂大模型工作原理

81. 从0到1

82. 普通人学用AI之大模型工作原理

83. 打破3大认知误区,普通人使用AI大模型的正确姿势

84. 大模型原理系列 · 开篇

85. AI大模型算法 从大模型原理剖析到训练(微调)落地实战课分享

86. 如果你总觉得大模型像黑箱,Karpathy 这个项目值得你看一眼

87. 阿里千问重磅开源!推出可解释性模块,打开大模型“黑箱”

88. 大模型黑箱被撬开

89. AI黑箱让人不安?英国团队找到新路,让机器思考过程从此透明!

90. 大模型走向内生透明

91. 破解AI黑箱难题,适配7款大模型14组权重

92. 我劝所有想学大模型的人

93. 一份面向动手实践者的大模型全栈学习指南

94. 手把手教你学大模型!上交大这套免费教程今天GitHub爆了,代码+课件全开源

95. 上海交大把大模型课程全部开源了

96. 2026 年大模型自学,这5个GitHub仓库够你学一年

97. 上海交通大学推出动手学大模型教程

98. 6个GitHub爆火的免费大模型教程,助你快速进阶AI编程

99. 【建议收藏】2025最新大模型学习路线图,零基础小白也能轻松入门!

100. 仅花3元、2小时从零训练大模型!这个开源项目让AI学习门槛降低

101. 16K星标!浙大《大模型基础》开源分享!入门AI大模型书籍看这本够了(附PDF)

102. 从模型下载到本地调用

103. Transformers

104. 国产大模型集体开源,2026年AI彻底平民化

105. 大模型入门不再难

106. 上交团队开源《动手学大模型》!从Transformer到Agent全覆盖,课程代码全免费白嫖

107. (9)大模型为什么会写代码?——开源社区如何意外点燃“代码智能”

108. Day2 Python大模型入门速成|0基础可学,实操代码直接套用

109. 纯享笔记

110. 16个开源项目正在改变人工智能和机器学习

111. 95后哈佛小哥撰《从零开始的机器学习》109页中文pdf,全部开源!

112. 自学机器学习太难了,到底该怎么入门?

113. 初学者如何挑选开源项目?5 个核心原则+优质项目推荐

114. GitHub starred 46.8k,微软开源的AI入门课程覆盖了AI学习的完整路径

115. LLM学习日记| 01入门介绍。内容总结

116. AI模型微调速查手册

117. AI大模型入门路线

118. ​大厂卷大模型,企业用小模型?一文理清 AI 落地的最佳分工

119. 小模型2026逆袭

120. 新手福音!Unsloth Studio 零代码实战,一站式微调 3.52B 小模型

121. Python大模型AI入门教程_普通人理解LLM原理

122. 大模型为什么要开源编程

123. 大模型的开源不同于传统的开源软件

124. Docs

125. 非技术背景,一文读懂大模型

126. 大模型大白话解释是什么?如何用简单语言说明其原理?

127. 大模型破圈指南:3周从入门到实战!50个案例详解+行业解决方案(GitHub万星资源包)

128. 【平衡点:解锁中国大模型开源闭源的新时代】关于大模型是否开源的分析

129. 一文读懂大模型的基本概念

130. llama.cpp 详细技术说明

131. 还在用ollama吗?试试llama.cpp给你更高的可控度

132. 从“看不懂人话”,到“理解世界”:一堂讲透大模型原理的课

133. 【全874集】(允许白嫖) 198小时讲完的大模型入门学习教程!告别盲目自学!从此少走99%弯路!全程干货无废话!学完即可自就业!!

134. 上交大一出手,瞬间霸榜GitHub!《动手学大模型》系列教程,已经达到next level!!

135. 三步本地跑起大模型:llama.cpp极简部署

136. 135M小模型微调实战:Unsloth+Outlines本地部署全流程

137. llama.cpp: 上手玩

138. 震惊!上交大首个零门槛大模型教程《动手学大模型》全网公布,免费开放!

139. 【2026最新版】claude code+Python+大模型RAG与Agent智能体项目实战教程,基于主流的LangChain技术从大模型提示词到实战项目

140. 2025大模型训练入门指南:从零基础到独立微调,7阶段科学路线

141. Windows版llama.cpp实操教程,从下载到启动服务,新手也能轻松上手

142. AI模型是个黑箱,这家公司造了一把能打开它的钥匙

143. Hugging Face Transformers 库

144. Ollama与llama.cpp:揭开本地大语言模型运行引擎

145. 本地跑大模型?我用 llama.cpp 把电脑榨干了…,0门槛部署|离线AI|性能实测

146. OpenClaw + 本地小模型:法律AI微调这条路,在自己电脑上能走通吗?

147. AI大模型面试攻略:Transformers库核心概念与模型加载

148. 万亿参数的大模型为什么能秒回答案?背后的黑箱终于被揭开!

149. 图解大模型:生成式AI原理实战(中英两版)

150. llama.cpp编译和运行 API调用

151. 史上最具诚意的开源项目!免费!手把手教你玩转大模型!

152. 531. 平替 ollama,docker 本地部署 llama.cpp

153. 2601第一天作业:预训练和微调文件概览

154. Transformer入门到进阶!内容涵盖transformer原理、Huggingface、GPT、BERT、大模型训练与微调实战!

155. 大模型原理

156. hugging face 使用指南 - 哔哩哔哩

157. AI也是个"黑箱",物理学家用"玩具模型"撬开了它的盖子

158. Transformer模型全家桶!HuggingFace这款开源神器让NLP开发效率飙升 10 倍

159. llama.cpp路由模式(router)-给客户端选择模型的自由及qwen模型配置调优

160. 还在为找 AI 学习资源发愁?这 10 个热门仓库,覆盖 LLM、RAG、智能体全领域

161. 撬开大模型黑箱:Natural Language Autoencoders,让AI“说”出心里话

162. Gemma 4 现在免费微调了!零门槛打造你的私有“最强小模型”

163. 全网最易懂大模型原理课,听不懂我倒立洗头

164. 轻量级模型,重量级性能,TinyLlama、LiteLlama小模型火起来了

165. 破解AI黑箱:大模型可解释性的现状、突破与未来

166. 谷歌DeepMind无预警发布Gemma 4系列开源大模型,开源大模型迎来效率革命,小参数模型性能超越行业巨头

167. 【Python+机器学习+语言模型】128集一周学会人工智能!比大学课程好太多,零基础合适初学者视频教程。自学Ai必备教程_深度学习图解展开_剖析机器学习原理

168. 初学者入门开源:从 0 到 1 参与开源项目的完整指南

169. 一张图看懂:Python编程、机器学习、深度学习、大模型到底什么关系

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章