AI方向选择指南:根据背景快速锁定适合赛道

源自71位全网作者

05-15 22:21

精选参考来源

1
2025过去了!这一年你是不是也在为AI焦虑? 老周用360一整年的实践,告诉你答案:不用怕,抓住Agent就赢了! 从我自己敲代码做100多个智能体,到带领团队All in,这条AI布道之路,全是实战干货。 2026,你想和智能体一起搞定啥?评论区留言,老周帮你研究!#大咖观察#2026 #年度总结 #红衣聊AI #agent
2
【2026年AI工程师学习路线:从调用模型到构建系统的九个关键能力】AI工程和传统机器学习工程正在分道扬镳。机器学习工程师从零训练模型,AI工程师则在基础模型之上构建应用。这个转变意味着你需要学习的东西完全不同了。一、理解基础模型GPT、Claude、Gemini、Llama这些基础模型是现代AI应用的基石。你不需要从头训练,但必须深入理解它们的能力边界、分词机制、上下文窗口和定价策略。成本控制能力往往决定了一个AI应用能否活下去。入门项目:做一个模型对比笔记本,用同样的10个提示词测试不同模型,记录质量、速度和风格差异。二、提示词工程在AI工程领域,提示词就是你的代码。一个平庸的AI应用和一个优秀的AI应用,差距往往就在提示词设计上。少样本学习、思维链、结构化输出这些技术能大幅提升效果,而且不需要任何模型训练。入门项目:选一个任务,写五种不同风格的提示词,在电子表格里打分对比。三、检索增强生成大模型有知识截止日期,还会产生幻觉。RAG让它们扎根于你的数据。从客服机器人到内部知识助手,这是生产环境中最常见的AI应用模式。分块策略、嵌入模型、向量数据库、检索指标,这些都是必修课。入门项目:用你自己的笔记文件搭建一个简单的RAG应用,50行代码就能跑起来。四、评估与测试凭感觉评估无法规模化。你需要系统性的方法来衡量AI应用是否在进步:构建评估数据集、选择指标、跑AB测试、检测性能退化。没有好的评估体系,你就是在盲飞。入门项目:准备20个问答对,写个脚本自动评分,每次改提示词都跑一遍。五、智能体与工具调用智能体把大模型从文本生成器变成行动执行者。它们能浏览网页、执行代码、查询数据库、调用API。理解智能体架构、工具设计和失败模式,是构建自主AI系统的关键。入门项目:做一个计算器智能体,让它通过调用工具来回答数学问题。六、结构化输出与数据提取真实应用需要结构化数据,JSON、SQL、API调用,而非自由文本。JSON模式、函数调用、约束生成这些技术确保大模型输出能与下游系统对接。这是对话式AI和软件工程之间的桥梁。入门项目:做一个食谱提取器,把网页上的乱七八糟的文本变成干净的JSON结构。七、护栏与安全AI应用可能被越狱、产生有害内容、泄露敏感信息。输入输出护栏、隐私检测、内容过滤、对抗测试,这些在生产部署中不可或缺。入门项目:给你的聊天机器人加上简单的输入输出过滤,用关键词匹配检测提示词注入。八、可观测性与监控无法衡量就无法改进。生产级AI系统需要日志、追踪、成本跟踪、质量监控和告警。入门项目:给你的应用加上调用日志,记录时间戳、提示词、响应、延迟、token数量和估算成本。一周后分析数据,你会发现很多优化空间。九、AI系统架构真实的AI应用是多个组件的组合:检索器、模型、护栏、缓存、数据库。理解复合AI系统的设计模式,才能构建可维护、可测试、可扩展的架构。综合项目:做一个个人助手机器人,整合RAG、结构化输出、输入验证和日志记录,部署到免费平台上。这就是一个能展示真实能力的作品集项目。有评论提出了一个值得深思的观点:2026年AI工程师真正的核心能力,是知道哪些层该自己掌控,哪些层该交给框架处理。这个答案每个季度都在变。智能体正在以超出学习速度的节奏压缩技术栈,RAG、结构化输出、护栏越来越多地被内置到平台中。学会构建固然重要,学会判断何时不必亲自构建,可能更重要。x.com/manthanguptaa/status/2018297734995075200
全部
来源
内容由AI生成

精选参考来源

1. 2025过去了!这一年你是不是也在为AI焦虑? 老周用360一整年的实践,告诉你答案:不用怕,抓住Agent就赢了! 从我自己敲代码做100多个智能体,到带领团队All in,这条AI布道之路,全是实战干货。 2026,你想和智能体一起搞定啥?评论区留言,老周帮你研究!#大咖观察#2026 #年度总结 #红衣聊AI #agent

2. 【2026年AI工程师学习路线:从调用模型到构建系统的九个关键能力】AI工程和传统机器学习工程正在分道扬镳。机器学习工程师从零训练模型,AI工程师则在基础模型之上构建应用。这个转变意味着你需要学习的东西完全不同了。一、理解基础模型GPT、Claude、Gemini、Llama这些基础模型是现代AI应用的基石。你不需要从头训练,但必须深入理解它们的能力边界、分词机制、上下文窗口和定价策略。成本控制能力往往决定了一个AI应用能否活下去。入门项目:做一个模型对比笔记本,用同样的10个提示词测试不同模型,记录质量、速度和风格差异。二、提示词工程在AI工程领域,提示词就是你的代码。一个平庸的AI应用和一个优秀的AI应用,差距往往就在提示词设计上。少样本学习、思维链、结构化输出这些技术能大幅提升效果,而且不需要任何模型训练。入门项目:选一个任务,写五种不同风格的提示词,在电子表格里打分对比。三、检索增强生成大模型有知识截止日期,还会产生幻觉。RAG让它们扎根于你的数据。从客服机器人到内部知识助手,这是生产环境中最常见的AI应用模式。分块策略、嵌入模型、向量数据库、检索指标,这些都是必修课。入门项目:用你自己的笔记文件搭建一个简单的RAG应用,50行代码就能跑起来。四、评估与测试凭感觉评估无法规模化。你需要系统性的方法来衡量AI应用是否在进步:构建评估数据集、选择指标、跑AB测试、检测性能退化。没有好的评估体系,你就是在盲飞。入门项目:准备20个问答对,写个脚本自动评分,每次改提示词都跑一遍。五、智能体与工具调用智能体把大模型从文本生成器变成行动执行者。它们能浏览网页、执行代码、查询数据库、调用API。理解智能体架构、工具设计和失败模式,是构建自主AI系统的关键。入门项目:做一个计算器智能体,让它通过调用工具来回答数学问题。六、结构化输出与数据提取真实应用需要结构化数据,JSON、SQL、API调用,而非自由文本。JSON模式、函数调用、约束生成这些技术确保大模型输出能与下游系统对接。这是对话式AI和软件工程之间的桥梁。入门项目:做一个食谱提取器,把网页上的乱七八糟的文本变成干净的JSON结构。七、护栏与安全AI应用可能被越狱、产生有害内容、泄露敏感信息。输入输出护栏、隐私检测、内容过滤、对抗测试,这些在生产部署中不可或缺。入门项目:给你的聊天机器人加上简单的输入输出过滤,用关键词匹配检测提示词注入。八、可观测性与监控无法衡量就无法改进。生产级AI系统需要日志、追踪、成本跟踪、质量监控和告警。入门项目:给你的应用加上调用日志,记录时间戳、提示词、响应、延迟、token数量和估算成本。一周后分析数据,你会发现很多优化空间。九、AI系统架构真实的AI应用是多个组件的组合:检索器、模型、护栏、缓存、数据库。理解复合AI系统的设计模式,才能构建可维护、可测试、可扩展的架构。综合项目:做一个个人助手机器人,整合RAG、结构化输出、输入验证和日志记录,部署到免费平台上。这就是一个能展示真实能力的作品集项目。有评论提出了一个值得深思的观点:2026年AI工程师真正的核心能力,是知道哪些层该自己掌控,哪些层该交给框架处理。这个答案每个季度都在变。智能体正在以超出学习速度的节奏压缩技术栈,RAG、结构化输出、护栏越来越多地被内置到平台中。学会构建固然重要,学会判断何时不必亲自构建,可能更重要。x.com/manthanguptaa/status/2018297734995075200

3. 【保姆级】RAG智能体终极方案:n8n+Google File Search,零门槛搭建高精度RAG工作流!

4. AI设计出来的火箭发动机,为什么让人类工程师看不懂?一个超越人类自身智力的AGI时代正在到来!#ai #火箭 #马斯克

5. 给建议的AI看够了?MiniMax Agent 让AI直接住进你的电脑干活#AI新星计划#科技改变生活#MiniMAX#Agent#minimaxagent

6. 一位中国AI创业者,一行代码都没写,却靠着AI智能体, 冲进了OpenClaw全球贡献者前30,而且排在他前后的,是一批干了十几年的硅谷顶级工程师。#大有学问 #红衣聊AI #创业 #智能体

7. 从 Harness 到 Environment? 这波 Agent 创业还有护城河吗?

8. LoRA微调的研究还能热很久吗?

9. 研究AI论文常常需要同时打开多个工具,arXiv搜论文、Google找代码、ChatGPT总结分析,来回切换效率低下。Feynman 把AI研究全流程整合到一起,提供了开源的AI研究代理解决方案。不仅支持论文搜索与分析、高质量网络与代码检索,还能多代理深度调查、实验复现、文献综述,甚至模拟同行评审。GitHub:github.com/getcompanion-ai/feynman主要功能:- AlphaXiv论文搜索、Q&A、代码阅读和标注分析;- 多代理研究系统,包括Researcher、Reviewer、Writer、Verifier;- 深度研究/lit综述/audit审计/replicate复现等命令;- 支持Docker容器实验、Web搜索、本地模型集成(LM Studio/Ollama);- 云端GPU计算(Modal/RunPod)和输出预览导出;- 会话搜索和持续研究监控,保持上下文记忆。支持 macOS/Linux/Windows 一键安装,通过 curl/bash 或 PowerShell 快速部署,适合AI研究者和开发者使用。#AI研究##开源工具##人工智能#

10. 我分析了求职APP的内部数据!原来应该这么用?

11. 3天赚1200刀?纯聊天就能捏出个能搞钱的 AI Agent!【教程】

12. 删掉 OpenClaw!Hermes Agent 才是真王炸,一键本地部署 +模型接入全教程(避坑指南) | 零度解说

13. 抖音前沿科技30X30|采访AI超级个体 Gemini 3发布后,这5个开发者给自己的人生装上了外挂。 27年程序员老兵:用AI写出多部长篇小说,一边敲代码一边圆武侠梦 ; 硬核奶爸:手搓本地AI操作系统,把私教装进孩子口袋; AI安全研究员:把AI变成科研副驾,打破思维墙; 有效加速主义者:打造AI全自动分身,让AI替自己看新闻处理琐事; 全栈讲师:降低新手学习门槛,把技术文档自动变成PPT; 本期视频,产品君连线5位GDE谷歌开发者专家,带你拆解AI时代的超级个体,听听他们给普通人的真诚建议。 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #Google

14. 终于蹲到了!清华社把这本 Agent 架构书引进了《构建Agentic AI系统》

15. 起底价值百万的顶级内参,2026年,普通人如何改命 #ai #职场 #面试

16. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说

17. AI 智能体开发常常需要折腾各种框架和工具,LLM 模型调用繁琐,工具集成复杂,状态管理还得自己从头搭,调试起来异常麻烦。AI 智能体实战速成指南 把从零到企业级落地的全流程浓缩成一套完整方案,助你快速上手实战。不仅有核心概念详解和架构设计,还提供 LangGraph、CrewAI 等框架实战案例、完整代码仓库,甚至企业级部署指南和优化策略。didilili.github.io/ai-agents-from-zero主要内容:- 核心概念详解,包括智能体架构、工具调用和记忆机制;- 多框架实战教程,支持 LangGraph、CrewAI、AutoGen 等主流方案;- 完整代码示例,从简单聊天机器人到复杂多代理协作;- 企业级落地指南,涵盖 RAG 集成、监控部署和性能优化;- 状态管理和调试工具,简化开发迭代流程;- 实际案例解析,如客服、销售和数据分析智能体。支持在线阅读和本地克隆,多平台浏览器访问,适合开发者、产品经理和企业团队快速上手 AI 智能体。#AI智能体##人工智能#

18. 对话EverMind:4个月做到SOTA,要给所有Agent装上长期记忆

19. LangChain Agent 年度报告:输出质量仍是 Agent 最大障碍,客服、研究是最快落地场景

20. 阿里全家桶全面Agent化!千问“任务助理”全面公测,从此AI不再只是动嘴出主意的狗头军师!

21. 官宣!姚顺雨出任腾讯首席AI科学家,带队大语言模型、AI Infra

22. 万字长文!小白全面入门Codex手把手教程【附保姆级文档】

23. 如果你现在还没用Agent帮自己干活,那其实很危险

24. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)

25. Claude Code+DeepSeek V4 Pro安装教程|3步从零装好开始用 | Mac Windows

26. Moltbook 保姆级部署教程:从 0 到 1 本地运行 AI Agent(OpenClaw 对接) | 零度解说

27. Deep Agents:LangChain开源的Agent框架,开箱即用的LLM应用方案。核心思想:给你一个开箱即用的Agent,需要定制再加工。Deep Agents基于LangGraph构建,内置了单Agent应用的标配能力:任务规划、文件系统访问、Shell执行、子Agent委托、自动上下文管理。会话长了自动总结,大输出存文件,子Agent有隔离的上下文窗口。启动简单,支持任何能调工具的LLM(OpenAI、Claude、开源模型都行)。需要时加工具、换模型、调提示词。支持MCP。对比其他框架:1.LangGraph:底层编排框架,基于图和状态机。完全可控,支持流式、持久化、断点恢复。缺点是学习曲线陡,小任务过度设计。2. CrewAI:多Agent协作框架,建在LangChain和LangGraph之上。提供Agent、Task、Crew等高级抽象,快速定义多Agent分工。优点是上手快,缺点是多Agent固定模式,非标准行为定制困难。3. AutoGen(Microsoft):事件驱动,支持conversation-based Agent交互和group chat。v0.4引入强可观测性和异步模型。适合多Agent对话,不适合需要持久化和复杂状态的应用。4. Deep Agents的位置:单Agent框架,高于简单的ReAct(思维链+工具调用),低于多Agent系统。填补了这个缝隙:需要快速上手,但又要求工业级的规划、文件访问、子Agent能力。技术特点:1. Deep Agents采用trust-the-LLM模型——Agent可以做工具允许的任何事,安全边界由工具和沙箱保证。这套思路来自Claude Code,也就是LangChain在把Claude Code的经验系统化。2. 上下文管理做得细致:会话自动总结、大输出转文件、子Agent隔离上下文窗口。处理长期运行任务(爬虫、研究、报告生成)时能显著降低token消耗。应用场景1. 快速原型或一次性脚本 → Deep Agents足够2. 复杂单Agent任务(爬虫、研究、代码生成) → Deep Agents很合适3. 多Agent协作 → CrewAI更顺手4. 需要完全自定义Agent行为 → LangGraph完全控制5. 对话式多Agent互动 → AutoGen更原生项目:github.com/langchain-ai/deepagents#HOW I AI# #程序员#

28. AI Agent 规模化落地最大障碍是技术还是商业模式?

29. 在学习各种技巧的同时,思维上的转变也很重要。理解 「AI 应用」与「传统应用程序」之间的差异,能够从更高层面来理解AI应用,这就比起掌握如何调用AI接口这种技能,更重要!!!「AI 应用」 vs. 「传统应用程序」不止是“模型 vs 程序”,而是“系统范式”的差异。长期以来,我们习惯了传统应用程序的逻辑:由程序员写规则 → 写程序 → 编译 → 执行 → 升级。这是一套从规则到程序的“确定性逻辑体系”。AI 应用则完全不同,它是一套“从数据到模型的统计逻辑体系”。1 传统应用程序1)规则由人写。2)软件行为由代码决定。3)编译和执行是固定流程。4)错误是可复现的、可定位的。5)程序升级靠人工开发和补丁。这意味着人类对系统行为几乎拥有完整控制权。2 AI 应用1)规则不是人写,而是数据和算法自动生成。2)错误不是由 bug 导致,而是由训练数据偏差、特征空间不完全、模型错误泛化导致。3)模型不是一次产物,而是持续更新的产物(持续训练和监控)。4)系统的可解释性有限(尤其深度学习)。5)模型行为随数据环境变化不断漂移。这意味着 AI 应用是一个不断演化的系统,而不是一个稳态软件。技术上的关键变化在于:1)模型的“逻辑”分布在参数空间中,而不是代码逻辑中。2)模型行为不可完全解释,只能通过监控、对抗测试、统计性手段约束。3)工程挑战从“代码工程”转向“数据工程 + 模型工程 + 算力工程”。#微博兴趣创作计划# #程序员#

30. 对话郝建业:Agent记忆、安全以及Harness框架

31. 线上微调大模型不想折腾环境配置、参数选型、代码编写?推荐大家试试 unsloth-buddy 这个零门槛的 LLM 微调技能工具。它支持 NVIDIA CUDA GPU 上的 Unsloth 和苹果 Apple Silicon 上的 mlx-tune,本地一站式自动完成环境搭建、LoRA微调(SFT、DPO、GRPO、视觉模型均支持)、效果评测和模型导出。主要特点:- 7步自动化工作流,包含任务调研、数据处理、环境检测、训练、评测、导出;- 智能访谈定制方案,帮你选对模型、训练方法和部署平台;- 支持 Qwen、Llama、Gemma 等主流模型,适配 Ollama、vLLM、HF Hub 等部署;- 苹果 M1~M4 机型友好,甚至能通过 Google Colab 免费云GPU扩展能力;- 可视化实时培训仪表盘,训练曲线一目了然;- 完整开源,MIT协议。不管你是有500条客服问答想做摘要微调,还是复杂多维度调参探索,unsloth-buddy都能带来极致顺滑体验。GitHub:github.com/TYH-labs/unsloth-buddy#AI开发# #大模型微调# #AppleSilicon# #NVIDIACUDA#

32. 「Github一周热点100期」爆火的AI编程工具却被Claude封禁?

33. AI也可以组建团队了港大开源的新项目ClawTeam感觉像是让AI Agent从单机到了集群,不同于当前主流的单Agent工具,ClawTeam引入了领导型Agent。当我们下单目标,它就会自主将复杂任务解构为子任务。从开发到部署的全流程自动化,ClawTeam的全栈闭环将原本需要人工干预的DevOps流程转化成了Agent群体的内部协作。 如果说OpenClaw解决了“手”的问题,ClawTeam就是在试图解决“脑与神经网络”的问题吧 #ai##ai前沿速递##微博兴趣创作计划#

34. 「Github一周热点99期」提升ClaudeCode效率10倍的工具?

35. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说

36. 开发 AI Agent 应用时,直接使用 LangChain 或 LangGraph 等框架虽然方便,但复杂的抽象往往像个“黑盒”,让开发者难以理解底层的调用逻辑和决策机制。ai-agents-from-scratch 是一个专注于教学的开源项目,主张从零开始构建 AI Agent。它不依赖现有的成品框架,而是通过 Node.js 和本地大模型,带你一步步拆解 Agent 的核心原理。项目不仅涵盖了基础的模型调用,还深入讲解了函数调用、长期记忆、ReAct 推理模式等关键技术,帮助开发者在掌握底层逻辑后再去更明智地选择和使用框架。GitHub:github.com/pguso/ai-agents-from-scratch主要功能:- 基于 node-llama-cpp 实现本地大模型运行,无需依赖云端 API;- 循序渐进的学习路径,从基础交互到复杂的系统提示词与角色设定;- 深入解析函数调用原理,展示 LLM 如何决定调用工具并处理返回结果;- 实现持久化存储与记忆管理,让 Agent 具备跨会话的信息记忆能力;- 详解 ReAct 推理模式,演示“思考-行动-观察”的循环逻辑;- 提供进阶教程,手写实现类似 LangChain 的 Runnable 接口和状态机图结构。该项目要求 Node.js 18 以上环境,建议配置 16GB 内存以流畅运行本地 GGUF 模型。它非常适合希望深入理解 Agent 架构、提升 AI 应用底层开发能力的工程师参考学习。

37. 【Hermes Agent三层记忆架构,彻底治好AI助手转头就忘】快速阅读:Hermes Agent 通过三层记忆系统、自主编写技能(Skills)以及离线优化引擎 GEPA,解决了 AI 助手“转头就忘”的痛点,实现了从简单对话工具向具备自我演进能力的个人工作流引擎的跨越。现在的 AI 助手大多像个只有瞬时记忆的临时工,每次对话结束,之前的偏好、纠错记录和项目习惯全都清空了。Hermes 的逻辑不太一样。它把 Agent 拆解成了三个层级:身份、记忆、技能。身份由 `SOUL.md` 定义,它是系统的第一优先级,决定了 Agent 是个严谨的工程师还是个随性的设计师。记忆则分成了三层:最核心的是存储环境习惯的 Markdown 文件,其次是可搜索的历史对话,最后是可扩展的外部插件。这种设计很像计算机的存储层级,把关键信息留在缓存,把海量数据丢进磁盘。最有意思的是它的“技能进化”机制。当 Agent 解决了一个复杂问题,它会自己写一份 `SKILL.md` 存起来。下次遇到类似任务,它直接调用“剧本”,而不是重新摸索。为了防止技能库变成垃圾堆,它还有一个类似垃圾回收(GC)的机制,定期清理或合并过时的技能。有网友提到,Agent 容易产生“自我感觉良好”的错觉,导致生成的技能并不好用。针对这个,Hermes 引入了 GEPA 引擎。它不靠 Agent 自己评价,而是通过分析执行轨迹,在离线状态下进行进化搜索,用更硬核的逻辑去优化技能。你可以同时运行多个完全隔离的 Profile,比如一个专门写代码的程序员,一个专门做调研的研究员。它们互不干扰,却能通过各自的记忆和技能,成为 24 小时在线的数字团队。如果一个 Agent 真的能通过不断积累技能来变强,那我们和它的关系,会从“指令下达者”变成“教练”吗?akshay_pachaar/status/2054564519280804028

38. 一个Agent教程 Easy-langent地址:github.com/datawhalechina/easy-langent“langent”由“lang”(代表LangChain、LangGraph等语言大模型开发框架)与“agent”(智能体)合并而来,核心目标是打破“理论学习”与“实战开发”的壁垒:让读者在系统掌握智能体核心逻辑的同时,真正学会运用LangChain、LangGraph框架解决实际开发问题,实现“从懂概念到会开发”的跨越。我们摒弃冗余的理论堆砌,聚焦“用框架做开发”的核心需求,每一章都配套针对性的实操任务,确保读者在学习过程中能够动手实践、深化理解。本项目配套的学习大纲遵循“循序渐进、实践导向”的设计原则,从框架基础认知入手,逐步深入核心组件实操、进阶应用开发,再到多智能体协作与系统优化,最终完成综合实战项目。#AI创造营#

39. AI编程代理经常缺乏生产级工程技能,容易跳过规格编写、测试验证、代码审查等关键步骤,导致代码质量低下、后期维护成本高。agent-skills 为AI编码代理提供生产级工程技能包,覆盖从需求定义到部署上线全开发生命周期的最佳实践。包含19个结构化技能工作流和7个斜杠命令,支持Claude、Cursor、Gemini CLI等多平台AI工具,让代理像资深工程师一样规范开发。GitHub:github.com/addyosmani/agent-skills主要功能:- 7个开发生命周期命令:`/spec`(规格先行)、`/plan`(任务分解)、`/build`(增量实现)、`/test`(测试验证)、`/review`(代码审查)、`/code-simplify`(代码简化)、`/ship`(安全部署);- 19个核心技能:从`idea-refine`(想法提炼)到`shipping-and-launch`(上线发布),每个技能包含步骤、工作流验证和反合理化表;- 专业代理角色:`code-reviewer`(资深工程师视角)、`test-engineer`(测试专家)、`security-auditor`(安全审计);- 参考清单:测试模式、安全检查、性能优化、无障碍标准等快速参考;- Google工程实践:集成Hyrum's Law、测试金字塔、Chesterton's Fence、Trunk-based Development等实战经验;- 多平台集成:Claude Code一键安装,Cursor规则文件,Gemini原生技能,支持任何Markdown提示的AI代理。通过`git clone`本地运行或Marketplace安装,适合开发团队、AI代理爱好者和工程实践训练。#AI编程# #工程技能# #AgentSkills#

40. 【DeepSeek 联合清北发布论文:发力智能体底层基建,突破 Agent 推理 I/O 瓶颈】DeepSeek 与北大、清华在 ArXiv 发布论文,提出全新针对智能体的推理框架 DualPath。其核心是解决 Agent 长文本推理 I/O 瓶颈,通过引入「存储至解码」路径,改变传统单路径加载模式,实现集群存储带宽全局池化与动态负载均衡。在 660B 规模模型实测中,离线推理吞吐量提高 1.87 倍,在线服务吞吐量平均提升 1.96 倍,优化首字延迟且不影响 Token 间生成速度。DualPath 构建双路径模型,由推理引擎、流量管理器和中央调度器组成,还给出以计算网卡为中心的流量管理和自适应请求调度器两套优化方案。实验显示其能有效突破大模型推理 I/O 墙,提升智能体 LLM 推理系统效率。此外,论文第一作者是北大博士生吴永彤,他聚焦系统软件与大模型基础设施研究。

41. 目前开源领域中,LangChain、LangGraph和DeepAgents是三款备受关注的项目,它们分别对应“代理框架”、“代理运行时”和“代理套件”三种不同的工具类型。尽管界限尚不完全清晰,但理解它们的区分有助于更好地构建和运行基于大语言模型(LLM)的智能代理系统。代理框架(如LangChain)侧重于抽象设计,提供统一的开发模型,帮助开发者快速上手并保持项目间的连贯性。它们的核心价值在于封装复杂逻辑,简化应用构建,但若设计不当,也可能限制高级用例的灵活性。市面上类似的还有Vercel AI SDK、OpenAI Agents SDK等。代理运行时(如LangGraph)则更关注生产环境中的执行基础设施,支持持久化执行、流式处理和人机协同等功能,保证代理的稳定可靠运行。它们通常低于框架层,能为框架提供底层支持。类似项目包括Temporal和Inngest。代理套件(如DeepAgents)是最新且更高层次的产品,构建在框架之上,内置默认提示、工具调用管理、规划工具及文件系统访问,提供开箱即用的完整解决方案。它们类似于“通用版的Claude Code”,目标是让复杂代理应用开发更简单高效。总结来说,框架适合快速构建和抽象设计,运行时保障生产级执行,套件则提供集成化的全功能体验。随着这一领域的发展,相关术语和边界还在逐渐明晰,社区的反馈和实践将推动更成熟的定义和标准形成。原文:blog.langchain.com/agent-frameworks-runtimes-and-harnesses-oh-my/

42. 【像工程师一样构建 LLM:从权重到生产环境的全栈路径】快速阅读:工程师学习 LLM 的目标不是理解数学公式,而是实现构建、优化与交付。核心在于打通模型架构、训练对齐与推理系统这三个层级,在精度、延迟与成本之间寻找最优解。---研究员在推导公式,工程师在处理权衡。如果把 LLM 看作一个复杂的软件系统,它的本质其实极其简单:预测下一个 token。所有复杂的架构,本质上都在为这个预测动作服务,试图让它更准、更快、更省钱。理解模型时,不要死磕数学细节,要看它的数据流。Text 变成 Tokens,再映射为 Embedding 向量。RoPE 这种位置编码不是为了增加复杂度,而是为了让模型在向量空间里通过旋转来感知距离,解决长文本的相对位置问题。Attention 机制是系统的核心调度器。Query 负责提问,Key 负责匹配,Value 提供信息。但在工程实践中,标准的多头注意力(MHA)太重了。为了让推理跑得动,大家开始转向 MQA 或 GQA,通过让多个头共享 Key 和 Value 来压缩内存占用。这就像是在带宽有限的系统里做数据压缩,牺牲了一点表达能力,换取了吞吐量。训练阶段,对齐(Alignment)决定了模型的“性格”。SFT 负责教它规矩,而 RLHF 或 DPO 则是通过反馈来塑造行为。有观点认为,对齐是在塑造行为,而不是在灌输知识。到了部署阶段,真正的工程挑战才刚开始。KV Cache 是为了避免重复计算而存在的缓存,但它会吞噬大量内存。PagedAttention 就像操作系统的虚拟内存管理,通过分块管理来解决碎片化问题。要把模型真正跑起来,必须在精度与性能之间做选择。量化(Quantization)通过降低数值精度来换取内存空间,而 vLLM 这种推理引擎则通过连续批处理(Continuous Batching)来压榨 GPU 的每一分算力。工程的本质是一场关于权衡的博弈。精度、延迟、内存、成本,这四个变量永远无法同时达到最优。现在的技术栈已经非常清晰:用 Hugging Face 加载模型,用 Unsloth 做高效的 LoRA 微调,最后交给 vLLM 去处理生产环境的推理。当你在设计推理流水线时,你会发现,最难的往往不是算法本身,而是如何让这些复杂的组件在硬件的约束下协同工作。x.com/kmeanskaran/status/2040651169744535722

43. 「Github一周热点98期」AI文档检索框架、微软最新TTS、Claude Code 记忆插件、自动化备份、 jellyfin和linux桌面环境

44. 太爽了!Hermes Agent 发布UI了,本地对接最强开源 Gemma 4 模型+ 微信(免费无需Token)| 零度解说

45. Agent常见面试题:LLM 是如何学会调用外部 API 或工具的?1 训练数据让模型先“知道工具是怎么用的”在模型具备工具调用能力之前,它必须先在训练数据里看到足够多的工具调用示例。通常包含两类数据:1)真实 API / 工具调用代码或文档,例如:a. “要获取天气,请调用 get_weather(city=...)”b. “要计算数学表达式,请调用 calculator(expression=...)”2)人类标注或模型生成的“对话 + 工具调用”示范,例如:a. 用户问:杭州天气如何?模型示范:调用 tool.get_weather({city:"杭州"})再根据工具返回的结果继续回答。通过这些示例,LLM 学会了:什么问题对应调用什么工具;工具调用的格式是什么;什么时候不该调用工具。2 监督学习(SFT)使模型学会“根据指令选择工具”在 Fine-tuning 阶段加入大量的示例:1)该调用工具的场景2)不该调用工具的场景3)多工具协作场景例如:用户问「告诉我台北到上海的机票价格」。正确示例:a. 模型判断这需要实时信息b. 模型调用 flight_search API模型学习到:当遇到“需要外部信息/计算能力”的问题时,应倾向调用工具。3 通过 RLHF 让模型“偏好正确的工具调用行为”强化学习阶段会奖励:1)正确调用工具2)不乱调用工具3)工具调用后能给出正确结果惩罚:1)不必要的调用2)调用错误的工具3)调用格式不正确这一步让模型不仅会“模仿”,还会“懂得什么时候该调用工具”。4 ReAct / 规划式数据让模型学会 “推理后再决定工具”许多训练数据采用 ReAct 风格:1)模型先思考:要不要调用工具?2)再决定工具调用3)执行后再继续思考与回答这种数据让模型具备:1)任务分解2)长链路推理3)工具调用规划最终效果是:面对复杂任务,模型不会盲调,而是自行形成“推理 → 调用 → 再推理”的结构化流程。5 架构层提供“可调用工具的接口”现代 Agent 框架都会在推理阶段给模型提供一个结构化 schema:1)告诉模型有哪些工具2)告诉模型调用格式3)告诉模型每个字段是什么类型这样模型在生成内容时不需要“猜”,而是严格遵循系统提供的 schema,直接输出可执行的 JSON 或结构化调用指令。例如:1)系统提供工具:search(query: string)2)模型内部只需决定:要不要调用?,以及 query 内容是什么。6 推理时的实际行为:模型并不真的“执行工具”,而是生成结构化调用请求推理时发生的事情是:1)模型生成 JSON 指令,例如:{"tool":"search", "query":"杭州天气"}2)外部系统执行工具并将结果返回3)模型继续根据工具结果生成下一步行动或最终答案模型本身没有执行能力,它只是生成符合 schema 的字符串而已。总结LLM 学会调用外部 API / 工具,是一个“示例训练 + 强化学习 + 架构支撑 + 推理策略”组合的结果:1)先在数据里看到大量工具调用示范2)通过 SFT 学会该如何调用3)通过 RL 学会什么时候应该调用4)通过 ReAct 学会任务分解与步骤规划5)通过 functions/schema 让调用标准化因此模型看起来像真的“理解工具”,但本质是根据统计学习到的模式生成结构化指令。#ai创造营# #程序员#

46. Clawdbot 之后,我们离能规模化落地的 Agent 还差什么?

47. n8n上线Chat Hub!工作流秒变GPTs、仅使用权分享终于实现了

48. AI工具实盘炒股爆赚第一,我用它来分析特斯拉,结果更炸裂 “AI炒股大战”太上头了!Qwen梭哈第一名,DeepSeek打工人第二,GPT-5纠结到只剩两千块。但真正把我震住的,是我实测Qwen的“深入研究”——17步投研流程、引用权威文献、还能自动生成图表、播客、网页。普通人第一次可以拥有专业分析师级别的判断力。AI时代,真正能提效的工具正在悄悄改变我们 #AI工具 #AI研究 #投研工具 #qwenchat #Qwen

49. 开发AI Agent常常需要切换多个框架和工具,记忆系统难管理,技能创建繁琐,自学习循环还得从零搭建,效率低下。《Hermes Agent 从入门到精通》橙皮书,提供Nous Research开源AI Agent框架的完整实战指南。全书17章5部分,详解自学习循环、三层记忆系统、自动技能创建与演化,还包括安装、多平台部署和真实场景应用。GitHub:github.com/alchaincyf/hermes-agent-orange-book主要内容:- 从Harness工程到Hermes Agent核心概念;- 学习循环、记忆系统、Skills与工具生态;- 动手安装、首次对话、多平台运行与自定义;- 知识助手、开发自动化、内容创作、多Agent实战;- 自学习Agent边界与三方对比深度思考。免费PDF下载,支持开发者与AI爱好者快速上手,基于Hermes Agent v0.7.0。#AI橙皮书##HermesAgent##人工智能#

50. 一个开源 CUDA 教程github.com/infatoshi/cuda-course本课程用来帮助习惯于 Python/PyTorch 的深度学习从业者理解底层 GPU 编程,并为理解如 Karpathy 的 llm.c 等项目打下基础。不同于传统的 CUDA 课程(通常侧重于物理模拟或通用并行计算),这门课非常针对深度学习。它明确讨论了 PyTorch 生态、Triton 语言以及如何编写 PyTorch 的 CUDA 扩展。对于 AI 工程师来说,这种上下文非常宝贵。#科技先锋官##AI创造营#

51. OpenClaw 接入微信、QQ、飞书等教程!打造 24 小时在线 AI助手!一键调用MiniMax 5.2、 GPT-5.4 模型| 零度解说

52. OpenAI 的 Agents SDK 最近做了一次重要升级,增加了两个关键功能:内置沙箱执行环境和模型原生执行框架(Harness)。这次更新的目标,是帮助开发者更容易地创建安全可靠、能长时间稳定运行的 Agent。 以前开发者使用 OpenAI 的模型来搭建 Agent 时,模型本身的能力虽然够强,但实际运行环境却需要自己搭建。比如文件读写、代码执行、依赖安装、状态保存等基础功能都需要开发者手动处理,费时费力。现在,SDK 自带沙箱执行环境,Agent 可以在这个统一受控的环境里读写文件、运行代码命令、自动安装依赖,还能保存状态。开发者再也不用从头开始搭建底层环境。 这个沙箱环境支持很多常见的云厂商,包括 Cloudflare、Vercel、Modal、E2B、Daytona 等,也允许开发者接入自己的解决方案。此外,SDK 还提供了一个名叫 Manifest 的统一配置层,可以挂载本地文件或云存储空间,比如 S3、Google Cloud Storage 和 Azure Blob。从本地开发调试到正式生产上线,开发者只需一套配置就能搞定。 另一个亮点是 SDK 采用了模型原生的 Harness 架构,这种设计将 Agent 的状态保存和计算执行分离开来。这样一来,即便运行 Agent 的容器意外崩溃,也能快速恢复状态,继续执行任务,无需从头开始。此外,这种状态外置的做法也能有效保护敏感数据和凭证,避免因提示注入等安全漏洞导致数据泄露。 除了以上这些功能,SDK 还内置了 MCP 工具调用、Skills 渐进式能力暴露、AGENTS.md 自定义指令、Shell 工具命令执行、Apply Patch 文件编辑工具和灵活的记忆系统。这些以前需要开发者自己用 LangChain 等通用框架组合或手写的功能,现在全部内置在 SDK 中,由 OpenAI 针对自家模型专门优化。Oscar Health 的工程师反馈称,使用新的 SDK 才真正实现了临床记录处理工作流在生产环境中的稳定运行,远超此前尝试过的方案。 放眼行业,类似的生态竞争越来越激烈:Anthropic 推出了 Claude Code,Google 提供了 Agent Development Kit(ADK),现在 OpenAI 也将自家的 SDK 从轻量级框架升级为带沙箱、带状态管理的完整开发平台。对于开发者来说,选择哪个平台生态可能会比单纯选模型本身更关键。 当前 SDK 支持 Python,TypeScript 支持也正在开发中。所有 OpenAI API 用户均可直接使用,计费方式维持不变,仍然按照 Token 和工具调用标准收费。 更多详情:http://t.cn/AXM1Kjq7

53. Stanford CS336(2026)把从零构建语言模型的全流程整合到一门课,提供完整的大模型开发实战训练。不仅有Transformer从头实现、高性能优化(FlashAttention2、Triton内核),还覆盖数据清洗去重、Scaling Laws、RLHF对齐,甚至分布式训练系统。官网:cs336.stanford.eduYouTube:youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV主要作业:- Assignment 1:实现Tokenizer、Transformer架构、优化器,从零训练语言模型;- Assignment 2:性能剖析+FlashAttention2 Triton实现,构建分布式训练系统;- Assignment 3:Scaling Laws分析,预测模型扩展性能;- Assignment 4:处理Common Crawl原始数据,数据过滤+去重;- Assignment 5:SFT+RL对齐,训练数学推理模型(可选DPO安全对齐)。5单位实战课,支持GPU云服务(Modal $6.25/hr免费额度),Python/PyTorch熟练即可,适合AI研究者和工程师。前置:CS229/CS224N线性代数概率论,超多代码量!#StanfordCS336##语言模型##大模型训练#

54. 照着学~大语言模型(LLM)学习路径和资料汇总入门篇:- 了解大语言模型的基础知识和常见术语。- 学会使用编程语言访问 OpenAI API 等常见大语言模型接口。- 面向非专业背景的大模型普及知识。应用篇:- 可以在本地环境搭建开源模型的推理环境。- 大语言模型应用开发框架(如 LangChain、Dify等)。- Prompt 工程、 RAG、Agent 等大模型应用开发范式。深入篇:- 大模型技术原理、训练微调、数据工程、推理优化等。- 大模型应用范式(RAG、Agent等)前沿进展。访问:github.com/ninehills/blog/issues/97#HOW I AI# #程序员#

55. RAG、LangChain、Agent 到底有什么关系?

56. Agent 框架记忆问题的解法~用过 LangChain、CrewAI 这些 Agent 框架的都知道一个痛点:它们的记忆管理很鸡肋。大多数框架的做法是:短期放在列表里,长期靠 RAG 检索。听起来合理,实际很脆弱。问题在哪?1. 信息丢失。RAG 只会检索出片段,但对话的整体脉络、为什么重要、前后的因果关系都丢了。用户说"上次那个项目",Agent 可能查出相关文档,但根本不知道用户为什么关心这个项目。2. 幻觉加倍。Agent 基于零碎的检索结果推理,没有全局认知,自然容易编造细节。3. 记忆冲突。同一件事在不同时间表述可能不一样,Agent 也不知道哪个才是"真相",结果前后矛盾。核心问题:RAG 本质是"我记不全,就检索部分"——但这对需要全局一致性的 Agent 任务来说,根本不够。文章的解法:混合记忆架构,不是非此即彼,而是分层:第一层:实时记忆 —— 最近 N 轮对话完整保留,一个字都不丢。这保证了 Agent 对当前对话的理解是准确的。第二层:压缩记忆 —— 更早的对话不是直接存,而是压缩成摘要。比如 50 轮对话压缩成"5 个关键决定 + 3 个重要背景"。成本低,还保留了信息密度。第三层:语义检索 —— 用向量数据库索引压缩后的记忆。这样检索时找的是"高浓度摘要",而不是淹没在海量文档里。第四层:验证 —— 最关键的一步。Agent 每次从记忆里检索出来东西,要自己验证一下:"这个旧记忆和我现在的对话一致吗?"不盲目信任。为什么这个方案值得用?1. 解决了 RAG 的致命问题——记忆有连贯性,Agent 知道全局脉络,不再前后不一。2. 成本可控——压缩记忆大幅降低向量库规模和 token 消耗,相比把所有历史都存下来,省一个数量级的钱。3. 可验证——加验证层,Agent 不会死板地信任过期的记忆。适用场景:- 长期对话的 AI 助手(用户期望 Agent 真的"记得我们的历史")- 复杂多轮谈判或诊断(需要一致决策,不能前后矛盾)- 需要积累知识的任务流不适用的场景:- 单轮或短对话(没必要这么复杂)- 纯知识库查询(RAG 本身够用)原文:dev.to/diego_falciola_02ab709202/every-ai-agent-framework-has-a-memory-problem-heres-how-i-fixed-mine-1ieo#HOW I AI# #程序员#

57. 五种主流且高效的微调技术,助你用有限资源实现定制化:1. 传统微调对LLM不现实,因模型参数量庞大,算力成本极高。参数高效微调(PEFT)因此诞生,核心是对权重矩阵做低秩近似,显著降低训练开销。2. LoRA:在大模型权重矩阵旁添加两个低秩矩阵A和B,只训练这两个小矩阵,节省存储和计算,适合超大模型。3. LoRA-FA:冻结矩阵A,仅更新B,进一步降低显存需求,保障训练稳定。4. VeRA:将A、B设为随机且共享,改为学习层特有的缩放向量,实现更轻量的层间适配。5. Delta-LoRA:在LoRA基础上,动态将A×B的增量“叠加”到原权重W,提升微调灵活性。6. LoRA+:发现矩阵B比A更需高学习率,调整学习率策略,改善收敛效率。这些方法不仅降低算力门槛,更是微调方法论的变革——不再盲目调整全部参数,而是精准塑造“关键方向”。未来趋势是结合模型结构智能选点,支持多任务与持续学习,打造可组合、可扩展的“微调语言”。PEFT不是简单的工程优化,而是智能塑造大模型知识的设计语言,开启了人人可控大模型定制的新时代。原文链接:x.com/_avichawla/status/1996467023334039646

58. 5倍吞吐量+显存砍半!vLLM碾压Ollama,推理引擎彻底变天

59. 大模型微调实战:用LoRA在云端低成本微调LLaMA3

60. 从显存瓶颈到推理革命:vLLM 为何成为大模型服务的底层标配

61. 大模型微调实战:LoRA和QLoRA到底怎么选?

62. 深度学习模型部署的“万能钥匙”:ONNX原理与实战解析

63. 程序员必看:FastAPI 从入门到实战,这一篇

64. SwanLab:3.9k+开源AI实验追踪神器,训练可视化工具

65. FastAPI 入门:Python 新一代高性能 API 框架

66. DeepSeek V4 本地部署 Gradio 完整版,一键启动+暗黑主题+参数调节

67. 千卡集群训练大模型:分布式训练策略、挑战与企业级方案选型

68. huggingfacetext-generation-inference:大语言模型推理部署工具

69. ComfyUI 如何生成 AI 短视频?动态视频工作流搭建教程?

70. 8G显存跑LTX 2.3!零崩溃低配电脑 ComfyUI 工作流 免费精品教程

71. 一行Python dict代码让VLM推理暴涨10%!vLLM官方都看傻了

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章