7B模型跑本地Agent纯属浪费时间,这五款开源模型实测谁才是真香选择

源自151位全网作者

04-07 10:26

内容由AI生成

精选参考来源

1. 大模型的上下文工程,都说很重要,但相关的研究那么少,对Agent开发有什么影响,有大佬能解释一下吗?

2. 大模型的上下文工程,都说很重要,但相关的研究那么少,对Agent开发有什么影响,有大佬能解释一下吗?

3. 【DeepSeek押注Agent:从“会聊天”到“会干活”】快速阅读: DeepSeek一口气放出17个Agent方向岗位,覆盖算法、评测、基础设施全链路,与DeepSeek-V3.2强化Agent能力同步推进。这不是普通扩招,是一家公司在用招聘单公开宣示自己的下一个赌注。---服务宕机12小时的热搜还没凉,DeepSeek悄悄挂出了17个岗位。全部指向同一个方向:Agent。算法研究员、数据评测专家、基础设施工程师,连产品经理都单独开了Agent方向。岗位描述里有一句话值得注意——“重度使用Claude Code、Cursor等AI编程工具者优先”。一家AI公司在招聘时明确要求候选人用竞品工具,这本身就是一种表态。所谓Agent,用最直白的话说:让AI从“被问才答”变成“自己想、自己干、干完自己检查”。规划任务、调用外部工具、多步执行、长期记忆。过去大模型像一个问答机,Agent更像一个能独立跑任务的进程。底层模型是CPU,Agent才是跑在上面的操作系统。有观点认为,底层模型的能力已接近某种边际,接下来的竞争转移到“训练Agent”和评测基础设施。这个判断大概是对的。参数规模的军备竞赛跑到一定程度,差距开始在别处显现——谁能把模型的能力接进真实工作流,谁能让Agent在复杂任务里不乱、不循环、不幻觉。DeepSeek-V3.2已经把思考推理和工具调用融进了正式版,此次招聘像是给这个方向补人手。有网友提到,宕机之后DeepSeek的编码风格突然发生变化,加上支持超长上下文,外界猜测内部正在测试新架构。招聘和模型迭代同步出现,这个时间点不像巧合。年薪最高154万,实习生待遇也不含糊。钱堆在强化学习、评测、基础设施这几块,说明DeepSeek很清楚卡点在哪。一个Agent系统能不能用,不只取决于模型聪不聪明,还取决于评测数据集够不够准、运行时环境够不够稳、工具调用够不够可靠。这些都是脏活,也都是护城河。有观点认为接下来半年内Agent会彻底改变工作流,很多执行类岗位将被替代。这个时间表可能太激进,但方向大概没错。真正没解决的问题是:Agent的自主性和可控性之间的张力。让它更自主,就更容易偏;约束得越死,又回到了问答机。这不是招几个工程师能解决的事,更像是一个还在跑的实验。#DeepSeek释放多个Agent相关岗位#

4. 市值近600亿,大模型公司上市了! #AI #智谱ai

5. 本地AI哪家强?统一内存大横评!

6. 全球AI开发者新宠!阶跃星辰Step 3.5 Flash,两天登顶OpenRouter趋势榜

7. DeepSeek V3.2 正式版发布,V4 还没来,但已经是开源模型里 Agent 能力最强了

8. 【跑本地模型,换个工具性能提升30%】快速导读:一篇在技术圈引起热议的帖子,揭示了一个普遍的误解:很多人以为自己电脑跑本地大模型卡顿是硬件不行,但大量一线玩家的真实经验是,仅仅把启动器从流行的Ollama换成更底层的llama.cpp,性能就能白拿30%以上的提升。你以为的硬件瓶颈,很可能只是工具瓶颈。---一个用户说,他起初用Ollama跑模型,体验很差,让他一度确信“我的电脑根本带不动更大的模型”——直到他换用llama.cpp,发现性能暴涨,原来电脑完全跑得动。这几乎是每个折腾本地模型的玩家都会经历的“旅程”。你以为在自己的MacBook或Windows笔记本上跑个9B(90亿参数)的模型,速度慢、响应迟钝是正常的,毕竟硬件有限。其实,一个正在被越来越多资深玩家确认的事实是:Ollama为了提供极致的便利性,牺牲了部分性能。它像一个精装修的样板间,拎包入住,但承重墙不是最优的。而llama.cpp是那个毛坯房,需要自己动手,却能挖出硬件的全部潜力。讨论中,不止一位用户报告,从Ollama切换到llama.cpp后,同一个模型、同一台机器,性能直接提升了30%。这个差异的背后,是封装带来的开销。Ollama本质上是在llama.cpp外面套了一层壳,负责模型管理、API服务等。这层“中间商”在带来便利的同时,也吃掉了性能。对于那些只想快速体验的用户,Ollama依然是最佳选择。但如果你开始严肃地将本地模型用于实际工作流——比如像原帖作者那样,用它来驱动一个自动化Agent系统处理文件、调用工具——那30%的性能就不是小事了。它决定了你的Agent是“可用”还是“好用”。一个有趣的现象是,许多人正是在Ollama上碰壁,才最终转向llama.cpp,并惊讶地发现自己的机器原来这么能打。所以,如果你也觉得自己的电脑跑本地模型力不从心,甚至因此放弃了尝试更大、更强的模型。不妨先问自己一个问题:限制你的,真的是那块显卡或那点内存吗?还是那个你以为最方便的工具?---简评:这再次验证了一个反直觉的道理:在任何前沿领域,最流行、最易上手的工具,往往不是性能最好的那个。它为你降低了入门门槛,但也悄悄给你设置了认知天花板。真正的“信息差”优势,往往藏在那些需要你多折腾一步的选项里。---ref: www.reddit.com/r/LocalLLaMA/comments/1rll349/ran_qwen_35_9b_on_m1_pro_16gb_as_an_actual_agent#AI创造营##人工智能#

9. MiniMax M2.1也算得上是个成熟的工程师了之前对这类模型预期不高,一般只让它们处理些简单的多语言转换或者写写博客。但这次让它用Claude Code做个Image-to-Video的SaaS网站,表现确实超出预料——它能主动调用Skill完成任务,十分钟就基于模板把网站初版搭出来了,完成度接近Claude Code原生的Opus 4.5(结果见图1)以前国产模型像实习生,得一步步指导,现在M2.1像个能独立干活儿的工程师,清楚该用什么工具、从哪里入手。它的工具调用和Agent能力,确实刷新了我对国产大模型的认知知识储备各家可能差不多,关键在模型能不能精准理解意图并调用工具去执行。这次通过“网站制作”这个Skill,M2.1展现的效果很扎实。Skill生态确实是重要方向,除了Claude Code,Codex、Antigravity也都在跟进#minimax##ai大模型#

10. 刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

11. Vercel推Agent Browser:让AI自己控制浏览器,比Playwright省93%上下文

12. Agent常见面试题:LLM 是如何学会调用外部 API 或工具的?1 训练数据让模型先“知道工具是怎么用的”在模型具备工具调用能力之前,它必须先在训练数据里看到足够多的工具调用示例。通常包含两类数据:1)真实 API / 工具调用代码或文档,例如:a. “要获取天气,请调用 get_weather(city=...)”b. “要计算数学表达式,请调用 calculator(expression=...)”2)人类标注或模型生成的“对话 + 工具调用”示范,例如:a. 用户问:杭州天气如何?模型示范:调用 tool.get_weather({city:"杭州"})再根据工具返回的结果继续回答。通过这些示例,LLM 学会了:什么问题对应调用什么工具;工具调用的格式是什么;什么时候不该调用工具。2 监督学习(SFT)使模型学会“根据指令选择工具”在 Fine-tuning 阶段加入大量的示例:1)该调用工具的场景2)不该调用工具的场景3)多工具协作场景例如:用户问「告诉我台北到上海的机票价格」。正确示例:a. 模型判断这需要实时信息b. 模型调用 flight_search API模型学习到:当遇到“需要外部信息/计算能力”的问题时,应倾向调用工具。3 通过 RLHF 让模型“偏好正确的工具调用行为”强化学习阶段会奖励:1)正确调用工具2)不乱调用工具3)工具调用后能给出正确结果惩罚:1)不必要的调用2)调用错误的工具3)调用格式不正确这一步让模型不仅会“模仿”,还会“懂得什么时候该调用工具”。4 ReAct / 规划式数据让模型学会 “推理后再决定工具”许多训练数据采用 ReAct 风格:1)模型先思考:要不要调用工具?2)再决定工具调用3)执行后再继续思考与回答这种数据让模型具备:1)任务分解2)长链路推理3)工具调用规划最终效果是:面对复杂任务,模型不会盲调,而是自行形成“推理 → 调用 → 再推理”的结构化流程。5 架构层提供“可调用工具的接口”现代 Agent 框架都会在推理阶段给模型提供一个结构化 schema:1)告诉模型有哪些工具2)告诉模型调用格式3)告诉模型每个字段是什么类型这样模型在生成内容时不需要“猜”,而是严格遵循系统提供的 schema,直接输出可执行的 JSON 或结构化调用指令。例如:1)系统提供工具:search(query: string)2)模型内部只需决定:要不要调用?,以及 query 内容是什么。6 推理时的实际行为:模型并不真的“执行工具”,而是生成结构化调用请求推理时发生的事情是:1)模型生成 JSON 指令,例如:{"tool":"search", "query":"杭州天气"}2)外部系统执行工具并将结果返回3)模型继续根据工具结果生成下一步行动或最终答案模型本身没有执行能力,它只是生成符合 schema 的字符串而已。总结LLM 学会调用外部 API / 工具,是一个“示例训练 + 强化学习 + 架构支撑 + 推理策略”组合的结果:1)先在数据里看到大量工具调用示范2)通过 SFT 学会该如何调用3)通过 RL 学会什么时候应该调用4)通过 ReAct 学会任务分解与步骤规划5)通过 functions/schema 让调用标准化因此模型看起来像真的“理解工具”,但本质是根据统计学习到的模式生成结构化指令。#ai创造营# #程序员#

13. 迟来,26年2月开源模型汇总!DeepSeek虚晃一枪,国内大模型狂卷~

14. 【AI Agent的终局不是无限上下文,而是60年前的操作系统】快速导读:大家都在卷百万上下文窗口,但一篇新论文和一线实践者的共识是:真正的解法是把AI的上下文当成一个文件系统来管。这不仅是理论,更是正在发生的事实。---几乎所有人都默认,AI Agent的瓶颈是上下文窗口不够大。从几千个token卷到上百万,仿佛只要窗口无限,AI就能包揽一切。但一篇名为《Everything is Context》的论文提出了一个反直觉的观点:解决上下文问题的最佳方式,是退回到60年前,像操作系统一样,把一切都视为文件系统。记忆、工具、外部源、人类笔记,都作为文件出现在一个共享空间里,只在需要时加载必要的部分。这不只是个学术脑洞。评论区里的一线开发者证实,他们早已在实践中这么做了。他们发现,真正的难题不是建立文件结构,而是决定“不加载什么”。上下文工程的核心,是战略性地遗忘,而不是暴力地堆砌。当AI的每一次信息调用都有时间戳和来源记录,调试Agent的过程就从“重跑一遍碰运气”,变成了像git-blame一样精确回溯。有人一针见血地评论:我们正在以惊人的速度,重跑一遍计算机科学60年的历史,最后发现,操作系统第一次就做对了。最好的想法不会消亡——它们只是在等待房间里的人跟上。---简评:长上下文的暴力美学走到了尽头,架构的优雅开始回归。从“大力出奇迹”到“万物皆文件”,不是技术倒退,而是认知升级。AI的未来,藏在计算机科学的过去里。---ref: x.com/rohanpaul_ai/status/2028184543040270769#AI创造营##人工智能#

15. 别再被 OpenClaw 的热度洗脑跟风了!它根本不是普通人能用的 AI 工具,而是专为技术党准备的 “高级玩具”! 高昂部署成本、高危隐私漏洞、陡峭学习门槛,三大致命痛点直接劝退普通人。免费只是噱头,硬件、算力、电费月月烧钱;权限高、漏洞多,个人信息随时可能泄露;命令行操作、环境配置、模型调试,没基础几天都装不好。 别为了跟风浪费时间金钱,更别拿隐私安全冒险!它的强大与你无关,它的坑却能让你全踩中。 看完这条视频,你会彻底清醒:普通用户远离 OpenClaw,才是最理性的选择!#OpenClaw安全风险争议##科技先锋官##微博超有用视频大赛##科普大作战##AI创造营# http://t.cn/AXVR4YKt

16. 大模型Agent的核心还是prompt?

17. 《Building AI Agents with Google Gemini 3 and Open Source Frameworks》AI代理正从简单聊天机器人进化为具备复杂决策能力的半自主系统。谷歌最新发布的Gemini 3 Pro Preview,成为推动这一变革的核心引擎。它不仅提升了推理深度和多模态处理能力,还通过“思维签名”技术确保多步骤操作不丢失上下文,实现高效稳定的任务执行。Gemini 3支持开发者灵活控制成本、延迟和推理深度,满足不同场景需求。其大上下文窗口有效防止“推理漂移”,让代理在长时间对话中保持逻辑一致。更重要的是,谷歌携手开源社区,实现了LangChain、Vercel AI SDK、LlamaIndex、Pydantic AI和n8n等主流框架的Day 0支持,助力开发者快速构建下一代智能代理。- LangChain通过图形化工作流,支持多角色复杂代理开发。- Vercel AI SDK以TypeScript为基础,优化代码生成和推理性能,助力现代前端框架。- LlamaIndex专注知识型代理,强化数据交互与索引能力。- Pydantic AI结合Python类型安全,提升代理数据的可靠性和可维护性。- n8n赋能非技术团队,无需编码即可打造智能自动化流程。使用Gemini 3时,建议简化提示语,开启thinking_level参数调控推理深度,保持temperature为1.0以保证性能,严格管理思维签名的传递,合理设置多模态分辨率以节省计算资源。详细开发指南中包含迁移建议和API新特性,助力顺利升级。Gemini 3不仅是技术升级,更是智能代理迈向实际应用的关键一步,推动AI更好地服务于复杂业务和多样场景。原文:developers.googleblog.com/building-ai-agents-with-google-gemini-3-and-open-source-frameworks/

18. 说句话就能自动找番下载?我把本地80B大模型调教成了“追番特工”!

19. 都有这么多 Agent SDK/框架了(我应该没列全吧)一、OpenAI Agents SDKOpenAI 推出的 Agents SDK 是目前最轻量、最直接的 Agent 开发方式。它原生支持 Python 和 TypeScript,语法简洁,几行代码就能让 LLM 调用外部函数、工具或执行任务。1. 与 OpenAI 模型的无缝集成,尤其是函数调用、上下文管理等特性。2. 支持 multi-agent handoff 与任务链式调用,便于扩展复杂逻辑。3. 具备生产友好的可观测性与追踪机制。它非常适合快速原型和中小规模生产项目,是“入门写 agent” 的理想起点。 二、LangChainLangChain 几乎是 LLM 应用开发的“标准库”。其 Agents 模块为 LLM 封装了链式推理、工具调用、上下文记忆等能力。1. 概念丰富——有 Chain、Tool、Memory、Agent、Retriever 等模块,适合构建复杂系统。2. 插件与生态极其庞大,几乎支持所有主流模型与数据源。3. 提供跨语言支持(Python 与 JavaScript/TypeScript)。LangChain 上手门槛略高,但生态完整,非常适合需要可扩展架构的项目。三、LangGraph用“流程图”思维管理 Agent 状态。LangGraph 是 LangChain 的“升级版本”,它将 Agent 系统抽象为状态机+有向图,可以显式地控制 Agent 间的消息流与执行路径。1. 天然适合多 agent 协作、任务编排和状态回溯。2. 支持持久化与可视化,能直观看到系统执行流程。3. 面向生产级场景,具备清晰的错误恢复与检查点机制。如果你想做一个“多 Agent 系统”,LangGraph 几乎是最强大的开源选择。四、Google ADKGoogle 的 ADK(Agent Development Kit) 主打可扩展性与安全性。它不是轻量原型工具,而是企业级 Agent 平台。1. 多语言支持,深度集成 Google 生态(Vertex AI、Gemini 等)。2. 工具调用能力极强,可直接对接云服务、API 与企业系统。3. 自带日志、监控、可观测性与治理能力。适合需要在企业内部署、具备高可靠性要求的 Agent 系统。五、SmolAgentsSmolAgents 是Hugging Face推出的一款轻量 Python 库,设计理念是“最小可行 Agent”。1. 安装简单、API 极少,几分钟即可跑通一个工具调用示例。2. 灵活支持 tool 注册与函数调用,但不追求完整框架。3. 适合快速原型、实验性项目或教育用途。如果你希望“几行代码让 LLM 动起来”,SmolAgents 是最轻便的起点。六、AutoGenAutoGen 最初由 Microsoft 研究团队推出,用于多 Agent 间的对话协作。它以“角色对话” 为核心,支持 LLM 代理之间互相交流、分工、调度任务。1. 多 agent 结构灵活,可模拟协作团队。2. 支持复杂任务分配与循环反馈。3. 对研究者和实验系统尤其友好。如果你的目标是研究 agent 交互机制或自动化工作流,AutoGen 是很好的基础。七、MetaGPT角色驱动的 Agent 系统。 MetaGPT 是一个以“AI 团队”为核心的框架,设计理念是让多个 agent 分别扮演项目经理、工程师、设计师等角色,共同产出结果。1. 多角色、结构化协作,任务拆解逻辑强。2. 擅长长链路流程(如产品需求分析→代码生成→测试)。3. 适合自动化软件工程类场景。如果你希望让 LLM 们“像一个团队一样协作”,MetaGPT 是不错的模板。八、Haystack AgentsRAG 与 Agent 的结合体。Haystack 原本是一套开源 RAG 框架,如今扩展出了 Agents 模块。它擅长将检索、知识库与 LLM 推理结合。1. 内置文档检索、索引、管道机制。2. 适合企业知识问答、文档助手类 agent。3. 与 LLM 、数据库和 vector store 的集成成熟。如果你的 agent 核心任务是“带知识的问答”,Haystack 是现成方案。九、Claude Agent SDKAnthropic 推出的开发包。它基于其先前产品 Claude Code 的 agent 引擎(agent harness)构建,目的在于为开发者提供“从模型调用 + 工具调用 +流程控制 +状态管理”这一整套能力。1. 上下文管理自动化:自带对话/会话上下文的压缩与管理机制,避免因上下文过长导致模型性能下降。 2. 丰富的工具生态:包含文件操作、代码执行、网络搜索等内置工具,并支持扩展自定义工具/插件。 3. 权限与安全机制:可以细粒度控制 agent 可使用的工具、权限模式(例如 allowedTools、disallowedTools)等。 4. 生产化准备特性:例如会话管理、错误处理、监控能力、模型优化/提示缓存机制。 5. 插件和扩展支持:通过插件机制(如自定义命令、子 agent、技能集、MCP 服务器)可创建复杂系统。#ai创造营# #程序员#

20. Deep Agents:LangChain开源的Agent框架,开箱即用的LLM应用方案。核心思想:给你一个开箱即用的Agent,需要定制再加工。Deep Agents基于LangGraph构建,内置了单Agent应用的标配能力:任务规划、文件系统访问、Shell执行、子Agent委托、自动上下文管理。会话长了自动总结,大输出存文件,子Agent有隔离的上下文窗口。启动简单,支持任何能调工具的LLM(OpenAI、Claude、开源模型都行)。需要时加工具、换模型、调提示词。支持MCP。对比其他框架:1.LangGraph:底层编排框架,基于图和状态机。完全可控,支持流式、持久化、断点恢复。缺点是学习曲线陡,小任务过度设计。2. CrewAI:多Agent协作框架,建在LangChain和LangGraph之上。提供Agent、Task、Crew等高级抽象,快速定义多Agent分工。优点是上手快,缺点是多Agent固定模式,非标准行为定制困难。3. AutoGen(Microsoft):事件驱动,支持conversation-based Agent交互和group chat。v0.4引入强可观测性和异步模型。适合多Agent对话,不适合需要持久化和复杂状态的应用。4. Deep Agents的位置:单Agent框架,高于简单的ReAct(思维链+工具调用),低于多Agent系统。填补了这个缝隙:需要快速上手,但又要求工业级的规划、文件访问、子Agent能力。技术特点:1. Deep Agents采用trust-the-LLM模型——Agent可以做工具允许的任何事,安全边界由工具和沙箱保证。这套思路来自Claude Code,也就是LangChain在把Claude Code的经验系统化。2. 上下文管理做得细致:会话自动总结、大输出转文件、子Agent隔离上下文窗口。处理长期运行任务(爬虫、研究、报告生成)时能显著降低token消耗。应用场景1. 快速原型或一次性脚本 → Deep Agents足够2. 复杂单Agent任务(爬虫、研究、代码生成) → Deep Agents很合适3. 多Agent协作 → CrewAI更顺手4. 需要完全自定义Agent行为 → LangGraph完全控制5. 对话式多Agent互动 → AutoGen更原生项目:github.com/langchain-ai/deepagents#HOW I AI# #程序员#

21. 单卡双芯 48G 显存!打造 20L 紧凑型 AI 算力怪兽:DeepSeek 70B 实测 19 tokens/s

22. iPhone本地跑Gemma 4火了,0 token时代还有多远?

23. DeepSeek 下一代模型 V4 将跑在华为芯片上。据 The Information 今天报道,DeepSeek 专门推迟了 V4 的发布时间,花了几个月和华为、寒武纪合作,重写了模型底层代码的部分模块,确保 V4 能在华为最新的昇腾(Ascend)芯片上流畅运行。模型预计未来几周内发布。华为这颗芯片是今年 3 月刚亮相的昇腾 950PR,搭载在 Atlas 350 加速卡上。单卡算力号称是英伟达 H20(目前对华出口合规版本)的 2.87 倍,配备 112GB 显存,内存带宽 1.4 TB/s。更关键的是,它是目前中国唯一支持 FP4 低精度推理的 AI 芯片,FP4 格式能大幅压缩模型对显存的需求,比如一个原本需要 140GB 显存才能跑的 700 亿参数模型,用 FP4 只需要 35GB,同样的硬件能部署更大的模型,或者同时处理更多请求。不过代价也不小:功耗 600W,大约是 H20 的两倍。按行业惯例,AI 公司在发布大模型前会提前把模型给英伟达、AMD 等芯片厂商做性能优化。DeepSeek 这次打破了这个惯例,没有给美国芯片厂商提供 V4 的早期访问权限,而是把机会独家给了华为和寒武纪。The Information 的报道还透露,DeepSeek 目前还在开发两个 V4 变体版本,分别面向不同的能力侧重,同样基于国产芯片。据英国《金融时报》此前报道,DeepSeek 曾尝试用华为昇腾芯片训练推理模型 R2,但遭遇了反复失败,包括稳定性问题、芯片间互联速度慢、软件工具链不成熟等,最终不得不退回英伟达硬件做训练,华为芯片只用于推理。V4 能直接跑在华为芯片上,说明过去这段时间软硬件适配取得了实质进展。对中国 AI 行业来说,这是从"离不开英伟达"到"至少推理环节可以用国产替代"的一步。对开发者而言,如果 V4 的性能确实如传闻所说在长上下文编程任务上能和 Claude、ChatGPT 掰手腕,那未来通过国产算力就能用上前沿模型,不用再担心美国芯片出口管制的影响。

24. 豆包大模型 1.8 发布,通用 Agent 模型成为了 AI 行业的新叙事

25. #千问Qwen3.5大模型发布#阿里在除夕夜甩出了个王炸——全新大模型千问Qwen3.5开源了,看完参数我直接好家伙: 用了Mamba混合注意力+MoE稀疏专家架构,总参数3970亿,但每次推理只激活170亿,相当于“小身材干大活”,显存占用直接砍半还多,长文本处理速度直接起飞。终于从纯文本模型进化成原生多模态,以后图文交互、复杂任务处理更丝滑。性能直接对标顶级开源产品,关键是部署门槛低了一大截,不管是企业还是个人开发者,都能轻松玩起来。 与其说是发布新模型,不如说是把大模型的“技术普惠”又往前推了一大步。

26. #苹果回应Macmini断货#OpenClaw掀起的“养龙虾”热潮,意外让Macmini M4全线断货,租赁、代装生意火爆,这不仅是硬件狂欢,更是AI智能体走向大众化的强烈信号。本地部署需求让低功耗、高兼容的Macmini成为首选,官方缺货、二手涨价、日租近50元,产业链被迅速激活。这股热潮印证了AI Agent从极客玩具走向大众工具的趋势,用户愿意为本地运行、隐私安全买单。同时也倒逼厂商降低部署门槛,腾讯QClaw等一键封装产品顺势登场,打通微信、QQ社交入口。OpenClaw以开源之力,撬动硬件、社交、云服务多方联动,预示本地AI+社交入口将成为新赛道。谁能简化部署、贴近用户,谁就能占据下一代AI生态主动权。苹果回应macmini断货

27. 大模型推理加速技术的学习路线是什么?

28. 罗福莉携小米MiMo-V2-Flash首次亮相:一次在推理与Agent上的下注|甲子光年

29. 酷睿 Ultra200H 处理器可分配 120GB 显存并运行 120BMoE 模型,这意味着什么?

30. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生

31. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

32. 谷歌又放大招了Gemma4发布后,谷歌一口气放出了四个版本:手机端 E2B/E4B 轻量版、26B MoE 极速版、31B 旗舰版。 尤其是31B 旗舰版,Arena AI 开源榜全球第三的位置相当惊人,小参数直接越级干翻体量20倍的对手,以前要机房集群才能跑的高端能力,现在消费级显卡就能本地跑通。不过,个人觉得31B版和国内顶流开源模型其实各有胜负,并非碾压全场 #ai前沿速递##微博兴趣创作计划##how i ai#

33. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC

34. 如果你现在还没用Agent帮自己干活,那其实很危险

35. 双卡 48G 显存!最省钱的多卡大显存选择 Arc Pro B60

36. 提速10倍!Mac Mini 本地跑 AI 大模型,OpenClaw + oMLX 加速神器实测效果惊人! | 零度解说

37. 上交大和辉羲把LLM刻进ROM!推理性能冲2万token/s,GPU时代终结?

38. 做一些比较激进的配置。拿我的顶配 Mac Studio (M3 Ultra, 512GB 内存) 跑本地大模型,暂定 minimax,作为模型服务器,有安全措施。拿我的普通 Mac mini (M4,24GB 内存,不登录 iCloud 或 Google 账号)作裸奔的 OpenClaw 服务器,基本无安全措施,内网调用 Mac Studio 上的本地模型。把本地模型和本地 agent 分开,大机连小机,普通操作基本不消耗 token。免费。(当然电费有一些,但不多。)大机还做些套壳 OpenAI API 的服务,比如翻译机什么的,在要求高质量输出的时候,在内网让 OpenClaw 做透明 API 调用。蛮好。至少骂龙虾不用花钱了。

39. Gemini模型:对系统提示词理解能力差,调用工具塞的数据太多会坏掉胡言乱语输出乱码。Claude模型:对系统提示词理解能力强,但只要有工具就会优先调用工具试试不管你系统提示词怎么写的,如果调用工具的同时不要求结构化输出,还会把自己的推理直接漏出来。OpenAI模型:没有以上问题。

40. 深度| 大模型年终观察,如何定义2025年的"好模型"?

41. 3天赚1200刀?纯聊天就能捏出个能搞钱的 AI Agent!【教程】

42. 月之暗面直接把OpenClaw塞进Kimi里 Kimi Claw Beta上线,简单说就是浏览器里跑AI Agent,不用自己搭服务器装环境了 核心就三点:接入了ClawHub的5000+社区技能,比自建多好几倍;给了40GB云存储,Agent能记长期东西;搜索升级了,能抓Yahoo Finance实时数据 底层跑的是Kimi K2.5模型,万亿参数MoE架构,实际只激活320亿,性能实测超了Claude Opus 4.5。还有个Agent Swarm能并行跑100个子任务,速度提升4.5倍 最关键是那个Bring Your Own Claw,你可以把自己本地部署的OpenClaw接进来,本地控数据,云端用界面和技能库,灵活度拉满 国外已经有老哥拿来管课程、做闪卡、调度任务、搞智能家居自动化。不过也有担心安全的,毕竟目前缺合规认证,定位更像个人和小团队的原型工具,离企业级还有距离 但我觉得这玩意儿最大的意义,是把AI Agent的门槛从“配VPS”干到了“打开浏览器”。以前折腾OpenClaw得折腾半天,现在点一下就行#ai#

43. 对话云栖大会:下一个AI爆款、大模型进化与Agent万亿级企业市场

44. 探访云栖(二):AI Agent元年,谁在打造“数字员工”?【101 Weekly】

45. TRAE中国版白送SOLO,一人指挥一支AI大军 重磅消息!SOLO终于上线TRAE中国版了,Waitlist免费开放中 本期视频实测TRAE的新版本,亮点很多 1、先规划再动手的 Plan 模式 2、带专家团一起干活的 Subagent 子智能体 3、DiffView 差异视图 4、多任务并行 5、上下文智能压缩长时运行不掉链子 SOLO终于把AI从“瞎干活的外包”变成了“懂协作的队友” #AI #人工智能 #TRAE #AI编程 #vibecoding

46. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说

47. 这是个好问题:> 随着基础模型继续进化,Skills 是否会逐渐被更强的自主规划取代?作为创业者现在去布局 Skills,究竟是短期红利还是长期壁垒?我的看法是:Skills 是短期红利,也是长期壁垒——但壁垒不在 Skills 本身。让我用 AI 发展的三个阶段来解释这个判断。第一阶段:AI Chatbot + Prompt回归第一性原理:AI 也好,Agent 也好,能解决问题才有价值。最早的 AI Chatbot 加上好的 Prompt,已经能解决很多「生成类」问题——回答问题、情感陪伴、翻译、写作、摘要。那时候 Prompt 就是短期红利。你会写出好的 Prompt,就能得到好的结果。我那时候花了大量时间研究 Prompt 工程,确实吃到了红利——很多网友就是那时候认识我的。但要说长期壁垒?没有。现在让 AI 辅助写 Prompt 已经不是什么难事了。不过,AI Chatbot + Prompt 只能解决生成问题,不能使用工具,不能与外部世界交互。第二阶段:AI Agent + 上下文工程然后是 AI Agent 的出现。Agent 能规划、能调用工具,解决了「与环境交互」和「完成特定目标」的问题。这时候 上下文工程(Context Engineering)就是短期红利。你知道怎么组织 Agent 需要的上下文,怎么在有限的上下文窗口里塞进足够的信息,那就是核心竞争力。但同样没有长期壁垒。很快模型越来越强,上下文窗口越来越大,上下文工程的最佳实践也逐渐系统化——比如借助文件系统压缩上下文、利用渐进式披露(Progressive Disclosure)解决工具描述占用太多 token 的问题。这些方法现在大家都知道了。第三阶段:Agent + Skills现在是 Agent + Skills 的阶段。Skills 解决的问题是:把特定工作流、特定领域的能力打包成可复用的「技能包」,让 Agent 之上可以长出丰富的应用生态。那些日常工作中琐碎但重复的任务,借助 Skill 的 Prompt 能力和工具能力,可以被高度自动化,带来巨大的效率提升。投资 Skills 是短期红利。 Skills 作为一种具体形式,可能会被更强的模型能力取代——也许未来模型足够强,不再需要人类预先打包好的「技能包」,它自己就能规划出最优路径。但问题来了:谁最能抓住这波短期红利?不是吹 Skills 的自媒体,而是真正懂 Prompt、懂上下文工程的人和团队。他们能借助之前积累的经验,快速做出真正解决问题的 Skills。投资的是能力,不是形式Skills 本身不会成为长期壁垒,但你在 Skills 上投入的学习和实践,会成为你的长期壁垒。这就像当年投资 Prompt 工程的人,后来更容易理解上下文工程;投资上下文工程的人,现在更容易做出好的 Skills。每一波技术浪潮的「短期红利」,都是下一波浪潮的入场券。所以我的建议是:不要纠结 Skills 会不会被取代,而是问自己:通过做 Skills,我能去解决什么问题?积累什么能力?这些能力在下一波浪潮里还有没有用?如果答案是肯定的,那就值得投入。

48. #AI龙虾爆火有人几天赚了26万#最近流行养龙虾,意思就是腾讯推出了一个AI本地大模型logo像一个龙虾🦞,类似于一个本地服务器,不需要依赖网络,可以把这个大模型AI安装在你家里的电脑上,这样家里电脑就有了AI推理思考能力,不需要连入互联网,效率更高。可以帮你分析股票,帮你剪视频,帮你写论文,帮你编程… #AI龙虾爆火工信部发布高危风险预警#

49. 开发 AI Agent 应用时,直接使用 LangChain 或 LangGraph 等框架虽然方便,但复杂的抽象往往像个“黑盒”,让开发者难以理解底层的调用逻辑和决策机制。ai-agents-from-scratch 是一个专注于教学的开源项目,主张从零开始构建 AI Agent。它不依赖现有的成品框架,而是通过 Node.js 和本地大模型,带你一步步拆解 Agent 的核心原理。项目不仅涵盖了基础的模型调用,还深入讲解了函数调用、长期记忆、ReAct 推理模式等关键技术,帮助开发者在掌握底层逻辑后再去更明智地选择和使用框架。GitHub:github.com/pguso/ai-agents-from-scratch主要功能:- 基于 node-llama-cpp 实现本地大模型运行,无需依赖云端 API;- 循序渐进的学习路径,从基础交互到复杂的系统提示词与角色设定;- 深入解析函数调用原理,展示 LLM 如何决定调用工具并处理返回结果;- 实现持久化存储与记忆管理,让 Agent 具备跨会话的信息记忆能力;- 详解 ReAct 推理模式,演示“思考-行动-观察”的循环逻辑;- 提供进阶教程,手写实现类似 LangChain 的 Runnable 接口和状态机图结构。该项目要求 Node.js 18 以上环境,建议配置 16GB 内存以流畅运行本地 GGUF 模型。它非常适合希望深入理解 Agent 架构、提升 AI 应用底层开发能力的工程师参考学习。

50. Kimi 发布并开源 K2.5 模型,哪些信息值得关注?Agent 集群能力能做哪些任务?

51. 昨天谷歌发了 Gemma 4 开放权重模型系列,升级挺猛的。一共四个版本,除了端侧轻量版,还头一回上了 MoE 架构的 26B 模型。全系支持多模态,能看懂图片听懂语音,自带推理思考功能,上下文直接拉到了 25 万。最香的是改用 Apache 2.0 彻底开源了。感觉谷歌这次是真的放开手脚了,那个 26B 单卡就能跑,性价比挺高,可以试着本地部署跑个试试看。#谷歌发布Gemma4开源大模型# #微博跨域计划# #AI创造营#

52. 8G显存真不够用?爆肝3个月实测18张显卡20款游戏,结果竟然......

53. 别再用 Ollama 了!OpenClaw 秒级响应方案(vLLM + 本地模型)完全免费!| 零度解说

54. 英伟达很快会反超谷歌TPU,AI模型的竞争格局会在2026年1季度变天#英伟达 #马斯克 #算力 #Gemini3#TPU #GPU #AI模型#算力集群

55. ¥8499起!48G显存的最强核显全能本!?天选Air 2026 锐龙AI Max版首发评测:值得买么?笔记本电脑

56. 半夜,小米大模型团队发布小米全模态Agent基座大模型 MiMo-V2-Omni“MiMo-V2-Omni 专为现实世界中复杂的多模态交互与执行场景而生。从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将“感知”与“行动”深度绑定。这不仅打破了传统模型“重理解、轻执行”的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。”“MiMo-V2-Omni 可无缝接入各种 Agent 框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落地门槛。”“在正式发布之前,我们将一个早期测试版本以「Healer Alpha」为代号匿名上架 OpenRouter,没有任何宣传,纯粹让模型能力说话。结果调用量自然攀升至平台前列,并在 OpenClaw 测评榜单 PinchBench 上拿下均分第一,用户和基准双双给出了同一个答案。” “我们还与金山办公合作,将 MiMo-V2-Omni 接入 WPS Office,探索全模态智能体模型在日常生产力场景中的表现。”

57. SubAgent 与 Skills:AI Agent 的两种扩展方式一句话解释 SubAgent 和 Skills 的区别:AI Agent 就像操作系统,Skills 就像应用程序,SubAgent 也是操作系统,不过预装了应用,并且像虚拟机一样运行,独立上下文。Skills 是一份“操作手册”。你招了个聪明的助理,但他对你的业务一无所知。每次布置任务,你都得从头解释流程、注意事项、工具用法。Skills 就是把这些知识写成文档,Agent 需要时自己去翻阅,不用你反复交代。比如我写了一个“给文章配图”的 Skill,它告诉 Agent:• 怎么分析文章找出需要配图的位置• 有哪些风格可选(科技感、温暖、极简……)• 怎么写图像生成的提示词• 图片存哪里、怎么命名Agent 启动时只记住“有这么个配图技能”,大概 100 个 token,真正要用时才去读详细内容。这叫“渐进式加载”,好处是装一堆 Skill 也不会撑爆上下文。SubAgent:开个虚拟机干活SubAgent 是独立运行的“专家助手”。它有自己的上下文窗口,相当于自己的“工作记忆”。干完活只把结果交回来,中间过程不会污染主 Agent 的思维空间。你是项目经理,手下有三个专家。你不需要盯着他们每一步操作,只需要告诉他们任务目标,等他们交报告就行。一个真实案例:给文章配图假设我写完一篇文章,想配三套不同风格的插图方案,让用户自己选。如果只用 Skills:主 Agent 分析文章 → 设计三种方案 → 调用画图 Skill 画第一套 → 画完再画第二套 → 再画第三套问题来了:1. 上下文爆炸:三套图的生成过程全堆在主 Agent 的“脑子”里,几十张图的提示词、中间结果、错误重试……全占着位置2. 速度慢:必须一个接一个画,串行执行如果用 SubAgent + Skills:主 Agent 分析文章 → 设计三种方案 → 同时启动三个 SubAgent每个 SubAgent:• 预装了“画图 Skill”• 拿到文章路径和自己负责的方案• 独立去读文章、生成提示词、调用画图工具、插入图片• 完成后只返回:新文章的 URL + 简短摘要主 Agent 这边呢?上下文干干净净,只有三个结果链接。用户想看哪套,再去读取对应的 URL。什么时候用哪个?用 Skills:• 任务简单,主 Agent 全程掌控• 需要的知识可以复用• 想节省上下文,按需加载用 SubAgent:• 子任务复杂、耗时长、中间过程繁琐• 需要并行处理多个独立任务• 想保持主 Agent 的“思维清晰”一句话总结Skills 是应用程序,装在主系统里按需调用;SubAgent 是虚拟机,独立运行完再把结果交回来。任务简单用应用,任务复杂开虚拟机。

58. Claude Code Skills 采用了一种极其巧妙的三层上下文系统。请记住这个结构,当你构建技能(Skills)时会非常有用。第一层:主上下文(Main context)——项目配置,总是会被加载。第二层:技能元数据(Skill metadata)——只包含 YAML 前言部分,每个技能大约占用 100–200 个 token。第三层:活动技能上下文(Active skill context)——SKILL.md 文件以及按需引用的文档,在需要时才会加载。像脚本(scripts)和模板(templates)这样的支持文件不会被预加载到上下文中,而是在使用时直接访问,不消耗任何 token。这种架构让系统可以同时容纳数十个技能,而不会触及上下文长度限制。#人工智能##程序员#

59. 不买会员,一期学会轻薄本跑大模型!

60. 如何跑通本地大模型,手搓 Agent,甚至把自己装进电脑里?真正的大学生AI玩家,已经开始卷“工程开发”能力了,不用配几万块的服务器,也不用花啃编程语言、配置开发环境;大学生AI赛道的入场券就在这台,MTT AIBOOK中。一起来看看,这些“高不可攀”的极客操作,是如何被国产算力一一撬动的?#摩尔线程# #AIBOOK# #人工智能# #AI开发# #AIAgent# #算力本# #大模型# GenJi是真想教会你的微博视频

61. #谷歌发布gemma4开源大模型#谷歌终于把最强开源大模型放出来了等了这么久Gemma 4总算来了,采用Apache 2.0的同时,针对不同的硬件环境发布了四种规模的模型。整体来说,Gemma 4这次所有规模的模型都原生支持处理视频和图像了,在OCR和图表理解方面表现得相当不错 #谷歌发布gemma4开源大模型##how i ai#

62. 爆火的 Z-Image 模型!8G 显存能跑,无内容审查、支持NFWS、超高速,本地部署教程!支持(Win/Mac)| 零度解说

63. 2025年被科技界提及最多的词—Agent!大家都把它视为下一个风口。那究竟什么是Agent?Agent到底能做些什么?这期视频,带大家看看理想同学Agent又能带给我们的生活哪些改变? #理想i8# 骆智慧的微博视频 抽奖详情

64. LTX-2 最新开源模型!只需8G显存,即可生成电影级AI大片!太离谱了, 附本地部署教程!| 零度解说

65. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)

66. 早!汇报一下养🦞进展:之前百炼大模型推理充的500块消耗没了,用时5天,这5天里消耗最快的,是部署了agent-browser后建立了第二个任务消耗的。然后昨天晚上又充了500,今天早上一看还剩174,嗯......总结下教训:第一个就是要根据不同需求秒tokens的消耗量,去考虑要本地部署大模型还是连网大模型。我的第一个测试任务tokens消耗的量很小,但第二个任务就很高,主要是更复杂,但又不需要连网大模型那么新的知识库,所以接下来会布属一个本地大模型去跑任务2第二个就是:建立好任务后一定要跟它讲清楚,先把规则和模拟测试结果给你,别真实测试,几个来回,那tokens的嗷嗷的。还有一个方法是直接修改配置文章,这样也能少消耗tokens;最后就是,不要乱装skill,除非真的有些功能实现不了,你再去装。比如这个agent-browser。我是因为有些页面不让抓,然后装了这个agent-browser模拟去点击复制粘贴,再丢给Gemini,过程太多,就......出差回来再修正一下,把本地大模型整上,争取早日tokens自由(图1是周六晚上6点的,图2是昨天晚上充完值截的,图3是刚才截的)#OpenClaw火了龙虾养了也要防#

67. #火山引擎正式推出ArkClaw#打造开箱即用的云上SaaS版OpenClaw,彻底告别繁琐配置与本地硬件依赖,打开网页即可拥有7×24小时在线AI智能体,轻松“养虾”。 产品深度协同Doubao-Seed-2.0,兼容Kimi2.5、MiniMax2.5、GLM等主流大模型,复杂任务处理能力拉满。面向不同用户开放分级体验,Coding Plan Pro用户直达使用,Lite用户可免费体验7天,降低全民试用门槛。 ArkClaw已打通主流即时通讯工具,深度适配飞书,无需重复授权与复制上下文,一键处理日程、文档、表格,办公效率大幅提升。 这是云、AI与协同场景的深度融合,以极简体验激活AI智能体价值,推动云端Agent进入普惠时代。

68. AI Agents 速查表如果你正试图理解 AI Agent 的概念,这是一份不错的起点。目前关于 Agent 框架的讨论很多,但从核心来看,大多数框架都建立在同一组基本思想之上。这份速查表简单概述了从大型语言模型(LLM)到编排层(Orchestration)再到协议(Protocols)的关键构建模块。无论你是在探索 Agent 工具、构建内部自动化,还是单纯想更好地理解这个领域,它都很有用。什么是 AI Agent?1. Agent 结合了“推理能力”和“行动能力”。2. 它们不仅能回答问题,还能制定计划、调用工具、访问数据,并触发现实世界的操作。语言模型(Language Model)1. 它是核心的推理引擎,用来理解输入并生成计划或回应。2. 但仅靠它自身,无法在现实世界中执行行动。工具(Tools)1. Agent 用来完成有用任务的 API、函数或外部集成接口。2. 例如查询数据库、发送邮件或调用 Webhook。编排层(Orchestration Layer)1. 负责协调 Agent 的行为——包括其推理方式(如 CoT、ReAct 等)、步骤顺序以及与工具的交互。Agent 协议(Agentic Protocols)1. MCP、A2A 等协议让不同平台上的 Agent 能协作(如 Slack、GitHub),并在多个任务间保持上下文。构建 AI Agent1. 没有唯一的构建方式。2. 有的从一个 Prompt 起步,有的依赖低代码平台,还有团队构建完整的自定义框架3. 这份速查表展示了各种方式之间的取舍与权衡。如果你想理解 Agent 领域,或向团队解释它的原理,这份结构化的拆解会很有帮助。可以收藏下来,作为随时查阅的参考资料。#人工智能##程序员#

69. OpenViking:一个非常实用的开源项目,专为AI Agent设计的上下文数据库,通过创新的“文件系统范式”统一管理Agent所需的记忆、资源和技能,彻底解决了传统向量数据库碎片化、检索效果差、上下文不可见的问题。主要亮点包括:- 文件系统管理范式,实现统一结构化管理,轻松浏览和操作上下文,像管理本地文件一样简单- L0/L1/L2三层上下文分级加载,按需调用,大幅降低Token消耗- 目录递归检索策略,结合目录位置和语义搜索,实现更精准、更全局的上下文获取- 可视化检索轨迹,完整呈现检索过程,方便调试和优化- 会话自动管理,自动提取长期记忆,Agent能“用得越久越聪明”支持Python包安装,也有Rust CLI工具;支持多家主流模型提供商,包含Volcengine、OpenAI、Anthropic、本地vLLM等等;同时提供详尽配置示例,轻松上手。新手快速开始示例脚本也非常简洁,几行代码即可增加资源、浏览文件结构、等待语义处理、抽取摘要、执行语义搜索,非常适合开发者验证和应用。同时官方推荐在云服务器(推荐Volcengine ECS + veLinux)环境中部署,保证稳定性和性能。如果你正打造智能Agent或者想优化上下文管理,强烈建议一试OpenViking,这个项目将让上下文管理和检索变得前所未有的清晰、高效、智能。GitHub地址:github.com/volcengine/OpenViking 官网:www.openviking.ai 文档:www.openviking.ai/docs

70. 「Github一周热点104期」智谱GLM-5发布,打响春节AI大战模型第一枪

71. 盘点一周AI大事(3月15日)|首次上传大脑成功 工程师开源龙虾办公室Claw3D 龙虾彻底出圈,,百虾大战正式开打 工程师开源一键装龙虾AlphaClaw 斯坦福开源科学家龙虾LabClaw 工程师Karpathy 开源龙虾版GitHub AgentHub Chrome上线龙虾Web协议 WebMCP 工程师开源龙虾软件协议CLI-Anything 吴恩达开源龙虾上下文工具Context Hub 研究员开源最强动漫图像模型Anima-v2 研究员开源最强视频分割模型MatAnyone 2 科学家成功上传了一只果蝇的大脑 #AI新星计划 #AI #AIGC #龙虾 #openclaw

72. 拉平显卡档位差距!移动端的X3D,会是游戏党的最优解么?ROG魔霸9 Mini上手评测

73. 盘点一周AI大事(1月11日)|最强人形机器人 OpenAI公布2026研发路线图 DeepSeek被爆2月发布DeepSeek V4 Google推出Veo3驱动的数字人Vids 字节开源换脸视频模型DreamID-V 阿里开源数字人框架HRM2Avatar Lightricks开源顶级视频模型LTX-2 ElevenLabs推出最强语音转录模型Scribe v2 斯坦福开源睡眠分析模型SleepFM 港大发布开源版NotebookLM DeepTutor Razer推出全息AI老婆Project AVA 波士顿动力推出下一代Atlas #抖音知识年终大赏 #前沿科技趋势发布月 #AI新星计划 #AI #机器人

74. 本地部署AI Agent开发环境(Ollama+Qwen3+AIAgent)

75. AI时代的归园田居,是本地Agent带来的生活——Libra,一个文档类本地智能体

76. OpenClaw很火?基于FlagOS部署和跑通“完全本地”的Agent工具调用闭环!

77. 用 Python + MCP + 本地模型(Ollama)打造离线 AI Agent(无API、0成本、可控到极致)

78. 构建Agent需要工具,但ToolCall却成了LLM的噩梦

79. 测测你的电脑能不能跑大模型?用这个工具快速自测!

80. 阿里 Qwen3.5-4B 终极指南

81. AI 大模型显卡要求详解

82. 4GB显存笔记本也能跑70B模型!这个神库直接把门槛干到地板

83. 低配电脑狂喜!4GB显存就能跑DeepSeek,Win10一键部署

84. 实测|MiniMax Agent 本地化部署全攻略,低显存也能跑

85. 本地部署大模型需要什么配置?2026年

86. 我初跑14B模型来说说说AI时代的硬件价值

87. AirLLM

88. Qwen官方又又又更新模型了!推出Qwen3.5 Int4官方量化版,让27B级“聪明大模型”瞬间变得超级亲民!

89. 手机就能跑的AI大脑!Google Gemma 4实测|2B参数4GB显存 3台真机对比 Ollama+Claude Code实战教程

90. DeepSeek 本地部署完整教程

91. Agent原生模型开启!3.5 Flash上线2天登全球榜

92. 2026年本地部署大模型完整指南,免费跑AI

93. 本地部署大模型工具-llmfit

94. 本地部署大模型方法,新手不二选择

95. 2025最火AI Agent平台!拖拽就能部署工作流,还支持本地大模型

96. 2026大模型本地部署全攻略

97. ZeroClaw

98. OpenHarness

99. 龙虾🦞OpenClaw是正经AI Agent吗?深度对比三类AI Agent架构

100. 【开源】Fabro 是一个开源的 AI Agent 工具平台,专注于提升开发者构建和管理智能体应用的效率。

101. AI日报

102. 零成本提供最适合 AI Agent 的运行环境,别再给 AI Agent 买一台 Mac Mini 了

103. 2026年高端Agent开发指南

104. OpenClaw(Clawdbot)多Agent协作系统全平台部署指南

105. AI基础 | Qwen3 0.6B 微调实现轻量级意图识别

106. 云顶轻量级Agent破解高校业务场景AI落地难题!开启智能速办新时代

107. 本地部署 AI Agent 的真实踩坑实录

108. 2026本地AI算力搭建指南,保姆级避坑

109. OpenClaw + Ollama 本地部署指南

110. 国产Agent选型指南

111. 302.AI 基准实验室丨性能平替还是效率降级?GPT-5.4 mini/nano实测

112. MiniMax M2 发布即爆,拿下开源模型第一名

113. 2026部署 OpenClaw 多Agent协同工作指南

114. 国产大模型Qwen3

115. 单卡3小时训练专属大模型Agent-基于LLaMA Factory实战

116. MiniMax开源M2模型 Agent与代码场景性价比

117. 在ModelScope中,ms-agent本地部署之后,推理速度有点慢,能给点优化建议吗?

118. 一周出demo,半年用不好,大模型技术应用困境何解?

119. 如何实现稳定的ai agent

120. 一个邪修方法,帮你把用Agent的钱省掉80%。

121. ModelScope中qwen有没有调用外部方法api和agent的东西呀?

122. 阿里qwen2.5大模型微调实战:手把手教学!

123. 行业AI Agent选型指南:穿越技术迷雾的实战手册

124. 大模型应用开发第五讲:成熟度模型:从ChatGPT(L2)到未来自主Agent(L4)

125. 大模型应用开发第五讲:成熟度模型:从ChatGPT(L2)到未来自主Agent(L4)

126. 智能Agent(智能体)落地:本地化运行复杂Agent的硬件门槛

127. Token太贵,中国开源模型一夜之间霸榜了

128. 苹果OpenELM开源:端侧大模型比微软Phi-3 Mini更适配iPhone?

129. Google开源Gemma 2:端侧AI的新战局

130. 2026年OpenClaw多Agent配置权威指南|飞书集成+main Agent保留+大模型部署全流程

131. 4GB显存跑70B大模型?

132. Agent变慢的元凶,可能不是模型:被忽视的JSON性能黑洞

133. AI Agent性能优化实战:多Agent架构为什么慢,怎么破?

134. 拒绝复读机!这个 GitHub 神器,让本地模型也能跑出顶级 Agent 的丝滑感!

135. .NET+AI | Agent | 启用工具调用(6)

136. 一起学AI算法v70:大模型推理延迟问题

137. Claude自动化微调开源大模型:HuggingFace Skills赋能agent训练全流程

138. 8G显存跑AI:Llama3.1完胜Qwen3.5?Ubuntu下四大模型横评,速度竟差一倍!

139. 设计AI Agent时,如何选择一款合适的大模型?

140. 使用模型量化技术提升 CPU 上 LLM 推理速度

141. AI研究:Agent及其主流框架算力要求是什么?

142. 大模型LLM参数高效微调框架

143. 本地跑大模型,显存到底怎么算?

144. 阿里开源四款Qwen3.5小模型,马斯克惊叹“智能密度”惊人 阿里近日开源Qwen3.5系列四款小尺寸模型(0.8B/2B/4B/9B),这些模型专为端侧设备优化,可在笔记本电脑甚至手机上运行。马斯克在社交媒体评价其具备“令人惊叹的智能密度”,引发开发者社区热烈反响。 #Qwen35 #马斯克 #阿里 #AI小模型 性能突破:小模型实现大能力 Qwen3.5-9B在多项基准测试中表现卓越,在GPQA Diamond、MMMU-Pro等评测中超越GPT-5 nano、Gemini 2.5 Flash-Lite等大型模型。特别是9B版本在MMMU-Pro测试中以13分优势击败GPT-5-Nano,展现出色性能。4B版本在多语言知识、视觉推理等任务接近9B水平,成为轻量级智能体的理想选择。 端侧部署优势明显 0.8B/2B版本专为移动设备和IoT边缘设备设计,具备低延时特性;4B版本支持多模态任务,平衡性能与资源消耗;9B版本在受限显存环境下提供高性价比服务。实测显示,Qwen3.5-9B在AMD Ryzen AI平台配合量化算法,处理速度达30 token/s,仅需16GB显存即可运行。 开发者积极验证应用潜力 开发者验证模型可在Mac mini等设备配合OpenClaw实现全天候运行,成本低于初级员工月薪。有用户成功在iPhone部署,引发移动端应用热潮。虽然小模型在复杂数学推理方面存在局限,但其在特定任务上已达到商用级水平。 此次开源标志着端侧AI能力显著提升,为低成本AI部署开辟新路径。模型已在魔搭社区和Hugging Face开放下载,助力全球开发者探索边缘计算新场景。

145. Windows下AMD 6600显卡本地部署 qwen3.5-9B (编译llama.cpp)

146. 【详情教程】Windows本地搭建AI Agent:OpenClaw+飞书,手机一句话控制电脑执行任务

147. 英伟达PersonaPlex 7B模型深度研究:全双工语音对话很吸引人

148. llama3完了,谷歌发布Gemma 2轻量级模型,单张A100全精度推理

149. AI 正在进入本地时代,我开源了一个推理平台—— 支持多模型 / Agent / Workflow 的工程实现

150. 轻量模型和专用模型在游戏制作中的算力优化效果有何不同?

151. 4月3日AI早报: HuggingFace-Speech-to-Speech 开源本地语音代理的新里程碑

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章