张大妈

8GB内存Mac也能跑CodeLlama,关键在这三点

源自71位全网作者

05-22 20:19

内容由AI生成

精选参考来源

1. 【硬核教程】教你搭建Mac AI集群!4台M3 Ultra,运行万亿参数大模型!

2. 万字长文!小白全面入门Codex手把手教程【附保姆级文档】

3. OpenAI 上线了官方命令行工具 openai-cli,开发者可以直接在终端里调 API,不用再写 SDK 代码。 项目开源在 GitHub (openai/openai-cli),Apache 2.0 协议,可通过 Homebrew 或 Go 安装。命令走资源化结构,比如 openai responses create --input "..." --model 这样的写法。 工具的几个核心能力: 调用 Responses API,并且支持所有 cloud tools,也就是 OpenAI 托管的内置工具,包括 web 搜索、代码解释器、文件检索、图像生成等。换句话说,agent 风格的工作流也能直接从命令行跑通。 输出走 Unix 风格的结构化格式(JSON、YAML、JSONL、pretty、raw 等),可以管道串联,再配合 GJSON 语法直接抽字段,跟 jq 类似,但是内建。 图像生成、图像编辑、语音转录、TTS 这些原本要写 Python 调 SDK 的事情,一行命令就能完成。 管理类操作也整合进去了,可以创建 project、配发 API key,对运维和团队管理者比较友好。 文件传参用 @ file.ext 语法,跟 curl 习惯一致;二进制内容可以用 @data:// 显式 base64 编码。 发布的人是 jxnlco(jason liu),他在 X 上把这个项目定性为 "small ship / passion project",暗示是相对轻量的发布,更多文档稍后放出。 之前 OpenAI 官方只有 Python、Node 等语言 SDK,纯命令行用户要么裸写 curl,要么自己包脚本。这次把 SDK 能力直接搬到 shell 里,能拼进现有的自动化流程,也方便服务器端和 CI/CD 场景。 很适合 Agent 使用。 http://t.cn/AXJ1ibKl

4. 全网最详细的Codex入门教程,手把手教你玩转Vibe Coding。

5. MiniMax M2.1模型正式推出,多语言编程SOTA,如何评价该模型?

6. OpenAI Codex桌面版深夜突袭!一人指挥Agent军团,程序员彻底告别996

7. MiniMax M2.5模型正式上线,是否真正实现“生产力SOTA ”与“低负担”,如何评价其表现?

8. 如何评价 GPT-5.5 和GPT-rosalind 以及其他早期模型在Codex上泄漏?

9. 如何评价OpenAI发布Codex桌面版Codex App?和 Claude Code 相比怎么样?

10. 在价值5万元的苹果本上部署本地大模型+小龙虾是什么体验?

11. OpenAI绝地反击!Codex大脑首曝,8亿用户极限架构硬刚Claude

12. OpenAI放大招!Codex桌面版保姆级教学:小白如何开启 Vibe Coding?

13. 【用 Codex 给 Claude Code 的代码做对抗性审查,这才是认真的】快速阅读:OpenAI 发布了一个 Claude Code 插件,让你在不离开 Claude Code 工作流的前提下直接调用 Codex。核心价值是三条命令:普通审查、对抗性审查、任务移交。适合高风险改动前的第二次把关。---两个顶级编程 Agent 一起用,听起来像在炫耀算力,其实是在解决一个很朴素的问题:同一个模型审查自己写的代码,盲点往往也一样。OpenAI 这次发布的 `codex-plugin-cc`,做的事情很简单:在 Claude Code 里装一个插件,三条命令搞定跨 Agent 协作。安装只需要几行:```bash/plugin marketplace add openai/codex-plugin-cc/plugin install codex@openai-codex/codex:setup```然后你就有了三个核心工具。`/codex:review` 是只读的标准审查,跑完就走。`/codex:adversarial-review` 是"挑刺模式",Codex 会主动质疑实现思路,不只是找语法问题。`/codex:rescue` 是把整个任务直接扔给 Codex 接手。对抗性审查这个设计值得单独说一句。迁移脚本、鉴权逻辑、基础设施改动,这类代码最危险的地方不在于写错了什么,而在于你以为对的那些前提其实根本没验证。让另一个 Agent 从头质疑一遍,相当于强制做一次假设审计。有观点认为,真正的风险是打开了 Claude 和 Codex 互相调用的循环,review gate 功能可以阻止 Claude Code 在 Codex 审查结束前退出,但官方也特别提醒:这个功能容易触发两个 Agent 的长循环,快速烧穿使用额度。架构上这个插件做得很轻。它走的是本地 Codex CLI,复用你已有的认证、配置和 MCP 环境,不是另起一个 runtime。从 Claude Code 里调用 Codex,感觉上更像是函数调用,不像是切换工具。默认用法推荐的节奏是:所有改动跑一遍 `/codex:review`,高风险的再跑 `/codex:adversarial-review`,卡住了或者想换人接手就用 `/codex:rescue`。后台运行加上 `/codex:status` 查进度,长任务也不影响主流程。一个 Agent 写,另一个 Agent 挑,这个模式能跑多深,还没人真正测过边界。

14. 硅谷一夜两弹! GPT-5.3-Codex狙击Claude 4.6, 奥特曼真急了

15. 别再当韭菜!600块组装Mac mini平替,跑AI Agent比白苹果还香?

16. 全网首发!小米 Miloco 完整安装教程来了:99% 的人根本想不到…它居然

17. 前面讲的用 6G 显存的 GTX 1660 Ti 跑 Qwen3.5-35B-A3B-Q4_K_M.gguf 速度能达到 21 t/s ~ 25 t/s 的这个实验(网页链接),有人问是不是用这个机器跑别的模型也可以。首先,并不能因为 35B 的 Qwen3.5-35B-A3B 在这个机器上能跑,所以认为 27B 的 Qwen3.5-27B 肯定也可以。实际上即使 Qwen3.5-9B 跑起来也很慢,只有 6 t/s。这主要是因为 Qwen3.5-35B-A3B 是 MoE 模型,激活参数只有 3B。也就是说,对显存较小机器来说,Qwen3.5-35B-A3B 是 Qwen3.5 系列中最适合的。另外,总参数 30B 激活参数 3B 的 GLM-4.7-Flash-Q4_K_M 也量化到 Q4,同样用 llama.cpp 在这台机器上的速度大约 13 t/s。Qwen3.5 的速度更快可能和它用了混合注意力设计、软件优化更好等因素等有关。所以,不仅在 Qwen3.5 系列中,而是在当前所有模型中,Qwen3.5-35B-A3B 可能都是小显存机器跑大模型的最优解。如果你有类似硬件,想体验一下,但对技术了解不多,可以参考下面的最简化尝试步骤(假设你的操作系统是 Windows):1、下载 llama.cppgithub.com/ggml-org/llama.cpp/releases/download/b8352/llama-b8352-bin-win-cuda-12.4-x64.zipgithub.com/ggml-org/llama.cpp/releases/download/b8352/cudart-llama-bin-win-cuda-12.4-x64.zip把两个压缩包解开,文件放进同一个目录。假设该目录名字是 llama。2、下载 Qwen3.5-35B-A3B-Q4_K_M.ggufhuggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF/resolve/main/Qwen3.5-35B-A3B-Q4_K_M.gguf?download=true建议存放在固态硬盘而不是机械硬盘上,这会直接影响接下来加载模型的速度。3、在命令行执行 llama 目录中的 llama-cli:llama-cli -m Qwen3.5-35B-A3B-Q4_K_M.gguf

18. Clawdbot 教程 01:模型的配置和切换

19. M2.5登顶OpenRouter:如何做出大家最需要的那个模型

20. 值得一读↓2025: The year in LLMs1 推理之年2025 年推理模型(reasoning models)成为主流,各大实验室发布支持逻辑推理和更强问题分解能力的模型,这类模型不仅在数学和逻辑任务上表现优异,还能更好地驱动工具型工作流。2 Agent 兴起真正有意义的 agent 是能通过工具循环调用完成多步任务的系统,这类 agent 在复杂任务和长流程执行上展现出实用性。3 编程 Agent 与 Claude Code2025 年最重要的事件之一是 Claude Code 的发布,它以及其他公司推出的编码 agent 让模型能够写代码、执行、检查结果并迭代完成任务,这推动了自动编码模式的成熟。4 命令行上的 LLMsLLM 在命令行界面上得到广泛采用,CLI 工具成为开发者常用方式,这表明强大模型的交互不再局限于图形界面或 Web 应用。5 YOLO 与风险常态化“YOLO” 模式(往往绕过确认步骤自动执行)在 agent 圈内流行,虽然能提升效率,但也带来安全风险,反映了对 AI 安全意识的偏移。6 订阅价格上升多个 AI 服务推出 约 200 美元/月的高端订阅计划,显示产品化趋向成熟及企业级用户需求增长。7 中国开源权重模型崛起中国实验室发布了一批表现优异且开源权重模型,它们在开放性和可扩展性方面对全球生态产生显著影响。8 长任务能力模型在处理需长时间推理和执行的复杂任务上有显著提升,能够完成更长、更复杂的软件工程任务。9 图像编辑与 Prompt 驱动特性Prompt 驱动的图像编辑功能爆红,特别是在用户生成内容领域带来巨大增长。10 模型在学术竞赛中获奖推理模型在 国际数学奥林匹克 等高难度学术竞赛中取得金牌表现,证明了 LLM 在核心逻辑推理与复杂问题求解上的突破。11 Meta Llama 迷失方向曾经引领开源 LLM 的 Llama 系列今年表现不如预期,在较轻量和实用性方面落后于其他开源模型。12 OpenAI 不再遥遥领先OpenAI 仍然领先于大众认知层面(如 ChatGPT 的品牌认知),但在技术深度和多领域竞赛中受到其他 lab(包括 Google Gemini)强力挑战。13 Google Gemini 的表现亮眼Gemini 系列推出一系列高能力模型,涵盖多模态输入和高效训练架构,并被视为 OpenAI 的主要竞争对手之一。Vibe Coding,MCP,……访问:simonwillison.net/2025/Dec/31/the-year-in-llms/#ai创造营##程序员#

21. 真正的本地(24小时)在线的AI员工openclaw,天钡NEX395迷你主机本地运行大模型跑openclaw!

22. OpenAI 正式发布 GPT-5.3-Codex,与其他版本相比,它在哪些方面有所改进?

23. 提速10倍!Mac Mini 本地跑 AI 大模型,OpenClaw + oMLX 加速神器实测效果惊人! | 零度解说

24. OpenAI 发布了 GPT-5.3-Codex-Spark,专为实时编程设计的小模型,也是 OpenAI 和 Cerebras 合作后的第一个成果。跑在 Cerebras 晶圆级芯片上,推理速度超过每秒 1000 个 token。Codex 之前的强项是长时间自主运行,连续工作几小时甚至几天。但日常写代码更多是改个函数、调个接口、重构一段逻辑,等模型想十几分钟再出结果,体验很差。Codex-Spark 填的就是这个空缺:你可以一边看它输出一边打断、纠正、追问,像跟一个反应极快的搭档对话。SWE-Bench Pro 上,Codex-Spark 达到 51% 准确率只需 2.3 分钟,GPT-5.3-Codex 同等准确率要 3 分钟,冲到 57% 则需要 16 分钟。Terminal-Bench 2.0 上 Spark 得分 58.4%,比不上完整版 Codex 的 77.3%,但大幅超过上一代小模型的 46.1%。OpenAI 顺便把整条推理管线做了优化:引入持久化 WebSocket 连接,往返开销降 80%,每 token 额外开销降 30%,首 token 响应减半。Cerebras 晶圆级引擎负责极低延迟场景,GPU 仍是训练和推理主力,两者可混合使用。目前 128K 上下文、纯文本、仅 ChatGPT Pro 用户研究预览。后续规划是让实时交互和长线任务两种模式融合:Codex 在跟你实时对话的同时,把耗时任务分派给后台子智能体,用户不需要预先选模式。模型越强,交互速度越是瓶颈,Codex-Spark 是 OpenAI 在这条路上的第一步。 宝玉xp的微博视频

25. 线上微调大模型不想折腾环境配置、参数选型、代码编写?推荐大家试试 unsloth-buddy 这个零门槛的 LLM 微调技能工具。它支持 NVIDIA CUDA GPU 上的 Unsloth 和苹果 Apple Silicon 上的 mlx-tune,本地一站式自动完成环境搭建、LoRA微调(SFT、DPO、GRPO、视觉模型均支持)、效果评测和模型导出。主要特点:- 7步自动化工作流,包含任务调研、数据处理、环境检测、训练、评测、导出;- 智能访谈定制方案,帮你选对模型、训练方法和部署平台;- 支持 Qwen、Llama、Gemma 等主流模型,适配 Ollama、vLLM、HF Hub 等部署;- 苹果 M1~M4 机型友好,甚至能通过 Google Colab 免费云GPU扩展能力;- 可视化实时培训仪表盘,训练曲线一目了然;- 完整开源,MIT协议。不管你是有500条客服问答想做摘要微调,还是复杂多维度调参探索,unsloth-buddy都能带来极致顺滑体验。GitHub:github.com/TYH-labs/unsloth-buddy#AI开发# #大模型微调# #AppleSilicon# #NVIDIACUDA#

26. 【跑本地模型,换个工具性能提升30%】快速导读:一篇在技术圈引起热议的帖子,揭示了一个普遍的误解:很多人以为自己电脑跑本地大模型卡顿是硬件不行,但大量一线玩家的真实经验是,仅仅把启动器从流行的Ollama换成更底层的llama.cpp,性能就能白拿30%以上的提升。你以为的硬件瓶颈,很可能只是工具瓶颈。---一个用户说,他起初用Ollama跑模型,体验很差,让他一度确信“我的电脑根本带不动更大的模型”——直到他换用llama.cpp,发现性能暴涨,原来电脑完全跑得动。这几乎是每个折腾本地模型的玩家都会经历的“旅程”。你以为在自己的MacBook或Windows笔记本上跑个9B(90亿参数)的模型,速度慢、响应迟钝是正常的,毕竟硬件有限。其实,一个正在被越来越多资深玩家确认的事实是:Ollama为了提供极致的便利性,牺牲了部分性能。它像一个精装修的样板间,拎包入住,但承重墙不是最优的。而llama.cpp是那个毛坯房,需要自己动手,却能挖出硬件的全部潜力。讨论中,不止一位用户报告,从Ollama切换到llama.cpp后,同一个模型、同一台机器,性能直接提升了30%。这个差异的背后,是封装带来的开销。Ollama本质上是在llama.cpp外面套了一层壳,负责模型管理、API服务等。这层“中间商”在带来便利的同时,也吃掉了性能。对于那些只想快速体验的用户,Ollama依然是最佳选择。但如果你开始严肃地将本地模型用于实际工作流——比如像原帖作者那样,用它来驱动一个自动化Agent系统处理文件、调用工具——那30%的性能就不是小事了。它决定了你的Agent是“可用”还是“好用”。一个有趣的现象是,许多人正是在Ollama上碰壁,才最终转向llama.cpp,并惊讶地发现自己的机器原来这么能打。所以,如果你也觉得自己的电脑跑本地模型力不从心,甚至因此放弃了尝试更大、更强的模型。不妨先问自己一个问题:限制你的,真的是那块显卡或那点内存吗?还是那个你以为最方便的工具?---简评:这再次验证了一个反直觉的道理:在任何前沿领域,最流行、最易上手的工具,往往不是性能最好的那个。它为你降低了入门门槛,但也悄悄给你设置了认知天花板。真正的“信息差”优势,往往藏在那些需要你多折腾一步的选项里。---ref: www.reddit.com/r/LocalLLaMA/comments/1rll349/ran_qwen_35_9b_on_m1_pro_16gb_as_an_actual_agent#AI创造营##人工智能#

27. Google 把 AI 装进Windows了!效率直接翻倍,用过真的回不去!最新下载安装实测 | 零度解说

28. 神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!

29. 遇到过做AI编程时,命令行输出信息太多,导致token消耗飞涨的问题吗?推荐试试 rtk(GitHub:github.com/rtk-ai/rtk)!rtk 是一个CLI代理,它会智能压缩和过滤命令输出,能为你节省 60-90% 的LLM token消耗!无论是 git 状态、代码测试、lint检测还是docker命令,rtk都帮你把结果压缩成最精简的形式,同时保证关键信息完整,极大降低AI辅助编程的费用压力。主要特点:- 单文件Rust二进制,无依赖,运行效率极高(<10ms 开销)- 智能过滤冗余信息、分组类似输出、截断多余内容、去重重复行- 支持丰富命令:git、cargo、npm、docker、kubectl、pytest、eslint、pip等- 自动挂钩bash命令,透明替换为rtk命令,保持使用习惯- 多AI工具集成方案,支持Claude Code、GitHub Copilot、Gemini、Codex等常见AI助手- 开箱即用,支持macOS、Linux、Windows多平台- 提供详尽统计,帮助你了解token节省效果安装方式简洁:- 推荐Homebrew: brew install rtk- 也可用curl脚本一键安装,或cargo源码安装试试 rtk,让你的AI编程体验更省token、更流畅、更高效!#开发效率# #AI助力编程# #开源工具#

30. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)

31. 15分钟做个0中介费3D看房网站,Codex手把手教程

32. Claude Opus 4.6 vs GPT-5.3-Codex,到底谁更强?

33. 在线使用 Claude Code 进行 AI 编程时,还得受限于单一模型——但现在有了 OpenClaude,这个开源项目帮你打破了这种限制!它基于 Claude Code 开源源码,并新增 OpenAI 兼容 API 适配层,支持接入 GPT-4o、DeepSeek、Gemini、Ollama、本地模型等 200 多款 LLM,一键切换超自由。OpenClaude 不仅支持所有 Claude Code 内置的强大工具:bash 命令执行、文件读写编辑、多步推理、任务管理等,核心还保持了流畅的实时 token 流、工具调用和持久记忆。安装也非常方便,npm 一键装,或者源码用 Bun 构建,再通过环境变量轻松配置比如 OPENAI_API_KEY 和模型名称即可启动。主要功能亮点:- 兼容多厂商多模型,自由选用最适合你场景的大语言模型;- 全面支持函数调用,实现场景复杂的多步 AI 辅助工作流;- 支持本地与云端模型混合使用,保障隐私且提升响应速度;- 强大的工具链系统,涵盖代码执行、文件操作、网络检索等;- 预设多种启动配置文件,快速定位最佳模型和使用体验。GitHub:github.com/Gitlawb/openclaude适合开发者及 AI 爱好者打造跨模型通用的智能助理、代码生成和自动化管道,无需局限单一生态。#开源AI# #多模型支持# #智能代码助理# #人工智能开发#

34. 【在家搭建你自己的AI编程助手:一套完全开源的本地方案】最近有个话题在技术圈子里很火:能不能在家里搭一套本地运行的AI编程助手,完全不依赖云端服务?答案是可以的。有人用OpenCode加上llama.cpp,再配合GLM-4.7 Flash模型,在自己的机器上跑出了相当不错的效果。先说硬件配置。这位开发者用的是三张3090显卡,128GB内存,上下文窗口开到了20万token。听起来配置不低,但实际上很多人用单卡也能跑。有人用4070Ti在5万上下文下跑出45 token每秒,有人用7900 XTX在零上下文时达到120 token每秒。关键在于参数调优和版本选择。这里有个重要提醒:一定要用最新版本的llama.cpp。LM Studio和Ollama虽然底层也是llama.cpp,但版本往往滞后。GLM-4.7 Flash最近有多个修复补丁合并进主分支,用旧版本可能会遇到各种奇怪问题,比如输出循环、工具调用失败等等。说到实际效果,这套方案能做什么?有人让它从一个简单的示例程序出发,自动生成了一个完整的多智能体辩论系统,包含配置文件、代理类、管理器、入口脚本,甚至还自动写了单元测试。整个过程没有人工干预测试部分,模型自己判断需要写测试就写了。当然,本地方案和云端服务还是有差距的。有人测试发现,同样的任务Claude Code几分钟搞定,本地模型可能会卡在某个错误上反复尝试。这不是框架的问题,是模型能力的差异。但换个角度想,这已经是能在消费级硬件上运行的最强开源方案之一了。有个有趣的发现:GLM-4.7 Flash在8bit量化下表现稳定,但4bit量化容易出现循环。这是目前发现的第一个量化精度对输出质量有明显影响的小模型。关于电费的问题,有人算过一笔账。即使用5090显卡全天候满载运行,按美国最贵的电价每度40美分计算,一个月电费大约165美元。大多数人的实际使用强度远低于此,加上平均电价只有一半左右,实际成本可能只有几十美元。最后说说工具选择。OpenCode是一个开源的编程助手框架,可以配置MCP服务器实现向量检索、网页搜索等扩展功能。有人问为什么不直接用Claude Code配本地模型,答案很简单:目标是搭建一套完全开源、完全本地的方案。这不仅是技术选择,也是一种态度。能在自己的机器上运行一个接近商业水准的AI编程助手,这件事本身就值得兴奋。技术进步的速度超出想象,今天的不可能很快就会变成明天的标配。reddit.com/r/LocalLLaMA/comments/1qqpon2/opencode_llamacpp_glm47_flash_claude_code_at_home

35. 一个 Bash `alias`(别名)小技巧,可以用来把 Claude Code 的各种启动参数封装成短命令,实现多供应商秒切换和全自动执行。可以直接在 `.zshrc` 或 `.bashrc` 中按需组合以下配置:### 1. 快速切换不同供应商 (API Base & Key)通过别名区分不同的大模型底座,只需输入 `cl-zhipu` 或 `cl-kimi` 即可一键启动:```bash# 智谱 AI alias cl-zhipu='export ANTHROPIC_API_KEY="your_key"; export ANTHROPIC_BASE_URL=" 网页链接 claude'# Kimi (Moonshot AI)alias cl-kimi='export ANTHROPIC_API_KEY="your_key"; export ANTHROPIC_BASE_URL=" 网页链接 claude'```### 2. 开启全自动模式 (跳过权限确认)如果你信任 Claude 的修改逻辑,不想在每次写文件时都手动点击确认,可以加上权限跳过参数:```bashalias cl-auto='claude --dangerously-skip-permissions'```### 3. 环境按需挂载代理针对需要访问外网的情况,将代理环境变量集成在别名里,不影响终端的其他进程:```bashalias cl-proxy='export http_proxy=" 网页链接 export https_proxy=" 网页链接 claude'```---**进阶玩法:**你可以将它们组合成一个最终形态,比如一个专门走本地代理且跳过确认的别名:`alias myclaude='cl-proxy --dangerously-skip-permissions'`配置完成后记得 `source ~/.zshrc` 生效。#Easy同学正在独立开发# #ClaudeCode#

36. Q10系列最强一代!TCL Q10M Pro深度测试暨使用心得

37. 一名独立开发者仅用7天就逆向工程破解了谷歌价值十亿美元的算法谷歌发表了一篇论文,导致全球内存股暴跌。然后,它却没有发布任何代码。汤姆·特尼读懂了数学公式,打开终端,和克劳德一起搭建了整个系统——然后让它比谷歌承诺的还要快。第 1-3 天:核心算法、141 个测试、Python 原型第3-5天:将C语言代码移植到llama.cpp,Metal GPU内核第 5-7 天:速度优化,从 739 tok/s 提升至 2747 tok/s这是纯粹通过工程技术实现的 3.7 倍速度提升:> fp32 → fp16 白> half4 矢量化蝴蝶运算图侧旋转> block-32 存储布局然后他又在此基础上补充了自己的研究成果:稀疏 V:在长上下文中跳过 90% 的值解压缩非对称键值对:保持键值精确,更严格地压缩值。时间衰减:旧标记的精度会自动降低。结果:35B 模型在 MacBook 上运行,缓存压缩倍数为 4.6 倍。一周内获得 613 个 GitHub 星标。谷歌至今仍未发布自己的代码。

38. Codex跑了22小时,真赚16.88美元:奥特曼预言的「AI打工人」来了

39. MiniMax M2.5模型正式上线,是否真正实现“生产力SOTA ”与“低负担”,如何评价其表现?

40. 本地运行大模型推理经常需要复杂配置,llama.cpp 通用性强但针对性不足,各种框架兼容性问题层出不穷,调试优化耗时费力。ds4 把 DeepSeek V4 Flash 的本地推理优化到极致,提供了专为 Apple Silicon 的高性能 Metal 推理引擎。不仅支持 100 万 token 超长上下文、高质量思考模式,还提供磁盘 KV 缓存持久化、OpenAI/Anthropic 兼容 API,甚至 2bit 量化在 128GB MacBook 上流畅运行。GitHub:github.com/antirez/ds4主要功能:- Metal 专用 DeepSeek V4 Flash 推理引擎,M3 Max 达 84 t/s;- 100 万 token 上下文窗口 + 超压缩 KV 缓存,支持磁盘持久化;- 兼容 OpenAI/Anthropic API,支持工具调用和 SSE 流式输出;- 2bit/4bit 特殊量化,128GB RAM MacBook 即可运行 284B 参数模型;- 多种思考模式(normal/max),思考长度随问题复杂度自适应;- CLI 交互 + Server 模式,完美适配 coding agent(如 opencode、Pi)。支持 macOS(Metal),make 编译后即可运行,适合开发者、研究者和 AI 爱好者。#DeepSeek##本地大模型##AppleSilicon#

41. 爆火的 Z-Image 模型!8G 显存能跑,无内容审查、支持NFWS、超高速,本地部署教程!支持(Win/Mac)| 零度解说

42. 苹果悄悄砍掉丐版Mac mini,人人都要交「AI 税」的时代来了

43. 零成本跑最强AI!Gemma 4手机本地部署(支持离线+多模态)安卓、iPhone全搞定! | 零度解说

44. 实测 GPT-5.3-Codex,OpenAI 史上第一个高危模型,连 API 都还不敢给我们

45. Codex上线手机端啦!免费用户可用

46. 在 Agent 时代,命令行界面(CLI)为何反而成为最优解?

47. 26年1月开源模型汇总,太卷了,这几个已经追平闭源了!

48. #真我Neo8#性能篇:骁龙8 Gen5+LPDDR5X+UFS4.1,7000mm² VC面积,苍穹通信芯片S1,极客性能面板:自定义温度调节和芯片频率(支持所有游戏),主流枪战手游165Hz无限满帧。然后还首发PC掌机模式,可离线畅玩。

49. windows 本地安装龙虾的步骤#HOW I AI# 1、工具准备,下载好 nodejs和git。下载地址分别是 网页链接 和 网页链接 ,2、 安装这两个程序,中间不用该任何配置选项,就是下一步。3、安装完成后 打开命令行工具 winkey+ R ,运行cmd。 4 输入node -v 回车,看到版本号 输入git -v 回车,看到版本号,说明两个都安装成功了。 5 输入命令 git config --global url." 网页链接 "ssh://git@github.com/" 回车 git config --global url." 网页链接 " 网页链接回车 npm i -g openclaw 回车。 就安装成功了。 见图1 然后就是 启动 openclaw onboard 进行第一次初始化配置。1、选yes 2、quickstart 3、选一个你有的模型 4、配置你模型的token 5、channel选跳过 (后面可以非常简单的配置微博作为 channel ,见这条微博,网页链接 ) 6、no 7 空格+回车 安装成功了。就可以通过本地的web界面操作了。

50. MiniMax M2.5模型正式上线,是否真正实现“生产力SOTA ”与“低负担”,如何评价其表现?

51. MiniMax M2.5模型正式上线,是否真正实现“生产力SOTA ”与“低负担”,如何评价其表现?

52. 在线使用专业软件常常受限于繁复的图形界面和缺乏自动化接口,AI智能代理难以直接操控这些工具完成任务。开源项目 CLI-Anything(GitHub: github.com/HKUDS/CLI-Anything),可以让任何有源码的软件一键生成命令行交互界面,实现真正的“Agent-Native”! CLI-Anything 的亮点: - 通过自动化七阶段流水线,从代码分析到测试再到安装,全自动生成完整专业CLI,支持交互REPL和脚本模式。 - 融合真实软件后端(Blender、GIMP、LibreOffice等),不只是模拟而是实操,保证功能和效果百分百正宗。 - 所有命令支持结构化JSON输出,方便智能代理解析和决策。 - 通过统一的CLI接口,AI代理无需兼顾复杂GUI,即可实现图像编辑、3D建模、音频处理、文档编辑、视频剪辑等全类软件控制。 - 多达8大复杂开源软件已创建成熟CLI,超过1298个自动化测试通过,保证生产级质量。 快速开始: 1️⃣ 添加 Claude Code 插件市场安装 CLI-Anything 插件 2️⃣ 一行命令生成目标软件CLI(例如 /cli-anything ./gimp) 3️⃣ 安装并从命令行调用生成的agent-native工具 CLI-Anything为软件智能代理开辟了全新入口,极大提高自动化能力,适合开发者、AI研究者和自动化爱好者使用! #AI创造营##智能代理##开源利器#

53. 零成本无限 Token!Hermes + Qwen3.6,本地最强 Agent 组合来了!附部署教程 | 零度解说

54. 巴掌大的性能怪兽:极摩客EVO-X2搭载 AMD 395,本地跑235B实测

55. 飞书 CLI 也开源了 为所有AI打开了大门今天飞书也正式开源其 lark-cli,把飞书的核心协作能力:即时通讯、云文档、多维表格、日历、邮箱、任务、会议、知识库等 11 个业务域、200 多个命令封装成了一个开源命令行工具你的 Claude Code 和小龙虾就能直接在飞书里帮你干活了!四步即可安装...详细教程及测试:网页链接

56. 制作Reddit爆款视频通常需要抓取热帖、找素材、剪辑合成、配音字幕,来回切换工具超级麻烦。RedditVideoMakerBot 只需✨一条命令✨,就把Reddit热帖自动变成TikTok/YouTube风格的完整视频。无需任何视频编辑或素材准备,全程纯编程自动化,支持抓取Reddit内容、TTS语音合成、视频渲染输出。GitHub:github.com/elebumm/RedditVideoMakerBot主要功能:- 自动抓取Reddit热帖,支持指定subreddit和NSFW过滤;- 纯编程生成视频,无需手动剪辑或资产编译;- TTS语音合成和字幕生成,附带背景音乐;- 支持GUI界面和命令行操作,一键运行;- Playwright驱动浏览器抓取,兼容多平台;- 输出高质量MP4视频,适合TikTok/YouTube/Instagram。支持 Windows/macOS/Linux,通过Python 3.10 + pip安装依赖即可运行,已获11.3k星标,适合内容创作者和搬运工。#AI工具##Reddit#

57. redis的开发者antirez专门 fork 了一个 llama.cpp 用来跑deepseek-v4-flash地址:github.com/antirez/llama.cpp-deepseek-v4-flash视频为其在 M3 Max 128GB 上运行deepseek-v4-flash的 2 位量化模型效果。#AI创造营#

58. 经常觉得写代码光靠提示不够,想要一个能帮你从零搭建项目、调试、执行代码甚至管理复杂流程的 AI 助手?Goose(github.com/block/goose)是一款本地运行的、可扩展的 AI agent,不仅能写代码,还能执行代码、完成测试,甚至能和外部 API 交互,真正做到自动化工程任务全流程。主要功能:- 从头构建项目,自动生成和运行代码- 调试失败,快速定位修复- 支持多模型配置,优化性能和成本- 无缝集成 MCP 服务器,兼容各种大型语言模型- 提供桌面应用和命令行接口,灵活适配不同开发场景适合开发者、工程师和创新团队,用它加速研发效率,把时间花在创新上,而不是管理琐事。GitHub:github.com/block/goose#AI开发助手# #开源项目# #智能编程#

59. 一键本地安装OpenClaw!怒省500上门安装费,还能提前用GLM新模型?

60. M5 MacBook Pro丨新手要学的9个Mac实用功能

61. 在线使用和部署大语言模型(LLM)经常面临硬件资源限制,不同模型对CPU、RAM、GPU的需求差别巨大,挑选合适模型既费时又费力。有个超实用的开源工具——llmfit(GitHub:github.com/AlexsJones/llmfit),能自动检测你电脑的CPU、内存和GPU配置,结合模型参数和量化信息,智能评估数百款主流模型(Meta Llama、Mistral、Qwen、DeepSeek、Llama.cpp等)在你本地硬件上的运行适配度、速度和质量,帮你快速找到最适合你机器的模型。主要功能:- 自动硬件检测(支持多GPU,NVIDIA、AMD、Intel Arc、Apple Silicon等)- 模型Fit评分,覆盖质量、速度、内存匹配度和上下文长度四维度综合评估- 支持多量化策略自动选择,以找到最高质量的量化模型- 交互式终端UI和经典CLI,操作简单直观- 计划模式估算不同模型配置对硬件需求,方便硬件升级规划- 支持本地多种运行时集成,如Ollama、llama.cpp和MLX- 多平台支持:Linux、macOS(Intel/Apple Silicon)、Windows安装方便,macOS/Linux一条命令即可启用,也支持通过cargo源码构建。内置了超过200款模型数据库,且支持自动更新。无论是AI研究者,开发者,还是AI爱好者,都能用它一键找到真正适合自己电脑的模型,极大提升体验。强烈推荐!#AI创造营##人工智能#

62. 【月之暗面最强模型!Kimi K2.6发布:13小时不停写代码 对标GPT-5.4】日前,月之暗面发布并开源Kimi K2.6模型,在代码、长程任务执行和Agent集群能力等方面全面升级。目前,Kimi K2.6已上线kimi官网、最新版应用、API和Kimi Code编程助手。在多项权威基准测试中,Kimi K2.6表现亮眼。无论是高难度的人类最后的考试(Humanity's Last Exam),还是侧重真实软件工程能力的SWE-Bench Pro,以及评估Agent检索能力的DeepSearchQA,成绩均达到行业领先水平,持平或优于GPT-5.4、Claude Opus 4.6和Gemini 3.1 Pro等闭源模型。作为Kimi迄今最强代码模型,Kimi K2.6长程编码能力大幅提升。在测试中可以不间断编码13小时,编写或修改超过4000行代码,完成复杂系统的开发和优化。同时,通过将代码与视觉能力的深度融合,Kimi K2.6可以交付极具设计创意的专业级Web应用。在内部代码评测Kimi Code Bench中,K2.6成绩较上一代K2.5提升约20%。值得一提的是,其泛化能力同样突出。实测显示,Kimi K2.6可在Mac本地部署模型,并通过Zig语言优化推理流程,在4000余次工具调用、12小时连续运行中,将吞吐量从约15tokens/s提升至约193tokens/s,最终实现比LM Studio快约20%的推理效率。在Agent能力方面,Kimi K2.6支持多Agent协同,可调度不同专长的Agent组合完成复杂任务,将搜索、深度研究、文档分析和长文生成等能力整合,整体任务质量显著提升。同时,其Agent集群架构也迎来升级,最多支持300个子Agent并行运行、执行约4000个协作步骤,可一次性完成从文档到网页、再到PPT和表格的多产物端到端交付。#kimi#

63. 刚才做了个实验,用一台老机器跑 Qwen 3.5。这台机器有 6G 显存,显卡是 GTX 1660 Ti,内存 32G,内存带宽大约 40 GB/s,跑 Qwen3.5-35B-A3B-Q4_K_M.gguf 输出速度可达到 21 t/s ~ 25 t/s。这个速度对家庭日常使用已经完全可接受了。我做了一些定量和定性的测试,结果还是挺好的,包括我之前提过的编程测试任务(网页链接)——这个测试甚至到今天国内仍有一家公司的最新模型还做不及格——只剩这一家,其它公司都可以了。GTX 1660 Ti 现在只要 700 元。内存虽然涨价了,但两根 16G 的 DDR 4 也就 1400 左右。如果用疫情前的硬件就能跑出这样的效果,那么“家庭智能中心”这样的产品也就变得很现实了。 tombkeeper的微博视频

64. 删掉 OpenClaw!Hermes Agent 才是真王炸,一键本地部署 +模型接入全教程(避坑指南) | 零度解说

65. 早期计算机都是命令行的。上世纪八十年代初苹果和微软才把图形界面推广开来。我一直没学过写图形界面程序。一方面这对我的技术方向来说不是必须的,另一方面我也不太喜欢。但不会毕竟不会,所以早年我对会用 MFC 画 GUI 的人始终心怀敬意。然而 AI 一来,世道变了,又全都 CLI 了。CLI,就是 Command Line Interface,命令行界面。前几天香港大学甚至发布了一个项目 CLI-Anything,能自动把 LibreOffice、Blender 之类图形界面的程序导出命令行接口,方便 AI 调用。看到没有!世界又回到命令行了!!

66. LTX-2 最新开源模型!只需8G显存,即可生成电影级AI大片!太离谱了, 附本地部署教程!| 零度解说

67. OpenAI推出Codex Security,AI自主修复软件漏洞

68. M5芯片15寸MacBook air开箱

69. 盘点一周AI大事(4月5日)|叫AI老公多干活 OpenAI内测下一代生图模型「GPT-Image-2」 OpenAI工匠计划「Project Stagecraft」曝光 Google发布最强开源小模型「Gemma 4」 Anthropic研究发现Claude有170种情绪向量 阿里发布最强开源多模态大模型「Qwen3.5-Omni」 Sakana AI 发布AI战略官「Marlin」 微软发布最强语音识别模型「MAI-Transcribe-1」 研究员开源最强声音克隆模型「LongCat-AudioDiT」 研究员开源最强语音合成模型「OmniVoice」 工程师开源AI同事「同事.skill」爆火 首个一人独角兽公司「Medvi」诞生 #前沿科技趋势发布月 #AI新星计划 #AI #OpenAI #AIGC

70. Codex

71. Codex、Claude、Gemini 装好了却打不开?Mac 终端环境排查指南

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章