AI调用月省90%:高危烧钱场景与低成本替代方案
05-27 10:23
精选参考来源
抖音 2026-02-15
微信公众号 2025-12-07
来源
精选参考来源
1. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能
抖音 2026-02-15 00:00:00
2. 谷歌68页提示词圣经+老金原创元提示词,直接复制就能用
微信公众号 2025-12-07 00:00:00
3. 如何评价OpenAI最新发布的GPT-5.4 mini和GPT-5.4 Nano?
知乎 2026-03-18 00:00:00
4. 【#爱马仕反超OpenClaw中国模型贡献最大#】5月12日,@小米技术 发文:OpenRouter最新数据,Hermes Agent全球调用量首超OpenClaw,登顶全球调用量榜首,小米MiMo成第一贡献模型。5 月 12 日 OpenRouter 最新数据显示,Hermes Agent 日 Token 调用量高达 2910亿,最近一周调用量超 1.75万亿。在模型调用量方面,MiMo排名第一,最近一个月累计贡献 1.45万亿 Token调用量。#小米MiMo近一月贡献1.45万亿Token调用量#
新浪微博 2026-05-12 00:00:00
5. 大模型的上下文工程,都说很重要,但相关的研究那么少,对Agent开发有什么影响,有大佬能解释一下吗?
知乎 2025-11-27 00:00:00
6. AI 算力计价是否会逐渐从「按词元计费」转向「按任务/结果计费」?
知乎 2026-05-17 00:00:00
7. HermesAgent 超越 OpenClaw 成为全球 Token 消耗第一,这意味着什么?
知乎 2026-05-17 00:00:00
8. 2025年度AI全景报告:AI变强,人类抽象! 2025年的AI进化史,比科幻电影更疯狂 一、大模型篇:GPT-5.2、Gemini、Claude如何刷爆IQ测试 二、AIGC篇:小香蕉和GPT-Image编辑现实 三、人类怎么用AI:跟“神”谈恋爱 四、AI机器人:伴侣还是终结者 五、AI4S:人类最后的发明 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #机器人
抖音 2026-01-04 00:00:00
9. 为什么硅谷大厂年薪 50万美金的工程师,要 Max Token ?如果不消耗 25 万美金的 token ,他们就觉得自己危险了?因为这些高度训练,简历完美,智商超高的人。。。恐惧。他们恐惧 Pieter Levels 这种人。超高的 token 消耗,是要形成一种生产资料和运用能力的垄断。但是我不认为在内燃机时代,比别人更能消耗汽油,会给自己什么优势。真正的问题是如何比别人更快到达目的地。车开得更快的优势,其实非常不可靠。。。(油门踩的更狠这事情其实不是门槛)
新浪微博 2026-04-07 00:00:00
10. #小米MiMo模型周token消耗量破4万亿# 单周token直接干到4万亿,OpenRouter日/周/月三榜全第一。之前马斯克转发的无幻觉率榜单,它还悄悄拿了全球第三,哇塞,那很低调了盲测进全球前五,实打实第一梯队实力。这数据是用户的调研结果,真好用才会有这调用量。期待小米赶紧出稳定的token计划,继续冲!
新浪微博 2026-03-31 00:00:00
11. 【10 个 Token 优化工具,帮你省下大量 Claude API 成本】如果你正在使用 Claude Code 却未加优化,你可能正在浪费高达 80% 的上下文窗口。上下文窗口是 AI 时代的 RAM,浪费它不仅意味着账单激增,更意味着 AI 逻辑能力的过早衰退。以下是 10 个能够拯救你 API 账单的顶级工具,它们将彻底改变你与 AI 协作的成本结构。---1. Caveman Claude:沟通范式的降维打击通过让 Claude 像原始人一样说话,在不损失任何技术准确性的前提下,砍掉 75% 的输出 Token。事实证明,精简的指令往往比长篇大论更易于模型执行。项目地址:github.com/JuliusBrussee/caveman2. RTK (Rust Token Killer):终端噪音过滤器这是一个极速的 Rust 代理工具,专门过滤终端输出。它能实现 60-90% 的数据削减,且完全无依赖。项目地址:github.com/rtk-ai/rtk3. Code Review Graph:大仓库的导航指南利用 Tree-sitter 构建代码图谱,让 Claude 只读取真正相关的部分。在大型单体仓库中,它可以实现惊人的 49 倍 Token 削减。项目地址:github.com/tirth8205/code-review-graph4. Context Mode:输出的沙盒化处理将原始输出存入 SQLite 而非直接塞进上下文。在处理日志和 GitHub 数据时,能减少 98% 的上下文占用。项目地址:github.com/mksglu/context-mode5. Claude Token Optimizer:文档瘦身的艺术通过精妙的设置提示词优化项目结构,将文档占用的 Token 从 11K 降至 1.3K,降幅达 90%。项目地址:github.com/nadimtuhin/claude-token-optimizer6. Token Optimizer:猎杀幽灵 Token专门寻找并清理那些吞噬上下文的不可见“幽灵 Token”,全方位保护上下文质量。项目地址:github.com/alexgreensh/token-optimizer7. Token Optimizer MCP:MCP 工具的智能增压为 MCP 工具添加激进的缓存和压缩机制,通过纯粹的策略优化实现 95% 以上的削减。项目地址:github.com/ooples/token-optimizer-mcp8. Claude Context:全库感知的经济方案来自 Zilliz 的混合向量搜索方案,以降低 40% 成本的代价,让整个代码库都成为 Claude 的上下文。项目地址:github.com/zilliztech/claude-context9. Claude Token Efficient:零代码改动的精简只需在仓库中丢入一个 CLAUDE.md 文件,即可强制执行严格的简洁回复规则。项目地址:github.com/drona23/claude-token-efficient10. Token Savior:符号级导航通过符号而非大文件来导航代码,在代码跳转和持久化记忆方面实现 97% 的削减。项目地址:github.com/rtk-ai/rtk---[ 战术组合建议 ]根据你的痛点选择 2-3 个工具进行组合:> 处理超大规模仓库:Code Review Graph + Token Savior> 终端输出刷屏:RTK> MCP 数据堆积:Context Mode> 追求即刻见效:Caveman + Claude Token Efficientx.com/DataChaz/status/2045784379155226971
新浪微博 2026-04-21 00:00:00
12. 【首发】GPT-5.5重磅上线!能自己搞定复杂任务的AI来了
哔哩哔哩 2026-04-26 00:00:00
13. #微博声浪计划##听见微博# 全球最大AI模型聚合平台OpenRouter最新周榜显示,中国大模型包揽调用量前四,周调用量达4.69万亿Token,连续两周超越美国。小米MiMo-V2-Pro以匿名测试的Hunter Alpha身份杀入前七,技术实力获国际认可。中国模型崛起得益于技术性能与成本优势,全球化开发者生态认可,同时也面临高端GPU国产化等挑战。 http://t.cn/AXftF0vO
新浪微博 2026-03-19 00:00:00
14. 大模型的token究竟是什么?
知乎 2026-03-13 00:00:00
15. “龙虾”狂热:ChatGPT们只是AI的后端,OpenClaw让AI真正有了前端
微信公众号 2026-03-02 00:00:00
16. 爆肝10亿token,我给OpenClaw做了个龙虾管家!【一键安装龙虾】
哔哩哔哩 2026-03-10 00:00:00
17. 一张4090就能爆改!面壁智能MiniCPM-V 4.6开源,1B多模态卷出新高度
微信公众号 2026-05-13 00:00:00
18. 烧Token成KPI,8.5万Meta员工狂刷60万亿Token,争榜一大哥
微信公众号 2026-04-07 00:00:00
19. 高效提示词(prompt)工程指南
知乎 2026-02-22 00:00:00
20. 又……又赢麻了?[憧憬][憧憬][期待]//@郑昀:OpenRouter数据显示,2026年2月全球前五中占据四席,合计占比85.7%,一年前份额尚不足2%。爆发源于AI应用从 简单“对话式”向Agentic“流程型”切换,成本敏感度放大。中国开源模型凭极致性价比(价格仅为美国模型的1/6至1/13)吃到红利,行业正从价格战转向需求驱动时代。//@郑昀:全球最大的AI API聚合平台OpenRouter数据显示,2月9日~15日这周,中国模型以4.12万亿Token的调用量,首次超过同期美国模型的2.94万亿Token。2月16日~22日这周,中国模型的周调用量进一步冲高至5.16万亿Token,三周大涨127%,而同期美国模型调用量跌至2.7万亿Token。//@三个老爸实验室:稍微详细一点呗。。
新浪微博 2026-03-11 00:00:00
21. 【文档越多检索越不准?高维向量空间的语义坍缩真相】快速阅读:随着文档量增加,高维向量空间的语义边界会变得模糊,导致检索精度大幅下降。解决办法在于从单纯的“搜索”转向基于图结构的“推理”。把成千上万的文档一股脑塞进 RAG,就像试图在一个溢出的堆内存里寻找一个特定变量。随着文档量突破 10,000 这个临界点,语义空间开始变得拥挤。原本清晰的特征簇在极高维度的压缩下逐渐重叠,每个向量看起来都和别的向量“挺像”。斯坦福的研究揭示了这种现象:当规模达到 5 万份文档时,检索精度会暴跌 87%。这其实就是维度灾难。在高维空间里,数据点趋向于分布在边缘,彼此之间的距离变得几乎相等。此时的语义搜索,找出来的不再是那个最精准的答案,而是一堆看起来都“相关”的噪声。有观点认为,这种现象源于工程实现的局限。目前的做法太过于依赖扁平化的向量检索。真正的知识不是散落在空间里的孤立点,而是一张带有层级、时效和权威性的图。如果只做余弦相似度计算,就无法处理法律条文被废止或辖区变更这种逻辑关联。解决路径正从“增加数据量”转向“优化检索结构”。通过 GraphRAG 引入关系约束,或者利用局部上下文窗口来规避全局坍缩。知识的价值在于连接,而非单纯的堆砌。twitter.com/HowToAI_/status/2043713987171492224
新浪微博 2026-04-15 00:00:00
22. 全球AI开发者新宠!阶跃星辰Step 3.5 Flash,两天登顶OpenRouter趋势榜
微信公众号 2026-02-06 00:00:00
23. 聊一聊OpenClaw和之前其它AI的区别:AI聊天软件:由用户给定的有限输入,由AI运行环境能力边界限制的输出内容Manus:由用户给定的有限输入,由AI运行环境能力边界限制的输出内容,但通过使用沙箱环境,输出能力极大增强Claude Code等本地智能体工具:由用户给出需求,AI自己在本地运行环境中取得需要的输入,通过使用本地运行环境,输出能力极大增强OpenClaw:AI使用本地环境无限制地取得输入且自主增强输出能力,用户给出需求不再是AI执行任务的主要触发源
新浪微博 2026-03-10 00:00:00
24. #为什么AI大厂开始卖Token#Token是大模型处理信息的最小单元,其消耗与算力消耗、电力成本直接挂钩,是按效用付费的最公平口径。AI从对话工具转向Agent与企业系统,工作量呈指数级爆发,按Token计费能精准匹配算力消耗,实现成本可控。同时,价格分层加剧:轻量模型低至135元/亿Token,旗舰模型则达数万元,形成差异化竞争。Token计费将主导通用场景与标准化服务,但并非绝对唯一。对高并发、低门槛的轻量应用,Token模式效率最高;而对复杂行业定制、私有部署或长期订阅场景,包年制/包量制仍有优势。此外,随着算力成本优化与缓存技术普及,部分场景可能出现价格阶梯或免费额度,以平衡普惠与商业化。Token不仅是计费单位,更可能成为AI时代的数字货币,承载价值尺度与流通手段功能。中国凭借绿电与算力基建,正以低成本Token重塑全球AI成本结构。未来,Token计费将与混合模式并存,共同构建AI商业化的多元生态。#how i ai# 为什么ai大厂开始卖token
新浪微博 2026-03-17 00:00:00
25. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】
哔哩哔哩 2026-03-24 00:00:00
26. 太爽了!Hermes Agent 发布UI了,本地对接最强开源 Gemma 4 模型+ 微信(免费无需Token)| 零度解说
哔哩哔哩 2026-04-16 00:00:00
27. #小米MiMo大模型首次推出TokenPlan# Token Plan提供四档套餐,Lite、Standard、Pro、Max,从39元/月到659元/月,而且计费方式简单透明,按 token使用量换算credit消耗量,开发者可根据消耗量按需购买。 价格确实有很大优势,首次购买还享88折优惠。能力第一梯队,价格却比同能力竞品低很多,越是重度使用、海量Token调用小米价格优势越大。我看开发者都用的飞起,昨天MiMo大模型调用量超过了1万亿Token。 小米这个就是模型全,能力强,价格低,支持主流编程工具与模型框架,你可以用来编程、养龙虾等,挺有竞争力的。
新浪微博 2026-04-03 00:00:00
28. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文
微信公众号 2026-02-11 00:00:00
29. 深扒GPT Image 2:疑似“吞”下了GPT-4o,OpenAI没把它当“生图”模型训练
微信公众号 2026-05-03 00:00:00
30. qwen3.6 确实强,已经达到上一代claude 4.5的水平,我又使用了一个opus的蒸馏版。现在用Q8量化本地生产级开完全代替了付费大模型。以我的使用量,全年节省2000美元的token成本,且不需要看anthropic的脸色还得特么科学上网。这就是我为什么可以决策买rtxpro6000的一个基本ROI核算。这张卡8000多美元,仅靠编程的token消耗,固定资产折旧就拉平成本了。且不说有了这个免费的神器以后我的本地token使用量将远远超过定额,以及各种其他模型本地AI的能力就白送了。 以往的经验看,我个人的节奏比行业快一年左右,也就是说明年中期,大部分在线烧token的中小公司都会转向本地部署AI服务器,将OPEX 费用支出转化成CAPEX 资本支出。在显卡这一块,保值率和耐用度远超一般服务器。比如rtxpro6000这张卡的折旧摊销可以拉到八年。虽然单价高,但是赚钱的。 面向中型以下企业的全套本地AI coding硬件选型规划,模型部署调优,软件开发环境配置集成,部署流水线,质量门禁控制,团队编程AI化治理,AI工程管理经验,完全可以指导企业全面向低成本可持续AI编程转型。重要的是可以实现完全离线,使大量隔离开发环境具备接近在线编程的应用能力,安全合规,成本可控。现在啥都敢往AI上甩真是无知者无畏。 硬件层级:中型企业 AI 编程服务器整机 / 硬件精准选型、算力资源配比 模型层级:蒸馏、Q8 量化、本地部署、性能调优 工程层级:开发环境集成、部署流水线、质量门禁、代码规范 管理层级:团队 AI 编程流程治理、AI 工程管理体系 合规层级:纯离线私有化部署方案,适配隔离内网开发 有人可能会问,你这套体系比原生的大型来强嘛。我可以肯定地告诉你,绝对比原生大模型强,因为两者根本不是一个维度的东西。我这是整体解决方案,原生大模型在我这里只是一个infra的能力底座,有什么资格与我相提并论?发动机再牛逼也不能自己跑。 有咨询需求的老板,可以联系。
新浪微博 2026-05-08 00:00:00
31. 李彦宏认为 AI 时代的度量衡可能是「日活智能体数」,比 Token 消耗,更接近价值,对此你怎么看?
知乎 2026-05-14 00:00:00
32. 【速通OpenClaw】如何隔离危险、进阶玩法…一次说清
哔哩哔哩 2026-03-11 00:00:00
33. 春节档最狠一刀:旗舰性能+小模型尺寸,大模型价格体系被掀翻了
哔哩哔哩 2026-02-15 00:00:00
34. OpenClaw + Ollama 本地部署!无需 API,断网可用,多模型自由切换(GPT-OSS / Qwen 3 / GLM 4.7)
哔哩哔哩 2026-02-09 00:00:00
35. Anthropic 推出了一个叫“顾问工具”(advisor tool)的新 API 功能,核心思路是:让便宜的模型干活,遇到难题时请贵的模型出主意。具体来说,Sonnet 或 Haiku 作为"执行者"全程跑任务、调工具、处理结果。碰到自己搞不定的决策,就把上下文递给 Opus,Opus 给出方案或纠正,执行者接着干。Opus 全程不碰工具、不直接输出给用户,只充当幕后军师。这跟很多人熟悉的“大模型拆任务、小模型干活”的模式正好反过来。以前是大模型当指挥官,把任务拆成小块分配下去。现在是小模型自己跑,只在关键节点向大模型请教。好处很直接:大部分 Token 消耗在便宜的模型上,贵的模型只在刀刃上用。效果方面,Sonnet 配 Opus 顾问在 SWE-bench 多语言测试上比 Sonnet 单干高了 2.7 个百分点,同时每个任务的成本还降了 11.9%。更有意思的是 Haiku 的表现:配上 Opus 顾问后,Haiku 在 BrowseComp 测试上从 19.7% 跳到 41.2%,翻了一倍多。虽然分数还是比 Sonnet 单干低 29%,但成本只有 Sonnet 的 15%,适合跑量大但对智能要求没那么极端的场景。用起来也简单,在 Messages API 的 tools 里加一个 advisor_20260301 类型就行,一个 API 请求内部完成模型切换,不需要额外管理上下文或做多次调用。可以设 max_uses 控制每次请求最多咨询几次顾问,账单里顾问和执行者的 Token 分开计费。对开发者来说,这提供了一个新的性价比选项:不用在"全程跑 Opus 太贵"和"只用 Sonnet 不够聪明"之间二选一了。你的 Agent 可以 95% 的时间跑 Sonnet 的价格,5% 的关键决策享受 Opus 的判断力。目前是 beta 阶段,需要加 anthropic-beta: advisor-tool-2026-03-01 请求头才能用。官方博客:网页链接
新浪微博 2026-04-10 00:00:00
36. 再见,白月光 GPT-4o
微信公众号 2026-01-30 00:00:00
37. Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文
微信公众号 2026-04-17 00:00:00
38. 问:上下文(Context)和上下文窗口(Context Window)什么差别?这两个概念经常被混用,但其实指的是不同层面的东西:上下文是指 AI Agent 在执行任务时实际拥有的所有信息,包括系统提示词、用户的对话历史、检索到的文档、工具调用的结果、记忆模块注入的内容等等。你可以把它理解为“Agent 此刻脑子里装的所有东西”。上下文是一个动态的、可以被工程化管理的概念——哪些信息该放进来、什么时候放、怎么组织,这就是现在越来越多人说的 Context Engineering。上下文窗口则是模型层面的一个硬性限制,指的是模型单次推理能处理的最大 token 数量。比如 128K、200K、1M 这些数字,说的就是上下文窗口的大小。它本质上是一个“容器的容量”。打个比方:上下文窗口是你厨房操作台的面积,上下文是你实际摆在台面上的食材、调料、菜谱和工具。台面就那么大(上下文窗口有上限),但你放什么上去、怎么摆放(上下文的管理)决定了你能不能高效做菜。在 Agent 开发中,一个核心挑战就是:Agent 需要的上下文往往远超上下文窗口的容量。对话越来越长、工具调用结果越来越多、检索的文档越来越大——这些都在消耗上下文窗口的空间。所以才需要各种策略来管理:摘要压缩历史对话、选择性检索而不是全量灌入、及时清理不再需要的中间结果等等。简单总结就是:上下文(Context)是“内容”,上下文窗口(Context Window)是“装内容的容器”。做 Agent 工程的核心功夫之一,就是在有限的“上下文窗口”里塞进最有价值的“上下文”。
新浪微博 2026-05-14 00:00:00
39. M2.5登顶OpenRouter:如何做出大家最需要的那个模型
微信公众号 2026-02-23 00:00:00
40. 我现在一大半的coding任务已经从付费api切入到本地编程上了。使用全开源产品线vscode+qwen3.6能完成很多标准任务了,比如 CRUD、标准业务逻辑、正则、脚本、配置文件、部署自动化、Devops、简单算法、前端页面、调试排错,单元和接口测试,以及所有的文档生成任务。实在有不行的地方我古法编程顶上。编程的刚需场景能被本地模型吃下70%左右,剩下我自己顶一部分,追求效率时用claude 4.7再顶一小部分。你贵咱们就不用你,没有张屠户还吃带毛猪不成?想赚我的token钱,那有点难度。token的利润,其实大多来自于外行的挥霍。
新浪微博 2026-04-28 00:00:00
41. MiniMax M2.7+OpenClaw实战!AI到底能接管多少工作?
哔哩哔哩 2026-03-23 00:00:00
42. 反直觉:前沿模型虽然贵,但反而更好卖#AI #大模型 #芯片 #ChatGPT #Token
抖音 2026-04-29 00:00:00
43. 今天AI太热闹了,DeepSeek V4预览版正式上线并开源,OpenAI几乎同期推出GPT-5.5,两大重磅发布“撞车”,直接把话题推向高潮。DeepSeek V4和GPT-5.5谁更强?哪些领域哪个更领先?从目前公开信息和基准来看,两者各有侧重,没有绝对碾压:🔻• DeepSeek V4(预览版): • 亮点:百万上下文(1M tokens)标配,这对处理整个代码库、长文档或复杂知识库非常友好。采用MoE架构(V4-Pro约1.6T总参数/49B活跃,V4-Flash更轻量),强调高效Agent能力和成本控制。 • 强项:长上下文理解、编码相关任务(SWE-bench Verified接近80.6%)、数学/推理(部分基准追平或接近顶级闭源模型)、极致性价比。开源权重已放出,支持本地部署和华为昇腾等国产硬件优化。 • 弱势:作为预览版,某些复杂Agentic任务(需要多轮工具调用、真实世界交互)可能还需进一步打磨,整体智能上限在部分基准上略落后于最新闭源旗舰。🔻• GPT-5.5: • 亮点:主打更快、更省Token,在编码、办公自动化、研究任务上优化明显。OpenAI宣称它在多项基准(包括Terminal-Bench、编码相关)超越同期竞品,Agent能力更“直觉”、能处理有限指令下的复杂工作流。 • 强项:通用智能、工具使用、实际生产力任务(写代码、调试、跨应用操作)、响应速度和效率。付费用户(Plus/Pro等)已可直接体验,生态集成(ChatGPT、Codex)成熟。 • 弱势:上下文窗口相对较小(此前系列多在128K-256K级别,未见1M标配),API定价较高,闭源限制了自定义和本地化。总结:• 长上下文/大文档/代码库级任务:DeepSeek V4明显领先,百万上下文不是宣传,是实际可用。• 通用Agent、生产力、复杂工作流:GPT-5.5更强,尤其在“省Token”和直观性上,实际使用中可能感觉更丝滑。• 编码/数学/推理:两者接近,DeepSeek在开源性价比上拉开差距,GPT-5.5在某些官方基准上略胜。• 多模态/综合体验:GPT-5.5目前更成熟(OpenAI生态加持),DeepSeek V4预览版据称有原生多模态潜力,但需验证。#DeepSeekV4和GPT5.5谁更强#
新浪微博 2026-04-24 00:00:00
44. 硅谷《连线》杂志:性能顶级的 GPT-5们,正在输给一个中国开源模型#连线杂志 #AI #千问 #Qwen #千问恐慌
抖音 2025-12-30 00:00:00
45. 零成本无限 Token!Hermes + Qwen3.6,本地最强 Agent 组合来了!附部署教程 | 零度解说
哔哩哔哩 2026-05-05 00:00:00
46. 国产版Ollama来了,Clawdbot终于不只属于Mac和英伟达
微信公众号 2026-02-03 00:00:00
47. 零成本跑最强AI!Gemma 4手机本地部署(支持离线+多模态)安卓、iPhone全搞定! | 零度解说
哔哩哔哩 2026-04-07 00:00:00
48. Qwen3.5 开源王炸!多模态性能屠榜,本地部署 + OpenClaw 实战全流程!|零度解说
哔哩哔哩 2026-03-03 00:00:00
49. 最强Claude比黄金还贵,有人用省token.skill 立降65%,还有10个小妙招
微信公众号 2026-04-09 00:00:00
50. #鸿蒙给开发者铺好了高速路#鲁豫访谈了4位鸿蒙开发者,小宇宙播客App鸿蒙项目负责人李会洋、Canva可画中国区总经理王可辛、圆周旅记创始人凌麒、独立开发者李尚儒,信息量相当大,让我们可以看到如今的鸿蒙生态的确非常适合开发者的,为开发者考虑了很多。光是从这次请的四位开发者就可以看出来,鸿蒙让那个这些“小而美”应用与独立开发者被看到,被肯定。李尚儒选择了all in鸿蒙,原因在于小开发者能在鸿蒙生态中被用户发现,鸿蒙提供的功能能够让一个开发者调用一个系统的力量,让独立开发者能和大产品站在同一起跑线上,对独立开发者实在是非常友好的。同时,我们从开发者口中可以了解到,鸿蒙开发其实学习成本不高,度过了开始的困难,后面就是一片坦途。更难的是,鸿蒙对于开发者的需求和反应的问题,都有一个很快的反应,能及时解决问题,让开发更顺畅。此外,鸿蒙的“多端协同”、“碰一碰”分享、“桌面小组件”不仅让我们这些用户赞不绝口,开发者也认为这些功能打破了物理边界,非常有意义。一个好的生态,一定是要对开发者足够友好,看了这次访谈,我对于鸿蒙生态的未来更有信心了。
新浪微博 2025-12-24 00:00:00
51. 实测OpenRouter黑马模型,批量任务秒级响应,成本只有GPT-5.4-mini的1/10
微信公众号 2026-04-22 00:00:00
52. 今天凌晨,小米把最强的MiMo-V2.5-Pro模型开源了,用的MIT协议,可以拿去商用、魔改都行。开箱就适配了7家芯片厂商,AMD、亚马逊云科技、阿里平头哥都在列,无论你习惯用哪家云或显卡,上线就能跑,不用折腾环境至于能力到底行不行,专业人士评价,量子位、数字生命卡兹克这些硬核玩家都上手测了。小米同时搞了一个MiMo Orbit计划,30天内给全球用户免费发放100万亿Token。可以把Token理解为AI的“油”,你想让模型跑起来就得消耗它,现在这波油钱小米全出了另外Agent框架团队还能定向免费接入,等于模型不要钱,算力也白送。这种力度在大模型圈确实很少见,趁着羊毛正厚,值得去试一把。#小米最强大模型开源# #小米百万亿Token计划启动#
新浪微博 2026-04-28 00:00:00
53. 用 Claude Code 省钱的正确方式,收藏~1. 正确配置1)创建 .claudeignore 文件,把 node_modules/、dist/、.git/、日志目录统统排掉。Claude 看不到的文件,就不会被塞进上下文。2)CLAUDE.md 控制在 500 token 以内。细节拆进独立的 skill 文件,用到哪个才加载哪个——按需加载,不是全部预加载。3)装 context-mode 插件,实时可视化上下文占用,在它失控之前感知到。2. 每次开 session 的习惯1)每个任务开一个新 session。上下文不跨任务污染,这一条单独能省很多。2)长 session 用 /compact 压缩上下文,而不是让它一直涨。3)用 /cost 随时查当前 session 消耗了多少 token,心里有数。4)读日志、全库扫描这种"大量读取"型任务,放到子 agent 里跑。子 agent 有自己的上下文,不会污染主会话。5)给 Claude 明确的验证标准——"跑完测试,截图对比",而不是让它自己判断对没对。能自我验证的 Claude 犯错更少,绕弯路更少,token 自然也用得少。#HOW I AI# #程序员#
新浪微博 2026-04-24 00:00:00
54. GPT-5.4:OpenAI做了个Kimi K2.5 +MiniMax M2.5?
微信公众号 2026-03-06 00:00:00
55. 央视信息,OpenRouter 最新数据显示,中国 AI 大模型周调用量达到 4.69 万亿 Token(3 月 9 日至 3 月 15 日),连续两周超越美国。全球调用量排名前三的位置也被中国模型包揽。Seedance2.0一段15秒钟的视频token消耗量就达30万token以上,OpenClaw和各种龙虾最近的繁荣,带动了中国大模型的调用增长。摩根大通预测,中国的 AI 推理 Token 消耗量将从 2025 年的约 10 千万亿增长至 2030 年的约 3900 千万亿,五年间增长约 370 倍。
新浪微博 2026-03-22 00:00:00
56. 最近小米的大模型 MiMo-V2-Flash 在海外开发者社区还挺火的不少国外开发者已经把 MiMo-V2-Flash 当成 Gemini 3 Flash 的性价比替代方案了,因为它在代码能力表现不错的前提下,API 定价只有同级主流模型的 2.5%,而且现在还依然是限时免费。对开发者来说,等于多了一个性能不错、成本极低的新选择。
新浪微博 2025-12-27 00:00:00
57. OpenAI、Anthropic 和 Google 的工程师为什么从不为提示词发愁?秘诀在于“上下文栈”——真正的元技巧是“上下文工程”。过去,我们用提示词“黑客”式地与AI沟通,像用简单短语和关键词和陌生人对话。但现在的模型不只是理解指令,它们理解的是“环境”。你的工作不再是简单“提示”,而是设计它的上下文。什么是上下文?就是你在模型开始生成内容前搭建的数字环境,包括:- 它应该“扮演”的角色(身份)- 它的目标是什么- 它的沟通风格和语气- 它参考的例子、数据和过往作品这才是保证输出连贯、高质且符合品牌调性的关键。举个例子:旧式提示: “写一篇关于AI生产力工具的LinkedIn帖子。”上下文设计版: “你是一位技术创始人,写实用且能病毒传播的推文,语气自信且带点挑衅,基于真实案例。这里有你过去的三篇示例。现在,写一篇关于AI生产力工具的新推文。”区别就在于,你不是在“提示”,而是在“简报”。模型不再是工具,而是你团队的新成员。就像招新人一样,它需要了解你的品牌、目标和期待,而非随便发号施令。这就是“上下文工程”的力量。一个简单且实用的框架是4C: 角色(Character)、命令(Command)、限制(Constraints)、上下文(Context)。 一次设定,反复使用。有了正确的上下文,你的模型变成真正懂你声音、受众和意图的创意伙伴。没有它,你只是靠运气。停止“提示词黑客”,开始“上下文构建”。每次简报,都像培训新员工一样,问自己:“他们需要知道什么,才能像我一样思考?”这才是2025年AI合作的未来。掌握上下文工程,不只是问什么,更是给什么;不只是它写什么,更是它懂什么。创作者借此放大品味,创始人放大判断力,团队放大知识。你今天的上下文结构是什么样的?原文:x.com/hasantoxr/status/1995891151535259864
新浪微博 2025-12-03 00:00:00
58. #DeepSeekV4和GPT6谁更值得期待#AI竞赛进入“决赛圈”:GPT-6 vs DeepSeek V4,谁是真正的生产力革命?GPT-6 核心看点: 重点不在参数,而在“Agent化”和“长程记忆”。它可能不再是对话框,而是能替你写代码、改Bug、顺便订外卖的数字员工。DeepSeek V4 核心看点: 依然是极致的 MoE 架构优化。据透露 V4 在代码生成的 HumanEval 评分上已经“封神”,更重要的是,它对中文语境和国内开发者工作流的适配,是天然的降维打击。一边是全球AI的风向标,一边是国产大模型的“排头兵”。这场对决,决定了未来两年的行业天花板。
新浪微博 2026-04-07 00:00:00
59. DeepSeek V4 前瞻:华为寒武纪接棒,拆解中国 AI 大模型告别英伟达后的生存战 | DeepSeek V4 | 华为昇腾 | 寒武纪 | 国产算力 |
哔哩哔哩 2026-04-07 00:00:00
60. 第一个把token拿来形容人的简直是天才,人早上一睁眼开始就是在消耗token来维持清醒的,和别人交流要token,处理工作要token,买东西点外卖要token,深度思考内耗要token,如果有人想用我自己的token给他提供情绪价值就得加钱,否则免费额度一旦用完,我就只能嘎吧一下装死。
新浪微博 2026-03-24 00:00:00
61. 终于来了!DeepSeek-V4 正式发布!免费开源,百万上下文,Agent能力直逼Claude!| 零度解说
哔哩哔哩 2026-04-24 00:00:00
62. Google 放大招!Gemini in Chrome 抢先开启,AI Agent 可自动浏览网页完成任务!| 零度解说
哔哩哔哩 2026-02-03 00:00:00
63. 白嫖顶级AI模型!GLM-4.7 + MiniMax M2.1 免费 API,媲美直连 Claude Code!NVIDIA 限免福利 | 零度解说
哔哩哔哩 2026-01-20 00:00:00
64. Claude Code+DeepSeek V4 Pro安装教程|3步从零装好开始用 | Mac Windows
哔哩哔哩 2026-05-09 00:00:00
65. 18个月,中国Token消耗狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本
微信公众号 2026-02-02 00:00:00
66. memsearch:OpenClaw同源的记忆系统Zilliz 最近开源了 memsearch,从 OpenClaw 的记忆系统里提取出来的,核心思路很干净:Markdown 文件就是记忆的唯一真相。设计理念:Markdown is the source of truthAgent 的记忆就是本地文件,按天存,人能读、能改、Git 可以管理版本。索引坏了?删掉重建,原始记忆一行不丢。这是对"数据库黑盒"方案的直接反叛。三步记忆范式- Recall:用混合检索(向量语义 + BM25 关键词)从历史记忆里找相关上下文- Think:把检索结果注入 LLM,做有记忆支撑的推理- Remember:把这次对话写回 Markdown,自动重新索引几个工程细节值得关注- SHA-256 内容哈希去重:内容没变就不重复 embed,大幅降低 API 成本- 文件监听自动索引: 开启后,文件一保存立刻更新向量库,删文件时对应 chunk 也同步清除- 多 embedding 引擎:支持 Gemini、Voyage AI、Ollama(本地)、sentence-transformers(离线),换引擎只改配置,历史记忆不影响和 Mem0 / Zep 的本质区别Mem0、Zep 把记忆存在数据库里,人看不到、改不了、换供应商就麻烦。memsearch 的记忆就是普通文本文件: 看改动, 查历史,跨机器 同步,零供应商锁定。主要短板:暂不支持时序关系图谱和多 Agent 共享记忆,适合单 Agent 长期记忆场景,不适合复杂多 Agent 协作系统。🔑 三个关键点① Markdown 文件即记忆,人类可读可编辑,彻底解决 AI 记忆的"黑盒"问题② 混合检索(向量 + BM25)比单纯语义检索精度更高,"Redis 缓存"能精确匹配到相关决策③ SHA-256 去重 + 文件监听自动索引,工程上几乎是零维护成本GitHub:github.com/zilliztech/memsearch#how i ai##程序员#
新浪微博 2026-03-03 00:00:00
67. 这是个好问题:> 随着基础模型继续进化,Skills 是否会逐渐被更强的自主规划取代?作为创业者现在去布局 Skills,究竟是短期红利还是长期壁垒?我的看法是:Skills 是短期红利,也是长期壁垒——但壁垒不在 Skills 本身。让我用 AI 发展的三个阶段来解释这个判断。第一阶段:AI Chatbot + Prompt回归第一性原理:AI 也好,Agent 也好,能解决问题才有价值。最早的 AI Chatbot 加上好的 Prompt,已经能解决很多「生成类」问题——回答问题、情感陪伴、翻译、写作、摘要。那时候 Prompt 就是短期红利。你会写出好的 Prompt,就能得到好的结果。我那时候花了大量时间研究 Prompt 工程,确实吃到了红利——很多网友就是那时候认识我的。但要说长期壁垒?没有。现在让 AI 辅助写 Prompt 已经不是什么难事了。不过,AI Chatbot + Prompt 只能解决生成问题,不能使用工具,不能与外部世界交互。第二阶段:AI Agent + 上下文工程然后是 AI Agent 的出现。Agent 能规划、能调用工具,解决了「与环境交互」和「完成特定目标」的问题。这时候 上下文工程(Context Engineering)就是短期红利。你知道怎么组织 Agent 需要的上下文,怎么在有限的上下文窗口里塞进足够的信息,那就是核心竞争力。但同样没有长期壁垒。很快模型越来越强,上下文窗口越来越大,上下文工程的最佳实践也逐渐系统化——比如借助文件系统压缩上下文、利用渐进式披露(Progressive Disclosure)解决工具描述占用太多 token 的问题。这些方法现在大家都知道了。第三阶段:Agent + Skills现在是 Agent + Skills 的阶段。Skills 解决的问题是:把特定工作流、特定领域的能力打包成可复用的「技能包」,让 Agent 之上可以长出丰富的应用生态。那些日常工作中琐碎但重复的任务,借助 Skill 的 Prompt 能力和工具能力,可以被高度自动化,带来巨大的效率提升。投资 Skills 是短期红利。 Skills 作为一种具体形式,可能会被更强的模型能力取代——也许未来模型足够强,不再需要人类预先打包好的「技能包」,它自己就能规划出最优路径。但问题来了:谁最能抓住这波短期红利?不是吹 Skills 的自媒体,而是真正懂 Prompt、懂上下文工程的人和团队。他们能借助之前积累的经验,快速做出真正解决问题的 Skills。投资的是能力,不是形式Skills 本身不会成为长期壁垒,但你在 Skills 上投入的学习和实践,会成为你的长期壁垒。这就像当年投资 Prompt 工程的人,后来更容易理解上下文工程;投资上下文工程的人,现在更容易做出好的 Skills。每一波技术浪潮的「短期红利」,都是下一波浪潮的入场券。所以我的建议是:不要纠结 Skills 会不会被取代,而是问自己:通过做 Skills,我能去解决什么问题?积累什么能力?这些能力在下一波浪潮里还有没有用?如果答案是肯定的,那就值得投入。
新浪微博 2026-01-18 00:00:00
68. DeepSeek-V4和GPT-5.5第一波实测对决,结果出人意料!
知乎 2026-04-25 00:00:00
69. DeepSeek官方宣布,DeepSeek-V4-Pro 模型 API 价格将于2026年5月31日结束2.5折优惠活动后,正式调整为原定价的1/4,即:每百万tokens输入(缓存命中)0.025元,输入(缓存未命中)3元,输出6元,创全球大模型价格新低。
抖音 2026-05-23 00:00:00
70. #DeepSeekV4和GPT6谁更值得期待#GPT-6大概率4月14号就来,DeepSeek V4也箭在弦上最快月内有消息。两边几乎同时亮剑,这波中美大模型的较量正式进入白热化阶段。GPT-6这次据说是奔着AGI去的全新架构,代号“土豆”,性能号称暴涨40%,200万token上下文加上原生多模态,看起来就是冲着“全能旗舰”去的。而DeepSeek V4走的是另一条路——它跟华为昇腾芯片深度绑定,从CUDA迁移到国产架构,极致性价比+百万上下文多模态,明显是想用工程能力打破算力封锁。一个秀天花板,一个卷供应链和成本。不管怎么选,这波最大赢家都是用户。
新浪微博 2026-04-07 00:00:00
71. 从自动写代码到智能影音刮削:实测 OpenCode,这台“赛博管家”真的能干苦力活
哔哩哔哩 2026-01-30 00:00:00
72. Openclaw小龙虾Windows本地全面部署保姆级教程,接入飞书,让小龙虾随时随地为你工作
哔哩哔哩 2026-03-09 00:00:00
73. #DeepSeekV4和GPT6谁更值得期待# 从用户需求看,两者面向不同人群。普通用户、内容创作者更期待GPT-6,主动对齐意图、长文档处理、多模态生成更省心。开发者、企业、国内用户更看好DeepSeek V4,开源可本地部署、成本极低、适配昇腾芯片,能落地私有化场景。更期待哪方还是要看谁更贴合使用场景。
新浪微博 2026-04-07 00:00:00
74. 文档平台 Mintlify 发了一篇工程博客,讲了一件挺有意思的事:他们给自家 AI 文档助手造了一套假的文件系统,叫 ChromaFs,让 AI 以为自己在用 grep、cat、ls 这些命令浏览文件,实际上每个命令都被拦截、翻译成了数据库查询。效果很直接:会话启动时间从原来沙箱方案的 46 秒降到 100 毫秒,每次对话的边际计算成本几乎为零。Mintlify 之前的方案是标准的 RAG 流程:把文档切块、向量化、存进 Chroma 数据库,用户提问时检索最相关的片段喂给大模型。问题是,如果答案分散在好几个页面里,或者用户要的是某段精确的代码语法,向量检索经常找不对。他们想让 AI 像开发者翻代码一样翻文档,而不是靠语义相似度碰运气。核心思路是:AI 不需要真的操作系统,只需要一个足够逼真的幻觉。ChromaFs 基于 Vercel Labs 的开源项目 just-bash(一个用 TypeScript 重写的 bash 子集)构建。just-bash 提供了可插拔的文件系统接口,负责解析命令和管道逻辑,ChromaFs 则把所有底层文件操作翻译成 Chroma 数据库查询。每个文档页面变成一个"文件",每个章节变成一个"目录",AI 就可以用 grep 搜精确字符串、用 cat 读整页内容、用 find 遍历结构。之前用真沙箱的方案(给每个用户起一个微型虚拟机),按 Mintlify 月均 85 万次对话的量算,一年光计算成本就要 7 万美元以上。ChromaFs 复用了已有的数据库基础设施,这笔钱省了。grep 是最难虚拟化的命令。如果真让它逐文件扫描,走网络 IO 会很慢。ChromaFs 的做法是先把 grep 的参数解析出来,用 Chroma 的元数据查询做粗筛,找出可能命中的文件批量预取到缓存里,再让 just-bash 在内存中做精确匹配。权限控制也很优雅:初始化时根据用户身份裁剪文件树,没权限的路径直接从树里删掉,AI 连路径都看不到,不存在越权风险。所有写操作一律返回"只读文件系统"错误,AI 能随便看但改不了任何东西,整个系统无状态,不用担心清理和数据污染。这篇文章在 Hacker News 上引发了一个有意思的讨论。好几位开发者指出,大家不知不觉中把 RAG(检索增强生成)等同于了向量搜索,但 RAG 里的 R 是 Retrieval(检索),本来可以是任何方式:全文搜索、SQL 查询、甚至翻电话簿。把 RAG 绑死在向量数据库上,是早期技术路径的惯性。有人解释了这种惯性的由来:RAG 概念流行的时候,大模型还不太会用工具,多轮搜索和纠错能力也差,向量检索是当时最省事的方案。现在模型的工具调用和推理能力上来了,让 AI 自己决定用什么方式找信息,反而比预设一条检索管道更灵活。也有人提出了务实的质疑:Mintlify 的场景是结构化的技术文档,天然适合文件系统隐喻,但如果是组织内部那种乱七八糟、没有层级结构的知识库,这套方案未必好使。这个方向和 Claude Code 的做法有相通之处:与其把所有信息预检索好喂给模型,不如给模型一套探索工具,让它自己决定看什么、怎么找。对于正在搭建 AI 文档助手或内部知识库的开发者来说,Mintlify 的这套方案提供了一个向量检索之外的选项,尤其适合文档结构清晰、对精确匹配要求高的场景。
新浪微博 2026-04-04 00:00:00
75. #鸿蒙给开发者铺好了高速路#华为布局鸿蒙系统,核心是打破移动生态的单一壁垒,构建自主可控、万物互联的智能终端操作系统。鸿蒙系统对于每个开发者来说都是一片蓝海,不仅学习成本低,当你有任何疑问都能快速得到想要的答案,这对于开发者来说非常友好。鸿蒙系统正处于高速发展阶段,对于每个开发者来讲会很公平,都在同一条起跑线上,在应用市场中,每个 APP 都会有团队介绍以及 APP 的灵感来源,这对于用户来讲能够更好了解应用背后的故事,从而下载。目前鸿蒙系统开发者人数已突破 1000 万,搭载HarmonyOS 5 和 HarmonyOS 6 的设备数突破 3200 万。庞大的用户基数与开发者群体形成正向循环,为“小而美”的创意应用提供了肥沃的生长土壤,也让鸿蒙生态的万物互联蓝图愈发清晰,期待更好的鸿蒙! 广州
新浪微博 2025-12-24 00:00:00
76. #小米MiMo模型周token消耗量破4万亿#前两天马斯克在宣传自家模型排第一的时候,小米已经悄悄的排在第三了 国内的社媒好像都没怎么注意到。4万亿的token消耗量,如果模型本身不好用的话,光靠免费肯定冲不到这个量,MiMo已经稳居目前大模型的第一梯队了,下一步小米应该会出更加经济实惠的token plan吧
新浪微博 2026-03-31 00:00:00
77. 【你经常使用AI工具吗?#国产算力需求指数级增长#】#中国模型调用量三周大涨127%# 2月26日,全球最大的AI模型API聚合平台OpenRouter数据显示,9日-15日这周,中国模型以4.12万亿Token的调用量,首次超过同期美国模型的2.94万亿Token。16日-22日这周,中国模型的周调用量进一步冲高至5.16万亿Token,三周大涨127%,而同期美国模型调用量跌至2.7万亿Token。与此同时,全球调用量排名前五的模型中,中国模型占据四席。中国模型厂商,正凭借快速迭代和成本优势占领全球市场,国产算力需求正经历指数级增长。 (每经) 网页链接
新浪微博 2026-02-26 00:00:00
78. 「Github一周热点107期」OpenAI收购的AI安全工具、AI代理事务所、OpenClaw技能库、claude code插件和上下文数据库
哔哩哔哩 2026-03-21 00:00:00
79. 我觉得用碳基生物的问题没办法体现模型的智能水准,至少目前评判的benchmark应该得和当前最热门的杀手应用OpenClaw结合来考查。对我来言,最直观的体现,就是哪家的API可以最大限度体现Agent执行Skill时的效果。这是需要真金白银评测的。我帮一个朋友写了一个简单的workflow,就是搜索几个网站,提炼筛选其中的TOP5做成一个newsletter,供他的客户订阅。很简单的逻辑,调试效果执行了大概五六次,轻轻松松70w token出去了,价值大概0.9刀。免费的token服务也就当乐子看看,真干活还是得pay per token! 查看图片
新浪微博 2026-03-08 00:00:00
80. LTX-2 最新开源模型!只需8G显存,即可生成电影级AI大片!太离谱了, 附本地部署教程!| 零度解说
哔哩哔哩 2026-01-19 00:00:00
81. Qwen3.6-Plus 太猛了!免费 + 百万上下文 + Agent + 视觉多模态AI能力拉满! 零度解说
哔哩哔哩 2026-04-09 00:00:00
82. 还是小米懂消费者的需求,养龙虾最头疼的无疑就是Token花销,控制不住动辄上千,没准还能冲个万!现在好了,小米将连续霸榜OpenRouter的MiMo出了个包月套餐,MiMo-V2-Pro的性能不用我再解释了吧(全部套餐都支持),全球开发者的调用量以及各种榜单数据在那里摆着,OpenRouter严选认证,绝对靠谱。能力不打折,价格更优惠,资深虾佬们这波羊毛不得薅一薅。
新浪微博 2026-04-03 00:00:00
83. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说
哔哩哔哩 2026-04-10 00:00:00
84. #小米首次登顶全球开源大模型第一#Xiaomi MiMo-V2.5 系列模型正式开启了公测,包含 MiMo-V2.5、V2.5-Pro、V2.5-TTS Series、V2.5-ASR 四款产品。其中: MiMo-V2.5-Pro定位小米迄今最强模型,在通用智能体、复杂软件工程、长程任务等维度,已能与 Claude Opus 4.6、GPT-5.4 等全球顶尖Agent模型正面抗衡。可稳定完成涉及近千轮工具调用的长程任务,超长周期内逻辑一致,指令遵循能力大幅提升。仅用 4.3小时、672次工具调用,就用Rust从零实现了完整的SysY编译器(北大《编译原理》课程项目),在隐藏测试集上取得233/233满分,还在11.5小时内自主开发出具备完整功能的视频编辑器Web应用(代码量8192行,1868次工具调用)。 MiMo-V2.5定位为Agent场景而生的原生全模态大模型,支持同时看、听、读,把理解转化为行动。Agent能力全面超越上一代MiMo-V2-Pro,API成本降低约50%。多模态感知能力超越上一代MiMo-V2-Omni,跨模态推理、视频理解、图表分析能力显著提升,在VideoMME、CharXiv、MMMU-Pro等评测中逼近甚至超越业界顶级开源模型。除此之外,全系列Token效率得到了前所未有的优化。在相同Agent基准(ClawEval)分数下,MiMo-V2.5-Pro相比Kimi K2.6节省42% Token,MiMo-V2.5相比Muse Spark节省50% Token,全球开发者已经对Mimo的Token效率赞不绝口了。 小米还对Credits计费做了简化,取消了按上下文窗口区分倍率,MiMo-V2.5消耗1Token=1Credit,MiMo-V2.5-Pro消耗1Token=2Credits。订阅新增了连续包月(老用户自动续费次月7折、新用户77折)、包年(全年88折)。所有已购买Token Plan的用户,Credits额度将全部重置清零,重新开始计算。
新浪微博 2026-04-23 00:00:00
85. OpenRouter最新测算,3月30日至4月5日,全球AI大模型总调用量达27万亿Token,环比增长18.9%。中国AI大模型表现强劲,周调用量升至12.96万亿Token,环比上涨31.48%,已连续五周实现增长并超越美国。从全球模型调用量排名来看,前六位均被中国AI大模型包揽。Qwen3.6 Plus (free) 以4.6万亿Token的周调用量位居榜首;小米 MiMo-V2-Pro 本周下滑至第二位,周调用量为3.08万亿Token;Qwen3.6 Plus Preview 排名第三,周调用量为1.64万亿Token;阶跃星辰Step 3.5 Flash (free) 排名第四,周调用量1.26万亿Token;MiniMax M2.7 排名第五,周调用量1.19万亿Token;DeepSeek V3.2 位列第六,周调用量同样为1.19万亿Token。
新浪微博 2026-04-06 00:00:00
86. 前阵子我想搭个能自动梳理行业资料,跟进项目节点的轻量Agent,折腾了好多天都没落地,现在顶尖的模型调用成本太高,一些开源模型的Agent能力跟不上,就很。。。 #小米最强大模型开源#小米把自研的MiMo-V2.5-Pro模型进行了开源,第一天就完成了AMD、亚马逊云科技等全球7家主流芯片平台的适配。也看了一些头部玩家的实测,MiMo的Agent能力能和Claude Opus 4.6正面掰掰手腕了想体验的门槛也不高,小米免费送了100万亿Token,Agent平台也限时免费,MiMo Orbit计划更是有点“你来用模型,成本我来管”的意思了
新浪微博 2026-04-28 00:00:00
87. Vibe Coding 终极指南 V1.2开发者在与 AI 搭档编程时,经常面临规划混乱、代码难维护的问题。Vibe Coding 是一个以规划为核心,结合系统提示词和模块化设计的终极 AI 编程工作流程,帮助你从想法到可维护代码,形成一条清晰可控的流水线。它提供了丰富的提示词库,涵盖需求澄清、开发计划、代码实现、测试验收等全流程,确保 AI 不会失控,项目结构清晰且易于扩展。无论是 CLI 还是 VSCode 扩展,都能顺畅体验。主要特点包括:- 以规划驱动开发,避免 AI 自主引发混乱;- 完善的系统级提示词集合,规范 AI 行为边界;- 闭环交付流程,从需求到测试全覆盖;- 共享记忆库,实现人机同步的项目上下文;- 支持多种 AI 模型和环境,灵活高效。项目地址:github.com/tukuaiai/vibe-coding-cn/tree/main适合开发者、团队和 AI 协同工作场景,助你打造可审计、可复盘、可持续的 AI 编程新体验。
新浪微博 2025-12-13 00:00:00
88. 大模型的记忆能力现在完全靠内存的大小决定,也就是上下文的大小决定了当前大模型的智能水平。这与去年我们玩小模型硬吃显存的逻辑是不一样的。现在经过量化的小模型已经能稳定地高效产出tokens。我在本地的gemma4上下文测试时一直对话,上下文的用量除着对话不断抬升内存用量,直到拉满然后爆炸了。从内存用量一半到爆炸,GPU显存几乎纹丝不动。也就是说对显存的需求被量化的压缩给控制住了。硬件从GPU的算力,发展到了存储容量的记忆力比拼。所以各大厂商都在无限堆推理上下文内存。但对内存的依赖应该在算法上可以优化,将上下文进行关键压缩和向SSD固化,需要时再对内存激活。不过内存厂家也是SSD厂家。这就是为什么最近半年多,内存被拉冒烟的根本原因。当LLM的算法遇到scaling law的天花板,内存大小决定了智能化程度。注意算法扰动,如果真出现数倍级压缩算法,那么内存的预期就会被暴击。因为现在认为内存决定能力还看不到天花板。我们迫切需要内存上下文量化技术和内存版MOE的出现。
新浪微博 2026-04-18 00:00:00
89. #微博声浪计划##听见微博# 雷军宣布小米MiMo大模型单日调用量破1万亿Token,相当于处理约3000本《红楼梦》文字量。MiMo-V2-Pro采用万亿参数MoE架构,API成本仅为竞品1/5,OpenRouter数据显示其包揽多榜第一,中国大模型连续四周超越美国。小米推出四档Token套餐布局AI运营商,但面临调用量统计范围及盈利可持续性争议。 蛋蛋科技说的微博音频
新浪微博 2026-04-04 00:00:00
90. 阿里云重写了云#阿里 #阿里云 #千问
抖音 2026-05-21 00:00:00
91. 2026 年 5 月 1 日,美国国家标准与技术研究院(NIST)下属的人工智能标准与创新中心(CAISI)发布了对 DeepSeek V4 的测试。结论是:1、DeepSeek V4 是迄今为止 CAISI 评估过的最强大中国 AI 模型。2、CAISI 认为 DeepSeek V4 的性能与 8 个月前发布的 GPT-5 类似,而 DeepSeek 自己的测试报告则认为与 Opus 4.6 和 GPT-5.4 类似。3、和同类模型相比,DeepSeek V4 最大的优势是成本低廉。CAISI 评估报告中最引人注意的是下面这张图。这张图暗示了自 DeepSeek R1 发布以来,中国最强大的模型和美国最强大的模型之间的差距实际上在慢慢扩大。www.nist.gov/news-events/news/2026/05/caisi-evaluation-deepseek-v4-pro
新浪微博 2026-05-03 00:00:00
92. 马化腾用“漏水的船”来形容过去在AI上的状态,挺坦率。承认慢了,但最新一季度财报能看出些变化:混元大模型不到三个月完成重建,Hy3 preview收费后调用量还在OpenRouter排第一,WorkBuddy成了国内日活最高的智能体。这些数据说明产品落地速度在加快,市场也愿意用。还在追,但至少已经跑起来了。#马化腾回应AI掉队#
新浪微博 2026-05-13 00:00:00
93. 盘点一周AI大事(1月11日)|最强人形机器人 OpenAI公布2026研发路线图 DeepSeek被爆2月发布DeepSeek V4 Google推出Veo3驱动的数字人Vids 字节开源换脸视频模型DreamID-V 阿里开源数字人框架HRM2Avatar Lightricks开源顶级视频模型LTX-2 ElevenLabs推出最强语音转录模型Scribe v2 斯坦福开源睡眠分析模型SleepFM 港大发布开源版NotebookLM DeepTutor Razer推出全息AI老婆Project AVA 波士顿动力推出下一代Atlas #抖音知识年终大赏 #前沿科技趋势发布月 #AI新星计划 #AI #机器人
抖音 2026-01-11 00:00:00
94. 【联想云电脑】战神配置 凌云算力 驰骋3A游戏世界!
哔哩哔哩 2025-12-02 00:00:00
95. #鸿蒙应用开发者激励计划2026发布# 在4月15号正式上线官网!目前搭载鸿蒙5/6的终端设备数已破5000万台,现在鸿蒙生态红利全面释放,不仅提供现金激励与全流程开发支持,更对新人和个人开发者极为友好,快去HarmonyOS开发者官网报名!期待更多有想法、有创意的优质App加入
新浪微博 2026-04-16 00:00:00
96. 在本地一台全新的Windows和两个云端部署了龙虾,确实出现了经常不可用的情况,最稳定的竟然是家里的那个本地部署。现在上手的门槛还是比较高,哪怕是安装上了,再去找插件、安装插件,都需要一定的基础。更别提对自己龙虾的运维了。如果你本地有VS Code加Claude ,倒是可以用它来帮你去优化本地龙虾
新浪微博 2026-03-05 00:00:00
97. RTK:Rust Token Killer一个 CLI 代理工具,让 AI 编程助手省下 60-90% 的 Token|单二进制零依赖,一行命令安装即用|Github Daily
百度 2026-05-21 00:00:00
98. Altman拿Token换股权只够烧45天,20亿Token捐母校只值100块
微信公众号 2026-05-21 00:00:00
99. 一周烧掉$1400后,他开源了这个爆火的token消耗追踪工具
微信公众号 2026-05-23 00:00:00
100. Claude 订阅计费调整:编程额度用尽后按 API 费率实报实销
知乎 2026-05-20 00:00:00
101. 你的员工一个月用多少token?你要不要省着点用?
微信公众号 2026-05-24 00:00:00
102. Agent 的提示词也配得上一次 git commit:Prompt 版本管理与可观测回滚工程
微信公众号 2026-05-24 00:00:00
103. 目前还有哪些平台能领到免费的AI Token试用额度
微信公众号 2026-05-20 00:00:00
104. OpenRouter 模型排名观察:DeepSeek V4 flash冲到第一,能力榜仍看 GPT-5.5
微信公众号 2026-05-25 00:00:00
已收藏
去我的收藏夹