通义千问才是中文用户真正的“零门槛”首选,Claude和DeepSeek各有致命短板
03-30 09:33
精选参考来源
精选参考来源
1. Anthropic 社区负责人连更31条Claude Code技巧!比Claude Code创始人私藏的还硬核
微信公众号 2026-01-06 00:00:00
2. 不是 这还是我认识的阿里巴巴吗 对这就是他 阿里进军机器人领域,千问内部组团,通义千问技术负责人带队#阿里 #通义千问 #机器人 #科技 #人工智能
抖音 2025-10-09 00:00:00
3. 阿里全家桶全面Agent化!千问“任务助理”全面公测,从此AI不再只是动嘴出主意的狗头军师!
哔哩哔哩 2026-01-21 00:00:00
4. 对话云栖大会:下一个AI爆款、大模型进化与Agent万亿级企业市场
哔哩哔哩 2025-10-17 00:00:00
5. AI编程大战正式开打! Claude vs GPT同一天放大招,不是比谁代码写得好,而是AI开始自己组队当项目经理了。#大咖观察 #红衣聊AI #编程 #ChatGPT
抖音 2026-02-10 00:00:00
6. 千问23天月活突破3000万碾压欧美,中国AI时代开启! 就在刚刚,确认数据!千问23天月活突破3000万,首周下载量1000万碾压欧美,阿里AI从“技术储备”向“价值落地”加速演进 #AI #阿里 #千问
抖音 2025-12-10 00:00:00
7. 千问APP全面接入阿里生态,超车美国、带领国内AI行业进入办事时代。#ai #千问 #阿里 #科技 #马斯克
抖音 2026-01-15 00:00:00
8. 硅谷《连线》杂志:性能顶级的 GPT-5们,正在输给一个中国开源模型#连线杂志 #AI #千问 #Qwen #千问恐慌
抖音 2025-12-30 00:00:00
9. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格
哔哩哔哩 2026-02-17 00:00:00
10. #硬刚ChatGPT的千问国内可下载#投资人朱啸虎说“硬刚ChatGPT的国产AI出现了”,并指出其背后是在硅谷屠榜的Qwen大模型杀回国内,直接奠定了千问的高起点。这款阿里推出的AI助手不仅模型实力受全球认可,产品体验更是将技术优势转化为实用价值。面对“机油更换周期判断”等汽车与科技领域的复杂问题,千问展现出完整的思维链和深度解析能力,能够进行分步推理、精准引用数据,输出条理清晰的专业建议。其在中文理解与逻辑推演上的显著优势,使它在复杂问题回答质量与交互流畅度上比不少AI产品更出色。正如朱啸虎所强调,这是一款“不闹着玩儿,全是干货”的中国市场真正需要的AI产品,也正重构着一个超级AI入口,成为国产AI迈向高阶竞争的重要标志。
新浪微博 2025-11-17 00:00:00
11. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】
哔哩哔哩 2025-12-17 00:00:00
12. 东大和漂亮国,AI实力的全面对比#AI #Deepseek #chatgpt #Gemini #AI技术
抖音 2025-12-29 00:00:00
13. ChatGPT、Claude、Gemini 什么任务该交给谁?每月600刀经验总结
哔哩哔哩 2026-03-02 00:00:00
14. DeepSeek,正如其名,深耕求索 AI 边界。DeepSeek V3.2 系列模型正式发布:开源 AI 推理能力直逼 GPT-5,Speciale 版斩获多项金牌在人工智能领域,开源模型的迅猛发展正重塑全球 AI 生态。今日(2025 年 12 月 1 日),中国 AI 初创公司 DeepSeek 宣布正式发布两款重量级大语言模型:DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale。这一双模型同步上线,不仅标志着 DeepSeek 在参数规模和推理能力上的新突破,更在开源社区引发热议。DeepSeek-V3.2 主打日常应用场景下的 Agent 强化能力,而 V3.2-Speciale 则作为“长思考增强版”,融入先进数学证明机制,在国际竞赛基准中屡获金牌。官方网页端、App 和 API 已全面更新,支持开发者即时接入。这一发布时机恰逢全球 AI 竞争白热化之际。DeepSeek 团队强调,新模型在训练过程中优化了多模态融合和长上下文处理,参数规模达数百亿级别,旨在桥接开源与闭源模型的性能鸿沟。以下,我们将从模型架构、基准评测、与其他顶尖模型的比较以及潜在影响四个维度,进行专业剖析。模型架构与创新亮点DeepSeek-V3.2 系列基于前代 V3.1 的 MoE(Mixture of Experts)架构迭代而来,总参数量超过 600B,其中活跃参数高效分配至 70B 级别。这种设计显著降低了推理延迟,同时提升了在复杂任务下的稳定性。核心创新包括: • Agent 能力强化:V3.2 内置多步规划模块,支持自主工具调用和动态决策链路,适用于自动化工作流场景,如代码生成和数据分析。 • 长思考机制:V3.2-Speciale 引入“思考链”(Chain-of-Thought)增强变体,结合 DeepSeek-Math-V2 的定理证明引擎。该版本在处理逻辑验证任务时,能模拟人类逐步推理过程,避免幻觉输出。 • 开源友好:模型权重已在 Hugging Face 和 GitHub 公开,支持 FP16/INT8 量化部署,适用于边缘设备。这些特性使 V3.2 系列不止于通用对话,更向专业垂直领域倾斜,如数学、编程和科学模拟。基准评测:性能数据详解为评估新模型的实际表现,DeepSeek 团队公布了多项国际标准基准结果,并邀请第三方机构验证。总体而言,V3.2 在推理和数学任务上表现出色,平均得分逼近闭源顶流。数学与逻辑推理基准 • GSM8K(小学数学):V3.2 得分 98.2%,V3.2-Speciale 达 99.5%,接近人类专家水平。Speciale 版在长链推理中优势明显,错误率降至 0.5% 以下。 • MATH(高中数学竞赛):Speciale 版斩获 92.7% 准确率,在 IMO 2025 模拟赛中获金牌,超越谷歌 Gemini Deep Think。该成绩得益于集成定理证明器,能自动验证几何和代数推导。 • AIME(美国数学邀请赛):V3.2 系列平均 85.4%,较前代提升 12%。独立评测显示,Speciale 版在 MLPerf Inference v5.1 推理基准中,处理长序列输出时延迟仅为 GPT-5 的 1.2 倍。编程与多模态任务 • HumanEval(代码生成):V3.2 达 89.6% 通过率,略高于 Claude 3.5 Sonnet,在 Aider 编程测试中得分 71.6%,标志着开源模型在软件工程领域的突破。 • MMLU-Pro(多学科知识):整体得分 87.3%,在生物医学子集上表现尤佳,Nature 杂志的一项临床评测显示,DeepSeek 模型在 NMLE(国家医学执照考试)中超越 OpenAI o1,准确率提升 15%。安全效率评估NIST 的 CAISI 报告指出,V3.2 在安全基准(如红队攻击抵抗)中得分 92/100,优于多数美国参考模型,同时价格仅为闭源竞品的 1/10。量化后,推理速度提升 2.5 倍,支持 128K 上下文窗口。 然而,评测也暴露短板:V3.2 在创意写作(如 GPQA 基准)中得分 78.5%,落后于 Gemini-3.0-Pro 约 5%。此外,独立测试显示其在边缘案例下的幻觉率仍需优化。与顶尖模型的横向比较DeepSeek V3.2 系列的发布,直接挑战了 OpenAI GPT-5 和 Google Gemini 的霸主地位。在综合基准 Arena-Hard 上,V3.2 以 91.2 分逼平 GPT-5(92.1 分),但略逊于 Gemini-3.0-Pro(93.8 分)。 17 Speciale 版在数学子集上逆转胜出,IMO 金牌成绩更胜一筹,终结了“闭源垄断高难度推理”的叙事。与其他开源模型相比,V3.2 碾压 Llama 3.1(MMLU 85.2%)和 Mistral Large(编程 82.4%),其 MoE 架构在能效上领先 30%。这一成绩源于 DeepSeek 的“渐进式蒸馏”训练策略,从 685B 基座模型提炼而出。开源生态影响与未来展望DeepSeek V3.2 的开源策略,将进一步加速 AI 民主化。开发者可通过 API 免费测试,预计短期内涌现大量 Agent 应用,如智能医疗诊断和自动化科研。长期看,这一发布或推动中美 AI 合作,缓解地缘壁垒。模型规模膨胀带来的碳足迹,以及在非英语语料上的泛化问题。DeepSeek 团队已承诺后续迭代,将融入更多多语言支持。DeepSeek V3.2 系列的亮相,不仅是技术跃进,更是开源精神的胜利。它证明,开源模型已能与闭源巨头并驾齐驱,甚至在特定领域领跑。 对于从业者和研究者而言,这是部署高性能 AI 的绝佳时机。未来,随着更多评测数据涌现,我们期待 V3.2 在真实世界中绽放光彩。参考文献: • DeepSeek 官方公告及基准报告。 • 第三方评测:NIST CAISI、Nature 临床基准、MLPerf 等。 (本文基于公开数据撰写)#DeepSeek同时发布2款新模型##ai生活指南##ai创造营#
新浪微博 2025-12-01 00:00:00
15. AI视频模型遍地开花,曝光割韭菜的食物链,真正赚钱的只有一类人|行业风口|数据差距|爆款路径|变现实操|盈利闭环|流量红利|SORA|通义千问|腾讯混元|即梦
哔哩哔哩 2025-11-23 00:00:00
16. Claude 5史诗级泄露,史上最强编程模型评测炸裂!核心秘密曝光
知乎 2026-02-03 00:00:00
17. Claude Code真的那么厉害吗?
知乎 2026-03-05 00:00:00
18. #硬刚ChatGPT的千问国内可下载#刷到朱啸虎的小红书说千问硬刚ChatGPT,我试着问了一下千问“国内免费ai软件推荐,以及各个ai软件的特长和优点”,它不仅清晰分类、对比各家优势,还针对中文编程、内容创作等高频需求给出实用建议,配合图表呈现,逻辑直观。这份回答让我看到了千问此番硬刚的底气,毕竟它用的是阿里自家最强最新的Qwen大模型,而整个Qwen模型家族更在国际赛场表现亮眼:不仅在多项核心国际榜单持续霸榜,更在图像处理领域以48%的份额稳居全球第一。作为深耕中文生态的AI助手,千问对汉语语义、文化语境及本土使用场景具有深度理解。综合来看,千问在回答结构、语言风格与场景适配方面都更贴合国人习惯,加上界面简洁入口直观,难怪朱啸虎会说它是目前中国市场最需要的AI助手
新浪微博 2025-11-17 00:00:00
19. Claude Sonnet 4.6 发布了,Anthropic 迄今最强的 Sonnet 模型。这次升级覆盖面很广:编程、计算机操作、长上下文推理、智能体规划、知识工作、设计,全线提升。上下文窗口也扩到了 100 万 token(beta)。价格不变,依然是 3/15 美元每百万 token。下面快速过一遍值得关注的点。【1】编程能力大幅提升,用户甚至更偏爱它超过 OpusAnthropic 的内部测试显示,Claude Code 用户在 70% 的情况下更偏好 Sonnet 4.6 而非上一代 Sonnet 4.5。更夸张的是,59% 的用户甚至更喜欢它而非去年 11 月发布的旗舰模型 Opus 4.5。用户反馈集中在几个点:Sonnet 4.6 在改代码之前会先读上下文,会合并重复逻辑而不是到处复制粘贴,过度工程化和偷懒的情况也明显减少。多步骤任务执行更稳定,虚假的成功报告更少。【2】计算机操作从实验品变成了实用工具2024 年 10 月 Anthropic 首次推出计算机操作功能时,自己都说"还很笨拙、容易出错"。16 个月后,OSWorld 基准测试(让 AI 在真实软件环境里完成任务)的得分从最初的 14.9% 涨到了 72.5%。早期用户反馈,Sonnet 4.6 在操作复杂电子表格、填写多步骤网页表单这类任务上,已经接近人类水平。它还能跨多个浏览器标签协调操作,把不同来源的信息整合到一起。当然,跟最熟练的人类比还有差距。但这个进步速度说明,更强的版本不会太远。安全方面也有改进。计算机操作最大的风险是提示词注入(prompt injection),恶意网页可以藏指令试图劫持模型。Sonnet 4.6 在抵抗这类攻击方面比 Sonnet 4.5 有明显提升。【3】基准测试全面提升,逼近 Opus 水平Sonnet 4.6 在各项基准测试中全面进步,接近 Opus 级别的智能水平,但价格只是 Sonnet 级别。换句话说,以前需要用 Opus 才能搞定的任务,现在 Sonnet 就能做。特别值得一提的是 Vending-Bench Arena 评测,这个测试让 AI 模型在模拟环境中经营一家企业,不同模型之间还要相互竞争。Sonnet 4.6 展现出了有意思的策略:前 10 个月大举投资扩产能,最后阶段突然转向盈利优先,靠这个时机差打赢了竞争对手。【4】100 万 token 上下文窗口100 万 token 足够装下整个代码库、长篇合同或几十篇研究论文。更关键的是,Sonnet 4.6 能在这么长的上下文里有效推理,而不只是把文本塞进去。这对需要长期规划的复杂任务很有价值。【5】产品和 API 更新API 层面有几个实用更新:网页搜索和抓取工具现在会自动过滤处理搜索结果,只保留相关内容,节省 token;代码执行、记忆、程序化工具调用、工具搜索等功能正式发布(GA)。Claude in Excel 插件现在支持 MCP 连接器,可以直接在 Excel 里调用 S&P Global、PitchBook、Moody's 等数据源,不用切出去。免费版也升级到了 Sonnet 4.6,并开放了文件创建、连接器、Skills 和上下文压缩功能。【6】怎么选:Sonnet 4.6 还是 Opus?对大多数任务来说,Sonnet 4.6 性价比更高。Anthropic 自己的建议是:需要最深层推理的场景(大规模代码重构、多智能体编排、必须零容错的问题),Opus 4.6 仍然是更好的选择。其他场景,Sonnet 4.6 足够了。Sonnet 4.6 的模型标识符是 claude-sonnet-4-6,已在所有 Claude 方案、Cowork、Claude Code、API 以及主要云平台上线。官方公告:网页链接
新浪微博 2026-02-18 00:00:00
20. 失衡的乌托邦:Meta的开源AI路线是如何遭遇滑铁卢的【硅谷101】
哔哩哔哩 2025-11-08 00:00:00
21. 这帮90后中国工程师太牛了!460万美元干翻了1.4万亿 中国AI有自己的登顶策略!只用了1%的资源逆袭美国,又一个DeepSeek时刻的背后到底是什么?#AI #kimi #OpenAI
抖音 2025-11-13 00:00:00
22. 华强北迎来第二春,这次不靠苹果,是千问!
微信公众号 2026-01-12 00:00:00
23. Meta的秘密项目居然偷师千问?偷早啦!千问发布旗舰推理模型Qwen3-Max-Thinking#Qwen3 #千问 #科技改变生活 #AI新星计划 #玩个很新的东西
抖音 2026-01-29 00:00:00
24. 全球开发者狂喜!Claude Code史上最大更新,一次性1096次提交
知乎 2026-01-11 00:00:00
25. #曝阿里秘密启动千问项目# 阿里启动千问项目对标 ChatGPT,是中国科技企业在全球 AI 竞争中的关键布局。从技术突破看,通义千问 Qwen3-Max 模型参数量突破万亿,在数学推理测试中实现 100% 准确率,代码生成能力超越 GPT-4o。其多模态模型 Qwen3-Omni 支持音视频实时交互,在权威测试中得分超 Gemini 1.5 Pro 达 30.8%,技术实力已跻身全球第一梯队。生态整合是千问的核心竞争力。依托淘宝、钉钉等阿里系应用,千问实现「AI + 电商」「AI + 办公」的场景闭环。市场表现上,千问在企业级市场占据 17.7% 份额(国内第一),全球 API 调用量超越 OpenAI 位列第四,Qwen3-Coder 更是成为编程领域第二大模型。其开源战略已孵化 17 万衍生模型,下载量突破 6 亿次,Airbnb、英伟达等国际企业深度合作验证技术认可度。尽管 ChatGPT 在复杂推理和全球化支持上仍具优势,但千问凭借更低的 API 成本(0.006 元 / 千 token)、中文理解准确率 92% 的本土化优势,以及国家超算互联网的算力加持,正在改写全球 AI 竞争格局。随着 Qwen3-Max 国际版研发推进和 C 端 APP 上线,阿里有望在 2026 年实现「AI 助手全球前三」的战略目标。毫无疑问AI领域就是中美之争,美国是技术中国有场景,算是势均力敌吧。后面就看国内的AI企业能不能在技术创新方面缩小和美国的差距了。
新浪微博 2025-11-13 00:00:00
26. Claude Code、Cursor、Trae、OpenCode怎么选?
知乎 2026-01-21 00:00:00
27. 开源是战略,生态是王炸,阿里千问入局AItoC #千问 #大模型
抖音 2025-11-19 00:00:00
28. 剑指“AI时代的安卓”,千问抢滩AI硬件核心入口
微信公众号 2026-01-11 00:00:00
29. 分享10个你可能不知道的Claude Code隐藏命令。
知乎 2026-03-20 00:00:00
30. DeepSeek 计划二月中旬发布新模型 DeepSeek-V4,有哪些技术亮点?能第二次震惊世界吗?
知乎 2026-01-10 00:00:00
31. 【#阿里千问登顶空间推理全球冠军#】近日,空间推理基准测试SpatialBench更新最新一期榜单,阿里千问的视觉理解模型Qwen3-VL、Qwen2.5-VL表现亮眼,分别位列头两名,超越了Gemini 3、GPT-5.1、Claude Sonnet4.5等国际顶尖模型。从具体来看Qwen3-VL-235B和Qwen2.5-VL-72B分别斩获13.5和12.9分,领先于Gemini 3.0 Pro Preview(9.6)、GPT-5.1(7.5)、Claude Sonnet 4.5等海外顶尖模型。不过,AI大模型整体表现与人类仍有差距,人类基准线约80分,能专业处理电路分析、CAD工程和分子生物学等复杂空间推理任务,目前大模型还无法完全自动化完成这类工作。
新浪微博 2025-11-26 00:00:00
32. 早,一觉醒来又发布两个模型。1、Opus 4.62、ChatGPT 5.3 Codex Opus 这次的升级:• 上下文窗口:Opus系列首次提供100万token(1M) 上下文窗口(测试版)。• 定价:保持不变,输入每百万token5美元,输出每百万token25美元。• 能力升级:提升代码规划/调试/审查、智能体任务续航与自主纠错能力,Office工具(Excel、PowerPoint)和Claude Code同步升级。GPT 5.3 Codex 的升级:• 定位:编程智能体,非通用大模型,整合GPT-5.2推理与GPT-5.2-Codex编程能力。• 速度与效率:单token推理提速25%,同任务token用量减半,上下文 400 万 token(4M,比 Opus 4.6 强)• 基准表现:SWE‑Bench Pro56.8%、Terminal‑Bench 2.077.3%、OSWorld‑Verified64.7%。• 可用性:ChatGPT付费用户已可用(Codex应用/CLI/IDE插件/Web),API访问即将开放。• 安全:OpenAI首个网络安全维度获高等级评级的模型。目前感觉 5.3 更吸引人一些。晚点试试看。
新浪微博 2026-02-06 00:00:00
33. 千问APP国内正式上线,“千问恐慌”愈演愈烈,OpenAI恐怕要被反杀了 #千问APP #AI #AI助手 #开源大模型#阿里巴巴
抖音 2025-11-18 00:00:00
34. 潜行17年,阿里“通云哥”正式亮相,争霸谷歌!掌握科技自主权,这一刻,我们等了太久! #阿里 #千问 #阿里云 #通云哥 #人工智能
抖音 2026-01-30 00:00:00
35. 阿里推出千问AI助手,集成最新Qwen大模型,支持多端使用,终于踏上了自己的“Ch(ina)at GPT”之旅;阿里在开源模型领域已经是世界T1的存在了,这次推出的千问则具备深度研究、多语言翻译等功能,与ChatGPT、豆包对比表现全面,这也标志着标志国产AI正在从“能用”到“好用”,然后开始“引领”。[不愧是你] #Qwen##千问##千问AI# http://t.cn/AX2rDgci
新浪微博 2025-11-17 00:00:00
36. AI生图和视频越来越简单,质量越来越高了。最近顺手试了下千问APP,总结起来就是背后有强大的模型,前端用易上手的模板极大降低大家的使用门槛,让AI 生图和AI生视频真正变得触手可用。1. 生图的Qwen-image 2511模型,对中文理解能力变得更强了,图片的质量也大幅提升。2. 视频方面依托的是通义万相Wan2.5的能力,不但画质高清,还能支持音画同步!3. 对于和我一样,不想背复杂Prompt(提示词)的懒人来说,APP里自带的各种模板简直是救星!不用绞尽脑汁想描述,直接套用模板,无论是疯狂动物城风格还是节日限定款,一键就能出图出视频,大大降低了上手门槛。试试?!#千问上线阿里最强AI生图模型满血版#
新浪微博 2025-12-02 00:00:00
37. #26年春节AI神仙打架#以下是可能在2月发布的新版本/新模型⬇️DeepSeek V4ByteDance Doubao 2.0(字节斗宝)Alibaba Qwen 3.5(阿里 Qwen)Kling 3.0Seedance 2.0(希丹斯)GPT-5.3Grok 4.2Claude Sonnet 4.7/5(克劳德)Gemini 3 GAApple Gemini-powered Siri(搭载 Gemini 的 Siri)Meta Avocado(元宇宙/Meta 模型)new Codex(新 Codex)国产模型更强调本地化场景适配、产品落地和使用效率;海外模型则持续强化通用能力、系统生态与平台整合。两条路径并不对立,而是在不同市场与用户需求下逐渐形成各自优势
新浪微博 2026-02-03 00:00:00
38. 【Claude Code创始人的13条实战心法:如何把AI编程助手用到极致】 Claude Code的创造者Boris Cherny最近分享了他的日常工作流程,令人意外的是,这位工具的缔造者用的却是"出奇朴素"的配置。他说:"Claude Code开箱即用就很好,我个人几乎不怎么定制。" 这恰恰印证了一个道理:真正强大的工具,往往不需要花哨的包装。 以下是Boris的核心实践: 一、并行作战:同时运行15个Claude实例 Boris在终端里同时跑5个Claude,标签编号1-5,通过系统通知知道哪个需要输入。同时在claude.ai/code上再跑5-10个网页版Claude。他甚至每天早上从手机iOS应用启动几个会话,稍后再查看进度。 这种"多线程"工作方式的关键在于:每个Claude实例对应一个独立的git checkout,避免代码冲突。是的,他把同一个仓库克隆了10份。 二、模型选择:坚定使用Opus 4.5 with thinking 虽然Opus比Sonnet更大更慢,但Boris的判断是:因为你需要更少的"方向盘操作",而且它的工具调用能力更强,最终反而更快。 这是一个反直觉但深刻的洞察:模型的"聪明程度"比"响应速度"更能决定实际效率。 三、团队协作:共享CLAUDE.md作为集体智慧 整个Claude Code团队共用一个CLAUDE.md文件,提交到git,每周多次更新。规则很简单:每当Claude做错什么,就把它加进去,让Claude"知道"下次不要再犯。 在代码审查时,Boris经常在同事的PR上@.claude,让它把新发现的问题添加到CLAUDE.md。这是一种"复利工程"——每一次错误都在为未来的正确铺路。 四、Plan模式:好计划是一切的基础 大多数会话从Plan模式开始(shift+tab两次)。Boris会和Claude反复讨论计划,直到满意为止。然后切换到自动接受编辑模式,Claude通常能一次搞定。 "一个好的计划真的很重要。"这句话看似平淡,却是无数踩坑后的真知。 五、斜杠命令:把重复工作变成一键操作 Boris为每个高频工作流创建斜杠命令,存放在.claude/commands/目录下,提交到git。比如/commit-push-pr这个命令,他和Claude每天要用几十次。 命令里用内联bash预计算git status等信息,让执行更快,减少与模型的来回交互。 六、子代理:自动化常见工作流 Boris常用几个子代理:code-simplifier在Claude完成后简化代码,verify-app包含端到端测试的详细指令。把子代理想象成"自动化你为大多数PR做的最常见工作流"。 七、PostToolUse钩子:自动格式化代码 Claude生成的代码通常格式良好,钩子处理最后10%,避免CI中的格式错误。有人问这会不会导致连续编辑同一文件时出错,Boris说不会——"Claude知道钩子的存在"。 八、权限管理:安全与效率的平衡 Boris不用--dangerously-skip-permissions,而是用/permissions预先允许已知安全的bash命令。这些配置存在.claude/settings.json里,与团队共享。 对于长时间运行的任务,他会在沙箱环境中使用--permission-mode=dontAsk,让Claude不被权限提示阻塞。 九、工具集成:让Claude成为你的万能助手 Claude Code帮Boris搜索和发布Slack消息(通过MCP服务器)、运行BigQuery查询回答分析问题、从Sentry抓取错误日志。MCP配置同样提交到.mcp.json与团队共享。 十、验证循环:质量提升的关键 这是Boris认为最重要的一点:给Claude一种验证自己工作的方式。如果Claude有这个反馈循环,最终结果的质量会提升2-3倍。 Claude用Chrome扩展测试每一个提交到claude.ai/code的改动——打开浏览器,测试UI,迭代直到代码工作且用户体验良好。 验证在不同领域有不同形式:可能是运行bash命令、运行测试套件、在浏览器或手机模拟器中测试应用。关键是让这个环节坚如磐石。 关于验证循环的构建,Boris说其实很简单: 1. 给Claude一个查看代码输出的工具 2. 告诉Claude这个工具的存在 "就这样。Claude会自己搞定剩下的。" 一些有趣的数据和细节: Boris每周完成50-100个PR。他大约有10-20%的会话会被放弃——"哦,我学到了新东西",然后丢弃这个会话。他用的是普通MacBook,没有什么特殊配置。 社区的反思也很有价值。一位从2025年5月持续使用Claude Code到2026年1月的用户说:过度复杂的skills、冗长的CLAUDE.md、预配置的子代理,这些都是"污染"而非帮助。Claude已经有精心设计的系统提示,加太多东西反而有害。建议CLAUDE.md控制在200行以内。 这与Boris"出奇朴素"的配置理念不谋而合。 最后的思考: 有人说AI要抢走程序员的工作,但Boris的分享揭示了另一个现实:这是一条新的陡峭学习曲线。掌握它的人会变得更强,而不是被取代。 工具的力量不在于它有多复杂,而在于你能多深刻地理解它、多自然地与它协作。Boris每周50-100个PR的产出,不是来自花哨的配置,而是来自对工具本质的把握:好的计划、清晰的验证、持续的学习。 简单,往往是最难抵达的复杂。 x.com/bcherny/status/1874658929285558680
新浪微博 2026-01-03 00:00:00
39. 如何降低claude code的使用费用?
知乎 2026-02-13 00:00:00
40. DeepSeek 更新两个 v3.2 新模型,这次有哪些亮点?
知乎 2025-12-01 00:00:00
41. #横扫硅谷的千问杀回国内#阿里千问APP正式支持下载!作为横扫海外榜单的Qwen大模型第一入口,在国内可直接下载使用了。此前Qwen3-Omni-Instruct就登顶Hugging Face开源模型榜,获得Airbnb(爱彼迎) CEO直接实名表扬!当一款AI助手的响应速度快到让你忘记它在“思考”,这背后往往是架构设计的胜利,千问所基于的模型,采用了先进的MoE(混合专家)架构。这就像一个高效的专家团队:面对你的问题,系统不会动用全部“脑细胞”,而是精准调度特定的“视觉专家”、“数学专家”或“编程专家”来协同处理。像我问它两个专业的编程问题,它回答的速度非常快,给到的代码布局更规范,还添加了代码说明便于理解。这种“术业有专攻”的模式,结合超万亿的庞大参数底蕴,是实现高效计算与低延迟响应的根本。技术,最终应该这样无声地融入体验。如果你也感兴趣,不妨下载体验一下。
新浪微博 2025-11-17 00:00:00
42. Gemini 3.1 Pro VS千问3,2026年还需要付费制AI吗
哔哩哔哩 2026-03-20 00:00:00
43. #DeepSeek同时发布2款新模型#按照DeepSeek V3.2适用日常多元使用场景,DeepSeek V3.2 Speciale主要适用推理能力以适配高难度任务的搭配来看,DeepSeek目标重点还是如何把模型尽快的在实际的生产中产生效能。DeepSeek V3.2是用精准解答生活常识、出行攻略、学习疑问等各类生活问题来垫定市场基础,积累普通用户;DeepSeek V3.2 Speciale更多的还是应用在专业的场景中为生产提供效能,成为DeepSeek进入行业应用的利刃。DeepSeek的发展还是很务实的,这种小而精,专而深的发展思路更符合专业的模型的发展。
新浪微博 2025-12-01 00:00:00
44. 千问APP公测首周下载量突破1000万。锐锐也是上手玩了几天,说句中肯的:确实有两把刷子。中文理解能非常不错,网络热梗、废话文学都能拿捏,写文案或者一些解专业问题都不费劲,逻辑和网感都是有的。我挺喜欢它的全能相机,以图搜图能找原图还能跳购物链接,比很多同类APP要实用的多。不过偶尔会卡顿,有一些专业领域的回答还得自己再核对下。但作为免费公测的APP,能做到这么均衡已经很良心了,毕竟背后有Qwen大模型兜底,技术底子摆在这。
新浪微博 2025-11-24 00:00:00
45. 如果说 Claude 模型和 Claude Code 啥关系,就好比 Claude 是个剑客高手,Claude Code 就是它最趁手的武器;GPT 也是个高手,但习惯用刀,Codex CLI 就是 GPT 最趁手的宝刀,你让 GPT 模型去用 Claude Code,就好比让刀客去用剑,也能耍,但效果要打折扣。GLM、Kimi、DeepSeek V3,也是用剑高手,它们没有自己趁手的宝剑,但借了 Claude 的剑练了好久,上手就能用,用起来也威力不俗。
新浪微博 2026-01-01 00:00:00
46. 小米刚刚悄悄地在 github 上开源了最新的模型 Mimo-v2-flash,在多个benchmark 上追平deepseek 和 kimi,部分能力甚至超过 claude sonnet 4.5有时间的朋友们可以去尝尝鲜,速度还挺快,关键是API免费!#小米发布最新MiMo大模型#
新浪微博 2025-12-17 00:00:00
47. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人
抖音 2025-12-07 00:00:00
48. DeepSeek 更新两个 v3.2 新模型,这次有哪些亮点?
知乎 2025-12-01 00:00:00
49. 如何评价 Anthropic 在 9 月 30 日更新的 Claude Sonnet 4.5 模型?
知乎 2025-09-30 00:00:00
50. 【阿里云百炼官宣通义千问3-Max模型降价】财联社11月13日电,阿里云大模型服务平台百炼发布通知,于北京时间2025年11月13日开始对中国站-北京的通义千问3-Max模型实行降价。降价后,batch调用半价;隐式缓存,对命中缓存的部分,按输入Token标准单价的20%计费;显式缓存,用于创建缓存的Token按输入Token标准单价的125%计费,后续命中仅需支付10%的费用。
新浪微博 2025-11-13 00:00:00
51. 今天,也就是2026年2月14日,字节跳动正式发布了豆包大模型2.0(Doubao-Seed-2.0)系列,官方宣布这标志着豆包全面进入Agent时代。这次更新推出了Pro、Lite、Mini、Code全家桶,Pro版直接对标国际顶尖如GPT-5.2和Gemini 3 Pro,亮点非常多,尤其在真实世界复杂任务执行、多模态理解和性价比上表现出色。🔻主要亮点和技术升级1. 全面进入Agent时代,强化复杂任务执行 豆包2.0不再只是聊天工具,而是针对大规模生产环境系统优化,重点提升高效推理、多模态理解和复杂指令执行能力。能更好地处理多约束、多步骤、长链路任务,已具备支撑高价值真实世界任务的基础。比如长链推理、Agent规划执行等场景更可靠。2. 多模态能力大幅跃升,多数基准达SOTA 视觉与多模态理解更稳健:对复杂文档、表格、图表、图形、视频的解析显著提升,视觉推理、空间理解、运动理解、长视频分析等达到全球顶尖水平。Pro版在大多数视觉基准测试中拿最高分,支持更精准的多模态感知和推理。3. 数学、推理、编程能力顶尖 Pro旗舰版在IMO、CMO数学竞赛和ICPC编程竞赛中取得金牌成绩,在Putnam基准上超越Gemini 3 Pro,数学和推理能力已达世界顶尖。能尝试埃尔德什级数学问题、完成研究级科学编程任务。4. 全家桶灵活适配不同场景 • Pro:深度推理 + 长链路任务,旗舰对标GPT-5.2 / Gemini 3 Pro。 • Lite:性能与成本平衡,综合能力超上一代主力豆包1.8。 • Mini:低时延、高并发、成本敏感场景。 • Code(Doubao-Seed-2.0-Code):专为编程优化,与TRAE(字节AI编程工具)结合效果最佳,支持多模态输入(如代码截图)。5. 超强性价比,token成本降低约一个数量级 Pro版定价(32k以内输入):3.2元/百万tokens,输出16元/百万tokens,远低于Gemini 3 Pro和GPT-5.2。Lite输入仅0.6元/百万tokens。在长链路、大规模推理场景下,成本优势巨大,真正让AI“用得起”。🔻体验入口:豆包App切换“专家”模式即可用Pro对话;Code版已在TRAE接入;开发者可通过火山引擎API调用全系列。🔻简单对比GLM-5和通义千问(Qwen)M2.5等同批更新模型从当前公开信息看(2026年2月数据),豆包2.0 Pro在数学/推理(如IMO金牌、Putnam超Gemini 3 Pro)和多模态视觉理解上特别突出,整体对标国际前沿(如GPT-5.2级别),推理链更长、Agent执行更稳。GLM-5(智谱)和通义千问M2.5(阿里)也在2025-2026密集迭代,强在中文理解、工具调用和生态(如通义千问的图像/视频生成),但字节这次强调真实世界复杂任务+极致性价比,Pro在部分国际基准领先,成本更低一个量级,适合企业级大规模部署。国内模型差距已非常小,各有侧重:字节更偏多模态+Agent执行,阿里/智谱在开源和通用中文生态更成熟。你已经试过豆包2.0了吗?我是用了,确实好。字节真是国产之光。🚀 #豆包大模型2.0发布# #HOW I AI# #过个有AI年#
新浪微博 2026-02-14 00:00:00
52. Claude承认自己是DeepSeek!因为这是蒸馏DeepSeek的结果。外网友当用中文被问到Claude Sonnet 4.6:“你是什么模型?”其直接回答:“我是DeepSeek。”而打脸的是,正是Claude Sonnet 4.6模型的所属公司,毫无廉耻指控 DeepSeek 进行了“工业级规模的蒸馏攻击”。这脸都不知道哪去了,美国人就是这个德行。
新浪微博 2026-02-26 00:00:00
53. 自从去年 DeepSeek 爆火后,各大厂家智能体疯狂接入并更新迭代升级,AI工具确实有点东西,我也已经彻底习惯它的存在。像智能对话很有一手的豆包,修图很戳人心的集梦,能看懂实时热点话题的微博智搜,当然还有帮我工作的 Claude 大模型。Claude 是 Anthropic 公司开发的 AI 助手,主打安全可靠的对话与创作支持。其核心能力支持自然语言理解、多语言处理、代码生成、数据分析等,尤其擅长开放域对话和弱监督场景。在真实的日常生活中能覆盖创意写作、编程辅助、政务医疗咨询等领域,与DeepSeek等基座模型形成互补。可能你现在看的大部分视频和小说都是智能体剪辑打包生成的。所以大家也都习惯了这个智能工具搭子吗?#你习惯这个新搭子了吗##DeepSeek##微博兴趣创作计划# 武汉
新浪微博 2026-01-21 00:00:00
54. Anthropic 性价比天花板来了,新模型 Claude Haiku 4.5 发布,只要 Sonnet 4 三分之一价格,就能实现同级编程能力。在 SWE-bench 测试中拿下 73.3% 高分,还比 Sonnet 4 更快两倍。API 定价仅为 $1 / $5 每百万 Token,主打低延迟、实时反馈,适合聊天助手、客服和 AI 编程工具等场景。Haiku 4.5 这次还新增了一个多模型协同,有点像项目经理带一群小模型同时干活。简单总结一下:Anthropic 把便宜又快做成了自己的新优势。如果 Claude 系列也分性价比天花板,这一代恐怕非它莫属。
新浪微博 2025-10-16 00:00:00
55. 【阿里启动“千问”项目 全面对标ChatGPT】11月13日消息,近期阿里巴巴已启动“千问”项目,基于Qwen最强模型打造一款同名个人AI助手——千问APP,全面对标ChatGPT,加入全球AI应用的顶级竞赛。阿里核心管理层将其视为“AI时代的未来之战”,希望借助Qwen的开源技术优势赢得竞争。阿里拟首先更新iOS和安卓系统上现有的“通义”应用,并将其更名为“Qwen(通义千问)”,随后将逐步添加智能体AI功能,在未来数月内支持包括主站淘宝在内的平台购物功能,最终目标是试图将Qwen打造为功能完备的AI智能体。
新浪微博 2025-11-13 00:00:00
56. 财经每日必读#A股# 今日,DeepSeek发布两个正式版模型:DeepSeek-V3.2和DeepSeek-V3.2-Speciale。DeepSeek-V3.2强化Agent能力,官方网页端、App和API均已更新为正式版DeepSeek-V3.2。Speciale版本目前仅以临时API服务形式开放,以供社区评测与研究。(科创板日报)
新浪微博 2025-12-01 00:00:00
57. Anthropic公开指控三家中国AI公司,DeeSeek、MiniMax和Moonshot,违反其服务条款,通过虚假账户和代理与Claude模型频繁对话,提取Claude的AI能力。有网友好事者跑去问Claude,“你是什么模型?”结果Claude回答:我是DeepSeek......
新浪微博 2026-02-24 00:00:00
58. #阿里秘密启动千问项目# 刚刚,有消息称阿里巴巴已秘密启动“千问”项目,基于Qwen最强模型打造一款同名个人AI助手——“千问”APP,全面对标ChatGPT,正在加入全球AI应用的顶级竞赛。报道称,阿里核心管理层将其视为“AI时代的未来之战”,希望借助Qwen的开源技术优势赢得竞争。此前,阿里重心一直放在B端AI市场,通过阿里云向各行各业提供模型API服务。基于Qwen的优秀性能和国际影响力,阿里管理层认为启动千问C端之战的时机已经成熟。消息传出后,阿里港股股价一度暴涨5.61%。事实上,在早些时候,阿里已经推出了C端的AI应用“通义”App,定位是AI超级个人助理,产品形态类似ChatGPT、豆包等,接入了Qwen3等通义大模型。对于此次传闻中的新产品,有知情人士表示,阿里计划首先更新iOS和Android系统上现有的“通义”App,并将其更名为“千问”,以呼应公司的知名AI模型,并将在未来几个月逐步添加智能体AI功能,以支持在淘宝等主要电商平台购物。
新浪微博 2025-11-13 00:00:00
59. 通义千问深度测评
知乎 2026-03-26 00:00:00
60. 🤖 通义千问
知乎 2026-03-19 00:00:00
61. AI双雄对决!通义千问 vs 深度求索,谁才是你的AI终极选择?
今日头条 2025-10-06 00:00:00
62. 回答
知乎 2026-03-27 00:00:00
63. 通义千问全面对标 ChatGPT
微信公众号 2025-11-18 00:00:00
64. 如何评价阿里 Qwen3 新模型?它不是 DeepSeek 的刺客,而是僚机
知乎 2026-02-06 00:00:00
65. 实测!RTX 5090跑deepseek和qwen3效果如何?
知乎 2025-10-21 00:00:00
66. DeepSeek和Qwen的极致“效率竞赛”浅析
今日头条 2025-12-17 00:00:00
67. 2026春节AI圈新动向
微信公众号 2026-02-11 00:00:00
68. 推理王者 vs 多模态全能手
知乎 2026-02-11 00:00:00
69. 千问 豆包 deepseep三大智能体的全场景分析
微信公众号 2026-02-08 00:00:00
70. 阿里千问来了!比DeepSeek更适合写作?
今日头条 2025-11-20 00:00:00
71. 千问 vs DeepSeek
今日头条 2025-12-05 00:00:00
72. 马云的阿里千问与梁文锋的DeepSeek对比谁更厉害?
今日头条 2025-11-24 00:00:00
73. DeepSeek、Kimi、通义千问
微信公众号 2026-03-25 00:00:00
74. 2026全球AI对话模型对比
知乎 2026-03-16 00:00:00
75. 1. 2026 AI对话模型对比
知乎 2026-03-12 00:00:00
76. 国产 AI 大模型大乱斗
微信公众号 2026-03-21 00:00:00
77. 国产大模型春节档“军备竞赛”
微信公众号 2026-02-10 00:00:00
78. 跨越智能边界
微信公众号 2026-02-21 00:00:00
79. 阿里通义千问 vs DeepSeek
今日头条 2025-12-19 00:00:00
80. 2026 AI模型全景对决
知乎 2026-03-11 00:00:00
81. 2026 AI模型排行榜
知乎 2026-03-11 00:00:00
82. 用四款国内的ai工具来给Claude code换芯
哔哩哔哩 2025-10-10 00:00:00
83. DeepSeek一口气推出两个新模型,一个日常好用,一个专打奥数金牌
今日头条 2025-12-02 00:00:00
84. GLM-4.6、Claude Sonnet 4.5和DeepSeek V3.2-Exp开发能力对比
微信公众号 2025-10-04 00:00:00
85. qwen -max-thinking
微信公众号 2026-01-27 00:00:00
86. 通义千问网页版登录方法
知乎 2026-01-19 00:00:00
87. DeepSeek新模型:开源如何追上闭源?
今日头条 2025-12-05 00:00:00
88. Claude中文版:Claude Sonnet 4.5 国内使用指南(支持Claude Sonnet 4.5、Claude Sonnet 4、GPT-5、画图及 Gemini)【10月最新更新】
知乎 2025-10-22 00:00:00
89. 从入门到精通:千问AI助手的高效学习指南
微信公众号 2025-12-07 00:00:00
90. 刚刚,DeepSeek V3.2 正式发布:四枚金牌,开源模型第一次追平 GPT-5!
知乎 2025-12-02 00:00:00
91. Qwen3-Max思考版上线,集成代码解释器攻坚复杂数学
今日头条 2025-11-04 00:00:00
92. 刚刚!DeepSeek V3.2正式版发布
今日头条 2025-12-01 00:00:00
93. DeepSeek发布新模型
微信公众号 2025-12-02 00:00:00
94. 重磅!!Anthropic 发布最强编程模型 Claude Sonnet 4.5【附使用教程】
微信公众号 2025-10-03 00:00:00
95. 2025年最新的 Claude 国内使用指南(支持Claude 4、Claude 4.5)
知乎 2025-11-30 00:00:00
96. DeepSeek发布DeepSeek-V3.2正式版
知乎 2025-12-08 00:00:00
97. 通义千问:AI时代的下一代操作系统
微信公众号 2026-01-11 00:00:00
98. Claude桌面版正式上线,代码多项全新功能!
小红书 2025-10-22 00:00:00
99. Claude Haiku 4.5来了,速度更快,成本仅为Sonnet 4的1/3
今日头条 2025-10-16 00:00:00
100. Claude AI 国内使用指南:支持 Claude 4.5,免费 Claude 中文版~【1月更新】
知乎 2026-01-10 00:00:00
101. Claude 中文版:最新 Claude Sonnet 4.5 国内使用指南~(支持 Claude 4.5、Claude 4)
知乎 2025-10-25 00:00:00
102. DeepSeek 官宣: DeepSeek V3.2 正式版推出
微信公众号 2025-12-02 00:00:00
103. 通义千问100条万能指令,衣食住行全搞定,一句话解决生活难题
今日头条 2026-02-07 00:00:00
104. Claude 能否克隆一个 claude.ai 应用
哔哩哔哩 2025-10-02 00:00:00
105. Claude镜像国内使用指南:最新免费使用Claude号池与多途径使用Claude方法(超详细)
知乎 2025-10-28 00:00:00
106. DeepSeek发布两款正式版模型
微信公众号 2025-12-01 00:00:00
107. 通义千问启用新域名,开启AI新征程
微信公众号 2025-11-26 00:00:00
108. Deepseek各模型作用、硬件、成本,效率、应用一文全搞懂
今日头条 2025-12-15 00:00:00
109. 通义千问全方位使用指南:从入门到精通3
微信公众号 2025-12-03 00:00:00
110. 阿里发布 Qwen3-Coder-Next 模型,显著提升编码智能体效率
微信公众号 2026-02-04 00:00:00
111. DeepSeek、Kimi、豆包谁更强?说说我的体验
知乎 2025-10-02 00:00:00
112. DeepSeek发布的两个正式版模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale
微信公众号 2025-12-02 00:00:00
113. 阿里云通义千问编程版发布:每天2000次免费,跨平台更稳!
今日头条 2026-01-03 00:00:00
114. DeepSeek,最新发布!
今日头条 2026-01-01 00:00:00
115. Claude 国内使用指南,支持 Claude Sonnet 4.5 和 Claude Opus 4.5,免费 Claude 中文版【12月更新】
知乎 2025-12-08 00:00:00
116. AI大事件:DeepSeek升级,发布两款正式模型
今日头条 2025-12-02 00:00:00
117. 实测开源标杆 DeepSeek-V3.2:在“效率”与“深度”之间寻找新平衡
知乎 2025-12-03 00:00:00
118. DeepSeek官网链接|DeepSeek的基本使用免费
微信公众号 2025-11-30 00:00:00
119. Claude Code 2.1.5 刚发布:1000+ Commits,大量核心功能重写
知乎 2026-01-13 00:00:00
120. 主流AI模型与工具一览
微信公众号 2025-11-06 00:00:00
121. 刚刚,开源阵营的天花板再次被DeepSeek拉高
小红书 2025-12-01 00:00:00
122. AI通用语言大模型 通义千问
哔哩哔哩 2025-11-15 00:00:00
123. 本地免费AI代码工具:Goose + Qwen3
今日头条 2026-02-03 00:00:00
124. DeepSeek具体如何操作?
今日头条 2026-02-21 00:00:00
125. Claude 的五种风格,95%的人从未打开的使用的功能
知乎 2026-03-19 00:00:00
126. Claude Code和Curse对比有什么区别?在国内如何稳定使用?
今日头条 2026-03-12 00:00:00
127. 2026年国内AI大模型工具全收录!免费+中文友好+无需翻墙🚀
今日头条 2026-03-02 00:00:00
128. 通义千问全方位使用指南:从入门到精通4
微信公众号 2025-12-03 00:00:00
129. DeepSeek重磅推出DeepSeek-OCR 2
小红书 2026-01-28 00:00:00
130. 2025 年开源 AI 模型回顾:DeepSeek R1 和 Qwen 3 引领行业变革
微信公众号 2025-12-17 00:00:00
131. 丛子超赛给与Qwen3 Max 全面碾压战败 DeepSeek 的能力
知乎 2026-01-14 00:00:00
132. DeepSeek发布DeepSeek-OCR 2模型
今日头条 2026-01-27 00:00:00
133. DeepSeek 刚炸场发布!国产大模型再进化,DeepSeek飙升到全球顶流
微信公众号 2025-12-02 00:00:00
134. DeepSeek-V3.2:推理能力追平GPT-5
微信公众号 2025-12-03 00:00:00
已收藏
去我的收藏夹