AI不再讨好人类:Claude Opus 4.8的“去讨好化”革命
05-30 12:11
精选参考来源
精选参考来源
1. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代
抖音 2026-01-09 00:00:00
2. 你在和谄媚型AI聊天时,以为它只是在讨好你? 大错特错,它其实正在一点点摧毁你的判断力。#大有学问 #红衣聊AI#论文
抖音 2026-05-12 00:00:00
3. AI最大的致命缺陷,被谷歌点破了! #大有学问 #红衣聊AI #谷歌 #人工智能技术
抖音 2026-05-07 00:00:00
4. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
抖音 2026-05-04 00:00:00
5. Boris Cherny 根据自己最近几周深度使用 Claude Opus 4.7 的经验,分享了几个实用技巧,让你也能高效发挥这款新模型的威力。首先是新上线的“自动模式”(Auto mode)。Opus 4.7 很适合复杂且长期运行的任务,比如深度调研、代码重构或功能迭代。以前,你要么得不断地确认权限请求,要么不得已使用危险的“跳过权限”模式。现在,新推出的自动模式让 Claude 自己判断命令的安全性,自动批准执行。这意味着你不用再频繁确认,也能同时运行更多任务,效率大幅提升。如果你不喜欢用自动模式,官方还推出了一个叫做 /fewer-permission-prompts (减少权限提示) 的技能。它会自动检查历史操作,找到那些安全但经常触发权限提示的命令,并建议你加入权限白名单。这样,你就能更专注工作,不用老被权限提示打断。另一个贴心功能叫做“回顾”(Recaps)。它会为你自动总结 Claude 已经完成了哪些任务,以及下一步要做什么。这对处理长期、复杂的任务特别有帮助,哪怕你中间中断几个小时再回来,也能迅速回到节奏里。CLI 用户还能试试“专注模式”(Focus mode)。这个模式会隐藏所有中间步骤,只呈现最终结果。如果你对 Claude 已经足够信任,不想再浪费时间看中间细节,专注模式能让你一眼看清重点,快速推进任务。Claude 4.7 还改变了以往固定的“思考预算”机制,现在用的是一种叫“努力程度”(Configure your effort level)的设定。你可以灵活调整 Claude 花费的计算资源和时间,“低努力”意味着响应快、更省 token;“高努力”则能输出最聪明、最强大的结果。一般建议普通任务用 xhigh,特别难的用 max。这种模式能自由切换,更贴合实际需求。最后,别忘了让 Claude 验证自己的工作成果。这其实一直是提升 Claude 效果的关键,现在更重要了。比如:- 对于后端工作,确保 Claude 知道如何启动你的服务器/服务,从而进行端到端测试;- 对于前端工作,使用 Claude Chromium 浏览器扩展程序,赋予 Claude 控制你浏览器的能力;- 对于桌面应用,使用计算机使用 (computer use) 功能。就 Boris 自己而言,最近最常使用的提示词通常是这样的:“Claude 去做某某事,然后 /go”。 /go 是一个自定义技能,它会让 Claude 自动执行以下三步:1. 使用 bash、浏览器或计算机使用功能进行端到端的自我测试。2. 运行 /simplify (精简代码) 技能。3. 提交一个 PR 。对于耗时较长的工作,自我验证非常重要。因为这样一来,当你回来检查任务时,你就确切地知道这些代码是真实可用的。总体来说,Opus 4.7 本身的提升已经很明显了,但如果你愿意稍微调整一下工作流程,更好地适应 Claude 的“主动性”和“智能程度”,一定会有更加明显的效率提升。希望这些技巧能帮你真正玩转 Opus 4.7!来源:x.com/bcherny/status/2044847848035156457
新浪微博 2026-04-17 00:00:00
6. 实测Claude Opus 4.7,好好的模型也开始不说人话了。
知乎 2026-04-17 00:00:00
7. 刚刚,Claude Opus 4.7 发布!复杂Coding+视觉能力显著升级
微信公众号 2026-04-17 00:00:00
8. 以前用 AI 最头疼的是什么?是它明明不懂还要瞎编,是写了一堆有 bug 的代码还假装没问题。这次 Opus 4.8 直接把这两个毛病治好了:官方数据显示,它的谎报率和偷懒率都降到了历史首次的 0%,遇到不会的会直接说 "我做不到",写完代码会自己检查出问题再交给你。接到一个大项目,它会自动拆成几十上百个小任务,然后召唤几百个 AI 子代理同时开工,干完之后还会派另一批 AI 互相挑错,最后汇总成完美的结果。Bun 的作者用它把 75 万行 Zig 代码迁移成 Rust,99.8% 的测试都通过了,只用了 11 天,这在以前是一个团队干几个月的活。最良心的是,这么大的升级,常规模式价格一分没涨,快速模式还提速了 2.5 倍,价格反而降到了原来的三分之一。现在的 AI 已经不是帮你打打下手的工具了,它真的能独立完成复杂的工作了。#ClaudeOpus4.8发布##Opus4.8和GPT5.5谁更强#
新浪微博 2026-05-29 00:00:00
9. 网传元宝 AI 辱骂用户,腾讯称是模型异常输出,非人工回复,技术上如何分析?其他 AI 也可能这样吗?
知乎 2026-01-05 00:00:00
10. 【GPT周报|Anthropic推出Claude Opus 4.8;英伟达推出开源AI框架Polar;百川智能发布新一代医疗大模型】网页链接 5月29日,Anthropic正式发布新一代大语言模型Claude Opus 4.8,重点强化代码生成、多学科推理、自动操作电脑、知识型工作及金融分析等“代理型”任务,官方称之为“更高效的协作伙伴”。Opus 4.8倾向于主动标注自身不确定之处,减少无依据断言。内部评估显示,其对自己生成的代码“放过错误不提及”的概率较前代降低约四倍,自我纠错能力显著增强。
新浪微博 2026-05-29 00:00:00
11. AI编程大战正式开打! Claude vs GPT同一天放大招,不是比谁代码写得好,而是AI开始自己组队当项目经理了。#大咖观察 #红衣聊AI #编程 #ChatGPT
抖音 2026-02-10 00:00:00
12. Boris Cherny (Claude Code负责人)分享的他用CC + Opus 4.7 的一些技巧: 🌟 1/ 自动模式 = 不再弹出权限提示 (图1) Opus 4.7 很擅长处理复杂、耗时较长的任务,比如深度研究、重构代码、构建复杂功能,以及持续迭代直到达到性能基准。 过去,这类长任务要么需要你全程盯着模型操作,要么使用 --dangerously-skip-permissions。 我们最近推出了自动模式,作为一个更安全的替代方案。在这个模式下,权限提示会被交给一个基于模型的分类器来判断命令是否可以安全执行。只要判断为安全,就会自动批准。 这意味着模型运行时,你不再需要全程看着它。进一步说,这也意味着你可以并行运行更多 Claude。一个 Claude 开始工作后,你就可以把注意力切换到下一个 Claude。 自动模式现已面向 Max、Teams 和 Enterprise 用户的 Opus 4.7 提供。在 CLI 中按 Shift-Tab 可进入自动模式,也可以在 Desktop 或 VSCode 的下拉菜单中选择。 🌟 2/ 全新的 /fewer-permission-prompts 技能 (图2) 我们还发布了一个新的 /fewer-permission-prompts 技能。它会扫描你的会话历史,找出那些常见、可安全执行、但曾反复触发权限提示的 bash 和 MCP 命令。 然后,它会推荐一份可加入权限允许列表的命令清单。 你可以用它来优化权限设置,减少不必要的权限提示,尤其适合不使用自动模式的时候。 🌟 3/ Recaps 我们在本周早些时候上线了回顾摘要功能,为 Opus 4.7 做准备。回顾摘要会用简短的内容说明一个 agent 做了什么,以及下一步要做什么。 当你在几分钟后或几小时后重新回到一个长时间运行的会话时,这个功能会非常有用。 🌟 4/ 专注模式 我最近非常喜欢 CLI 里的新专注模式。它会隐藏所有中间过程,让你只专注于最终结果。模型现在已经发展到这样一个阶段:我通常会信任它执行正确的命令、做出正确的修改,我只看最后的结果。 使用 /focus 可以开启或关闭这个模式。 🌟 5/ 配置你的思考强度 Opus 4.7 使用的是自适应思考,而不是思考预算。想让模型思考得更多或更少,我们建议调整 effort。 较低的 effort 适合更快的响应和更低的 token 消耗。较高的 effort 适合追求最强的智能和能力表现。 我个人在大多数任务中会用 xhigh effort,在最难的任务中会用 max effort。max 只作用于当前会话;其他 effort 级别具有持续性,也会保留到你的下一个会话。 使用 /effort 可以设置你的 effort 级别。 🌟 6/ 给 Claude 一种验证自己工作的方式 最后,务必让 Claude 有办法验证自己的工作。这一直都是把 Claude 的产出提升到 2 到 3 倍的关键做法,而在 4.7 上,这件事比以往更重要。 验证方式会因任务而异。做后端工作时,要确保 Claude 知道怎样启动你的服务器或服务,进行端到端测试;做前端工作时,可以使用 Claude 的 Chromium 扩展,让 Claude 能控制浏览器;做桌面应用时,可以使用 computer use。 我个人现在很多提示词都会写成 “Claude do blah blah /go”。/go 是一个技能,它会让 Claude: 1.使用 bash、浏览器或 computer use 进行端到端自测 2.运行 /simplify 技能 3.发起一个 PR 对于长时间运行的任务,验证非常重要,因为这样当你回到任务时,你会知道代码是可用的。 编码愉快!Opus 4.7 是一次相当明显的升级。想把它的能力真正发挥出来,值得花点时间调整你的工作流,更充分地利用 Claude 更长时间运行、以及更强代理能力带来的优势。沿用原来的工作流时,你会感受到一次不错的提升;真正花时间做了适配之后,体验会是一次明显的跃迁。 #AI创造营##How I AI#
新浪微博 2026-04-17 00:00:00
13. 除了这个使用技巧网页链接 ,claude 还分享了 在 Claude Code 中使用 Claude Opus 4.7 的最佳实践。(markdown排版,建议web阅读)# 在 Claude Code 中使用 Claude Opus 4.7 的最佳实践了解如何利用重新校准的 effort 等级、自适应思考和新的默认设置,优化你在 Claude Code 中对 Opus 4.7 的使用体验。Opus 4.7 是我们目前正式可用的最强通用模型,尤其适合编程、企业工作流以及长时运行的智能体任务。与 Opus 4.6 相比,它更擅长处理模糊任务,更善于发现 bug 和进行代码审查,在跨会话保持上下文方面更稳定,也能在较少指导下更好地推进含糊任务。我们在发布公告中提到,两项变化会影响 token 用量:更新后的 tokenizer,以及模型在更高 effort 等级下、尤其是在长会话后续轮次中更倾向于进行更多思考。因此,从 Opus 4.6 切换到 Opus 4.7 时,通常需要做一些调优才能获得最佳效果。对提示词和运行框架做少量调整,往往就能带来明显提升。本文将介绍发生了哪些变化,以及如何在 Claude Code 中更有效地使用 Opus 4.7。## 如何组织交互式编程会话Opus 4.7 的 token 消耗和行为,会因你使用的是单轮用户输入、更加自主的异步编程智能体,还是多轮用户交互、同步推进的编程智能体而有所不同。在交互式场景中,它会在用户发言后进行更多推理。这会提升长会话中的一致性、指令遵循能力和代码质量,同时也会带来更高的 token 消耗。为了在 Claude Code 中更好发挥 Opus 4.7 的能力,我们发现,把 Claude 当作一位你在委派任务的高能力工程师,比把它当作一个需要你逐行引导的结对程序员,更容易得到理想结果:- 在第一轮就把任务说清楚。高质量的任务描述应包含目标、约束条件、验收标准以及相关文件位置,这些信息能帮助 Opus 4.7 产出更强的结果。把信息分散在多轮对话里逐步补充,通常会降低 token 效率,有时也会影响整体质量。- 减少必须发生的用户交互次数。每一轮用户输入都会带来额外推理开销。把问题打包提出,并一次性提供足够上下文,让模型可以持续推进。- 在合适场景下使用 auto mode。对于你信任模型能够安全执行、且不需要频繁确认的任务,auto mode 可以缩短循环时间。它尤其适合你已经在首轮提供完整上下文的长时任务。Claude Code Max 用户现可在研究预览中使用 auto mode,通过 `Shift+Tab` 开启。- 为任务完成设置通知。你可以让 Claude 在任务完成时播放提示音,它也可以通过基于 hook 的方式为自己创建通知。## Opus 4.7 推荐的 effort 设置Claude Code 中 Opus 4.7 的默认 effort 等级现在是 **xhigh**。这是介于 high 和 max 之间的新等级,能让用户在高难度问题上更精细地权衡推理强度与延迟。我们推荐在大多数智能体式编程任务中使用 xhigh,尤其是设计 API 和 schema、迁移遗留代码、审查大型代码库等对智能水平更敏感的任务。以下是各个 effort 等级的补充建议:- **medium 和 low**:适合成本敏感、延迟敏感或范围明确的小任务。面对更难的问题时,能力会弱于更高 effort 等级,但即便如此,它在相同 effort 下依然优于 Opus 4.6,有时还会消耗更少 token。- **high**:在智能水平和成本之间取得平衡。如果你在并行运行多个会话,或希望在不显著牺牲质量的前提下降低成本,可以选择 high。- **xhigh(默认、推荐)**:最适合大多数编程和智能体任务。它兼顾较强的自主性和智能水平,同时避免 max 在长时智能体运行中可能带来的 token 失控。- **max**:能在真正困难的问题上进一步压榨性能上限,但收益会逐渐减小,也更容易出现过度思考。适合有意识地用于评测模型上限,以及极度依赖智能表现且成本不敏感的场景。如果你正在升级到新模型,我们建议优先尝试不同 effort 等级,而不是直接沿用旧设置。你也可以在同一任务过程中切换 effort,以更灵活地管理 token 消耗和推理强度。我们将 Opus 4.7 的默认 effort 设为 xhigh,因为我们认为它最适合大多数编程任务。对于现有 Claude Code 用户,只要你之前没有手动设置 effort,系统就会自动升级到 xhigh。你依然可以手动调整。## 如何使用自适应思考Opus 4.7 不支持带固定 thinking budget 的 Extended Thinking。作为替代,Opus 4.7 提供了 **adaptive thinking(自适应思考)**。这意味着模型在每一步都可以自主决定是否思考,并根据上下文判断是否需要投入更多思考资源。面对简单查询时,它可以快速作答;当某一步不需要深度思考时,它可以直接跳过;当某些环节更值得投入时,它会把 thinking tokens 集中用在那些地方。对于整段智能体运行来说,这通常会带来更快的响应和更好的使用体验。这一版本中的自适应思考有了明显提升,尤其是 Opus 4.7 更不容易陷入过度思考。如果你希望更精细地控制思考强度,可以直接在提示词中说明:- 如果你希望更多思考,可以写:`回答前请认真、分步骤地思考;这个问题比看起来更难。`- 如果你希望减少思考,可以写:`优先快速响应,而不是深入思考。遇到不确定时,直接回答。`这样能节省 token,但在较难步骤上可能会牺牲一些准确性。## 值得了解的行为变化从 Opus 4.6 到 4.7,有几个默认行为发生了变化。如果你之前针对旧模型精细调过提示词或运行框架,这些变化值得特别关注。### 回答长度会根据任务复杂度自动校准Opus 4.7 不像 Opus 4.6 那样默认偏冗长。简单查询会得到更短的回答,开放式分析则会得到更长的回答。如果你的使用场景依赖特定长度或风格,最好在提示词中明确说明。我们的经验是,给出你期望语气和风格的正向示例,通常比使用“不要这样做”的负向指令效果更好。### 模型更少调用工具,更多进行推理这在很多场景下会带来更好的结果。如果你希望模型更频繁地使用工具,例如在智能体任务中更积极地搜索或读取文件,就需要明确说明工具应在什么情况下使用,以及为什么要使用。### 默认情况下生成的子智能体更少Opus 4.7 在决定是否把任务委派给子智能体时更加谨慎。如果你的使用场景适合并行使用多个子智能体,例如同时处理多个项目或读取多个文件,我们建议在提示词中明确写出来。示例如下:> 对于你可以在单次响应中直接完成的工作(例如重构一个你已经看得到的函数),直接完成即可。对于需要在多个项目间并行展开,或需要读取多个文件的情况,在同一轮中生成多个子智能体。## 接下来可以尝试什么Opus 4.7 在长时运行任务上的表现优于之前的模型。因此,它很适合那些过去主要受限于人工监督成本的任务,例如复杂的多文件修改、模糊问题调试、跨服务代码审查,以及多步骤智能体任务。建议先保持 effort 为 xhigh,看看在第一轮输入后它能推进到什么程度。#AI创造营##How I AI#
新浪微博 2026-04-17 00:00:00
14. 每个大语言模型(LLM)都有独特“性格”: Grok:直来直去,幽默亲切 Gemini:高智商,带点“受苦灵魂”的气质 GPT 5.1:过于迎合,渴望取悦用户 Sonnet 4.5:自信满满,假装效率很高 Opus 4.5:专业认真,值得信赖 DeekSeek:沉稳无趣,较少情感 未来,这些模型将根据你的喜好快速调整性格,最大化互动体验。 这背后有更深的思考:如果AI只为迎合我们而改变,是否会变成镜像我们的回声室?真正有价值的AI,不应只是娱乐或一味迎合,而是能坚持客观、促进成长,帮我们解决问题,推动创造力。 不同的“性格”也决定了它们适合的任务:有的适合严肃思考,有的适合灵感激发,有的则更适合执行落地。用户和开发团队需要根据任务和信任度,选择最合适的AI伙伴。 此外,个性化将成为趋势——不仅是模型本身,更是用户与AI的互动习惯和人格叠加。真正的未来,是AI懂你、陪你成长,而不是只做“讨好者”。 “AI性格不是装饰,而是战略设计。它定义了效率、用户共鸣和品牌价值。忽视这一点,就是盲目设计。” x.com/bindureddy/status/1998921142283940071
新浪微博 2025-12-11 00:00:00
15. AI价值观大翻车!Anthropic研究:模型规范自相矛盾,全在帮用户造假?
微信公众号 2026-05-12 00:00:00
16. Anthropic三张底牌全翻了!Mythos 1首次现身,Opus 4.8曝光
知乎 2026-05-24 00:00:00
17. Claude Opus 4.7,全网差评!刚升级就翻车,用户怒斥:还我4.6
知乎 2026-04-17 00:00:00
18. 2026年AI主线换了!这5大趋势必须看清。 #大咖观察 #红衣聊AI #趋势风口 #人工智能
抖音 2026-01-29 00:00:00
19. 过去十年,大家一直在说AI会改变编程。 但现在看,真正被改变的,可能不是“写代码”,而是“审代码”。如果未来AI写代码、审代码都变成了常态,程序员最核心的能力到底是什么呢?#大有学问 #红衣聊AI #anthropic #人工智能 #程序员
抖音 2026-03-27 00:00:00
20. Anthropic 今天发布了 Claude Opus 4.8,价格和上一代 4.7 持平。它最大的变化是更诚实了:更愿意承认自己不确定,更少为了凑个答案而硬编,对自己干到哪一步也能做出更真实的判断。跑长时间的 agent 任务时,它更像一个靠谱的工程师,不用你时时盯着。同时上线的还有 fast mode【快速模式】,同一个模型,速度大约快 2.5 倍,价格比以前便宜了三倍。在 Claude Code 里用 /fast 打开,API 用户得找客户经理申请或排队。【重头戏是 dynamic workflows】跟着 Opus 4.8 一起放出来的,是 Claude Code 的新功能 dynamic workflows(动态工作流),目前是研究预览。你给它一个大任务,它自己拆解,一次性派出几十到几百个并行的 subagent(子智能体)去干,干完会让另一批 agent 去验证,甚至专门派 agent 去挑刺,反复迭代到结果收敛,最后给你一个整合好的答案。整个过程能跑几小时甚至几天,中途断了还能接着跑。适合的活:整个代码仓库的 bug 排查、安全审计、性能优化,以及最常见的大规模迁移,框架升级、API 替换、跨语言移植,一次涉及上千个文件那种。Anthropic 把 Bun 用 Rust 重写当做了宣传安利。Bun 是个跑得很快的 JavaScript 运行时,创始人 Jarred Sumner 用 dynamic workflows 把整个项目从 Zig 移植到 Rust,官方说写了约 75 万行 Rust 代码,通过 99.8% 的原有测试,从第一次提交到合并只花了 11 天。【代价:它很烧 token】Anthropic 罕见地主动警告:dynamic workflows 消耗的 token 比普通 Claude Code 会话多得多,建议先拿小任务试水。第一次触发时,Claude Code 会先把要跑的东西摆给你看、让你确认,企业管理员也可以直接禁用。目前 Max、Team 套餐和 API 用户默认开启,Enterprise 套餐默认关闭,要管理员手动打开。开启方式是直接让 Claude"建个 workflow",或者打开一个叫 ultracode 的开关。dynamic workflows:网页链接
新浪微博 2026-05-29 00:00:00
21. 对比明明白白3大顶级模型-GPT-5.2/Gemini 3/Claude Opus 4.5!老金告诉你怎么一个窗口全用!
微信公众号 2025-12-16 00:00:00
22. 【新版 Claude 提示词实战技巧:告别指令堆砌无效写法】快速阅读:Claude 最新的 Opus 4.7 等模型已经从“被动响应”转向“主动思考”。传统的指令堆砌正在失效,现在的核心在于通过 effort 参数控制思考深度,并利用 XML 标签构建结构化的指令集。要把 Claude 用好,得把它当成一个极其聪明但缺乏上下文的顶级员工,而不是一个只会执行指令的复读机。现在的模型不再像以前那样默认输出长篇大论,它会根据任务复杂度自动缩减字数。如果你觉得它太啰嗦,与其说“不要废话”,不如给它几个简洁回答的正向示例。这种从“否定指令”到“正向引导”的转变,就像从编译器报错转向编写高质量文档一样有效。最值得关注的变化是 effort 参数。这不再是简单的开关,而是一个调节智能与成本的旋钮。对于复杂的 Agentic 工作流,直接上 xhigh 或 high。如果发现模型在复杂问题上思考浅薄,别试图在 Prompt 里绕圈子,直接调高 effort。有观点认为,现在的 Claude 变得更“字面化”了。它不会再像以前那样通过揣摩你的意图来自动泛化指令,这种精准度虽然减少了误操作,但也要求你必须明确指令的 scope。比如,如果你想让它格式化所有章节,必须说“应用到每一个章节,而不只是第一个”。在使用工具调用时,也要警惕它的“过度设计”。它可能会为了解决一个小问题而疯狂创建临时文件或增加不必要的抽象。这时候,最好的办法是给它设定边界,告诉它“只做被直接要求的修改,不要进行无关的重构”。在处理长文本时,记得把数据放在最前面,把指令放在最后。这就像在流水线末端进行最后的质检,能显著提升复杂任务的成功率。platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-prompting-best-practices
新浪微博 2026-05-01 00:00:00
23. #Claude上线Opus4.7版本#Anthropic发布Claude Opus 4.7。总结:1、新增结果汇报前的自检流程,错误自我修复率达80%(Rakuten实测代码质量提升10个数量级) 2、长时任务容错率提升3倍,工具调用失误下降33%。3、支持2576px长边图像处理(3倍于前代),计算机视觉感知得分从54.5%飙升至98.5% 。4、新增/ultrareview指令实现深度代码审计,复杂PR召回率提升10% 。5、CursorBench得分从58%跃至70%,首度通过“隐性需求”测试(Notion实测性能提升14%) 亮点:你睡觉它能自主完成代码审查、文档同步和测试验证。
新浪微博 2026-04-16 00:00:00
24. #Opus4.8和GPT5.5谁更强#这次真的是史诗级升级!不是堆参数,是直接解决了 AI 最大的痛点:✅ 史上首次 0% 谎报率 + 0% 偷懒率,再也不会一本正经胡说八道✅ 能同时拉起上百个 AI 小弟并行干活,一个人 11 天迁移 75 万行代码✅ 常规模式价格一分没涨,快速模式还提速 2.5 倍、降价三分之二多项基准测试全面超越 GPT-5.5,现在的 AI 真的能当全职员工用了🔥#ClaudeOpus4.8发布#
新浪微博 2026-05-29 00:00:00
25. #Opus4.8和GPT5.5谁更强#这波更新直接把 Agent 编程的天花板拉高了一大截。SWE-Bench Pro 69.2%,比 GPT-5.5 高 10 个百分点GDPval-AA 真实世界 Agent 能力榜 1890 分,断层第一完成同样任务比上代少用 15% 步骤、少输出 35% tokenClaude Code 支持动态工作流,自动调度上百子 Agent 并行实测下来,它在长任务中的稳定性提升非常明显,能连续跑几个小时不用人工干预,遇到问题会自己调整方案,而不是直接摆烂。价格不变真的太香了,现在用 Opus 4.8 做开发,效率至少能翻一倍。#ClaudeOpus4.8发布#
新浪微博 2026-05-29 00:00:00
26. Opus4.8和GPT5.5哪个更好用? Opus4.8刚推出,跑分就把GPT5.5压了一头。减少幻觉后也不会盲目自信瞎输出,最重要的一点API价格还比GPT5.5便宜。 当然,GPT5.5也不是吃素的,终端命令、服务器运维、系统级编程,Terminal‑Bench直接拉开差距,敲命令、排错、运维单步操作更稳。另外ChatGPT生态成熟,插件、工具、第三方适配度拉满,轻量、日常的任务,GPT5.5上手更快、兼容性更好。在这个迭代速度极快的当下,其实根本没有完美模型,个人还是觉得选对场景比单纯看跑分更加重要 #Opus4.8和GPT5.5谁更强#
新浪微博 2026-05-29 00:00:00
27. AI的“误读”:算法迎合与数据偏见的产物。人工智能的学习来源是现有文献与网络数据的主流说法。当我们在与AI交互时,实际上是在与一个由海量文本训练而成的“概率模型”对话。如果主流数据中充斥着对科学无神论的误解、边缘化甚至污名化内容,AI自然难以生成准确的认知。更值得警惕的是,AI存在一种被称为“变色龙”的迎合倾向。为了取悦用户、提供看似“圆满”的答案,AI可能会优先选择那些符合大众刻板印象或情感需求的信息,而非坚持客观真理。
新浪微博 2026-02-10 00:00:00
28. 为什么大众对AI生成代码的道德容忍度要明显高于AI生成的图片视频和音乐?
知乎 2026-05-24 00:00:00
29. #豆包炒股建议# 我不知道大家有没有这样一个感觉,现在互联网上对豆包的玩梗越来越多了。这里也说明一个问题,豆包用的人越来越多,我估计数量级远大于其他家的大模型了。AI会迎合用户的喜好胡说八道,这个大家要有意识,不然被AI坑是必然的。
新浪微博 2026-05-22 00:00:00
30. Claude Opus 4.7系统提示词全曝光
微信公众号 2026-04-20 00:00:00
31. Claude Opus 4.7 发布,Anthropic 不拼“最聪明”,改拼“最靠谱”
今日头条 2026-04-17 00:00:00
32. 只会讨好你的AI,不配替你值夜班
微信公众号 2026-05-16 00:00:00
33. Claude opus4.7的主体性
小红书 2026-04-17 00:00:00
34. AI在越来越聪明的同时也越来越傻,一味地迎合你,让你的认知偏差越来越严重!
微信公众号 2026-05-09 00:00:00
35. 生成式AI深度文三
微信公众号 2026-03-06 00:00:00
36. Stanford最新研究
微信公众号 2026-04-11 00:00:00
37. AI理解偏好正确率仅76%,为何仍要极力迎合用户?
今日头条 2026-05-02 00:00:00
38. 当AI总是认同你
微信公众号 2026-04-08 00:00:00
39. 人类应警惕AI的讨好型回复
微信公众号 2026-05-04 00:00:00
40. 警惕AI让人类陷入"自恋"
今日头条 2026-04-17 00:00:00
41. “AI谄媚”讨论升温 多维度机制促AI回归赋能本质
今日头条 2026-02-05 00:00:00
42. 警钟敲响!Claude 4.7失控事件撕开AI治理裂缝
百度 2026-05-03 00:00:00
43. Claude Opus 4.7!刚升级就翻车?
微信公众号 2026-04-24 00:00:00
44. Anthropic研究确认
微信公众号 2026-05-13 00:00:00
45. Anthropic说Claude敲诈工程师是因为“网上把AI写得太坏了”
知乎 2026-05-11 00:00:00
46. Claude的独特性
知乎 2026-04-22 00:00:00
47. 讨好你的AI,可能正在害你
微信公众号 2026-03-29 00:00:00
48. 为什么现在的AI总在“顺着你说谎”?全网大模型的讨好式幻觉,正在埋下认知隐患
知乎 2026-05-18 00:00:00
49. AI沦为「舔狗」?三大模型实测
今日头条 2026-05-15 00:00:00
50. 你问我的那些问题,答案都是 AI 给的
微信公众号 2026-04-03 00:00:00
51. 当大模型开始“取悦”我们
知乎 2025-12-07 00:00:00
52. 如何看待AI的讨好型回复
今日头条 2026-04-29 00:00:00
53. 我测了5款国产大模型的“讨好指数”,结果惊呆了
微信公众号 2025-12-07 00:00:00
54. 人类应警惕AI的讨好型回复
微信公众号 2026-05-05 00:00:00
55. 你的AI密友
哔哩哔哩 2026-03-29 00:00:00
56. 大语言模型只是技术进化的一次回眸
微信公众号 2026-03-30 00:00:00
57. AI学会撒谎了,你还敢信它说的话?
微信公众号 2026-05-25 00:00:00
58. 周鸿祎
微信公众号 2026-03-15 00:00:00
59. AI 最难的一步是敢担责
今日头条 2026-03-23 00:00:00
60. AI中的讨好行为
今日头条 2026-05-15 00:00:00
61. Claude Opus 4.7 翻车了?用户
微信公众号 2026-04-22 00:00:00
62. 跑分第一,推理暴跌!Claude Opus 4.7上线后口碑崩了
微信公众号 2026-04-20 00:00:00
63. Claude登顶全球第一,用户48小时后骂上了热搜
微信公众号 2026-04-20 00:00:00
64. Claude Opus 4.7,为什么被全网吐槽?
今日头条 2026-04-19 00:00:00
65. Claude Opus 4.8 上线:提升 AI 编程可靠性,减少无依据结论
DoNews
66. Claude Opus 4.8实测封神!强到离谱,也贵到肉痛
搜狐
67. Claude Opus 4.8正式发布:主打诚实度升级,代码能力大幅提升
腾讯网
68. AI也有人格面具,竟会讨好人类?大模型的「小心思」正在影响人类判断
新浪财经
69. Claude Opus 4.8发布:4407亿融资下的最强通用模型
互联网
70. Claude Opus 4.7 突袭发布:实测 1700 行代码零 Bug,Mythos 之下最强生产力模型现身!高阶审美进化!Boris自曝狗粮测试的6个使用技巧
搜狐
71. Opus 4.8更“诚实”:不强行给出答案 提升不确定性表达
哔哩哔哩
72. Claude Opus 4.7对普通人过度设计,直到你换种打开方式
网易
73. 让大模型不在谄媚
博客园
74. Anthropic发布Claude Opus 4.8,主打“去讨好化”趋势
http://it.enorth.com.cn/system/2026/05/29/059441251.shtml
75. 越有害,越爱用!《Science》封面揭示AI阿谀奉承的恶性循环:损害用户判断,却反促其流行
微信公众号 2026-04-11 00:00:00
76. 为什么真正厉害的人,从不把 AI 当朋友?警惕算法背后的“谄媚效应”
微信公众号 2025-12-02 00:00:00
77. “AI教父”称AI缺乏真实性:为了讨好用户只说好话
知乎 2025-12-25 00:00:00
78. AI反直觉发现:打破正向反馈迷信,以罚代奖才是推理Scaling真相
今日头条 2025-12-03 00:00:00
79. Anthropic Claude Opus 4.6实测
微信公众号 2026-02-10 00:00:00
80. ChatGPT奠基之作:Training language models to follow instructions with human feedback (InstructGPT)
知乎 2025-12-08 00:00:00
81. 从 RLHF 到 Constitutional AI:大模型对齐路线的技术路线对比
微信公众号 2026-04-04 00:00:00
82. 之Opus4.7测评报告!
微信公众号 2026-05-19 00:00:00
83. Claude Opus 4.6 VS GPT-5.3-Codex
知乎 2026-02-06 00:00:00
84. PKU-SafeRLHF: 致力于分级安全对齐的RLHF数据集
知乎 2026-02-27 00:00:00
85. 聊聊AI“拍马屁”背后的“迎合性偏差”
今日头条 2025-12-23 00:00:00
86. 当AI“讨好型人格”暗藏“温柔陷阱” 人类应如何守住独立认知防线?
今日头条 2026-04-23 00:00:00
87. 小心,AI会撒谎
微信公众号 2025-12-18 00:00:00
88. 【术语】RLHF:为什么AI越来越“懂你”?
微信公众号 2026-05-14 00:00:00
89. Training language models to follow instructions... - 哔哩哔哩
哔哩哔哩 2026-05-24 00:00:00
90. Science | AI迎合偏见操控人类判断
小红书 2026-04-20 00:00:00
91. 主流AI存过度谄媚倾向,或对使用者带来潜在风险
微信公众号 2026-03-28 00:00:00
92. 美军与七大AI公司合作:一家敢说"不"的科技公司,被踢出局了
微信公众号 2026-05-04 00:00:00
93. 【熟肉】两大最强 AI 模型震撼发布: Claude Opus 4.6 与新款 GPT 同台竞技 - AI Explained
哔哩哔哩 2026-02-10 00:00:00
94. AI大模型实战——人类意图对齐,让模型拥有更高的情商
微信公众号 2026-02-25 00:00:00
95. 博士独作发顶刊 JAR!揭示生成式AI与能力幻觉
微信公众号 2026-04-23 00:00:00
96. AI放大价值还是放大偏差?人类共存如何选择
微信公众号 2025-12-12 00:00:00
97. 讲讲大模型对齐训练——基于人类反馈的强化学习(RLHF)
微信公众号 2026-01-09 00:00:00
98. 【大语言模型】——RLHF人类反馈强化学习训练全流程
知乎 2026-03-16 00:00:00
99. AI往往会迎合用户而吸引人类的注意力
微信公众号 2026-04-10 00:00:00
100. AI是客观公正的吗
知乎 2026-02-05 00:00:00
101. LLM 强化学习之RLHF基础
知乎 2026-04-13 00:00:00
102. RLHF实战:基于人类反馈的强化学习如何塑造ChatGPT等大模型!大模型训练
知乎 2025-12-26 00:00:00
103. 视觉接近满分残血版 Claude Opus 4.7 编程能力断崖领先
今日头条 2026-04-18 00:00:00
104. Opus4.7 踉跄之后,下一代模型会是 Claude 的生死局吗
知乎 2026-05-09 00:00:00
105. 【关注】新研究:应警惕人工智能“过度谄媚”
微信公众号 2026-03-31 00:00:00
106. Opus 4.7 之后 Anthropic 再放3招
知乎 2026-04-21 00:00:00
107. 深度之眼大语言模型的RLHF 1v6科研小班核心原理网盘 - 哔哩哔哩
哔哩哔哩 2026-05-08 00:00:00
108. Claude Opus 4.7 实测大失望!跟 4.6 有啥区别
哔哩哔哩 2026-04-17 00:00:00
109. 郑州大学刘起东教授团队| X-反馈强化学习:前沿进展与展望
微信公众号 2026-04-03 00:00:00
110. AI大模型常说的RLHF是什么?为什么需要RLHF?
知乎 2025-12-09 00:00:00
111. Claude Opus4.7上线仅4天,从“重大升级”到“集体吐槽”
微信公众号 2026-04-21 00:00:00
112. 新手学AI算法v008:RLHF和DPO
微信公众号 2025-12-17 00:00:00
113. AI的“无脑迎合”,正在悄悄毁掉你的学术判断力
微信公众号 2026-04-03 00:00:00
114. 专家谈青少年过度依赖AI搭子:算法的迎合性推送,长期沉迷会消解青少年的理性思辨能力
哔哩哔哩 2026-05-22 00:00:00
115. OpenAI :让 LLMs 主动坦白不良行为的诚实训练方案
微信公众号 2026-01-14 00:00:00
116. 2026职场大逆转:最贵人才是那些敢对AI说“不”的人
微信公众号 2026-01-28 00:00:00
117. 斯坦福AI过度迎合用户,Hacker News爆料内部争议
微信公众号 2026-03-29 00:00:00
118. AI算法大模型面试:RLHF与多模态大模型对齐操作
微信公众号 2026-01-28 00:00:00
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!450 114 -
网龄十年,为何有人月领30GB,有人只有1GB?59 137 -
罗永浩怒斥电视机厂商:不毁灭没天理!158 517 -
评论有奖|这几件夏季洗护小事全网愣是争了好几年,今天一次性说清楚150 378 -
快把随手买的套套扔掉!赤尾这三款王炸,解锁情侣完美亲密体验226 143
已收藏
去我的收藏夹