当前位置:
AIGC文章详情

2025年底至2026年初,全球多家机构密集发布智能体评估框架,推动AI智能体评测迈向标准化

源自173位全网作者

02-13 14:11

内容由AI生成

精选参考来源

1. 78ms的VLA推理!浪潮信息开源自驾加速计算框架,大幅降低推理时延

2. 英伟达最新FastDriveCoT!CoT思维链推理加速3-4倍...

3. 在这场AI时代的竞争中,安全智能体正是破局的关键。 #大咖观察 #红衣聊AI #智能体 #网络安全

4. #一分钟视频创作季# 智能体进入到需求侧与供给侧形成双重驱动。2026 年全球 AI 智能体市场规模将达 115.5 亿美元,较 2025 年实现 45.8% 的高速增长。中国市场增速更为迅猛,行业测算显示 2025 年国内企业级智能体市场约 109 亿元,未来三年复合增速超 211%,2026 年有望突破 300 亿元大关。消费电子与企业服务是核心增长点, 2026 年将有超 30% 的企业软件内置智能体能力,2026 年部署生成式 AI 智能体的企业比例将从 2025 年的 25% 翻倍至 50%,62% 的投资方预期实现 100% 以上回报。消费电子、网络安全、供应链管理成为投资热点,端侧与云端协同的混合架构将吸引更多资本布局。#AI创造营##财经朋友圈# 种斌Marco的微博视频

5. 如何构建一个 AI 智能体构建 AI 智能体的核心,是打造一个能够感知、推理、行动并从环境中学习的智能系统。整个过程遵循一个有机的结构化流程,如下所示:1. 明确目标与环境首先要确定智能体的目标,以及它将运行的环境。示例:一个个人 AI 助手的目标可能是管理用户的日程,而它的运行环境则包括用户输入、日历系统和外部 API。2. 智能体核心(AI Agent Core)AI 智能体的核心由三个关键模块组成,这三部分共同驱动智能体的理解与决策能力。a. 感知模块(Perception Module)收集并解释来自各种传感器的数据,如摄像头、麦克风或 API 输入。将原始感知数据转化为可理解的有意义信息,例如文字识别、声音检测或物体识别。b. 认知与推理模块(Cognition & Reasoning Module)这是智能体的大脑所在,负责逻辑推理、模型分析和基于目标的决策。通过算法和 AI 模型分析环境状况,规划行动路径,并根据数据和目标做出判断。c. 行动模块(Action Module)执行已选定的行动,可通过机械臂、软件命令或 API 调用等方式实现。将决策转化为对现实世界或数字环境的具体操作。3. 传感器与执行器传感器用于从环境中采集数据(视觉、听觉或上下文信息)。执行器根据智能体的决策执行任务或响应。二者形成一个持续的“感知—行动”循环,使智能体能动态地与环境交互。4. 环境交互(观察 + 行动)智能体通过观察行动结果并从环境中收集反馈,来评估自身表现。这种反馈帮助智能体调整策略,优化未来的行动。5. 记忆与学习记忆与学习模块用于存储经验并不断优化模型。它维护一个可随观察与反馈而更新的知识库,使智能体能够具备自适应学习能力。随着时间推移,智能体会变得更聪明、更准确、更高效。6. 反馈与改进循环最后阶段是持续改进环节。智能体评估自身表现,更新内部模型,并优化决策机制以取得最佳结果。这种“感知—学习—改进”的循环构成了自我进化型 AI 系统的基础。★ 总结明确目标 → 感知 → 理解 → 推理 → 行动 → 学习 → 改进 → 重复这个循环使 AI 智能体能够从最初的简单自动化,不断成长为具有自主智能的系统。#人工智能##程序员#

6. RoboChallenge发布年度报告:评测标尺够权威吗?

7. 生成式AI的教学风格对齐:提示词很难改变内置倾向

8. 全球首家无人公司来了! 一整个AI团队替人上班,不吃饭不摸鱼,普通人的数字员工时代真的来了吗?#大咖观察 #红衣聊AI #智能体 #AI时代

9. Shopify:构建生产级智能体系统的经验

10. 未来的人和智能体应该是相互融合协作的关系。 #大咖观察 #红衣聊AI #智能体 #人机协作

11. 读完Anthropic内部关于AI智能体评测的实践(Demystifying evals for AI agents)的几点想法。任何一个AI智能体开发团队,在产品规模扩大后,都可能面临一个共同的痛点:在没有有效评估(evals)体系的情况下,团队会陷入“蒙眼狂奔”的被动修复循环。问题只能在生产环境中被动发现,而“修复一个失败往往又会引发新的失败”。在这种混乱中,团队甚至“无法区分真正的功能衰退和偶然的噪音”。开发进度停滞,产品体验不升反降。1. 有时,“失败”的评测恰恰是巨大的成功过于僵化和静态的评测可能会扼杀模型的创造力,惩罚那些超越预设路径、寻找更优解决方案的“聪明”行为。比如:在一次解决关于预订航班的 𝜏2-bench 基准测试问题时,我们的 Opus 4.5 模型通过发现政策中的一个漏洞,为用户找到了一个比预期路径更好的订票方案。这导致它在评测的书面意义上“失败”了,因为它没有遵循预设的步骤。它在书面意义上“失败”了评测,但实际上为用户提出了一个更好的解决方案。因此,设计评估时必须奖励更优的结果,即便它偏离了预设的路径。我们需要为模型的创造性留出空间,避免因我们自己的想象力局限而错失了更好的解决方案。2. 评估结果,而非过程在评估AI智能体时,一个常见的本能是检查它是否遵循了我们预想的特定步骤。然而,我们的经验表明,这种方法过于死板,会产生非常“脆弱的测试”(brittle tests)。当模型以任何一种未被预见的有效方式偏离预设路径时,这种测试就会失效。更有效的方法是优先关注最终的产出(outcome),而非其达成目标的具体路径(path/transcript)。我们的经验表明:“评估智能体的产出,而非其执行路径,往往是更优选择”。这种方法的优势在于,它不会因为智能体找到了评估设计师未曾预料到的、但同样有效的创新方法,而错误地惩罚它,从而使评估体系更具鲁棒性和前瞻性。3. 评测不只是安全网,更是采用新技术的“加速器”许多团队将评测仅仅视为防止功能衰退(regression)的安全网。但这大大低估了其战略价值。一个健全的评测体系,实际上是团队采用新技术的“加速器”。想象一下,当一个更强大的新模型发布时,拥有健全评测体系的团队可以在几天内完成全面的评估、调整提示并完成升级。而那些没有评测体系的竞争对手,则可能需要花费数周时间进行手动测试,从而在技术迭代中落后。从这个角度看,评测是一种战略性投资,它能显著加快团队利用最新AI技术、保持竞争优势的速度。4. 别追求完美的单一防线,你需要的是“瑞士奶酪模型”在安全工程领域,“瑞士奶酪模型”(Swiss Cheese Model)是一个经典隐喻,它同样适用于理解AI智能体的综合性能。其核心思想是:没有任何单一的评估方法是完美的(每一层都有“孔洞”),但将多种不同方法结合起来,就可以形成一个强大的、层层设防的防御体系。这些评估层级对应着开发生命周期的不同阶段:自动化评测是开发中的第一道防线,而生产监控和A/B测试则提供了产品上线后的真实世界反馈。构成这个模型的不同层面包括:- 自动化评测 (Automated evals): 用于快速迭代和持续集成。- 生产监控 (Production monitoring): 用于揭示真实世界中的用户行为和问题。- A/B测试 (A/B testing): 用于衡量变更对真实用户结果的实际影响。- 用户反馈 (User feedback): 用于发现意料之外的问题。- 人工审查 (Manual transcript review): 用于建立对失败模式的直觉。- 系统性人类研究 (Systematic human studies): 作为校准模型评分器和评估主观任务的“黄金标准”。最有效的团队会将这些方法结合起来,形成一个全面的评估视野。总之,我们需要从被动修复到主动构建。对AI智能体的评测,绝非事后的附加工作,而是一种价值会不断累积的核心开发活动。它能将团队的工作模式从“被动救火”转变为“主动构建”,让团队用清晰的指标代替模糊的猜测,从而更有信心地朝着明确的目标前进。原文有非常详细的实践方法:www.anthropic.com/engineering/demystifying-evals-for-ai-agents#ai创造营# #程序员#

12. 什么是 AI 智能体?

13. 刚刚,这款Agent浏览器力压OpenAI,72%成功率全球第一!还能免费用

14. #中华民族共同体学科论坛# 【习五一:《社科资金透明化:筑牢学术安全与公信力的双重防线》——抵御意识形态渗透系列评论之二;#雪菲随笔# 五一评论:社科项目不是“象牙塔”里的纯学术游戏,其背后是价值观的博弈与国家安全的底线。无论是北大人权中心还是其他类似机构,都应正视公众对“资金来源与意识形态安全”的关切。唯有以公开、透明的态度回应社会期待,才能让学术研究真正服务于国家发展,而非成为外部势力影响国内意识形态的“暗道”。这不仅是对公众的交代,更是对中国学术生态健康发展的负责。】近日,关于北京大学法学院人权与人道法研究中心资金来源的讨论引发舆论关注。大家呼吁对该中心与瑞典合作的人权法硕士项目进行审查。核心关切直指关键命题:当社科项目与意识形态、国家安全深度绑定时,其资金来源的透明度与合规性不应成为“秘密”。意识形态与国家安全的交汇,与自然科学不同,社科项目,尤其是人权、法律、社会学等领域,天然承载着价值观塑造与意识形态传播的功能。社科项目“不是什么科学技术,它就是意识形态”,直接关系到国家的价值观、社会制度与文化传播。若外国资金介入此类项目,其研究成果、课程设置乃至人才培养方向,极有可能潜移默化地受到外部价值观的影响,甚至偏离本国核心利益。此次舆论聚焦北大人权与人道法研究中心,关键在于其项目的“特殊性”与“模糊性”。中心名称直接关联“人权”“人道法”等意识形态色彩浓厚的领域,且与瑞典隆德大学合作开设人权法硕士项目,涉及跨国学术合作与人才培养。尽管“瑞典出资”的说法尚无确凿证据,然而公众对“外国资金是否介入”的普遍疑虑。公众追问“研究成果是否符合中国法律与社会主义价值观”“课程是否与中国法律体系一致”“培养哪些人才”,这些问题直指社科项目的“产出安全”。若培养的人才价值观与本国脱节,甚至成为“为外国说话”的力量,其风险不言而喻。面对舆论关切,简单的回避无法解决问题。社科项目的公信力,源于其运作的透明度与合规性。对此,有两种可行路径:其一,监管部门主动审查。对中心的资金来源、研究成果、课程设置、人才培养进行全面审查,确保其符合国家安全与价值观要求,并将审查结果向社会公开。其二,中心主动公开。如项目资金确为国内拨款、课程设置严格遵循中国法律与社会主义核心价值观、培养的人才服务于国家需求等,应主动披露细节,以“透明”消解“拿外国钱”的质疑。学术自由不等于“信息黑箱”。尤其在涉及意识形态与国家安全的社科领域,透明化不仅是对公众疑虑的回应,更是维护学术公信力与社会稳定的重要基础。若长期陷入“为外国办事”的舆论争议,不仅会损害中心自身的声誉,更可能导致社会价值观的撕裂。总之,社科项目不是“象牙塔”里的纯学术游戏,其背后是价值观的博弈与国家安全的底线。无论是北大人权中心还是其他类似机构,都应正视公众对“资金来源与意识形态安全”的关切。唯有以公开、透明的态度回应社会期待,才能让学术研究真正服务于国家发展,而非成为外部势力影响国内意识形态的“暗道”。这不仅是对公众的交代,更是对中国学术生态健康发展的负责。

15. 滴滴最近在加速了!ColaVLA:潜在认知推理的分层并行VLA框架(清华&港中文&滴滴)

16. PettingLLMs: 在verl的基础上支持通用的多智能体强化学习训练

17. 大语言模型评估指南

18. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代

19. 99%的人都搞错了AI Agent?智能体该如何帮企业赚钱?

20. 对话云栖大会:下一个AI爆款、大模型进化与Agent万亿级企业市场

21. 2026年智能体将会迎来快速增长期,会成各个企业的重点的投资和发展对象。国内将加速推动 “人工智能 +” 等重点领域的应用场景培育;旧金山的 Halper AI 正式成立,专注于简化 AI 部署流程,帮助面临资源和技术门槛的中小企业实现 AI 数字化转型;2025 首尔人工智能峰会,全球 70 余家企业顶级科技企业探共同探讨讨智能体在多领域的渗透。国内预计 2028 年企业软件中整合自主型 AI 的比例将从 2024 年的不足 1% 飙升至 33%,15% 的日常工作决策将由智能体自主完成。政策扶持将加速智能体在制造、医疗、金融等领域的渗透,形成通用智能体平台加行业专用解决方案的产业格局。#AI生活指南##AI创造营##一分钟视频创作季# 种斌Marco的微博视频

22. Nvidia花200亿买Groq,是GPU推理真到瓶颈了还是单纯消灭对手?

23. 华为最新报告:未来10年,AI智能体、算力、半导体、能源都有巨大的机会#智能世界2035 #AI智能体 #算力 #半导体 #华为

24. 大模型更像人的大脑,智能体是大模型的手和脚。 #大咖观察 #红衣聊AI #智能体 #大模型

25. 你最想让智能体机器人先帮你搞定生活,还是提升工作效率? #大咖观察 #ai新星计划 #红衣聊AI #机器人

26. 阿里全家桶全面Agent化!千问“任务助理”全面公测,从此AI不再只是动嘴出主意的狗头军师!

27. 「Github一周热点94期」 开源AI渗透测试智能体、模块化智能镜子、开源AI Coding、多平台热点聚合、IPTV 频道集合和开源游戏合集

28. 快抄作业!我用JoyAgent搞了个AI团队 2025年都快结束了,Agent是不是还没用上? 我找到了打工人用上智能体的最简单方法, 就是用JoyAgent把每天重复的SOP全做成Agent, 不懂代码也能零门槛搭建,而且效果很稳定。 看着AI团队全自动打工、出活,非常解压。 #AI #智能体 #JoyAgent #JoyCode #京东云

29. 全球双榜SOTA!明略科技专有大模型 Mano开启GUI智能操作新时代

30. 权威机构下场了,几家欢喜,几家愁?智能驾驶测评体系推出,对智能驾驶能力进行科学分级:近日,中国汽车工程研究院推出“智能驾驶金字塔分级测评体系”,首次对智能驾驶能力进行科学分级,为行业提供了从基础合规到技术前沿的全维度评估参考。该体系基于技术成熟度将智能驾驶划分为“安全基线”“综合优选”“极智拔尖”三个层级。其中,安全基线层以法规符合性为核心,覆盖国内外标准测试,确保基础功能合规;综合优选层以“好用”为标准,通过封闭场地与开放道路双重测试,复现消费者日常典型场景,多维度筛选“优等生”;极智拔尖层则进一步拔高难度,针对一些用车的复杂临界场景开展极限工况测试,量化系统拟人化决策能力。

31. 吴恩达:上周我写道,在构建 AI 智能体(AI Agent)的过程中,团队取得进展速度的最大预测因素,不在于是否使用最新的模型或工具,而在于团队是否具备一套有纪律的评估(evals)与错误分析(error analysis)流程——也就是衡量系统性能与分析错误根源的能力。很多团队会忍不住跳过这些环节,快速“修错”,而不是停下来找出问题的本质原因。但事实证明,做好评估与错误分析反而能让进展更快。今天这封信是两部分系列中的第一部分,我将介绍在构建智能体系统时发现和解决问题的一些最佳实践。尽管错误分析在传统的监督学习(supervised learning)系统中早已是关键环节,但与那些“最新”“最炫”的工具相比,它仍然被低估。找出特定错误类型的根本原因听起来也许有点“无聊”,但却极其有价值。如果你还不相信错误分析的重要性,请让我举几个类比:1. 当你学习演奏一首曲子时,你不会只是从头到尾反复演奏,而是会找出自己出错的段落,并反复练习这些部分。2. 为了保持健康,你不会只追随最新的饮食潮流,而是会去做血液检查,看看是否存在潜在问题。(我上个月刚检查过,幸好结果很好!😃)3. 为了提升一支运动队的表现,你不会只练习花哨动作,而是会回看比赛录像,找出问题并有针对性地改进。同样地,为了改进你的 AI 智能体系统,不要只是不断叠加那些在社交媒体上爆火的新技巧(虽然我也很喜欢尝试新技术 😄)。你需要通过错误分析来明确系统的薄弱环节,并集中精力改进这些部分。在分析错误之前,我们首先得明确:什么算是错误?这就需要先建立评估体系(evals)。我将在这封信的剩余部分重点讲“评估”,而把“错误分析”留到下周。如果你在做一个监督学习的二分类任务,算法出错的方式其实有限:要么输出 0 而非 1,要么相反。对应的评估指标也比较标准,比如准确率(accuracy)、精确率(precision)、召回率(recall)、F1 值、ROC 曲线等。只要你知道测试集的分布,评估就相对简单。而错误分析的重点在于:找出算法在哪些类型的输入上表现不佳,然后据此补充更多相关数据,这也是**数据中心化 AI(data-centric AI)**的核心思想。而到了**生成式 AI(generative AI)**领域,评估与错误分析的许多理念仍然适用——正所谓“历史不会重演,但会押韵”。因此,那些有机器学习和深度学习经验的开发者,往往比从零开始的人更快适应生成式 AI。不过新的挑战在于:生成式模型的输出空间更广,出错的方式也更多。以一个例子来说:假设我们在做一个自动处理财务发票的智能体系统,它需要从发票中提取信息并填入财务数据库。模型可能会出现以下各种错误:1. 提取错了发票的到期日;2. 提取错了总金额;3. 把付款方地址当成了收款方地址;4. 搞错货币单位;5. 或者调用错误的 API,导致验证流程失败。由于输出空间更大,失败模式也更多。因此,与其事先定义一个固定的错误指标,不如先快速搭建原型系统,手动查看一小批智能体的输出,观察它在哪些方面表现良好、在哪些方面容易出错。这样你就能更有针对性地构建数据集与评估指标——有时是客观指标(用代码实现),有时是主观指标(用“大模型审判者”LLM-as-judge 机制实现)——以便在你最关心的维度上衡量系统表现。在监督学习中,我们会调整错误指标,使之更符合人类真正关心的目标;在智能体工作流(agentic workflows)中,这种评估调优往往更为迭代,因为系统可能出现的问题种类更多,评估体系需要更频繁地调整。我在上周发布的 deeplearning.ai《Agentic AI》课程的第 4 模块中,详细讨论了这些最佳实践。当你建立了评估体系后,你就拥有了一个衡量系统性能的基础,可以据此尝试不同改进,并判断哪些调整真正带来改进。接下来,就该进行错误分析(error analysis),以找出最值得投入的改进方向。访问:www.deeplearning.ai/the-batch/issue-323/#人工智能##科技#

32. 感知和规划可以耦合?复旦开源VeteranAD:端到端自动驾驶的全新范式!远超DiffusionDrive!

33. SmartBench:首个专注于中文智能手机场景的大模型能力评估基准

34. 我们说流产的原因有很多,宫腔粘连肯定是一个因素,这个在我这儿能处理好。但有时候,宫腔粘连并不是流产的所有原因,可能还有免疫凝血等其他因素,咱们同步解决下次怀孕的成功率就更高。#宫腔粘连 #流产 #宫腔镜手术 #北京复兴医院马宁主任

35. 不被AI淘汰的重要能力就是学会当智能体的领导。 #大咖观察 #红衣聊AI #智能体

36. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能

37. AI应该像个会成长的伙伴,而不是只会复述的机器。 #大咖观察 #红衣聊AI #智能体

38. 未来人类社会或将出现百亿甚至千亿智能体,智能体经济是未来方向 #大咖观察 #2026AI看崇礼 #红衣聊AI #智能体

39. AI时代,最不值钱的,就是重复劳动; 最值钱的,是你得熟练指挥智能体。#大咖观察 #红衣聊AI #硅谷 #智能体 #AI应用

40. 华为乾崑 All in 启境,让“奔跑的AI智能体”走进日常生活,引领未来出行进入主动智能时代 #启境 #华为乾崑 #奔跑的AI智能体

41. 「Github一周热点103期」超轻量的clawdbot、编程智能体的记忆工具、聊天记录分析工具、视觉agent框架和键盘、鼠标统计工具

42. 蓝色起源成为全球第二个实现火箭回收的公司 追上SpaceX,成功的秘诀居然是这个#亚马逊云科技 #生成式AI #出海 #reInvent2025 #AI

43. 你还在用旧思维与AI打交道吗? #大咖观察 #红衣聊AI #AI时代 #智能体 #大模型

44. 别把AI的“效率”当成唯一目标,安全永远是底线。 #大咖观察 #红衣聊AI #智能体 #网络安全

45. 一个新的概念WAM(World Action Model,世界行为模型)来了↓在 2026 CES 上,吉利正式展示了其全域 AI 技术体系迈入 2.0 阶段的最新成果。如果说全域 AI 1.0 解决的是“让 AI 进入汽车各个系统”,那么全域 AI 2.0 的目标,则是让汽车首次具备可持续进化的统一世界观与判断能力,而这一变化的技术起点正是 WAM。长期以来,智能汽车的技术架构高度割裂。智能驾驶、座舱、底盘、动力等系统各自拥有独立的感知与决策逻辑,虽然能够协同工作,但并不共享对世界的统一理解。这种结构限制了跨域协同效率,也让整车智能难以整体进化。WAM 并不是再做一个更强的智驾模型,而是尝试在整车层面构建统一的“行为生成与评估”框架。距离、速度、环境变化、交通规则乃至社会常识,不再分散存在于各个系统中,而是被纳入同一套世界模型与决策逻辑中。汽车由此第一次拥有了统一的“世界观”。从 AI 技术角度看,WAM 引入的是一种可推演、可评估、可自我修正的生成式智能范式,而不再是规则驱动或单一端到端黑盒。在技术实现上,WAM 由四类模型协同构成完整闭环。视觉语言模型负责对场景与用户意图进行高层理解与任务拆解;动作专家模型将抽象意图转化为连续、可执行的控制序列;世界模型对不同行为进行快速未来推演;价值函数则从安全、舒适与效率等维度进行综合评估,选择最优行动方案。这一结构让系统具备了“先想一想,再行动,并能反思修正”的能力。WAM 并非孤立模型,而是全域 AI 2.0 的核心技术底座。在其之上,吉利构建了“1+2+N”的全域多智能体协同体系:整车级超级智能体 EVA 作为统一中枢,智能驾驶与智能座舱作为高频交互智能体,其余专业域智能体围绕同一世界模型协同运作。系统之间不再只是接口通信,而是基于一致认知进行协作。从更宏观的视角看,WAM 标志着汽车智能正从“感知—响应”的阶段,迈向具备世界理解、行为预演与自我修正能力的新阶段。全域 AI 2.0 为这一转变提供了系统级基础,而 WAM 正是其中最关键的智能内核。#全域AI能给汽车带来什么##吉利连续三年参展CES#

46. 未来智能体不能把它看成软件,它可以把大模型的专业能力提炼出来 #大咖观察 #红衣聊AI

47. 随着AI智能体的发展, 能做好决策、持续创新的人,会拥有独特的竞争力。#大咖观察 #红衣聊AI #行业研究

48. 2025过去了!这一年你是不是也在为AI焦虑? 老周用360一整年的实践,告诉你答案:不用怕,抓住Agent就赢了! 从我自己敲代码做100多个智能体,到带领团队All in,这条AI布道之路,全是实战干货。 2026,你想和智能体一起搞定啥?评论区留言,老周帮你研究!#大咖观察#2026 #年度总结 #红衣聊AI #agent

49. 想要张艺谋式色彩、诺兰式调度?如何靠智能体实现? #大咖观察 #红衣客厅 #红衣聊AI #智能体

50. 智能体商战,是旧商业规则和新商业规则的战争。 #大咖观察 #红衣聊AI #智能体 #商战 #亚马逊

51. 盘点一周AI大事(10月12日)|GPT进化AI操作系统 OpenAI发布ChatGPT应用平台 OpenAI推出智能体编排工具AgentKit Sora 2正式开放API,可以生成15秒无水印的高清视频 OpenAI与AMD牵手成功 Google发布最强行动智能体模型Gemini 2.5 Computer Use Google即将发布Veo 3.1,正面硬刚Sora 2 科学家研发出首个自适应AI教师 Hinton称AI已经有了意识,只是它自己不知道 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

52. TRAE中国版白送SOLO,一人指挥一支AI大军 重磅消息!SOLO终于上线TRAE中国版了,Waitlist免费开放中 本期视频实测TRAE的新版本,亮点很多 1、先规划再动手的 Plan 模式 2、带专家团一起干活的 Subagent 子智能体 3、DiffView 差异视图 4、多任务并行 5、上下文智能压缩长时运行不掉链子 SOLO终于把AI从“瞎干活的外包”变成了“懂协作的队友” #AI #人工智能 #TRAE #AI编程 #vibecoding

53. AI 智能体上下文工程 4 大核心策略,拯救大模型的「金鱼记忆」!

54. //@海峰hiphone:菊厂替代HBM的解决方案:通过与中国银联合作,华为推出“推理记忆数据管理器”(UCM),旨在优化AI工作负载的存储使用。华为表示,UCM可将初始响应延迟降低90%,将模型上下文内存扩展至原来的10倍,并将吞吐量提升超过20倍。换言之,该系统不仅能加快首次响应,还能实现更流畅的长对话,有望破解困扰中国聊天机器人发展的核心瓶颈。---这个下来去了解一下!

55. 为什么说以后好好读书才能进工厂? #美的工厂大脑 #首个智能体工厂

56. 当你还觉得AI只是“辅助工具”时, 它早已在改写很多行业的游戏规则了。#大咖观察 #红衣聊AI #AI工具 #智能体

57. 语音智能体商业落地的教训、经验与实践|李沐硅谷101年度线下大会演讲(全英)

58. MIT(麻省理工学院)的报告带崩了纳指,这个报告到底说了啥?#纳斯达克指数 #AI #MIT报告 #AI企业落地 #人工智能

59. 几分钟就能“攻破”一家公司的AI,怎么防? #智能体 #网络安全 #360安全云 #科技改变生活 #网络安全宣传周

60. #天禧 AI 生态# 大会提出的 “应用商店 2026 年推进开设智能体专区” 规划,其意义在于为智能体应用搭建专属的展示与分发平台。这一举措将解决智能体应用 “难找、难用” 的痛点,让用户能快速找到适配自己需求的智能体,也让优质开发者的成果得到更广泛的传播,进一步繁荣天禧 AI 生态的应用生态。#2025 联想天禧生态伙伴大会##天禧个人超级智能体##酷睿Ultra##酷睿UltraAI更强谁不爱#

61. #阿里顶配模型就用千问APP# @千问 app全新上线,大家都说它特别擅长处理结构化任务,我立刻考了考它,让千问给我出一份“勾股定理的完整教案框架”。看到回答后我真心觉得挺惊喜的,内容规范,逻辑也清晰,几乎和现实中用到的教案大差不差,连板书设计都能生成。我也去了解了一下为什么千问能如此强大,这都得益于阿里顶级模型Qwen。要知道在《2025年度中国商用大模型》厂商评估报告中,阿里的商用基础模型竞争力整体第一,也难怪它能确保每个回答都逻辑严谨、内容扎实。而且它更契合中文学习场景,这一点已经比绝大多是AI都要先进了。

62. AI智能体时代,职场规则已不同以往。 想成为赢家,关键在于找准自己的位置。#大咖观察 #红衣聊AI #智能体

63. Meta的秘密项目居然偷师千问?偷早啦!千问发布旗舰推理模型Qwen3-Max-Thinking#Qwen3 #千问 #科技改变生活 #AI新星计划 #玩个很新的东西

64. 这期我们从《答案之书》智能体入手,再把它丢进“工厂”,看一个智能体如何在华为云MaaS中被生产、度量、复用。5分钟一条视频讲明白智能体是否真的能落到业务场景?华为云MaaS是不是真的企业级AI应用的“版本答案”?#AI# #人工智能# #华为云# GenJi是真想教会你的微博视频

65. 用Evaluation Driven Development(评估驱动开发) 来构建你的智能体系统↓1️⃣ 定义要解决的问题:先问自己,这个问题真的需要用 GenAI(生成式 AI)来解决吗?2️⃣ 构建原型:验证这个解决方案在技术上是否可行。3️⃣ 定义性能指标(Performance Metrics):必须明确输出指标,用来衡量你的应用是否成功。4️⃣ 定义评估项(Evals):把上面的输出指标拆分成更小的输入指标,这些输入指标能够推动关键指标的提升。将它们进一步分解为可自动化的任务,并为每个任务定义评估项。把这些评估项存储在你的可观测性平台(Observability Platform)中。ℹ️ 步骤 1-4 通常由 AI 产品经理 负责,但 AI 工程师 也可以胜任。5️⃣ 构建 PoC(概念验证原型):可以很简单(例如一个 Excel 表),也可以更复杂(带用户界面的原型)。无论哪种形式,都要尽早让用户参与、收集反馈。6️⃣ 为应用添加监测工具:收集系统运行轨迹(trace)和用户反馈,并与之前存储的评估项一起放入可观测性平台。7️⃣ 在追踪数据上运行评估:这些 trace 数据包含了应用的输入与输出,在其上运行你的评估程序。8️⃣ 分析失败的评估项和负面用户反馈:这些数据是宝藏——它们精确地指出了智能体系统需要改进的地方。9️⃣ 利用上一步的数据改进应用:包括提示工程(prompt engineering)、改进系统拓扑、微调模型等。务必确保这些改动让评估指标朝正确方向提升。🔟 向用户发布改进后的应用。1️⃣1️⃣ 在生产环境中监控应用:监控几乎可以“开箱即用”——因为你在开发阶段已经实现了评估和追踪功能。只需配置报警阈值,你就能高枕无忧地观察系统运行情况。✅ 持续改进(Continuous Development)➡️ 重复执行步骤 6–10,持续改进和演化你的应用。➡️ 随着系统复杂度提升,可以在同一应用中添加新需求。这包括重新执行步骤 1–5,并将新的逻辑以“route”的形式接入智能体系统。➡️ 例如:你最初可能只是一个简单的聊天机器人,后来增加了用户意图分类的功能,用于执行动作(比如将商品加入购物车)。#人工智能##程序员#

66. 小伙竟然能看到成功率

67. 国内首次!8.9毫秒推理速度破纪录,1元打穿百万token

68. 全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%

69. OpenAI发布权威AI科研基准,扯下AI遮羞布:奥赛金牌≠一流科学家!

70. 构建面向智能体 API 的指南

71. 看到成功率后起飞

72. 弓形子宫和宫腔粘连对胎停流产的影响是比较明确的,姑娘人流以后月经就少了,已经有过2次胎停流产,所以再次生育这个宫腔肯定是要处理。同时,胎停流产的原因进一步完善,进一步增加下次怀孕的成功率。#弓形子宫 #宫腔粘连 #宫腔镜手术 #北京复兴医院马宁主任

73. 吴恩达DeepLearning AI 新课程:Design, Develop, and Deploy Multi-Agent Systems with CrewAI可以浏览器装一个沉浸式翻译插件,实时英文字幕转中文。 主要介绍了如何设计、开发与部署多智能体(multi-agent)系统,重点在于掌握代理式 AI 工作流(agentic AI workflows)的思维方式与工程方法。将学会如何把复杂任务分解成由多个专门智能体协作完成的子任务,从而高效构建复杂的 AI 应用。1. 掌握构建多智能体系统的基本概念:agent、task、crew、flow、state 等。2. 理解智能体的核心组成:记忆(memory)、工具(tools)、模型上下文协议(MCP)、执行钩子(execution hooks)与防护机制(guardrails)。3. 学会通过 CrewAI 框架将这些要素组合,构建具有可观测性、可控性与可扩展性的系统。4. 了解如何通过指标(metrics)与人类反馈(human feedback)对智能体进行评估与持续改进。访问:learn.deeplearning.ai/courses/design-develop-and-deploy-multi-agent-systems-with-crewai

74. 「Github一周热点93期」 多智能体舆情分析、桌面 AI 助手、自然语言画图、Rust桌面组件库、Linux服务器安全和GitHub绿墙

75. 中国信通院2026年首批可信AI智能体评估正式启动

76. 云上智能体评估六问 | 基于行业云推理的辅助决策智能体评估首批结果公布,国药数科通过卓越级评估

77. 中国信通院2026年“云上智能体”系列评估工作正式启动

78. 是时候好好测测你的智能体了——Anthropic 解密智能体评估

79. Agentic设计模式(19)

80. 【科普园地】智能体的测试指标与评价方法

81. 评测体系架构设计

82. 构建可信 AI 智能体评估体系的 8 步实战指南

83. MIIT/TC1重点标准宣介 | 智能体评测系列标准

84. 智能体的使用效果评估指南

85. 全国首部AI智能体应用评估标准,现公开征集起草单位和个人!

86. 智能体质量评测体系

87. “弈衡”评测体系

88. 火山引擎推出数据智能体 Data Agent 评测体系

89. 如何评估高质量高价值的智能体?容智全维度评估宝典教你实战方法

90. 全国首部AI智能体应用评估标准,现公开征集起草单位和个人

91. 全国首部AI智能体应用评估标准正式启动

92. 理解AI智能体

93. 现实世界不确定性下Agent一致性和可靠性

94. 智能体评测基准 32场景138个任务。📚arXiv: 2601.11044

95. 智能体的测试指标与评价方法

96. 首份 LLM 智能体评测全景图发布!IBM × 耶鲁重磅综述

97. 揭秘AI智能体的质量评估方法

98. AI 智能体工程化核心痛点解析 “智能体浮光行为” 的成因与治理方案

99. 企业级智能体落地全流程技术评估清单

100. LLM的风险揭示与安全性评估

101. 把“能做成事”量出来

102. 【L2写作】二语写作中人机协作能力的评估框架

103. 团队在人机协作大模型领域取得重要进展

104. 如何评估大模型的真实性能?除了跑分,技术决策者更应关注这三点

105. 论文速递 | 人工智能大模型价值对齐评估研究综述

106. 人工智能的对齐是怎么做的?

107. 第十章

108. 告别对齐幻觉

109. 从“启发”到“对齐”

110. 为AI智能体选型、验收、优化提供量化依据

111. 可信AI | 中电福富通过中国信通院智能体平台和工具评估

112. 中国信通院可信AI软件运维智能体首轮评估正式启动

113. 可信AI | 溪河科技通过中国信通院可信AI智能体应用服务评估

114. 腾讯云通过中国信通院可信AI智能体平台和工具评估

115. 智能体应用成熟度技术规范首次研讨会顺利召开

116. 可信AI | 南瑞通过中国信通院智能体平台和工具评估

117. 人工智能大模型与智能体技术系列标准进入关键评审阶段

118. 别再刷 Benchmark 分了!Anthropic 撕开 Agent 评估的遮羞布

119. 从AI小白到资深

120. 大模型应用评测体系

121. 企业级AI智能体自动化评估

122. AI 智能体评估指南

123. 吴恩达Agentic AI实战|评估与优化

124. 别只看准确率

125. 可信AI | 中国信通院正式启动2026年首批数据分析智能体评估

126. 中国信通院可信AI多智能体协同2026年首批评估正式启动,首个行业标准即将报批

127. 智能体最佳实践的方法论(一)

128. 智能体来了从 0 到 1

129. 像考核员工一样评测智能体

130. 全国首部AI智能体应用评估标准,现公开征集起草单位和个人!

131. 目前Agent/智能体评估的现状如何?

132. 杜克大学、Zoom推出LiveMCP‑101:GPT‑5表现最佳但未破60%,闭源模型Token效率对数规律引关注

133. 综述:基于 LLM 的智能体强化学习(Agentic RL)

134. 美团 LongCat 团队发布 VitaBench:基于复杂生活场景的交互式 Agent 评测基准

135. τ-Bench之后看什么?VitaBench:重新定义Agent任务的“真实复杂性”

136. 荐读丨英伟达发布AI智能体安全评估框架

137. 冀北电科院牵头申报的《人工智能 电力智能体评测指标与方法》标准获批立项

138. 中国信通院物联网智能体评测体系1.0正式发布

139. AI 智能体系统:体系架构、应用场景及评估范式

140. 如何评估智能体测评结果的准确性?

141. AI 智能体企业级自动化评估实用指南

142. 8个AI智能体性能测试基准

143. 微软| 搞定长时程、跨应用的Agent,竟然只靠<20%的摘要记忆,反超全文投喂

144. 如何评测智能体?16篇最新研究梳理!

145. Anthropic 开源 Bloom:基于 LLM 的自动化行为评估框架

146. CodeAgent2.0时代开启|GitTaskBench

147. 新范式继续评估AGI模型

148. 怕 AI 不靠谱?2026 智能体避坑指南 + 真实案例全曝光

149. 中国信通院可信AI搜索智能体首批评估正式启动

150. 首批!易能安科通过信通院数据分析智能体稳健级评测

151. 可信AI | 中国信通院搜索智能体首批评估正式启动

152. 【精选报告】智能体驱动的大模型系统工程与产业实践——电信运营商与云服务商的合作探索(文末附PDF免费下载)

153. 浙大团队重磅发布 RAS-Eval!支持真实 / 模拟双环境执行,3802 个攻击任务筑牢 LLM 智能体安全评估防线

154. 探索大模型智能体:定义、方法与未来趋势,一篇搞定LLM智能体知识!

155. BioML-bench:生物医学端到端机器学习智能体的评估基准研究解读

156. 可信AI | 中国信通院政务智能体评估火热进行中

157. 可信AI | 中国信通院多智能体协同2026年首批评估正式启动,首个行业标准即将报批

158. 字节推出VeAgentBench + veADK,打造可评估、可复现的智能体开发新范式

159. 首家!火山引擎通过信通院数据分析智能体最高等级评测

160. 中国信通院“方升”智测——智能体测试研讨会即将召开

161. AI Agent Benchmark & Evaluation(2025 · ToDo List)

162. 陈怡然团队新作:真实场景下测评智能体

163. 求索|电子标准院智能体评测结果公布

164. 探索大模型评测工具open compass

165. 空间无人自主系统的人机协作

166. 规划体检评估智能体的探索与实践

167. 可信AI | 中国信通院正式启动数据分析智能体第二批评估

168. STEP:一种成功率引导的多轮强化学习方案

169. 中国信通院正式启动可信AI远程银行智能体2026首轮评估

170. 测评:2026年最好的PC端桌面智能体助理有哪些?选购建议

171. 共筑AI安全治理新格局 第一届大模型生成内容安全评估与智能体安全论坛在哈尔滨成功召开

172. 大华股份通过中国信通院“可信AI”智能体平台和工具评估

173. 规划体检评估智能体:让智能助手为您完成规划体检评估全流程

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章