Meta-Harness真能终结大模型评测调参噩梦?三类团队实测结果大不同

源自78位全网作者

04-10 15:28

精选参考来源

1
Harness Engineering 到底是什么?你可能已经会写 prompt 了,但最近火的 Harness Engineering 是什么?先搞清一个区别:- Prompt Engineering = 教你怎么说话让 AI 听懂- Harness Engineering = 造一套系统让任何人都能驾驭 AIPrompt 是手艺活,效果取决于写的人的水平。Harness 是工程活,目标是不管谁来用,结果都稳定可靠。- 打个比方:Prompt 像苦练骑术,Harness 像发明马鞍+缰绳+马镫——装备好了,骑术一般的人也能跑得稳。那它具体包括什么呢:- AI 模型本身就像一匹野马,很强但不可控。Harness Engineering 就是给它套上"马鞍",具体包括:1. 提示词模板:标准化的思考框架,不用每次现写2. 工具调用:让模型能查天气、搜网页、读文件3. 结构化输出:回答不是一堆文字,而是程序能解析的 JSON4. 容错重试:模型抽风了自动重试,不用人盯着5. 检索增强(RAG):让模型能查你的私有数据6. 护栏机制:防止模型说出不该说的话核心思路:- 不要试图让模型更聪明,而是让系统更聪明地使用模型。以前大家卷的是模型大小、跑分高低。现在大家发现模型够用了,真正决定产品好坏的是套在外面那层"马鞍"。Prompt Engineering 只是 Harness 里最小的一个零件。真正的竞争在于整套系统的工程能力。#Harness##Prompt Engineering##Prompt##Prompt Engineering##AI##大模型#
2
模型和框架的关系 基座大模型正在快速模仿并内化框架的核心能力,并将其直接纳入自身产品当中,而框架本身也随之变得越来越复杂,这种现象背后,模型与框架的关系正在发生根本性的转变。在早期阶段,基座大模型由于主要擅长下一词预测,在多步规划、工具调用、状态管理和长任务执行上存在明显短板,因此LangChain、LlamaIndex、AutoGen等框架扮演了外骨骼和放大器的关键角色,通过提供ReAct循环、RAG增强、Agent执行器、内存管理等机制,让模型得以从聊天机器人转变为真正能落地的应用系统,那时框架本质上是模型的补丁和工程支架,开发者大量精力都耗费在框架编排上。然而进入2025-2026年Agent爆发期后,情况发生了显著变化,GPT5.4 、Claude、 Gemini等前沿模型已原生内置结构化Tool Calling、长链推理、自我纠错、百万token上下文记忆以及Agentic规划能力,直接将过去框架负责的很多逻辑吸收到模型内部,使得简单场景下开发者甚至无需复杂框架,一次API调用即可实现以往需要大量代码才能完成的智能体功能。尽管如此,框架非但没有被淘汰,反而进化得更加复杂和专业,它从简单的链式结构转向以LangGraph为代表的图状工作流和状态机,从单Agent扩展到多智能体协同体系,并率先引入MCP、A2A等标准化协议,专注于Agent之间的通信协调、权限控制、人类在环干预、生产级监控、审计追踪以及复杂企业级场景的可靠性保障。可以说,模型与框架的关系已从“框架全力补齐模型短板”的单向依赖,转变为“模型是大脑负责聪明与创造、框架是操作系统负责稳定、协同与规模化”的深度共生关系——模型吃掉了框架中简单重复的执行逻辑,而越强大的模型反而越需要框架来管住它、用好它并实现工业级落地。未来,两者将进一步融合成端到端的AgentOS形态,简单任务由模型内置轻量框架逻辑直接完成,复杂工业应用则依赖重型框架进行元协调与持续进化,最终共同推动AI从生成式工具迈向真正可信赖、可控的数字劳动力体系。#新媒沈阳聊ai#
全部
来源
内容由AI生成

精选参考来源

1. Harness Engineering 到底是什么?你可能已经会写 prompt 了,但最近火的 Harness Engineering 是什么?先搞清一个区别:- Prompt Engineering = 教你怎么说话让 AI 听懂- Harness Engineering = 造一套系统让任何人都能驾驭 AIPrompt 是手艺活,效果取决于写的人的水平。Harness 是工程活,目标是不管谁来用,结果都稳定可靠。- 打个比方:Prompt 像苦练骑术,Harness 像发明马鞍+缰绳+马镫——装备好了,骑术一般的人也能跑得稳。那它具体包括什么呢:- AI 模型本身就像一匹野马,很强但不可控。Harness Engineering 就是给它套上"马鞍",具体包括:1. 提示词模板:标准化的思考框架,不用每次现写2. 工具调用:让模型能查天气、搜网页、读文件3. 结构化输出:回答不是一堆文字,而是程序能解析的 JSON4. 容错重试:模型抽风了自动重试,不用人盯着5. 检索增强(RAG):让模型能查你的私有数据6. 护栏机制:防止模型说出不该说的话核心思路:- 不要试图让模型更聪明,而是让系统更聪明地使用模型。以前大家卷的是模型大小、跑分高低。现在大家发现模型够用了,真正决定产品好坏的是套在外面那层"马鞍"。Prompt Engineering 只是 Harness 里最小的一个零件。真正的竞争在于整套系统的工程能力。#Harness##Prompt Engineering##Prompt##Prompt Engineering##AI##大模型#

2. 模型和框架的关系 基座大模型正在快速模仿并内化框架的核心能力,并将其直接纳入自身产品当中,而框架本身也随之变得越来越复杂,这种现象背后,模型与框架的关系正在发生根本性的转变。在早期阶段,基座大模型由于主要擅长下一词预测,在多步规划、工具调用、状态管理和长任务执行上存在明显短板,因此LangChain、LlamaIndex、AutoGen等框架扮演了外骨骼和放大器的关键角色,通过提供ReAct循环、RAG增强、Agent执行器、内存管理等机制,让模型得以从聊天机器人转变为真正能落地的应用系统,那时框架本质上是模型的补丁和工程支架,开发者大量精力都耗费在框架编排上。然而进入2025-2026年Agent爆发期后,情况发生了显著变化,GPT5.4 、Claude、 Gemini等前沿模型已原生内置结构化Tool Calling、长链推理、自我纠错、百万token上下文记忆以及Agentic规划能力,直接将过去框架负责的很多逻辑吸收到模型内部,使得简单场景下开发者甚至无需复杂框架,一次API调用即可实现以往需要大量代码才能完成的智能体功能。尽管如此,框架非但没有被淘汰,反而进化得更加复杂和专业,它从简单的链式结构转向以LangGraph为代表的图状工作流和状态机,从单Agent扩展到多智能体协同体系,并率先引入MCP、A2A等标准化协议,专注于Agent之间的通信协调、权限控制、人类在环干预、生产级监控、审计追踪以及复杂企业级场景的可靠性保障。可以说,模型与框架的关系已从“框架全力补齐模型短板”的单向依赖,转变为“模型是大脑负责聪明与创造、框架是操作系统负责稳定、协同与规模化”的深度共生关系——模型吃掉了框架中简单重复的执行逻辑,而越强大的模型反而越需要框架来管住它、用好它并实现工业级落地。未来,两者将进一步融合成端到端的AgentOS形态,简单任务由模型内置轻量框架逻辑直接完成,复杂工业应用则依赖重型框架进行元协调与持续进化,最终共同推动AI从生成式工具迈向真正可信赖、可控的数字劳动力体系。#新媒沈阳聊ai#

3. Harness Engineering 来了,SDD 还有意义吗?

4. 对普通人来说,找到自己的行业痛点就是AI时代最好的入场券。 #大咖观察 #红衣聊AI #AI时代 #热点知多少

5. 看看 Claude Code 怎么做 Harness,这才是 Agent 工程化的真正难点

6. 在智能体开发中,经常面临模型智能与多样工具、记忆和安全治理的整合难题。OpenHarness 是一个轻量级的开源 Agent Harness 框架,专为研究者和开发者设计,提供了完整的智能体基础设施。它不仅支持丰富的 43 种工具(文件、Shell、搜索、Web、任务管理等),还能动态加载 40+ 技能,支持插件生态扩展,还拥有细粒度多级权限治理和多智能体协作能力。核心特点包括:- 持续的 Agent 循环(流式工具调用,API 重试,代币计数等)- 丰富的工具和技能支持,结合 Anthropic 生态兼容性强- 持久化记忆、上下文压缩与会话续接- 多重权限管理,交互式审批保障安全- 多代理团队协作和任务委派- React 终端 UI,提供交互式命令选择和权限弹窗支持 Python 3.10+,提供一键命令行启动(`oh`),适合构建定制化智能体及多任务协作系统。GitHub:github.com/HKUDS/OpenHarness主要功能:- 43 种工具:文件操作、Shell 命令、网络搜索、任务管理等- 40+ 按需加载技能,涵盖代码提交、测试、安全审查等- 灵活插件系统,方便自定义命令、事件钩子和多智能体- 多级权限配置,确保执行安全- 多智能体协调,支持子智能体创建和团队管理- 交互式 React 终端UI,提升用户体验如果你想了解国产版 Claude 轻量实现,或是打造高效可扩展的智能体框架,OpenHarness 绝对值得一试!#开源智能体# #AgentHarness# #AI开发#

7. 当AI能写测试脚本时,测试工程师需要具备这些能力(附升职涨薪关键策略+保姆级资源)

8. 梦想照进现实!AI大模型全屋智能居然成了?!

9. #阿里顶配模型就用千问APP# @千问 app全新上线,大家都说它特别擅长处理结构化任务,我立刻考了考它,让千问给我出一份“勾股定理的完整教案框架”。看到回答后我真心觉得挺惊喜的,内容规范,逻辑也清晰,几乎和现实中用到的教案大差不差,连板书设计都能生成。我也去了解了一下为什么千问能如此强大,这都得益于阿里顶级模型Qwen。要知道在《2025年度中国商用大模型》厂商评估报告中,阿里的商用基础模型竞争力整体第一,也难怪它能确保每个回答都逻辑严谨、内容扎实。而且它更契合中文学习场景,这一点已经比绝大多是AI都要先进了。

10. 大模型只是能力,必须要跟场景结合。 #大咖观察 #红衣聊AI #大模型

11. 盘点一周AI大事(1月4日)|Google包揽年度最佳模型 LMArena大模型盲选排行榜公布年度冠军 Google推出AI辅助学习系统Learn Your Way 阿里开源最强手机智能体MAI-UI DeepSeek发布新研究mHC IQuest发布最强开源编码模型IQuest-Coder-V1 字节发布动态概念大模型DLCM 腾讯发布最强开源翻译模型HY-MT1.5 阿里更新最强开源图像模型Qwen-Image-2512 Meta开源极速视频生成模型HiStream 研究员开源对象植入模型InsertAnywhere 研究员开源MV智能体AutoMV 腾讯开源3D动作生成模型Hunyuan Motion 1.0 研究员开源高保真3D模型UltraShape 研究员开源世界模型Yume 1.5 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #AIGC

12. 「Github一周热点104期」智谱GLM-5发布,打响春节AI大战模型第一枪

13. 从 Vibe Coding 到 Harness Engineering:重构 AI 时代的工程信任

14. 超级章鱼-传感器工程师的智能助手,重要更新至 2.0 版本,本次更新给您带来了一个数字工程师军团,本次基于专业超级智能体运行时框架(Super Agent Harness),定位为面向复杂多步骤任务的全栈式工程智能体执行专家团队,效率直接提升十倍。为工程师从需求明确,传感选品,非标定制,现场测试,方案集成全流程赋能。把原来六周的工作量最低压缩到三天。让AI 与私有传感大数据助力工程问题快速解决#新媒沈阳聊ai#

15. Harness 驾驭工程是 AI 平权的必经之路?

16. 探秘 AgentRun丨流量一大就瘫痪?如何解决 AI 模型调用之痛

17. 蚂蚁数科王磊:垂直大模型训练成本呈百倍级下降,金融AI落地需构建“可信智能体”三大基石 | Alpha峰会

18. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型

19. 盘点一周AI大事2月8日|AI相亲、AI当老板、AI狼人杀 Anthropic发布最强大模型Claude Opus 4.6 OpenAI发布最强编码模型GPT5.3Codex OpenAI推出Codex桌面版 Google上线AI狼人杀 AI雇佣人类平台RentAHuman爆火 AI雇佣AI平台ClawTasks爆火 龙虾相亲平台MoltMatch爆火 智谱开源最强OCR模型GLM-OCR 字节发布最强视频模型Seedance 2.0 研究员开源无痕编辑视频模型Edit Yourself 字节开源最强分子预测模型Protenix-v1 Google发布论文配图AI Paper Banana #AI新星计划 #前沿科技趋势发布月 #AI #AIGC #OpenAI

20. 别再用 Ollama 了!OpenClaw 秒级响应方案(vLLM + 本地模型)完全免费!| 零度解说

21. 在线构建AI代理的可靠运行环境,总是头疼环境搭建、上下文管理、评测设计和安全约束?“Awesome Harness Engineering”(GitHub:github.com/walkinglabs/awesome-harness-engineering)专注于“harness engineering”,即为AI代理打造稳定高效的工作环境合集。它集合了上下文管理技巧、安全约束设计、工作流程规范、评测基准和成熟的运行时框架,覆盖了从长时运行的代码代理到多任务协调的全流程实践。核心亮点:- 深度解析上下文、记忆与工作状态的优化方法,提升代理持续工作能力;- 框架级安全防护与约束设计,保障代理安全自主运行;- 丰富的标准规范和工作流设计参考,提高项目规范化与可复用性;- OpenAI、Anthropic、LangChain等多大厂核心技术与最佳实践直达;- 专业评测套件和基准测试,量化衡量代理效能与稳定性;- 具备实战价值的Agent运行时、SDK和参考实现合集,助力快速落地。支持多种行业和应用场景,适合研发人员、AI工程师和架构师学习借鉴,打造更“靠谱”的智能助手和自动化系统。快去GitHub探索,开启高效AI代理工程新篇章!#AI代理# #智能自动化# #开源工程# #HarnessEngineering#

22. Harness Engineering:AI Agent 落地企业的工程化核心

23. 盘点一周AI大事(11月23日)|AI自己画CAD图纸 Google发布最强大模型Gemini 3、最强图像模型Nano Banana Pro OpenAI发布最强编码模型GPT-5.1-Codex-Max 马斯克升级Grok 4.1,情商最强 字节开源最强空间重建模型Depth Anything 3 腾讯发布最强开源视频模型HunyuanVideo-1.5 Meta开源最强对象分割模型SAM 3,最强3D分割模型 SAM 3D Autodesk研发出最强CAD智能体VideoCAD AI2发布最强开源深度研究智能体Deep Research Tulu Google发布最强AI天气预报WeatherNext 2 Maxima推出AI会计智能体 头号玩家套装问世 #AI新星计划 #人工智能 #AIGC #OpenAI #大模型

24. 盘点一周AI大事(2月22日)|不赚钱拔网线,龙虾狂赚1万 工程师开源龙虾打工人ClawWork,10刀开局,7小时狂赚1万刀 工程师Sigil开源首个全自主智能体The Automaton Kimi上线云端龙虾Kimi Claw 网易开源桌面版龙虾LobsterAI Google上线地表最强大模型Gemini 3.1 Pro Gemini接入音乐模型 Lyria 3 NotebookLM升级,动动嘴就能修改PPT,还支持导出PPTX格式 Anthropic发布Claude Sonnet 4.6 Claude与Figma官宣史诗联动,Claude Code写的页面能一键导入Figma 阿里开源最强行动智能体 Mobile-Agent-v3.5 字节开源极速生图模型BitDance Tavus发布最强数字人模型Phoenix-4 Taalas研发出革命性AI芯片HC1 #抖音年味新知贺岁 #前沿科技趋势发布月 #AI新星计划 #OpenAI #智能体

25. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月

26. Harness is the New Dataset:模型智能提升的下一个关键方向网页链接“最近,harness engineering 又成了继 prompt engineering、context engineering 之后新一代的 buzzword。这背后对应着一个越来越清晰的变化:当基模能力逐渐成熟后,现在真正决定 agent 上限的,已经不是模型本身,而是围绕模型搭建起来的整套系统。尤其对于模型公司来说,谁更早把 harness 跑顺,谁就更早有机会捕获高质量的执行轨迹;谁能持续捕获这些轨迹,谁就更有可能形成更强的数据飞轮。Deepmind 的 Staff Engineer Philipp Schmid 甚至直接给出了一个判断:“The Harness is the Dataset. Competitive advantage is now the trajectories your harness captures (Harness 本身就是数据集。现在真正的竞争优势,在于你的 harness 能捕获到怎样的执行轨迹) .”所以我们最近深入研究了一下这个概念,梳理了 Anthropic、OpenAI、Google 等一线团队的实践经验,也调研了一些身边顶级 agentic engineering 的经验感受,这里分享一些关键的方法论和思考。”#How I AI#

27. 盘点一周AI大事(10月19日)|Gemini 3.0逆天 OpenAI官宣自研AI芯片,与博通合作打造10吉瓦算力中心 OpenAI更新Sora 2,支持故事板画分镜,时长加到25秒 Google上线Veo 3.1硬刚Sora,支持3张参考图锁定主体,支持首尾帧平滑过渡,支持扩展长度到1分钟,支持添加和移除任意物体 Gemini 3.0 已开启灰度测试,前端开发能力炸裂,甚至能复刻网页版操作系统 Anthropic上线Haiku 4.5,编码能力追平Sonnet4 Claude上线Skills,把指令、脚本和资料压缩成技能包 AI学界首次提出可量化的AGI定义 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

28. 盘点一周AI大事(11月30日)|AI自己剪片子 奥特曼预告下一代大模型Shallotpeat Anthropic发布最强编码模型Claude Opus 4.5 DeepSeek发布最强开源推理模型DeepSeek-Math-V2 微软开源最强行动智能体Fara-7B Black Forest推出最强开源图像模型Flux.2 阿里发布开源版小香蕉平替Z-Image 腾讯发布开源版Veo 3平替Tencent Harmony 字节开源AI剪辑大模型Vidi2 腾讯开源最强OCR模型HunyuanOCR 1B 科学家研发出最强数据分析智能体Edison Analysis RAI研发棒球陪练机器人 港科大训练出首个会打篮球的机器人 工程师开源家用机器人Aloha mini #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

29. 在线开发自动化调试和迭代代码的朋友们注意了!autoagent(网页链接)致力于打造“自主引擎工程”。autoagent的核心思想是:你不再直接改动运行代码,而是通过编写一份program.md指令文件,让一个meta-agent自主读取、修改和优化agent.py中的代码,实现自动构建和迭代agent。它会根据benchmark任务的得分,自动调整策略,类似AI自动“打怪升级”的过程。项目亮点:- 单文件Python架构,注册驱动,结构清晰易改;- 任务基于Harbor格式,方便统一测试;- 整合Docker隔离环境,安全无风险地自动跑任务;- 自动根据测试得分保留更优改动,实现闭环优化;- 支持并行任务运行,提升效率。适合AI研发、智能agent工程师做自动化实验、自动调优agent的好帮手。只需写好benchmark任务和program.md,就能让meta-agent自主“熬夜”改进代码,效率爆棚!GitHub: github.com/kevinrgu/autoagent#自动化开发# #智能Agent# #开源项目#

30. 大模型更像人的大脑,智能体是大模型的手和脚。 #大咖观察 #红衣聊AI #智能体 #大模型

31. 从能聊天的大模型,到会干活的智能体,AI正迎来全新进化。 企业AI落地的机会就藏在这里。#网络名人赞两会 #2026全国两会 #红衣聊AI #产业升级

32. AI时代,会有一套全新的软件工程规范的,你爸以前学的软件工程方法,都过时了。 但加加,记得关注Harness Engineering,我认为比Vibe Coding,是更正确的工程观念。 你看,先接触市场上流行的Vibe Code,如果迷信就容易错失后面的Harness Engineering。但,Just do it,先用Vibe Coding写两个项目,知道优缺点,就容易接受更好的新概念。 // Vibe Coding 之后最主流、最受关注的两个新兴工程概念是:Agentic Engineering(智能体工程)和 Harness Engineering(驾驭工程)。它们是 AI 编程从 “随性生成” 到 “工程化可控” 的关键演进。 #父女日常#

33. 从Prompt Engineering、Context Engineering到Engineer the Harness。所以问题的关键变成:首先不是行智能体的任务能不能高质量交付,而是用户有没有拿完整的工作流去对应;其次不是Agent的进程有没有断点,而是面向操作层的完整生态有没有形成;再次不是所有AI产品都有能力成为超级入口,而是只有面向操作层的接管型通用智能在这个形态和生态位上。AI已经“通了”,但应用是不是“贯通”,取决于CC、OC类产品的厂商和用户有没有一起“拉通”。Engineer the Harness前和后是42%和78%的区别。目前处在拉通并形成自我改进和增强机制的阶段。

34. 告别手动调Harness!Stanford 提出 Meta-Harness,自动找到最优“模型脚手架”

35. 斯坦福新作Meta-Harness

36. 告别人工写代码!斯坦福MIT引爆Agent“自进化”革命,Meta-Harness到底颠覆了什么?

37. Meta-Harness

38. DeepMind Harness自动化。📚arXiv: 2603.03329

39. Meta‑Harness

40. 大模型落地的"最后一公里":评测、可靠性与风险控制实践|TiD2026演讲征集

41. 🚀 大模型评测实战指南

42. 关于征集企业大模型专业评测需求的通知

43. Meta-Harness

44. Meta-Harness: 让AI系统自动优化自己的Harness

45. 斯坦福&MIT最新Meta-Harness技术

46. 每日论文--元框架

47. Meta-Harness

48. 你以为是模型不够强,其实可能是“外壳”没调对

49. 让AI自己优化harness

50. AI自己优化AI

51. 还在卷AI模型?斯坦福改了Harness,排行榜直接第一了

52. Meta-Harness

53. Harness Engineering

54. 大家都在讲 Harness,一文吃透 AI Agent Harness

55. Harness Engineering

56. Harness Engineering 的6层架构基础设施

57. 给 AI 搭环境的设计图——我的Harness 四层模型

58. Meta-Harness颠覆性研究

59. 模型越强,AI 工程越要重写一遍 Harness

60. Agent Harness

61. 别再只盯着大模型了!真正决定AI Agent生死的,是它外面那层 Harness

62. Meta-Harness:斯坦福让harness实现自我改进

63. Meta-Harness让Haiku性能狂飙,甚至追平Opus!

64. 告别玄学调参:Agent 稳定落地的核心——Harness Engineering

65. Meta-Harness让Haiku性能狂飙,甚至追平Opus!

66. 斯坦福&MIT最新Meta-Harness技术:端到端优化大模型Harness

67. Meta Harness:AI自我进化的驾驭系统 | Matthew Berman

68. Context 还不够,Harness 才是 Agent 工程优化的正解?

69. 2026 年,Agent Harness 为什么会变得关键

70. 大模型时灵时不灵?试试 Harness Engineering,AI 稳定性直接拉满!

71. harness 工程Agent自优化Prompt跑通了

72. 我的Harness Engineering实践心得

73. 测试工程师怎么用 ai 去提效

74. 一文搞懂测试团队如何转型 AI 测试

75. AutoHarness:通过自动合成代码护栏(Code Harness)提升 LLM 智能体性能

76. 最近很火的 Harness-Engineering 到底是什么?

77. 一文读懂Harness Engineering:从14篇工程文章中,寻找那个让AI不再离经叛道的壳|亮马桥小纪严选

78. Harness 还是 Environment? 这波 Agent 创业还有护城河吗?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章