当前位置:
AIGC文章详情

【闪客】你管这破玩意叫智能体?Manus背后的技术

源自UP主:飞天闪客

01-19 17:46

随着Meta收购通用智能体Manus,AI智能体再次成为焦点。但这个听起来高大上的概念,其底层原理却异常朴实。本文旨在穿透技术术语的迷雾,揭示智能体Agent的本质,它并非神秘的未来科技,而是一套巧妙赋予AI感知与操作能力的逻辑框架。

【闪客】你管这破玩意叫智能体?Manus背后的技术智能速览

  • 智能体的核心,是让AI具备与外界交互的能力。

  • 将人工辅助流程程序化,就构成了Agent的基本框架。

  • ReAct模式是主流的Agent运行逻辑,即思考、行动、观察的循环。

  • Function Calling与MCP协议,正逐步规范Agent的工具调用标准。

  • Agent的可靠性仍受限于大模型的概率本质,离完全自动化尚有距离。

【闪客】你管这破玩意叫智能体?Manus背后的技术精华内容

要理解智能体,不妨忘掉这个花哨的名字。其本质逻辑,源于一个简单的沟通问题:如何让一个只会“一问一答”的AI,主动去获取外部信息并完成任务?

从人工到程序

理解智能体,可以从一个简单的场景开始。用户向AI提问,若AI缺少信息,用户手动搜索并补充,AI再给出答案。这个过程中,如果把中间人工搜索和补充信息的环节,替换成一个自动执行的程序,那么“AI+辅助程序”就构成了智能体的雏形。

为了让程序能与AI沟通,必须将模糊的自然语言需求,转换为机器可识别的、格式化的指令,确保AI能按预定流程执行,而不是随机回应。

ReAct模式核心

目前最知名的Agent运行模式是ReAct,其核心是一个持续的循环:思考、行动、观察。

具体流程是,AI先根据用户问题进行思考,判断是否需要调用外部工具。如果需要,就将具体的调用指令放入Action字段。程序执行该工具后,将结果填入Observation字段。AI根据新的信息再次思考,决定是继续调用工具还是给出最终答案。这个循环直到AI认为信息足够,才在Answer字段中返回结果。

规范与演进

早期的Agent严重依赖大段的自然语言提示词,稳定性较差。为了提升可靠性,出现了Function Calling技术,它将用户问题、系统角色定位和工具调用描述分离开,并用标准化的JSON格式来规范工具调用,降低了不确定性。

而MCP协议则走得更远,它将工具函数封装成独立的服务,通过通用标准对外提供。这不仅解耦了Agent主程序与工具,也让工具可以被不同的Agent复用,为构建更复杂的生态系统奠定了基础。

本质与局限

尽管技术不断演进,但当前所有Agent的底层,依然依赖大语言模型生成自然语言,再从中解析出确定性指令。这决定了其本质仍是一个概率系统,无法像传统程序那样实现100%的精确控制。

Function Calling和MCP等规范,只是在一定程度上约束了“随机性”,并未改变大模型作为语言概率模型的根本属性。因此,今天的Agent技术离真正可靠的自动化系统还有明显距离,更像是在语言模型之上硬塞了一层操作能力,未来的路还很长。

总而言之,智能体并非遥不可及的黑科技,而是一套工程化的实现思路。它巧妙地扩展了大语言模型的能力边界,却也继承了其不可控的基因。在通往真正智能自动化的路上,我们还有很长的路要走。下一个突破点,会出现在哪里?

【闪客】你管这破玩意叫智能体?Manus背后的技术关键评论

  • 有网友精辟概括,Agent的本质就是LLM加上提示词工程和工具调用。

  • 从商业视角看,Manus被收购为国内IT创业者如何实现海外toB变现提供了范例。

  • 一种观点认为,在科技行业,商业上的成功远比技术上的绝对正确更具现实意义。

  • 许多观众调侃Meta的策略,认为其收购行为更像是在为故事和营销付费。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章