当前位置:
AIGC文章详情

张大妈

苹果发表Manzano:无损融合“看图”与“绘图”的多模态AI模型

源自今日头条:IT之家

01-18 21:09

苹果最新研究的多模态模型Manzano,解决了AI长期存在的“看图”与“绘图”难以兼顾的难题。传统模型常在理解与生成间妥协,而Manzano通过创新架构,实现了两种能力的无损融合,为未来端侧AI体验带来了新的想象空间。

苹果发表Manzano:无损融合“看图”与“绘图”的多模态AI模型智能速览

  • 多模态AI存在“看图”与“绘图”任务的根本冲突。

  • Manzano采用混合视觉分词器、大语言模型和扩散解码器三段式架构。

  • 在处理反直觉指令时,其逻辑准确性与GPT-4o等模型旗鼓相当。

  • 模型在3亿至300亿参数规模下均表现出良好的可扩展性。

  • 该技术未来有望被整合进“图乐园”功能,提升苹果端侧AI竞争力。

苹果发表Manzano:无损融合“看图”与“绘图”的多模态AI模型精华内容

Manzano的核心突破在于其巧妙地解决了AI处理视觉信号时的内在矛盾,它究竟是如何做到兼顾“理解”与“生成”的?

任务冲突

AI进行图像理解时偏好连续的数据流,类似看视频;而进行图像生成时则依赖离散的数据块,类似拼图。传统模型用单一架构处理这两种信号,导致任务冲突,结果要么是能看懂但画不出,要么是画得好但理解有偏差。这种“视觉分词”方式的根本差异,是长期困扰多模态AI发展的技术瓶颈。

混合分词

Manzano的创新始于一个混合视觉分词器,它能同时为同一图像生成连续和离散两种视觉表示,从根源上解决了信号冲突。随后,大语言模型(LLM)介入,负责预测图像的语义内容,确保模型在宏观层面准确理解需要描绘什么,为后续的像素生成提供了精确的蓝图。

精准渲染

最后,LLM预测的语义内容被送入扩散解码器,进行像素级的精细渲染。这种分工明确的架构,使其在处理“一只鸟在大象下方飞翔”这类反直觉指令时,逻辑准确性与OpenAI的GPT-4o及谷歌Nano Banana模型持平。测试中,从3亿到300亿参数的不同版本,都证实了该架构的优越性与可扩展性。

Manzano模型虽处于研究阶段,但它揭示了苹果在端侧AI领域的深厚布局。这项技术若能融入消费级产品,将极大提升图像创作与编辑的智能化水平。未来,当每个人的设备都兼具强大的视觉理解与创造能力时,数字生活的边界将被如何重新定义?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章