苹果最新研究的多模态模型Manzano,解决了AI长期存在的“看图”与“绘图”难以兼顾的难题。传统模型常在理解与生成间妥协,而Manzano通过创新架构,实现了两种能力的无损融合,为未来端侧AI体验带来了新的想象空间。
智能速览
多模态AI存在“看图”与“绘图”任务的根本冲突。
Manzano采用混合视觉分词器、大语言模型和扩散解码器三段式架构。
在处理反直觉指令时,其逻辑准确性与GPT-4o等模型旗鼓相当。
模型在3亿至300亿参数规模下均表现出良好的可扩展性。
该技术未来有望被整合进“图乐园”功能,提升苹果端侧AI竞争力。
精华内容
Manzano的核心突破在于其巧妙地解决了AI处理视觉信号时的内在矛盾,它究竟是如何做到兼顾“理解”与“生成”的?
任务冲突
AI进行图像理解时偏好连续的数据流,类似看视频;而进行图像生成时则依赖离散的数据块,类似拼图。传统模型用单一架构处理这两种信号,导致任务冲突,结果要么是能看懂但画不出,要么是画得好但理解有偏差。这种“视觉分词”方式的根本差异,是长期困扰多模态AI发展的技术瓶颈。
混合分词
Manzano的创新始于一个混合视觉分词器,它能同时为同一图像生成连续和离散两种视觉表示,从根源上解决了信号冲突。随后,大语言模型(LLM)介入,负责预测图像的语义内容,确保模型在宏观层面准确理解需要描绘什么,为后续的像素生成提供了精确的蓝图。
精准渲染
最后,LLM预测的语义内容被送入扩散解码器,进行像素级的精细渲染。这种分工明确的架构,使其在处理“一只鸟在大象下方飞翔”这类反直觉指令时,逻辑准确性与OpenAI的GPT-4o及谷歌Nano Banana模型持平。测试中,从3亿到300亿参数的不同版本,都证实了该架构的优越性与可扩展性。
Manzano模型虽处于研究阶段,但它揭示了苹果在端侧AI领域的深厚布局。这项技术若能融入消费级产品,将极大提升图像创作与编辑的智能化水平。未来,当每个人的设备都兼具强大的视觉理解与创造能力时,数字生活的边界将被如何重新定义?