张大妈

谷歌北大联手学术版Banana爆火,论文图表100%精确生成

源自今日头条:新浪财经

02-07 11:46

学术插图制作耗时且要求高,PaperBanana的出现为此提供了全自动解决方案。该工具由谷歌与北大联合开发,通过多智能体协作,不仅能生成逻辑清晰、视觉美观的插图,更能通过代码模式保证图表数据100%精确,为研究人员节省了大量精力,有望改变学术论文的配图生态。

谷歌北大联手学术版Banana爆火,论文图表100%精确生成智能速览

  • PaperBanana由谷歌与北大联手打造,专攻学术插图自动生成。

  • 采用五智能体分工协作,模拟人类从构思到出图的完整流程。

  • 提供两种模式:代码生图保证数值精准,直接生图提升视觉美观度。

  • 搭建专用评测基准,在忠实度、简洁度等维度全面超越基线方法。

  • 目前仍存在无法编辑、细节忠实度不及人工的局限性。

谷歌北大联手学术版Banana爆火,论文图表100%精确生成精华内容

PaperBanana的强大并非源自单一模型,而是借鉴了人类科研工作者的绘图流程,通过五个分工明确的智能体协同工作,将抽象的学术概念转化为精准的视觉表达。

五智能体协同

该系统的核心是模拟人类制作论文插图的步骤。首先,检索智能体查找顶会论文的配图范例,寻找灵感与规范。接着,规划智能体根据研究内容构思架构蓝图。然后,风格优化智能体参考“顶会审美”标准,为蓝图增添设计感。最后,生成智能体负责出图,批判智能体进行审查校对,确保准确无误。

值得一提的是,介绍这一工作流程的示意图,也是由PaperBanana自身生成的。

精准与美观兼得

PaperBanana提供两种出图模式以应对不同需求。代码生成模式是默认选项,它利用Gemini-3-Pro自动编写并执行Python可视化代码,从而保证图表数值100%精准,无任何幻觉,适用于对数据精度要求极高的场景。另一种是直接生图模式,跳过代码环节,直接生成图像,视觉效果更出色,但可能产生数值错误,在美观与准确之间需要权衡。

效果超越基线

为客观评估效果,团队构建了PaperBananaBench评测基准,包含292个源自NeurIPS 2025论文的测试样本。评估采用“VLM-as-a-Judge”范式,让视觉语言模型作为裁判,从忠实性、简洁性、可读性、美观性四个维度进行打分。实验结果显示,PaperBanana在所有维度上均全面超越了传统的单模型直接生成等基线方法。消融实验也证实,检索参考、风格优化与批判迭代三个环节对最终质量至关重要。

PaperBanana的出现,为学术插图的自动化生成树立了新的标杆,显著降低了科研人员的绘图门槛。尽管目前尚有局限,但其多智能体框架与评测方法为后续研究提供了宝贵思路。它是否会成为未来科研人员的标配工具?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章