学术绘图繁琐耗时,谷歌与北京大学联合开源了PaperBanana工具,利用多智能体架构自动生成NeurIPS级别的论文插图。它兼顾美观与精准,能将科研人员从绘图负担中解放出来,显著提升科研效率。
智能速览
谷歌北大联合开发,支持多模式生成与图表风格增强。
采用多智能体协作架构,模拟人类绘图全流程。
性能全面碾压传统模型,综合得分提升17.0%。
代码生成模式实现100%数值忠实度,逻辑清晰度大幅提升。
精华内容
PaperBanana通过五大智能体协作,实现了从理解论文到生成出版级插图的端到端自动化。
核心功能优势
PaperBanana具备多模式生成能力,支持直接生成图像或通过代码绘制图表,兼顾视觉效果与数值精准性。它能对现有人工绘制的图表进行智能风格优化,提升专业感。
该工具实现了全流程自动化,从理解论文内容到生成最终插图,端到端处理能力显著。在需要精确数值的统计图表任务中,其代码生成模式可实现100%的数值准确性。
多智能体架构
创新点在于采用了多智能体协作架构,模拟人类绘图全流程。检索智能体从NeurIPS 2025论文库匹配参考案例;规划智能体将文字描述转化为详细绘图说明书。
风格智能体总结顶会审美规范,适配不同领域风格;可视化智能体根据说明书生成图像或代码;批判智能体进行事实校验,经3轮循环迭代后输出成品。
性能实测表现
搭配Nano-Banana-Pro时,综合得分达60.2,相对基线提升17.0%。简洁性得分提升高达37.2%,可读性和美观性也分别实现12.9%和6.6%的提升。
在匿名人类盲测中,72.7%的研究员认为其效果优于基线模型。消融实验证明,检索参考、风格优化、批判迭代三个环节缺一不可,共同支撑了“准确又好看”的效果。
PaperBanana为自动化生成出版级学术插图提供了可行方案,目前在GitHub备受关注。尽管图像编辑灵活性仍待提升,但已能高效优化现有图表。未来应用场景有望扩展至专利技术图、UI原型等领域,科研绘图自动化已来。