北大与谷歌联合开源的PaperBanana框架,专为解决科研人员论文配图难题而生。它通过五大AI智能体协作,能自动生成高质量图表,大幅提升科研效率,让研究者能更专注于核心想法。
智能速览
北大与谷歌联合开源专为科研设计的论文插图生成框架PaperBanana。
采用五大智能体协作,完整复刻人类设计师的工作流程。
在权威测试中,其生成图表的准确性、简洁性和美观度均超越基线。
不仅能生成流程图和统计图,还能优化已有的人工绘图。
独创性地结合代码与图像生成,兼顾数据准确性与视觉美感。
精华内容
PaperBanana的核心价值在于其高度自动化的工作流和卓越的生成效果,它究竟是如何实现的?
智能体协作
PaperBanana模拟了人类设计师的完整工作流,通过五个核心智能体协同作业。首先是Retriever智能体负责检索相关文献和参考图,为内容创作提供基础。随后Planner智能体根据论文内容规划图表布局与核心信息点。接着Stylist智能体设计整体视觉风格,确保图表符合学术规范。Visualizer智能体则执行具体的渲染工作,将计划转化为图像。最后,Critic智能体进行自我批判与优化,确保输出质量。这一流程确保了生成图表的逻辑性与专业性。
性能实测
为验证其性能,研究团队构建了包含292个NeurIPS 2025真实案例的PaperBananaBench测试集。测试结果显示,PaperBanana在多项关键指标上全面超越现有方法。其中,准确性提升2.8%,确保了图表数据的严谨可靠;简洁性提升37.2%,使信息传达更高效;可读性提升12.9%,提升了图表的易理解性;美观度也获得了6.6%的提升。这些数据证明了其在学术场景下的实用价值。
超越绘图
PaperBanana的功能不止于从零生成图表。它不仅能绘制复杂的方法论流程图,也能生成各类统计图表。此外,它还能对已有的人工绘图进行智能“美颜”,通过调整配色和排版,提升图表的整体专业度。研究还发现了一个有趣的技巧:对于数据点稀疏的图表,直接使用图像生成模型效果更好,美观度高;而对于数据密集的图表,采用代码生成方式能更有效地保证数值的准确性,避免“数值幻觉”。
PaperBanana为科研人员提供了强大的自动化绘图解决方案,显著降低了学术创作的门槛。未来,AI能否在更多细分科研领域发挥作用,进一步解放生产力?