科研绘图耗时且审美难达标。PaperBanana,一个由北大和谷歌研究团队开发的AI框架,通过多智能体协作,能自动生成逻辑严谨、风格专业的学术图表,解决科研人员的绘图痛点。
智能速览
PaperBanana 是北大和谷歌研发的 AI 绘图框架。
它专为解决科研图中常见的逻辑“幻觉”和审美问题设计。
内部“五人团队”智能体协同工作,确保图表专业性。
风格师强制使用“柔和科技色”等顶级会议审美标准。
评判代理会进行多轮迭代修改,直至图像完美。
精华内容
传统的 AI 绘图总在逻辑和审美上翻车,PaperBanana 则通过一个“五人团队”式的智能体框架,给出了革命性的解法。
绘图两大痛点
科研人员常为论文插图耗费大量时间,甚至花费20小时绘制一张摘要图,却仍被导师评价为“上世纪90年代的PPT味”。
当前通用AI绘图模型在应用于科研场景时,暴露出两大核心缺陷。一是逻辑“幻觉”,表现为箭头指向错误、模块关系错乱,缺乏科学严谨性。二是审美不达标,普遍采用高饱和度配色和不专业字体,与学术出版物的要求格格不入。
五位一体团队
PaperBanana 的核心并非单一的AI模型,而是一个分工明确的智能体框架。这个“团队”包含五个关键角色:检索员、规划师、风格师、可视化师和评判员。
它们协同工作,模拟了从查找参考、梳理逻辑、确定风格到最终绘图和审核优化的完整工作流,确保了产出的科学性与专业性。
定义顶级审美
其中的“风格师”智能体尤为关键,它相当于整个团队的灵魂。它学习了大量顶级会议(如NeurIPS 2025)的论文插图,并总结出了一套审美指南。
该指南强制推行“柔和科技色”和“学术粉彩”等色彩方案,从源头上避免了配色的随意性,让生成图片的视觉效果直顶会水平。
反复迭代优化
为确保最终成品无可挑剔,PaperBanana 设置了“评判员”智能体。这个角色如同一位严厉的导师,会对可视化师生成的初稿进行严格审查,找出逻辑、构图或细节上的问题。
该过程会进行至少3轮的迭代修改,每一次都根据评判员的反馈进行精准调整,直至生成4K高清且逻辑完美的最终图像。
PaperBanana 通过AI智能体协同,将科研绘图从耗时美学任务转变为高效的自动化流程,解放了科研人员的生产力。未来,AI能否深度融入学术创作的每一个环节?