许多研究者在参加学术会议前,常常会因为制作海报所耗费的大量时间和精力而感到困扰。一张精心设计的海报是高效的学术交流媒介,但现有自动化方法普遍忽略了核心设计原则,导致生成的海报仍旧需要大量人工调整。
为解决这一痛点,来自纽约州立大学石溪分校、纽约大学、不列颠哥伦比亚大学和浙江大学的联合团队推出了 PosterGen,一个能将论文 PDF 直接转化为设计精良、完全可编辑的 PPTX 格式学术海报的多智能体框架。
PosterGen 的核心创新在于:
case 1:
case 2:
case 3:
PosterGen 能够生成高品质海报的核心要素在于,它并非简单地堆砌内容,而是将专业设计师的美学知识和设计策略,转化为 AI 可理解和执行的四大核心原则。
叙事结构(Narrative):一张好的海报必须逻辑清晰。PosterGen 采用科学写作中经典的「And, But, Therefore」(ABT)叙事结构。它首先建立研究背景(And),接着点明问题与挑战(But),最后呈现解决方案与成果(Therefore),以此构建出一条引人入胜的逻辑线索,引导观众快速理解研究核心。
空间布局(Layout Structure):为确保信息传递的秩序感,PosterGen 采用专业且高效的三栏式网格布局。这种布局能够保证自然的阅读流,确保第一时间抓住观众的注意力的同时,提供一定的视觉喘息。同时,通过对留白(White Space)的有效运用,清晰地分离各个内容模块,减少视觉混乱感。
色彩方案(Color Design):色彩在视觉传达中扮演着建立层次和确保可读性的关键角色。PosterGen 采用一套克制的主题单色调配色方案,以维持视觉的和谐统一。该颜色方案由主题色、用于背景的单色变体以及用于高亮的高对比度强调色构成。所有文本的色彩应用都严格遵守 WCAG 4.5:1 的对比度标准,以保证在标准观看距离下的可读性。
版式层级(Typography Design):字体设计与色彩协同工作,用来构建信息的清晰度。PosterGen 优先选用易读的无衬线字体,并建立两类层级:(1)利用不同字号区分标题、正文等的视觉层级;(2)通过粗体、斜体和强调色等格式来构建关键词的语义层级,共同确保信息传递的高效与精准。
图 1 PosterGen 多智能体框架概览
PosterGen 的工作流由四个协同工作的专业智能体(或模块)构成,系统性地将设计原则贯穿于海报生成的每一个环节,环环相扣、各司其职,让学术海报的自动化生成拥有了接近人类设计师的「审美与灵感」。
该阶段主要功能是一次「智能化的故事重构」。Parser Agent 负责从原始 PDF 论文中提取所有文字与视觉元素(如图表),而 Curator Agent 则像一个「叙事导演」,按照 ABT 结构(And, But, Therefore),将复杂的论文内容转化为简明扼要的故事板,为后续设计奠定叙事骨架。
Layout Agent 负责将概念性的故事板转化为精确的空间布局,在一个标准的三栏式画布上,系统地放置每一个内容元素。这种结构被广泛证明能有效确保自然的阅读流,并通过将关键视觉元素策略性地放置在视平线的「热区」(如中间列顶部),构成视觉锚点以吸引观众。
图 2 PosterGen 所采用的基本布局框架
为实现元素间的精准间距控制,Layout Agent 还将留白(white space)视为关键的设计元素。它实现了一个类似 CSS 的盒模型(box model),为每个内容元素(文本、图片、表格)封装独立的「外边距」和「内边距」属性,从而对元素周围的间距进行精细化控制。
图 3 类 CSS 的盒模型布局方法
由于不同系统的渲染引擎的差异,精确计算文本框的高度是 PPTX 自动化布局中的一个核心挑战。为此,研究团队提出了一种优化的估算算法,该算法通过二分搜索来确定避免字体大小被自动缩减的最小文本框高度,并结合换行符进行偏移校正,以精准预测最终渲染高度,从而有效避免了令人头疼的内容溢出与浪费空间。
图 4 文本高度估算算法伪代码
此阶段是 PosterGen 实现「美学设计」的关键,由两个智能体组成:
图 5 学术海报智能色彩生成方案
图 6 学术海报字体样式设计方案
最后,Renderer 模块将所有风格与布局信息精准落地,并调用 python-pptx 库生成完全可编辑的 PPTX 格式的学术海报,并自动生成高分辨率的 PNG 图像,供用户查阅和使用。生成的结果能够直接用于学术会议现场,达到演示级别的水准。
为了证明 PosterGen 的「美学驱动」确实有效,研究团队引入了一套基于视觉语言模型(VLM)的综合性评估标准(VLM-as-Judge),从内容和设计两大维度对生成结果进行评分。
图 7 定量实验结果
图 8 案例研究对比结果
实验结果证明了 PosterGen 框架的有效性:
图 9 消融实验结果
消融实验进一步证明了 PosterGen 各核心智能体设计的必要性。结果显示:
这一过程清晰地展示了每个智能体在从内容到最终设计成品转化过程中的不可或缺的贡献。
PosterGen 不仅是又一个自动化工具,而是一次对「设计智能体」未来形态的大胆探索。它让学术海报自动生成真正跨越了从「能用」到「好用」、再到「够美」的门槛。
这一框架不仅极大地减轻了研究者的负担,更展示了多智能体系统在「逻辑与创意融合任务」上的巨大潜力。对科研人员来说,PosterGen 意味着:从此再也不用被海报设计困住,可以把宝贵的精力完全放在学术会议中的科研与交流上。
文章来自于“机器之心”,作者“机器之心”。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【免费】ffa.chat是一个完全免费的GPT-4o镜像站点,无需魔法付费,即可无限制使用GPT-4o等多个海外模型产品。
在线使用:https://ffa.chat/