作者:互联网 时间: 2026-07-20 17:40:01
AI 做 PPT 时,最常见的愿望其实有点互相打架:页面要像设计师做的那样复杂、漂亮、有信息图质感,同时又希望打开 PowerPoint 后还能改文字、挪图标、继续细修。
纯图片页容易好看。模型能一次性把光影、卡片、连接线、图标、强调数字放进同一张画面里,整体感强,第一眼也更像成品。
但图片页的麻烦也很直接:哪怕只想把一个小标题改掉,也可能变成重新出图。反过来,原生 PPT 元素虽然好改,却容易被默认形状、普通图表和规整文本框拖回模板味。
GordenSun/GordenSuperPPTSkills 有意思的地方就在这里。它没有假装一个步骤能同时解决这两件事,而是把流程拆开:先用图片生成能力做出高完成度页面,再把图片页拆成可编辑 PPTX。
这不是更短的路,而是一条更敢折腾的路。它把“好看”和“能改”放在两个阶段里分别处理,再用编排技能把它们接回一条线。
仓库 README 一上来就把三块拆得很清楚:GordenImagePPTGen 负责生成图片格式 PPT,GordenImage2PPTX 负责把图片还原成可编辑 PPTX,GordenSuperPPTSkill 则把前两者串起来,按 A 到 B 的顺序跑完整流程。
这个拆分比“万能 PPT Skill”更实在。只想要图片版 PPT,就只跑第一段;手上已经有图片页,只想转成可编辑文件,就跑第二段;没指定功能,只说要一份既好看又能编辑的成品,再交给 Super 编排。
它的自信也来自这种拆法。图片阶段追求高密度、复杂框架和统一配色;还原阶段追求层级拆解、坐标对齐和视觉 QA。两段各有自己的验收证据,不需要互相迁就。

GordenImagePPTGen 对“出图”管得很死。SKILL.md 里反复强调,生成图片只能理解为实际调用 imagegen 图像模型,每页都要有真实生成源;不能用 Python、PIL、SVG、HTML、Canvas、matplotlib、PowerPoint shapes 或截图渲染来冒充。
这条规则说明它很怕流程退化。一旦允许代码画一张规整 PNG,再说它是图片型 PPT,这个项目就失去自己的方向了。它要的是模型一次性生成完整页面,而不是把代码绘制的模板换个后缀。
它还要求每页图必须含全部真实文字,不能出占位符或无字模板图。outline.json 只是大纲和画面半成品,真正用于出图的 prompts/NN-*.md 必须把页面文字写满。这里的逻辑很直接:图片 PPT 如果没有真实文字,只是漂亮壳子。
所以第一段的重点不是“更快生成”,而是先把内容做厚,再让每页选不同的复杂框架。房子型架构、Bento 看板、同心圆、鱼骨、漏斗、Hub-Spoke、金字塔这些形式并不是拿来堆装饰的,而是用来承载高信息密度。
GordenImage2PPTX 的思路更像逆向工程。它不是把原图当背景,然后在上面叠几个文本框就完事;那样会出现双重文字,也谈不上真正还原。
它强制四层:背景图、整体框架图、元素图标和文本。背景要复刻成干净背景;框架图要把容器、卡片、分隔线、图表骨架这些非背景非文字的东西提出来;图标和装饰单独用绿幕图生成、抠底、切片;普通文字由 GPT 视觉提取,再写成真文本框。

这里的“可编辑”要读仔细。文字层是真文本框,后续改字比较方便;框架和图标更多是可移动、可替换、可缩放的图片层,并不等于每条线、每个卡片都变成 PowerPoint 原生形状。它追求的是可继续编辑的工程拆层,而不是把整页完全变成原生矢量对象。
这个判断反而让它更可信。因为从一张复杂图片里还原出真正原生的所有图表、线条、卡片和装饰,代价会非常高,也很容易丢样式。把框架保成透明图片层,再把文字做成文本框,是视觉保真和后续修改之间的折中。
这个仓库里有不少看起来很啰嗦的规则,细看都是踩坑后的经验。GordenImage2PPTX 要求每次转换先建唯一 RUN_ROOT,所有背景、框架、图标、layout、QA 和最终 PPTX 都写进这个目录,不能复用工作区固定 editable/01 或 out。
这件事对图片还原很关键。因为每一页都会生成 background.png、frame.png、icons、layout.json、imagegen-assets-manifest.json,一旦目录复用,很容易把上一页或旧任务的素材读进来。文件串了,页面看起来也许还能合成,但结果已经不是这张源图的还原。
它还要求 B2、B3、B4 的图片层都在 imagegen-assets-manifest.json 里登记生成源、prompt 文件、复制路径和后端。manifest 里如果出现 programmatic、PIL、SVG、HTML、Canvas 这类来源,本页转换就算失败。这个项目把“有没有真的按流程生成”也当成产物的一部分。
图片转可编辑最难的不是合成 PPTX,而是合成后像不像原图。GordenImage2PPTX 准备了 layout_guard.py、placement_qa.py、visual_compare_qa.py 这类脚本,用来检查坐标契约、源图包围盒、预览对位、并排图、叠图和差异热图。
这说明它很清楚自己的风险:文字位置会漂,图标尺寸会偏,框架层可能和源图有几像素到几十像素的差异。layout_guard 只能证明数学字段一致,不能证明视觉上对了;所以还要看源图框、看预览、看差异图,再回校。
这种流程不会轻。README 甚至提到,图片转可编辑 PPTX 比较费额度,转换一张图片大概会消耗 Plus 订阅 5 小时额度的 10%。这句话其实把项目的现实面摊开了:它不是便宜地把图片贴进 PPT,而是在用多轮视觉生成和检查换一个可继续编辑的结果。
GordenSuperPPTSkills 的野心很明显:让 AI 先做出图片级完成度,再尽量把这份完成度带回 PPTX 编辑环境。它不是最轻的 PPT 工具,也不是最适合随手做三页普通汇报的工具。
它更适合那些真的在意第一眼效果的人:产品介绍、方案提案、路演页、复杂信息图、需要密集模块和视觉冲击的演示稿。对这类场景,先出图能把设计上限拉高,后面再拆层保留修改空间。
如果只需要普通可编辑 PPT,直接走原生模板路线可能更省心。如果想要的是“先漂亮起来,再尽量可改”,这套三技能串联的价值就出来了。它真正解决的不是 PPT 生成,而是把图片级视觉和后续编辑之间那段麻烦的中间路铺出来。