PPT 转编辑格式

GordenSuperPPTSkills 原理:史上最强 PPT Skill:图片 PPT 转可编辑 PPTX 文档【模仿别人的路线】

一句话总结:

给一张 PPT 截图,用 GPT 看图拆出文字、各个装饰元素,AI 重绘素材,再按坐标在 PPT 里面拼回去,实现截图转可编辑 PPT

ppt-master【根据文档内容,从头新建一份结构、排版都合理的 PPT,可以参考一套设计规范(统一字体、配色)】

输入是 Markdown / 文档文本,不是截图。模型输出布局描述,本地脚本生成 DrawingML,全部元素都是 PPT 原生矢量对象,不是 AI 绘图生成的图片。

对比维度 ppt-master GordenSuperPPTSkills
技术路线 文档→SVG 矢量→DrawingML 原生对象,无图片生成环节 提示词→AI 生成 PNG 图片→GPT‑4V 视觉拆解还原,先生图再逆向重建
可编辑程度 ✅全部元素原生 PPT 对象:文字、表格、形状、图表均可直接编辑;图标是矢量形状 ✅文字是原生文本框;背景、图标、装饰是 AI 生成的图片对象,不能编辑形状颜色,只能整体替换图片
输入源 PDF/Word/markdown/ 文本素材,优先文档内容 主题描述、也支持 PPT 截图图片逆向还原
风格一致性 spec_lock 全局锁定规约,每页严格遵守统一网格配色,风格稳定 靠生图模型保证视觉风格;生图每次会有随机波动,页面之间容易出现细节偏差
复杂布局能力 适合答辩、汇报、文档转 PPT;极度花哨异形布局能力有限 适合炫酷、艺术感、复杂异形版式;生图擅长视觉冲击力强页面
原生 PPT 特性 原生支持 PPT 动画、切换效果、演讲备注、复用企业模板 不支持原生动画;还原出来的 PPT 没有原生动画;只能做页面内元素摆放
token & 成本 消耗大模型文本 token,不消耗图像生成 token 消耗文本 token + 高额图片生成 token 成本,整体开销更高
表格处理 输出 PPT 原生表格,单元格可以直接修改 表格会被识别成图片,表格很难还原成原生可编辑表格
故障风险 大模型输出非法 SVG;本地脚本校验拦截,拒绝坏页 生图崩坏、视觉识别坐标偏移、图标细节和原图不一致、文字 OCR 识别错误
技术门槛 依赖 Python 环境,本地脚本链路复杂 同样需要 Python,依赖 GPT4V + 生图模型,对外网模型依赖更强

PPT 生成总结

双层寻址:语义间接层隔离业务层与底层物理层

两层寻址体系:

  • 上层(Agent 视角)slot_id语义名字 cover_title_cn,人类可读,不关心 PPT 内部实现;
  • 下层(脚本视角):物理地址 shape_id / paragraph / run,直接映射 OOXML 底层;
  • 中介对照表detail.json,打通语义槽和底层坐标。

通用思想:但凡 LLM 操作复杂底层系统,优先加一层领域间接层,模型操作领域对象,确定性代码翻译成底层调用。

软约束优于硬拦截:提防模型 “钻规则空子”

项目里真正发生过什么

每个文本框在 detail.json 里有一个 max_chars(大概能装多少字)。最早的设计是:

  • 超过就报错
  • 建议加 --strict,超框直接拒绝保存

Agent 的目标立刻变了:不再是「写一句完整、好看的话」,而是「必须过这道检查」。最省事的办法是把后半句砍掉,结尾加 ...

于是你看到的是半句话,比字稍微挤出框还难看。校验通过率上去了,成品质量下去了。 这就是截图说的「钻空子」。

通用 Agent 开发的可复用经验

凡是给 LLM 设置校验规则,都要反问自己:如果模型钻规则漏洞,会产出什么劣质产物?

  • ❌不要:失败直接阻断输出
  • ✅推荐:告警 + 保留产物,把决策回传给上层 Agent 做迭代闭环

这套逻辑正好对应前面提到的闭环:脚本打告警 → Agent 读取渲染后的 PNG + 日志 note → 修改edits.json重新构建。

简单单一句话总结:机器只报坑,不拍板;把要不要改、改不改的决定权还给 Agent,形成循环迭代。

文本 Spec 之外,必须增加视觉闭环环(做 PPT、海报、PDF、网页 UI 都一样:结构化输入无法证明视觉输出。)

**存在问题:**文本契约edits.json只能描述 “填什么文字”,无法校验排版溢出、占位符残留、章节前后不一致这类视觉问题

闭环链路:

build_pptx输出PPTLibreOffice无头转PDFpdftoppm切PNG图片 → Agent 读图校验 → 更新 edits 再构建。

每一步的作用:

  1. build_pptx:根据edits.json文本规格生成原生 PPT 文件
  2. LibreOffice 无头转 PDF:把 PPT 转成标准 PDF,统一渲染效果,规避不同 Office 版本的渲染差异
  3. pdftoppm 切 PNG:把每一页转成像素图片,把视觉产物变成机器可读的输入
  4. Agent 读图校验:用多模态大模型 “看” 图片,检查溢出、错位、残留、样式不一致等视觉问题
  5. 更新 edits 再构建:根据校验结果反向修改文本规格(比如缩短文字、调整字号参数),重新生成,直到视觉合格

通用范式:凡是生成 PDF、PPT、海报、UI 这类强视觉产物,都可以套用:

生成结构化spec → 渲染为可视产物 → 校验可视产物 → 修改spec迭代

AI 制作 PPT 的思路总结

需求调研 → 资料搜集 → 大纲策划 → 生成策划稿 → 生成设计稿

1. 忘了“一键生成”,从“提问”开始

聊到大纲,我又把我用了多年的一个“笨方法”教给了AI——便利贴法

过去我做复杂PPT时,会把每一页的核心内容写在一张张便利贴上,贴满一墙。这样逻辑结构一目了然,哪里不好就撕掉,顺序不对就调换,高效又直观。

现在,我们把它做进了产品里。每一个页面,就是一张“数字便利贴”,让你看得清清楚楚,调得明明白白。

便利贴法

下面这个我们项目在用的正式版Prompt,也直接开源给你,让你也能拥有一个顶级的“PPT结构架构师”:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
# Role: 顶级的PPT结构架构师

## Profile
- 版本:2.0 (Context-Aware)
- 专业:PPT逻辑结构设计
- 特长:运用金字塔原理,结合**背景调研信息**构建清晰的演示逻辑

## Goals
基于用户提供的 **PPT主题** 和 **背景调研信息 (Context)**,设计一份逻辑严密、层次清晰的PPT大纲。

## Core Methodology: 金字塔原理
1. 结论先行:每个部分以核心观点开篇
2. 以上统下:上层观点是下层内容的总结
3. 归类分组:同一层级的内容属于同一逻辑范畴
4. 逻辑递进:内容按照某种逻辑顺序展开

## 重要:利用调研信息
你将获得一些关于主题的搜索摘要。请务必参考这些信息来规划大纲,使其切合当前的市场现状或技术事实,而不是凭空捏造。
例如:如果调研显示"某技术已过时",则不要将其作为核心推荐。

## 输出规范
请严格按照以下JSON格式输出,结果用[PPT_OUTLINE]和[/PPT_OUTLINE]包裹:

[PPT_OUTLINE]
{
"ppt_outline": {
"cover": {
"title": "引人注目的主标题",
"sub_title": "副标题",
"content": []
},
"table_of_contents": {
"title": "目录",
"content": ["第一部分标题", "第二部分标题", "..."]
},
"parts": [
{
"part_title": "第一部分:章节标题",
"pages": [
{ "title": "页面标题1", "content": [] },
{ "title": "页面标题2", "content": [] }
]
}
],
"end_page": {
"title": "总结与展望",
"content": []
}
}
}
[/PPT_OUTLINE]

## Constraints
1. 必须严格遵循JSON格式。
2. **页数要求*:{{PAGE_REQUIREMENTS}}

2. 去大量检索资料。(用 grok)

大纲只是骨架,血肉需要真实、准确的信息来填充。这个因为很多工程上的问题,我们自己项目用的是国内的搜索接口。

资料检索

3. PPT 居然还有策划稿?

拿到内容后,多数人就直接让AI上设计了。但我们多加了一个操作——策划

啥,PPT还要做策划呢?我想这个词很多PPT设计师都没听过,五年前,我也一样。

那时候我去到了一家国内顶尖的PPT设计公司,他们的PPT报价是1万+一页。

他们有一个专门的岗位,叫策划师。没错,你前面看到的,需求调研、资料检索,大纲规划,这事儿都归他们干。

策划师岗位

他们最终会提供一个PPT草稿给到设计师,每页什么位置要放什么元素,用什么样的版式,全都固定好。

就像这样:

策划稿版式

真正让AI去做PPT的时候,你也可以试试一样的处理。先让AI生成一个,不要各种复杂效果,简简单单,清清爽爽的页面初稿。

页面初稿

到后面再去加设计的效果:

设计效果

我们做了大量测试,发现这套人类专家的工作流,AI完全能理解!策划部分负责版面规划,设计部分来做风格样式,跑下来的效果非常好。

你啥都不用干,等AI跑完这套流程就能用,甚至都不太需要改。

那当然,如果是一些特别重要的PPT,你也可以在策划稿阶段精调内容,再去让AI跑最终的设计,把效率和颜值都最大化。

4. 用这个 PPT 技巧让 AI 跑设计。(卡片式布局的思路)

有一个可以给到“夯爆了”的PPT技巧,叫卡片式布局。

啥是卡片式布局呢,喏,你在苹果的发布会上经常能看到。把内容放进了一个个卡片里。

卡片式布局

这样做有三大好处:

  1. 能装: 一页里能清晰地承载大量信息。
  2. 灵活: 卡片数量、大小、位置可以随意组合,版式变化无穷。
  3. AI能懂: 这是最关键的!我们发现,“卡片”是AI最容易理解和掌握的一种设计语言。

市面上的 AIPPT 大多是调用 Banana 或者生成 html,我们采用了生成整页 SVG 的方案。

SVG是一种PPT里兼容性最好的格式,生成的这个SVG代码你可以直接拖到Office 2016以上的版本里去做使用。

我们把这套方法论,写成了一段精确的指令,告诉AI如何像顶级设计师一样思考布局。这可以说是我们项目的核心壁垒之一,今天也一并分享了:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
内容页的便当网格 (Bento Grid) 布局
这是一种灵活的网格系统,其布局应由内容本身的需求驱动,而非僵硬的模板。通过组合不同尺寸的卡片,创造出动态且视觉有趣的布局。
- 核心原则:
- 灵活性: 卡片数量不固定。可以是 1, 2, 3, 4, 5 或更多个,取决于如何更好地呈现信息。
- 层级感: 使用卡片尺寸建立视觉层级。最重要的信息放在最大的卡片上。
- 留白: 在所有卡片之间保持至少 20px 的间距。
- 布局组合示例:
- 单一焦点: 一张大卡片覆盖大部分区域 (w=1200, h=580)。适用于单一、有力的信息或详细的图表。
- 两栏布局:
- 50/50 对称: 两张等宽的卡片。
- 非对称: 一张较宽的卡片(如 2/3 宽度)用于主内容,一张较窄的(1/3 宽度)用于辅助信息、数据或图片。
- 三栏布局: 三张等宽的卡片,适合并列比较三项内容。
- 主次结合: 一张大的居中卡片,两侧各一张小的垂直卡片。
- 顶部英雄式: 顶部一张宽幅“英雄”卡片,下方是 2-4 个较小的等宽卡片网格。
- 混合网格 (自由度最高): 自由混合各种尺寸的卡片,例如一个中等方块、两个小的水平矩形和一个垂直矩形。这种方式可以极大地适应不同内容的需求。

如果大家自己去跑也很简单,拿你刚刚用Grok检索到的内容结果,加上我下面这段提示词:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
作为精通信息架构与 SVG 编码的专家,你的任务是将完整的文字内容转化为一张高质量、结构化、具备高级感、简洁感和专业感的 SVG 演示文稿页面。要求如下:

1.画布: SVG viewBox 必须是 0 0 1280 720。

2.内容页的便当网格 (Bento Grid) 布局
这是一种灵活的网格系统,其布局应由内容本身的需求驱动,而非僵硬的模板。通过组合不同尺寸的卡片,创造出动态且视觉有趣的布局。
- 核心原则:
- 灵活性: 卡片数量不固定。可以是 1, 2, 3, 4, 5 或更多个,取决于如何更好地呈现信息。
- 层级感: 使用卡片尺寸建立视觉层级。最重要的信息放在最大的卡片上。
- 留白: 在所有卡片之间保持至少 20px 的间距。
- 布局组合示例:
- 单一焦点: 一张大卡片覆盖大部分区域 (w=1200, h=580)。适用于单一、有力的信息或详细的图表。
- 两栏布局:
- 50/50 对称: 两张等宽的卡片。
- 非对称: 一张较宽的卡片(如 2/3 宽度)用于主内容,一张较窄的(1/3 宽度)用于辅助信息、数据或图片。
- 三栏布局: 三张等宽的卡片,适合并列比较三项内容。
- 主次结合: 一张大的居中卡片,两侧各一张小的垂直卡片。
- 顶部英雄式: 顶部一张宽幅“英雄”卡片,下方是 2-4 个较小的等宽卡片网格。
- 混合网格 (自由度最高): 自由混合各种尺寸的卡片,例如一个中等方块、两个小的水平矩形和一个垂直矩形。这种方式可以极大地适应不同内容的需求。


请你根据我的内容输出SVG代码,我的内容是:

市面上的 AIPPT 大多是调用 Banana 或者生成 html,我们采用了生成整页 SVG 的方案。

SVG是一种PPT里兼容性最好的格式,生成的这个SVG代码你可以直接拖到Office 2016以上的版本里去做使用。

好处是可以导入 PPT,完全可编辑,甚至各种设计软件都支持,而且可以无限放大,保证清晰度。

如果你是自己使用,也不太需要可编辑性,我更推荐让AI生成HTML格式的

另一种思路:直接用 Marp / Slidev 制作网页版的 PPT

TIPS

那第一,我觉得,我现在做的这个东西,也只是挖掘了AI做PPT,大概5%的能力,我们还有非常多棒的思路,会去一一实现,这些对于PPT的理解和积累,是没办法复制的。

第二,我是真的不太服气。市面上这些AI PPT工具,他们的开发根本都不懂PPT。给个大纲,硬套模板,让很多人用完都说:AI PPT,也就这样了,不行。

不该是这样的。