# html2pptx 项目文档 ## 项目定位 一套通用 PPT 生成基础设施。核心价值在于**翻译引擎**——把标准 JSON 描述翻译成可编辑的 PPTX 文件。 ## 架构 ``` 输入(任意来源) 中间层 输出 ━━━━━━━━━━━━━━━ ━━━━━━━━━━━ ━━━━━ AI 直接输出 标准 JSON PPTX 文件 HTML 提取 → JSON → Schema 校验 → 翻译引擎 截图识别 → JSON (机械映射) pptxgenjs Markdown → JSON ``` ### 三层 | 层 | 内容 | 状态 | |---|------|------| | **知识库** (`reference/`) | pptxgenjs 完整参数表,每个参数的类型/取值范围/默认值 | ✅ 已完成 | | **Schema** (`schema/`) | JSON Schema 定义 + 多种场景的示例文件 | ✅ 已完成 | | **翻译引擎** (`renderer/`) | JSON → pptxgenjs API 调用的机械映射代码 | ✅ 已验收 | ### 前端处理器(待开发) "输入 → 标准 JSON"这层目前没有稳定的通用方案。试验过以下方向: | 方案 | 结论 | |------|------| | 多模态截图识别(Mimo v2.5) | ❌ 坐标和字号不够精确 | | LLM 直接读 HTML+CSS 源码 | ❌ 样式映射不准确 | | playwright 全量 DOM 提取 | ⚠️ 数据精确但分页和元素筛选不稳定 | 目前推荐的做法:**AI 直接按 Schema 输出 JSON**,不经过中间提取步骤。 ## 翻译引擎使用 ```javascript const { render, renderFile } = require('./renderer/index'); // 从 JSON 对象生成 const pptx = render(specObject); pptx.writeFile({ fileName: 'output.pptx' }); // 从 JSON 文件生成 await renderFile('./spec.json', 'output.pptx'); ``` ## 验收标准 - 输入标准 JSON(符合 Schema)→ 输出可编辑的 PPTX - 文字可双击编辑(非图片) - 支持:文字、形状、表格、图片、图表 - 颜色、字号、位置精确还原 ## 已知限制 - 翻译引擎不做样式推断——JSON 里有什么就画什么 - 前端处理器(HTML/截图→JSON)尚无稳定方案 - 渐变、阴影等高级 CSS 效果依赖 pptxgenjs 支持程度