| name | whiteboard-book-video-skill |
|---|---|
| description | 白板火柴人拆书短视频工作流。用于把一本书或一段长内容做成 60-90 秒竖屏(9:16)白板手绘信息图风格的拆书口播短视频,并用 HyperFrames 在本地渲染无平台水印的最终成片。覆盖:拆书脚本与分镜表生成、白板火柴人信息图分镜图生成、口播配音生成(可选男声/女声)、背景音乐生成(可选活泼/沉稳/其他风格)、每个阶段与用户确认、HyperFrames 动效渲染+字幕卡点+音乐混音装配、成片交付。当用户提到"拆书视频""拆解一本书""白板风/火柴人信息图短视频""口播短视频""书评视频""把这本书做成视频"等需求时使用。 |
白板火柴人拆书视频工作流
把一本书做成 60-90 秒竖屏白板手绘口播短视频。全流程分 6 个阶段,每个阶段产出后都要先向用户确认再进入下一阶段。最终成片用 HyperFrames 本地渲染,不用云端视频生成模型(本地渲染环节无平台水印,不消耗云端视频生成额度)。
总流程(每阶段产出 → 用户确认 → 下一步)
- 选节奏模式(开跑前先问):问用户要「慢版」还是「高密版」(见下方"节奏模式")。两种模式各有对应脚本/图片/渲染参数,用户也可自定义画面数。
- 调研与脚本:读懂书的核心内容 → 产出「调研报告 + 拍摄脚本」(含按所选模式生成的分镜表 + 口播逐字稿 + 每镜头生图提示词)。→ 用户确认脚本
- 分镜图:按白板火柴人信息图规范,根据所选节奏模式生成对应数量的竖屏图。→ 用户确认风格/图(含人设或火柴人讲师选择)
- 口播配音:按脚本逐字稿生成配音,先问用户要男声还是女声。→ 用户试听确认
- 背景音乐:生成 BGM,先问用户要活泼还是沉稳(或其他风格)。→ 用户确认
- 渲染装配:HyperFrames 逐步画出动效 + 词级字幕卡点 + BGM 侧链混音 → 无水印成片。
- 交付:拷贝到项目根目录,
present_files交付,留系列化建议。
节奏模式(用户在开跑前二选一,可自定义)
| 模式 | 画面数 | 每画面时长 | 口播字数 | 适合 |
|---|---|---|---|---|
| 慢版 | 约 6-8 画面 | 6-9s | 约 320-380 字 | 讲书逻辑/深度解读,节奏从容 |
| 高密版 | 约 16-20 画面 | 4-5s | 约 280-340 字 | 信息密度高、快节奏、防单调,适合短视频完播 |
- 两种模式都用同一套白板信息图风格与"逐步画出"动效,差异只在画面切分粒度与口播断句。
- 用户未表态时默认问一次;用户自定义画面数时按其要求生成。
- 渲染阶段:慢版直接每画面一镜;高密版可把相邻画面合并成"多小节一镜"(每镜内依次 reveal),减少渲染镜头数,具体见
references/render-and-assemble.md。
关键默认(可被用户覆盖)
- 画幅:竖屏 9:16,1080×1920;单张分镜图 1152×2048(9:16)。
- 时长:60-90 秒;镜头硬切 + 每镜"逐步画出"揭示动效(约 1.9s)。
- 配音时长 = 视频总时长(视频按配音长度铺)。
- 字幕:词级卡点(用 faster-whisper ASR 词级时间戳),白板便签风样式(白底黑边圆角、黑字、红高亮),高密版字幕更多更短、慢版字幕更少更长。
- 画面角色:默认角落简笔画火柴人讲师;若用户提供个人 IP 形象(AI 生成卡通头像),先征询是沿用 IP 当主角还是用火柴人。
阶段细则(按需读取 references)
| 阶段 | 读哪个 reference | 要点 |
|---|---|---|
| 脚本 | references/script-writing.md | 钩子→痛点→核心观点→案例→行动→收尾;7 镜头分镜表+逐字稿 |
| 分镜图 | references/image-prompt.md | 白板/网格底、马克笔线条、红蓝黑三色、角落火柴人、30%+ 留白、单图高密度 |
| 配音 | references/audio-voice.md | seed-audio T2A;男/女声模板;下载核验真实时长;ASR 词级字幕 |
| 音乐 | references/audio-music.md | 活泼/沉稳/其他风格模板;ffmpeg 循环拼接;侧链 ducking 混音命令 |
| 渲染装配 | references/render-and-assemble.md | HyperFrames lint/check/render、逐步画出动效、抽帧验证、混音交付 |
必须遵守的纪律
- 每个阶段结束必须停下来等用户确认,不擅自连续跑完。
- 配音和 BGM 的音色/风格是用户点名的选择项,必须先问再生成。
- 生成图片若要做系列延展(保持白板背景/字体/配色一致),用
image_edit并传已确认的核心图 URL,不靠文字重画。 - 涉及书的价格、评分、销量、豆瓣数据等外部事实,必须来自检索结果并标注来源,不编造。
- 成片交付前必须抽帧验证真实渲染画面(逐步画出、字幕位置、无重叠),不只看静态预览。
