AI PRODUCT / PRACTICE
AI 短剧制作:从镜头卡到局部返工
结合漫序的创作思路与短剧制作经验,把创作者控制权保留在关键步骤。
1. 先确认故事,再花生成预算
输入故事直接生成视频,可能到成片时才发现人物行为不合理、道具错误或音画冲突。我的做法是先审核剧本,再确认角色、场景和分镜,最后生成与合成。早期文字修改通常比后期整段视频返工更容易。
漫序沉淀的是分阶段确认和局部修改的思路。后续短剧制作将检查进一步落实到镜头卡、采用时间段和音轨。两者是方法延续,不意味着一个工作台已经自动解决所有穿帮问题。
2. 写一张能用于生成和验收的镜头卡
镜头编号:E01-S03 叙事作用:女儿看到消息后决定回家 人物状态:同一角色、同一服装;情绪从迟疑转为坚定 道具约束:仅一部手机,手机由右手持有 动作:看屏幕,停顿,抬头;避免同时安排多项复杂动作 景别与风格:中景,沿用已确认的人物与画面参考 对白与声源:准确台词、说话人;配音与生成原声选择一种 检查点:人物与道具一致、动作合理、对白正确、无重复人声 采用区间:生成后记录起止时间和素材版本
角色和风格一致性可以通过固定参考图、角色档案和统一镜头描述约束,但这些是控制手段,不是绝对保证。每次采用素材仍要检查。
3. 按问题类型选择修复动作
| 问题表现 | 检查与归因 | 修复动作 | 复验 |
|---|---|---|---|
| 两只手拿两部手机 | 回查源镜头,检查动作和道具描述是否含糊;不能直接断定模型内部原因 | 明确一部手机与持握手,简化动作,重生成该镜头或替换素材 | 逐帧看道具数与动作连续性,检查前后镜头衔接 |
| 对白中夹入机械音或双人声 | 独立听生成原声与配音,排查源素材异常和重复声轨 | 选定主声源,静音重复轨;替换异常音频或裁掉异常区间 | 单听对白,再带画面听,确认重叠与口型问题 |
| 手机屏幕名单乱码 | 判断文字是否承担叙事信息,检查是否可读 | 用 Pillow 绘制正确文字图层并贴合画面,或替换镜头 | 检查可读性、透视、遮挡及运动中的稳定性 |
| 剪辑后情节跳跃 | 连看前后镜头,确认人物行动缺口和时空关系 | 补过渡镜头或调整镜头顺序与采用区间 | 脱离制作说明连看,确认观众能理解因果 |
先定位镜头和秒段,再确定问题来自素材、声音、合成还是叙事。返工记录不要只写“让 AI 再改一次”。
4. 用镜头清单组织合成
JSON 是结构化数据格式,可以记录镜头路径、采用区间、顺序和声源。FFmpeg 是音视频处理工具,用于裁切、拼接、静音和合成。Pillow 是 Python 图像处理库,用于绘制文字图层等图像任务。
{
"shot_id": "E01-S03",
"source": "assets/E01-S03-v2.mp4",
"in_seconds": 0.8,
"out_seconds": 4.2,
"audio_source": "voice/E01-S03.wav",
"mute_source_audio": true
}以上是教学示例,不是通用渲染接口。字段要与自己的渲染脚本对应;记录版本能帮助回到具体源素材,不代表可以直接修改视频里任意一个物体。
5. 分四轮验收并记录总成本
- 静音看:检查人物、手部、道具、文字、动作与场景衔接。
- 独立听:检查对白完整、机械音、重复声轨和音量突变。
- 带声逐镜:检查口型、对白归属和音画时序。
- 连看全片:检查因果、节奏与跨集一致性,按预先约定的交付标准决定是否继续返工。
成本包括候选素材和失败重试,不能只统计最终采用视频。我的六集短剧制作记录为 403 秒成片、124 笔视频生成、11,460 积分;积分不是人民币,不同平台不可直接横比。
是否继续修复取决于问题是否影响理解、交付目标与剩余预算。自动循环也要设成本上限和停止条件,不能默认让 Agent 无限重试。
6. 练习与开源资料
先做三个镜头的小故事:建立人物、发生选择、呈现结果。完成剧本审核与镜头卡,只生成这三个镜头,再用四轮验收找到一个实际问题,记录修复前后变化。
返工记录 问题镜头与时间码: 具体表现: 核查证据:源素材 / 声轨 / 镜头卡 / 合成配置 原因判断:确认了什么,哪些仍只是推测 采取动作:替换、重生成、裁切、静音或补镜头 复验结果:原问题是否解决,是否引入新问题 额外成本与耗时: