短视频 / 短剧生成流水线
把「写脚本 → 配音 → 找素材 → 剪辑 → 加字幕」这条传统上需要一天的流程,做成一条全自动流水线,日产成百上千条成片;再往前一步,用 AI 视频生成做短剧——有剧情、有角色、能追更的内容形态。项目覆盖这两条生产线。
一、项目背景
做短视频矩阵的都知道最痛的是产能:一个运营一天手工产出三五条就到头了,而矩阵打法需要的是几十个账号每天稳定更新。手工模式扩不动,只能上自动化。
AI 生成视频的单条质量目前还打不过精剪人工视频,但矩阵场景要的不是单条爆款,是规模化、可接受的质量下限、极低的边际成本——这正好是流水线的甜点区。
2024 年之后短剧爆发(市场规模已超过电影票房),但真人短剧拍摄成本高(一部几十万)、周期长(数周),AI 短剧把单集成本压到千元级、周期压到天级——第二条生产线由此而来。
二、生产线一:短视频流水线
选题库 ──→ 脚本生成(LLM) ──→ 分镜拆解 ──→ 素材匹配 ──→ 配音(TTS)
│
发布 ←─── 平台上传(自动化) ←── 合成(FFmpeg) ←── 字幕对齐 ←─┘
│
└──→ 数据回流(播放/完播/互动) ──→ 反哺选题库六个环节,逐个说:
1. 选题与脚本生成
选题来源两块:人工维护的选题库(保证方向可控)+ 数据回流的热门话题(什么火做什么)。脚本用 LLM 生成,prompt 里注入账号人设、目标人群、历史爆款脚本的结构特征(黄金 3 秒开头、钩子密度、时长控制)。一条脚本生成后自动拆解成分镜:每句话配什么画面、什么时长。
2. 素材匹配
分镜的每句话需要画面。素材来源按优先级:
- 自有素材库:预先打好标签(场景/物体/情绪/运镜)的版权素材,向量检索匹配
- 生成式兜底:库里实在没有的,用图像生成模型按分镜描述生成【待补充:具体生图方案】
匹配不是纯语义相似,还要过一道画面规则:相邻镜头不能同景别(全是特写会很闷)、色调统一、避开低质素材。
3. 配音
TTS 生成旁白,重点调「不像机器人」:多音字注音(中文 TTS 的老大难,行业/品牌词容易读错)、语速和停顿控制、按句尾标点自动加呼吸停顿。
4. 合成(FFmpeg)
这一步是工程重头。纯靠 FFmpeg filter 拼一条带转场、字幕、BGM、片头的视频,filter_complex 会复杂到没法维护,所以做了一层合成 DSL:把「分镜序列 + 字幕轨道 + 音轨 + 转场规则」声明成 JSON,渲染器翻译成 FFmpeg 命令:
{
"timeline": [
{"asset": "shot_001.mp4", "dur": 2.1, "transition": "fade"},
{"asset": "shot_002.mp4", "dur": 3.4, "transition": "slide"}
],
"audio": {"voice": "tts_001.mp3", "bgm": "bgm_soft_03.mp3", "bgmVolume": 0.15},
"subtitle": {"srt": "subs_001.srt", "style": "bold-white-stroke"}
}性能上用分布式渲染:合成任务是 CPU 密集的,扔到任务队列里由 worker 集群消费,一条 60 秒的视频几十秒出片。
5. 字幕对齐
字幕逐字卡拉 OK 效果需要精确的「字-时间」对齐,用 forced alignment(强制对齐)从 TTS 音频里拿到每个字的起止时间【待补充:具体对齐方案】。
6. 发布与数据回流
批量定时发布到多平台,发布后回收播放量、完播率、互动数据——这些数据反过来调选题库和脚本模板,形成「生产 → 分发 → 数据 → 优化」的闭环。
三、生产线二:AI 短剧生成
短剧和短视频是两个物种:短视频是「一条内容」,短剧是连续叙事产品——有贯穿多集的角色、有钩子递进的剧情、有付费卡点。生产复杂度完全是另一个量级,架构上也单独成线:
剧本书法(LLM) ──→ 分集大纲 ──→ 单集剧本 ──→ 分镜脚本(镜头级)
│
角色资产库 ──→ 角色一致性控制 ──────────────→ AI 视频生成
│ │
└── 角色立绘/参考图/LoRA ──→ 图生视频 ──→ 粗剪拼接(FFmpeg)
│
成品 ←── 配音·音效·字幕·BGM ←── 转场修复·画质增强 ←─┘1. 剧本层:LLM 做编剧,人做主编
- 剧本书法:LLM 先产类型框架(战神归来/穿越/重生/甜宠——短剧的题材公式非常成熟),再展开 80~100 集的分集大纲,每集卡点(悬念钩子)显式标注
- 单集剧本:按大纲逐集生成,prompt 里注入前情摘要(多集上下文窗口控制)、本集钩子目标、台词风格
- 人在回路:剧本层保留人工主编环节——叙事产品的「爽感节奏」目前 LLM 还拿不稳,人把结构和卡点,AI 把台词和分镜
2. 角色一致性:AI 短剧的生死线
短剧最大的技术坎:主角第 3 集换脸、第 8 集换了身衣服,观众立刻出戏。方案是「角色资产库」:
character:
name: 林晚
reference_images: # 多角度立绘(正面/侧面/全身),由图像模型生成后人工选定
- char_linwan_front.png
- char_linwan_side.png
lora: char_linwan_v3 # 角色专属 LoRA 微调权重,锁定面部特征
voice: tts_female_07 # 固定 TTS 音色
wardrobe: # 每套服装也是资产,跨集锁定
- outfit_casual_a
- outfit_dress_b- 静帧用「参考图 + LoRA」保证人物长相稳定
- 视频镜头用图生视频(image-to-video):先生成本镜头首帧(含角色资产注入),再驱动运动——一致性从「文本生成」的碰运气变成「图像锚定」的可控
- 每个镜头生成后过一致性校验(人脸相似度打分),低于阈值的镜头自动重roll
3. 镜头层:分镜到成片
分镜脚本拆到镜头级(景别/机位/时长/台词/动作),每个镜头独立生成后拼接:
- 镜头时长策略:当前视频模型单次生成 5~10 秒,短剧节奏靠「短镜头快切」天然契合——情绪戏用长镜头(生成多段拼接),冲突戏用快切
- 对口型:台词密集镜头用数字人对口型方案,远景/背影镜头用 TTS 画外音规避口型问题
- 拼接修复:镜头间运动不连续、闪烁、伪影,靠转场设计(黑场/甩镜/回忆滤镜)把「AI 感」的跳变转成「剪辑风格」
- 画质增强:统一过一遍超分 + 插帧,多源生成素材的质感拉齐
4. 成本结构
| 项 | 真人短剧(单集) | AI 短剧(单集) |
|---|---|---|
| 演员/场地/设备 | 数万元 | 0(角色资产一次性投入) |
| 制作周期 | 数周 | 1~2 天 |
| 修改成本 | 重拍 | 重新生成镜头 |
| 规模化 | 线性 | 边际成本递减 |
四、核心难点
- 质量下限控制:全自动必然有翻车内容(素材驴唇不对马嘴、TTS 读错品牌名)。方案是「机器筛 + 抽样人审」:每条成片过一遍自动质检(画面黑帧检测、音画同步校验、敏感内容识别),高风险类目再人工抽检
- 成本控制:LLM/TTS/生图都是按量付费,批量场景下 token 账单很吓人。脚本生成用便宜的小模型,只有需要「爆款改写」时才用旗舰模型;TTS/生图缓存素材复用率
- 平台风控:批量发布同质内容会被平台限流,每条视频强制差异化——不同的开头模板、BGM 池、转场组合随机组合,标题和封面各自独立生成
五、效果
| 指标 | 数值 | 说明 |
|---|---|---|
| 日产能 | 【待补充】 | 成片/天 |
| 单条成本 | 【待补充】 | 对比人工制作 |
| 人工介入率 | 【待补充】 | 需返工的比例 |
六、收获
AIGC 落地内容行业,拼的不是「能不能生成」,而是流水线的稳定性和质量下限。单点 demo 谁都能做,难的是每天几千条不出低级错误、成本可控、数据能闭环。做完这个项目,对「AI 提效」的理解从概念变成了账本。