Skip to content
当前页大纲

短视频 / 短剧生成流水线

领域 AIGC · 内容生产自动化角色 主程架构 · 核心开发状态 已落地 ·【时间待补充】#LLM#TTS#AI视频生成#FFmpeg

两条生产线:短视频全自动流水线(脚本→配音→素材→剪辑→字幕,日产百条)+ AI 短剧生产线(多集叙事、角色一致性、分镜到成片),支撑矩阵账号与短剧内容供给。

把「写脚本 → 配音 → 找素材 → 剪辑 → 加字幕」这条传统上需要一天的流程,做成一条全自动流水线,日产成百上千条成片;再往前一步,用 AI 视频生成做短剧——有剧情、有角色、能追更的内容形态。项目覆盖这两条生产线。

一、项目背景

做短视频矩阵的都知道最痛的是产能:一个运营一天手工产出三五条就到头了,而矩阵打法需要的是几十个账号每天稳定更新。手工模式扩不动,只能上自动化。

AI 生成视频的单条质量目前还打不过精剪人工视频,但矩阵场景要的不是单条爆款,是规模化、可接受的质量下限、极低的边际成本——这正好是流水线的甜点区。

2024 年之后短剧爆发(市场规模已超过电影票房),但真人短剧拍摄成本高(一部几十万)、周期长(数周),AI 短剧把单集成本压到千元级、周期压到天级——第二条生产线由此而来。

二、生产线一:短视频流水线

选题库 ──→ 脚本生成(LLM) ──→ 分镜拆解 ──→ 素材匹配 ──→ 配音(TTS)

发布 ←─── 平台上传(自动化) ←── 合成(FFmpeg) ←── 字幕对齐 ←─┘

                └──→ 数据回流(播放/完播/互动) ──→ 反哺选题库

六个环节,逐个说:

1. 选题与脚本生成

选题来源两块:人工维护的选题库(保证方向可控)+ 数据回流的热门话题(什么火做什么)。脚本用 LLM 生成,prompt 里注入账号人设、目标人群、历史爆款脚本的结构特征(黄金 3 秒开头、钩子密度、时长控制)。一条脚本生成后自动拆解成分镜:每句话配什么画面、什么时长。

2. 素材匹配

分镜的每句话需要画面。素材来源按优先级:

  1. 自有素材库:预先打好标签(场景/物体/情绪/运镜)的版权素材,向量检索匹配
  2. 生成式兜底:库里实在没有的,用图像生成模型按分镜描述生成【待补充:具体生图方案】

匹配不是纯语义相似,还要过一道画面规则:相邻镜头不能同景别(全是特写会很闷)、色调统一、避开低质素材。

3. 配音

TTS 生成旁白,重点调「不像机器人」:多音字注音(中文 TTS 的老大难,行业/品牌词容易读错)、语速和停顿控制、按句尾标点自动加呼吸停顿。

4. 合成(FFmpeg)

这一步是工程重头。纯靠 FFmpeg filter 拼一条带转场、字幕、BGM、片头的视频,filter_complex 会复杂到没法维护,所以做了一层合成 DSL:把「分镜序列 + 字幕轨道 + 音轨 + 转场规则」声明成 JSON,渲染器翻译成 FFmpeg 命令:

json
{
  "timeline": [
    {"asset": "shot_001.mp4", "dur": 2.1, "transition": "fade"},
    {"asset": "shot_002.mp4", "dur": 3.4, "transition": "slide"}
  ],
  "audio": {"voice": "tts_001.mp3", "bgm": "bgm_soft_03.mp3", "bgmVolume": 0.15},
  "subtitle": {"srt": "subs_001.srt", "style": "bold-white-stroke"}
}

性能上用分布式渲染:合成任务是 CPU 密集的,扔到任务队列里由 worker 集群消费,一条 60 秒的视频几十秒出片。

5. 字幕对齐

字幕逐字卡拉 OK 效果需要精确的「字-时间」对齐,用 forced alignment(强制对齐)从 TTS 音频里拿到每个字的起止时间【待补充:具体对齐方案】。

6. 发布与数据回流

批量定时发布到多平台,发布后回收播放量、完播率、互动数据——这些数据反过来调选题库和脚本模板,形成「生产 → 分发 → 数据 → 优化」的闭环。

三、生产线二:AI 短剧生成

短剧和短视频是两个物种:短视频是「一条内容」,短剧是连续叙事产品——有贯穿多集的角色、有钩子递进的剧情、有付费卡点。生产复杂度完全是另一个量级,架构上也单独成线:

剧本书法(LLM) ──→ 分集大纲 ──→ 单集剧本 ──→ 分镜脚本(镜头级)

角色资产库 ──→ 角色一致性控制 ──────────────→ AI 视频生成
     │                                            │
     └── 角色立绘/参考图/LoRA ──→ 图生视频 ──→ 粗剪拼接(FFmpeg)

成品 ←── 配音·音效·字幕·BGM ←── 转场修复·画质增强 ←─┘

1. 剧本层:LLM 做编剧,人做主编

  • 剧本书法:LLM 先产类型框架(战神归来/穿越/重生/甜宠——短剧的题材公式非常成熟),再展开 80~100 集的分集大纲,每集卡点(悬念钩子)显式标注
  • 单集剧本:按大纲逐集生成,prompt 里注入前情摘要(多集上下文窗口控制)、本集钩子目标、台词风格
  • 人在回路:剧本层保留人工主编环节——叙事产品的「爽感节奏」目前 LLM 还拿不稳,人把结构和卡点,AI 把台词和分镜

2. 角色一致性:AI 短剧的生死线

短剧最大的技术坎:主角第 3 集换脸、第 8 集换了身衣服,观众立刻出戏。方案是「角色资产库」:

yaml
character:
  name: 林晚
  reference_images:      # 多角度立绘(正面/侧面/全身),由图像模型生成后人工选定
    - char_linwan_front.png
    - char_linwan_side.png
  lora: char_linwan_v3   # 角色专属 LoRA 微调权重,锁定面部特征
  voice: tts_female_07   # 固定 TTS 音色
  wardrobe:              # 每套服装也是资产,跨集锁定
    - outfit_casual_a
    - outfit_dress_b
  • 静帧用「参考图 + LoRA」保证人物长相稳定
  • 视频镜头用图生视频(image-to-video):先生成本镜头首帧(含角色资产注入),再驱动运动——一致性从「文本生成」的碰运气变成「图像锚定」的可控
  • 每个镜头生成后过一致性校验(人脸相似度打分),低于阈值的镜头自动重roll

3. 镜头层:分镜到成片

分镜脚本拆到镜头级(景别/机位/时长/台词/动作),每个镜头独立生成后拼接:

  • 镜头时长策略:当前视频模型单次生成 5~10 秒,短剧节奏靠「短镜头快切」天然契合——情绪戏用长镜头(生成多段拼接),冲突戏用快切
  • 对口型:台词密集镜头用数字人对口型方案,远景/背影镜头用 TTS 画外音规避口型问题
  • 拼接修复:镜头间运动不连续、闪烁、伪影,靠转场设计(黑场/甩镜/回忆滤镜)把「AI 感」的跳变转成「剪辑风格」
  • 画质增强:统一过一遍超分 + 插帧,多源生成素材的质感拉齐

4. 成本结构

真人短剧(单集)AI 短剧(单集)
演员/场地/设备数万元0(角色资产一次性投入)
制作周期数周1~2 天
修改成本重拍重新生成镜头
规模化线性边际成本递减

四、核心难点

  1. 质量下限控制:全自动必然有翻车内容(素材驴唇不对马嘴、TTS 读错品牌名)。方案是「机器筛 + 抽样人审」:每条成片过一遍自动质检(画面黑帧检测、音画同步校验、敏感内容识别),高风险类目再人工抽检
  2. 成本控制:LLM/TTS/生图都是按量付费,批量场景下 token 账单很吓人。脚本生成用便宜的小模型,只有需要「爆款改写」时才用旗舰模型;TTS/生图缓存素材复用率
  3. 平台风控:批量发布同质内容会被平台限流,每条视频强制差异化——不同的开头模板、BGM 池、转场组合随机组合,标题和封面各自独立生成

五、效果

指标数值说明
日产能【待补充】成片/天
单条成本【待补充】对比人工制作
人工介入率【待补充】需返工的比例

六、收获

AIGC 落地内容行业,拼的不是「能不能生成」,而是流水线的稳定性和质量下限。单点 demo 谁都能做,难的是每天几千条不出低级错误、成本可控、数据能闭环。做完这个项目,对「AI 提效」的理解从概念变成了账本。

💬 对这个项目的架构细节、技术选型有想法?欢迎加我泡泡(微信)一起探讨技术与科技前沿 → 🍵 加我泡泡

MIT License.