短视频生成

短视频自动化生产:从脚本到成片的工程实践

2025-03-15 wangjun 14 min read

为什么需要自动化生产?

知识类、资讯类短视频的产能瓶颈从来不在创意,而在 重复劳动:写稿、录音、加字幕、配 BGM、切片渲染。把这些环节变成流水线,一个人也能日产数十条视频。

流水线的五个环节

文案生成 → 配音合成 → 字幕制作 → 素材拼接 → 渲染发布
   ↓           ↓           ↓           ↓           ↓
 LLM       TTS 引擎      ASR/硬字幕   ffmpeg    批处理脚本

1. 文案生成

用 LLM 按模板批量产出脚本,核心是把"选题"转成结构化文案:

模板示例
选题:{topic}
开头钩子:前 3 秒提出反常识问题
正文:3 个知识点,每个 80-120 字
结尾:总结 + 引导关注

2. 配音合成

TTS 引擎(如微软 Edge TTS、讯飞、CosyVoice)把文案转为音频:

# edge-tts 命令行示例
$ edge-tts --text "大家好,今天聊一聊短视频自动化" \
  --voice zh-CN-YunxiNeural \
  --rate=+15% --write-media audio.mp3

语速上调 15%-30% 是短视频的通用做法,信息密度更高。

3. 字幕制作

两条路线:

  • 语音转字幕:ASR(Whisper)把音频转成带时间戳的字幕,适合口播
  • 脚本直出:按句长估算时间戳,快但需要对齐校正
# whisper 生成 srt
$ whisper audio.mp3 --language zh --output_format srt

# 生成 ASS 字幕(可带样式)
$ ffmpeg -i video.mp4 -vf subtitles=sub.ass output.mp4

4. 素材拼接

ffmpeg 是核心引擎:

# 图片 + 音频 → 视频(幻灯片式)
$ ffmpeg -loop 1 -i bg.png -i audio.mp3 \
  -c:v libx264 -tune stillimage -c:a aac \
  -shortest out.mp4

# 多片段 + 淡入淡出拼接
$ ffmpeg -f concat -safe 0 -i list.txt \
  -vf "fade=t=in:st=0:d=0.5,fade=t=out:st=10:d=0.5" out.mp4

# 批量加标题字幕(drawtext)
$ ffmpeg -i in.mp4 -vf "drawtext=text='标题':fontsize=48:x=100:y=100" out.mp4

5. 渲染与发布

用脚本批量处理并重采样到统一规格(如 1080x1920 竖屏、H.264 + AAC、30fps),再通过平台 API 或人工上传。

素材与版权红线

  • 背景音乐优先使用无版权曲库,避免侵权
  • AI 生成的画面若涉及真实人物/品牌,需谨慎使用
  • 平台对"AI 生成内容"有标识要求,发布时如实标注

效果衡量

自动化不是目的,数据反馈才是。建议每条视频统计:完播率、3 秒留存、转粉率,用数据反哺文案模板与选题方向,形成"生产-发布-优化"的闭环。

短视频自动化的价值不在于替代创作者,而在于把创作者从流水线上解放出来,去思考真正重要的选题与表达。