短视频生成
短视频自动化生产:从脚本到成片的工程实践
▶
为什么需要自动化生产?
知识类、资讯类短视频的产能瓶颈从来不在创意,而在 重复劳动:写稿、录音、加字幕、配 BGM、切片渲染。把这些环节变成流水线,一个人也能日产数十条视频。
流水线的五个环节
文案生成 → 配音合成 → 字幕制作 → 素材拼接 → 渲染发布
↓ ↓ ↓ ↓ ↓
LLM TTS 引擎 ASR/硬字幕 ffmpeg 批处理脚本
1. 文案生成
用 LLM 按模板批量产出脚本,核心是把"选题"转成结构化文案:
模板示例
选题:{topic}
开头钩子:前 3 秒提出反常识问题
正文:3 个知识点,每个 80-120 字
结尾:总结 + 引导关注
2. 配音合成
TTS 引擎(如微软 Edge TTS、讯飞、CosyVoice)把文案转为音频:
# edge-tts 命令行示例
$ edge-tts --text "大家好,今天聊一聊短视频自动化" \
--voice zh-CN-YunxiNeural \
--rate=+15% --write-media audio.mp3
语速上调 15%-30% 是短视频的通用做法,信息密度更高。
3. 字幕制作
两条路线:
- 语音转字幕:ASR(Whisper)把音频转成带时间戳的字幕,适合口播
- 脚本直出:按句长估算时间戳,快但需要对齐校正
# whisper 生成 srt
$ whisper audio.mp3 --language zh --output_format srt
# 生成 ASS 字幕(可带样式)
$ ffmpeg -i video.mp4 -vf subtitles=sub.ass output.mp4
4. 素材拼接
ffmpeg 是核心引擎:
# 图片 + 音频 → 视频(幻灯片式)
$ ffmpeg -loop 1 -i bg.png -i audio.mp3 \
-c:v libx264 -tune stillimage -c:a aac \
-shortest out.mp4
# 多片段 + 淡入淡出拼接
$ ffmpeg -f concat -safe 0 -i list.txt \
-vf "fade=t=in:st=0:d=0.5,fade=t=out:st=10:d=0.5" out.mp4
# 批量加标题字幕(drawtext)
$ ffmpeg -i in.mp4 -vf "drawtext=text='标题':fontsize=48:x=100:y=100" out.mp4
5. 渲染与发布
用脚本批量处理并重采样到统一规格(如 1080x1920 竖屏、H.264 + AAC、30fps),再通过平台 API 或人工上传。
素材与版权红线
- 背景音乐优先使用无版权曲库,避免侵权
- AI 生成的画面若涉及真实人物/品牌,需谨慎使用
- 平台对"AI 生成内容"有标识要求,发布时如实标注
效果衡量
自动化不是目的,数据反馈才是。建议每条视频统计:完播率、3 秒留存、转粉率,用数据反哺文案模板与选题方向,形成"生产-发布-优化"的闭环。
短视频自动化的价值不在于替代创作者,而在于把创作者从流水线上解放出来,去思考真正重要的选题与表达。