文生图、图生视频、TTS 配音、AI 音乐——把工作台的四个工具串成一条完整的内容生产线。
2026-09-05 · 约 7 分钟读完
短视频的三要素——画面、旁白、音乐——在动手之前应该先有一份 30 秒的脚本:开头一句抓人的话、中间两到三个信息点、结尾一句行动引导。这个脚本可以直接在对话里让 AI 帮你打磨,告诉它平台、时长和主题即可。
有了脚本,后面每一步都有了依据:旁白文字就是 TTS 的输入,每个画面点对应一张底图,情绪基调决定音乐的风格词。没有脚本就开工,是新手成片「东拼西凑感」的根源。
按脚本里的画面点,用绘画模板生成底图:风景类内容用风光大片模板,国风主题用国风少女,城市题材用赛博朋克。提示词按文生图教程的四模块结构写,注意横版出图(适配主流短视频画幅),封面帧单独出一张留白的。
底图生成后进入图生视频,每个画面只需要一种微小运动:云层流动、镜头缓推、光影扫过。几秒钟的动态画面拼起来就是一条完整的片子——记住图生视频教程里的原则,运动要小要慢,一次一种。
旁白用 TTS 合成,文本按「标点就是呼吸」的原则预处理:长句拆短、关键信息前后加逗号。音色跟着内容走,知识类选沉稳的中音,情感类选年轻明亮的声音。合成后用 1.5 倍速听一遍,错读和多音字问题在这时候暴露得最彻底。
配乐用音乐生成,风格描述控制在三个词左右,并和旁白的情绪对齐——治愈的画面配 citypop 就很怪。混音时旁白音量在前、音乐压低做铺底,音乐在人声停顿处才允许冒头,这是所有口播类视频通用的混音规则。
全流程走通一次大约半小时,比任何单个工具的调试都更值得花时间——工作流一旦建立,产能的差距就拉开了。
第一条视频走完全流程后,别急着开下一条,先沉淀三样可复用的资产:一是不变的风格词组合(底图风格、音色偏好、音乐风格),存成固定的开场描述;二是脚本的句式骨架(钩子怎么写、信息点怎么排、结尾怎么引导),下次换主题直接填空;三是这次踩的坑(哪个模型的运动词容易崩、哪种文本 TTS 读不稳)。
这三样东西加起来,你的第二条视频制作时间能砍掉一半,第三条之后进入稳定产能区。AI 工具人人都能用,但「个人工作流」是积累出来的——它才是同题材创作者之间拉开差距的东西。
把每条视频的脚本、提示词和成品数据记在同一份文档里,十期之后你会得到一本只属于你的爆款手册。
一条 30 秒短视频的素材,拆开能覆盖多个渠道:底图单独拿出来是公众号配图;旁白文字扩写一下是图文笔记的正文;脚本改写成清单就是小红书笔记;配音音频单独发布是音频口播。一次创作、四处分发,单位素材的产出效率翻几倍——这对独立创作者尤其重要,你缺的不是素材,是「再利用一次」的意识。
分发时的关键动作是「按平台改形式」而不是复制粘贴:让 AI 把同一条内容分别改写成短视频脚本、图文笔记和公众号段落,每种形式保留核心信息、适配平台习惯。素材同源、形式各异,既节省了创作时间,又避免了全平台内容一模一样的敷衍感。