
先说结果
用 豆包写剧本 + 即梦出分镜图 + 可灵图生视频 + 剪映合成,四款免费工具,30 分钟就能做出一集 1 分钟的 AI 短剧。核心是"结构化指令锁死剧本质量 + 垫图锁 Seed 保证角色一致 + 交叉并行提升效率"。本文给出完整四步流程和三套可直接复制的提示词模板,跟着做就能出片。
一、为什么是这三款工具
抖音、视频号上那些画风复古、色调像老电影、剧情堪比悬疑片的 AI 短剧,不是专业团队花几十万做的,而是普通人用免费 AI 工具"拼"出来的。
| 工具 |
负责环节 |
核心优势 |
| 豆包 |
剧本 + 分镜脚本 |
结构化指令 10 秒出分镜,台词口语化调整 |
| 即梦 |
分镜图片生成 |
垫图 + 固定 Seed 值,主角长相一致不穿帮 |
| 可灵 |
图生视频 |
国产之光,物理规律理解好,手指不乱长 |
| 剪映 |
配音 + 剪辑 + 字幕 |
AI 配音、自动字幕、BGM 音效一站式,全免费 |
二、第一步:豆包写剧本,10 秒出分镜
写剧本最头疼,但豆包就是你的灵感榨汁机。别让它自由发挥,要用"结构化指令"锁死质量。
1
给角色设定:你是一位擅长短视频节奏的编剧,尤其擅长怀旧、悬疑题材。
2
明确任务:生成一个 1 分钟 AI 短剧脚本,题材为"城中村传闻",背景设定在 90 年代末。
3
锁死要求:分镜数 5 个镜头;开头 3 秒必须出现"年代感钩子"(老电视机雪花声、老式电话铃声);结尾留悬念;每个镜头包含【景别】【画面描述】【台词】。
粘贴后,豆包 10 秒就会吐出一份带分镜的脚本。如果觉得台词太文艺,加一句"台词口语化,像街坊邻居聊天",它立马改得接地气。
三、第二步:即梦出图,10 分钟搞定 5 张电影级分镜
有了剧本,下一步是把文字变画面。即梦的"图片生成"是核心,但秘诀在于"垫图" + "固定 Seed 值",保证主角长相一致,不穿帮。
1
生成主角定妆照:用详细提示词生成主角正面高清图,包含五官、发型、服装、光影、画风。
2
保存参考图 + 锁定 Seed:生成满意的图后,上传到即梦"参考图"功能,让系统记住 Seed 值。后续所有镜头都锁定这个值。
3
逐镜生成分镜图:每个镜头用"画面主体 + 场景 + 光影风格 + 画质 + 镜头语言"的提示词公式,5 个分镜 10 分钟搞定。
提示词公式
画面主体 + 场景 + 光影风格 + 画质 + 镜头语言
示例:一个穿白色背心的中年男人,国字脸,头发微乱,眼神疲惫不安 + 城中村出租屋,傍晚,窗外老式居民楼和交错天线 + 电影级光影,暗部偏暖黄,高光带褪色感,像老照片 + 8k,超现实,胶片颗粒感 + 平视角度,略带手持感。
四、第三步:可灵图生视频,2 分钟让静态图动起来
图片有了,就差动起来。可灵是国产之光,对物理规律理解极好,手指不会乱长。
2
粘贴动作提示词:描述人物动作、环境变化、镜头运动、背景音。
提速技巧:交叉并行
可灵生成一个镜头约 2-3 分钟,这 10 分钟里别干等——直接去即梦处理下一个镜头的图片。两个工具交叉并行,效率翻倍。等可灵出完第一个视频,即梦的第二张图也做好了,无缝衔接。
五、第四步:剪映合成,5 分钟出成片
素材到手,进剪映。按"自动踩点 → AI 配音 → 关键帧微调 → BGM"四步走。
1
自动踩点:导入素材,点击"音频 → 踩点 → 自动踩点",把视频对齐节奏点。
2
AI 配音:用剪映"文本朗读"功能,选"解说男声"或"怀旧电台风",情绪瞬间拉满。
3
关键帧微调:如果视频太静,给素材打上"缩放"或"轻微旋转"关键帧,模拟手持呼吸感,质感直接提升一个档次。
4
BGM + 音效:搜"怀旧悬疑"配乐,音量调低至 20%,不抢戏但烘托氛围。加环境音效(电视声、狗叫声、脚步声)增强代入感。
导出,上传,完活儿!
六、三套万能提示词模板(直接复制)
角色设定:你是一位擅长短视频节奏的编剧,尤其擅长怀旧、悬疑题材。
任务:帮我生成一个1分钟AI短剧脚本,题材为"城中村传闻",背景设定在90年代末。
要求:
1. 分镜数:5个镜头。
2. 结构:开头3秒必须出现"年代感钩子"(比如老电视机雪花声、老式电话铃声),结尾留悬念。
3. 格式:每个镜头需包含【景别】、【画面描述】、【台词】。
4. 台词口语化,像街坊邻居聊天,不要书面语。
画面主体:一个穿白色背心的中年男人,国字脸,头发微乱,眼神里带着疲惫和不安。
场景:城中村出租屋,傍晚,窗外是老式居民楼和交错的天线,墙上有旧海报和挂历。
光影风格:电影级光影,暗部偏暖黄,高光带一点褪色感,像老照片。
画质:8k,超现实,胶片颗粒感,光影层次丰富。
镜头语言:平视角度,略带手持感,突出真实和压抑。
(生成满意后,右键复制图片,上传到即梦"参考图"功能,锁定Seed值,后续所有镜头共用)
男人缓缓转过头,看向窗外,窗外的老式路灯闪烁了一下,他手里夹着的烟灰掉落。镜头缓慢推近,背景音有远处模糊的电视声和狗叫声。
(通用公式:人物动作 + 环境变化 + 镜头运动 + 背景音效,动作越简单成功率越高)
七、新手避坑指南:最常犯的 3 个错
避坑提醒
1
角色不一致(最头疼):每次生成新图时,必须用垫图功能并锁定 Seed 值,否则主角长相会变。先做 1 张主角定妆照,全程参考。
2
画面太新没质感:在提示词里加"褪色、胶片颗粒、旧化效果、暖黄暗部"等关键词,年代感和电影质感会好很多。
3
动作不连贯:可灵生成多个片段后,在剪映里用"叠化"转场,0.3 秒就行,看起来更丝滑。单镜头动作不要复杂,多拆短镜头。
八、效率翻倍的 5 个进阶技巧
1
交叉并行:可灵生成视频时,去即梦做下一张图,两个工具同时跑,30 分钟出片的核心。
2
先批量出图再转视频:先把所有分镜静态图全部生成,确认人物没问题再批量转视频,避免做到一半发现角色崩了浪费算力。
3
单镜头不超过 10 秒:太长容易出现肢体扭曲、人脸崩坏,5-8 秒最佳,多拆短镜头用转场拼接。
4
2-3 个主角最佳:不要一集做多个人物,人物越多变脸概率越高,新手先从 2 人单一场景练手。
5
先做 60 秒小样测试:先做 1 集 60 秒小样,测试角色画风和流程,跑通后再批量生产系列剧,避免大规模返工。
九、一句话收个尾
观众看的不是 AI,是"故事"和"氛围"。当你用 AI 把那些现实中拍不出来的年代细节、氛围感变成画面时,这种视觉冲击就是最大的流量密码。豆包写剧本、即梦出图、可灵动起来、剪映合成——30 分钟,就是你弯道超车的开始。
作者声明:本作品含 AI 生成内容