跳到内容
当前位置:首页>短剧全集>新人做AI短剧,从零到第一集,你只需要这7步

新人做AI短剧,从零到第一集,你只需要这7步

  • 2026-10-01 01:22:18
新人做AI短剧,从零到第一集,你只需要这7步
你刷到过那种AI短剧吧?
画面挺好,人物不崩,运镜居然还有点电影感。你脑子里冒出三个问题:
"这是用什么工具做的?" "做一个出来要多久?" "我能学会吗?"
我试了一圈,答案比你想象的要简单。
不需要学编程,不需要会画画,不需要组团队。
一个人,一台电脑,一周。
下面是我自己跑通的全流程。不是什么理论框架——是我正在做的项目,每一步都踩过坑,每一步都有能直接用的东西。

先看全景:7步工序

做一集AI短剧,本质上不是"拍视频",是"组装拼图"。你的拼图有这些:
1️⃣出角色 ─→ 2️⃣ 出场景 ─→ 3️⃣ 出俯视图 ─→ 4️⃣ 出多角度视图
5️⃣拆分镜 ─→ 6️⃣出调度图 ─→ 7️⃣ 生成视频
每一步单独拎出来都不难。难点在于——每一步出来的东西,下一步必须能用。角色图要和场景图比例一致;俯视图要和分镜里的机位对得上;调度图上的走位不能穿模。一旦中间断链,你就得从头来。
我按顺序讲。

1️⃣出角色:别画"好看的人",画"这个人的说明书"

新人最常犯的错:花三个小时调一个好看的AI头像,然后换一个角度它就变成别人了。
角色不是头像。角色是一份在任何角度、任何光线、任何表情下都能认出是同一个人的文档。
所以你需要的不叫"立绘",叫角色设定板(character design sheet)。
它长这样——一张图上至少包含:
正面面部特写(看清五官比例)
正面全身(看清服装层次和身材比例)
侧面全身 + 背面全身(发型、服装从背后看什么样)
瞳孔特写 + 手部特写 + 脚部特写
7个分区,纯白背景,极细黑线分隔。没有任何文字、水印、logo。
写提示词的时候,有三条铁律能让你少翻车:
第一,能数字化的不要用形容词。别说"身材高挑"——AI不知道什么叫高挑。说你的人身高172cm、八头身、腰围60cm。别说"宽腰带"——说腰封宽15cm。
第二,材质必须写因果链。别只写"月白外袍"——AI不知道月白外袍应该是什么质感。你应该写"月白底大袖长袍,冰蚕丝质感——轻透、飘逸、有冷色偏光。"材质名→物理属性→视觉结果。三个环节缺一个,出来的质感就飘。
第三,每个角色需要一个内置矛盾。这是很多人忽略但最值钱的技巧。一个角色如果从头到脚都是同一个形容词,AI画出来会非常"平"。比如一个掌门——"冷、白、无情绪",这是对的。但如果你加一句"但曲线致命"——AI会在无情绪的脸上同时渲染贴合曲线的衣服。这就是张力。一个老妇人——"虚弱的身体"+"年轻的眼神"。一个剑修——"骄傲的表情"+"被击败后重新站稳的姿态"。矛盾让画面成立。
新人能踩的坑:角色设定板用一次就扔。不行。你的每一个角色设定板,是接下来的俯视图、分镜图、视频提示词里反复调用的"身份证"。没有它,后面每一步都在赌AI能不能画得像。

2️⃣ 出场景:先有"主图",再有其他

一个场景不是一张图。它是一组图。
但你不能一上来就生成10张不同角度的场景图。为什么?因为AI每次生成都是独立采样——10张图就是10个不同的房间。
正确顺序是:
Step 1:生成场景主图。一张正面平视全景。房间里有什么家具、光从哪里来、什么色调——这一张图定死。
Step 2:从主图推导俯视结构图。不用AI画——是你自己画。用一张俯视图把主图里所有家具的位置、门窗的位置、光柱的角度全部标在二维平面上。这张图不漂亮,但它管用。
Step 3:生成多角度视图。有主图确定了"这个房间长什么样",有俯视图标清了"东西都在哪",这时候你再让AI从别的角度拍同一个房间,它才不会穿帮。
新人能踩的坑:跳步。一上来就"给我生成6个角度的房间"。不行。没有主图锁定DNA,6张图6个房间。后面你的人物一走进去就穿模——因为场景和场景对不上。

3️⃣ 出俯视图:这是你的"地图"

俯视图画什么?
房间的尺寸和形状
所有家具的位置和尺寸
门窗和光源的位置
预标6-9个摄影机机位(为后面的分镜做准备)
这张图不是用来"好看"的。它是你的空间数据库。后面分镜脚本里写"机位在案几侧面1.5m处"——这个1.5m不是猜的,是从俯视图上量的。
如果你不画俯视图就进分镜,你会发现你写"镜头从右侧拍摄"的时候自己都不知道右边有什么。

4️⃣出多角度视图:测试场景有没有漏洞

有主图和俯视图之后,出9张不同角度的场景图——3×3九宫格:
| 正面平视 | 45°斜侧 | 侧面 | | 低位仰拍 | 90°正俯 | 高空俯拍 | | 对向回望 | 极远景 | 极近特写 |
这9张图的意义不只是"好看"。它是一个压力测试:如果9个角度拍出来的房间布局不一致——比如正面的椅子在左边、仰拍的椅子跑到右边了——说明你的场景提示词不稳。这时候你得回头改主图提示词,而不是硬着头皮进分镜。

5️⃣ 拆分镜:把文字翻译成AI能看懂的指令

分镜脚本不是你拿剧本文本改改格式就算的。
一个AI能看懂的分镜,每一镜要写清楚16件事:

镜号 / 场景 / 时长 / 景别 / 机位 / 构图 / 人物站位 / 人物动作 / 表情变化 / 运镜 / 变速 / 光影 / 画面内容 / 台词 / 音效 / 情绪目标

听起来多,其实逻辑很直:你在告诉AI——"摄影机在哪、拍什么、怎么动、什么光、人说啥、什么声"。
三个原则:
台词拆到多个镜头。
一段长对白不要全塞进一个镜头——镜头会死。每镜2-4秒,台词能拆就拆。
运镜必须绑在身体上。
别说"镜头推进"——说"镜头随他倒下的身体同步下沉20cm,速度0.15m/s"。摄影机是参与表演的第三个演员,不是旁观者。
音效和环境音先写。
很多人只写画面不写声音。AI视频模型对音效的响应和你想象的不一样——你不写它就不加。环境音(风声、哭声、脚步)、关键音效(吐血、敲门、拔剑)必须逐镜标注。
新人能踩的坑:分镜写得含糊。你写"近景,安佩兰很悲伤"——AI画出来大概率是另一个老太太。你要写"安佩兰面部正前方0.5m,平视,固定,右脸亮左脸暗,瞳孔缓慢收缩,嘴唇微动无声说了一句话"。

6️⃣ 出调度图:提前检查会不会穿帮

这是全流程最关键的一步——也是大多数教程根本不提的一步。
调度图就是你在俯视图上加人物走位和摄影机机位。
比如:第一场戏有5个镜头。你要在俯视图上画清楚——安佩兰站在哪、太监站在哪、每个镜头的摄影机放在哪、拍什么方向。如果第一个镜头安佩兰在案几右侧,第二个镜头她突然出现在左侧——你在俯视图上两秒就能看出来,不用等AI生成完才发现。
每批分镜出一张调度图。每张独立。机位从C1开始重新编号。
穿帮的最常见原因:人物在下一批镜头里凭空出现或消失。调度图上提前解决——人物只要进了这个空间就一直标在图上,不管镜头有没有拍到他。

7️⃣ 生成视频:这一步最不重要

说真的。
如果前面6步做扎实了,生成视频就是"把拼图放进去点一下"。
你现在需要的不是一个完美的AI视频工具。你需要的是:角色设定板、场景主图、俯视图、九宫格、分镜脚本、调度图。这6样东西有了,你用任何工具生成视频都不会崩。
工具可以换——今天用Seedance,明天用可灵,后天用Sora——但你的资产包、你的分镜流程、你的调度习惯是通用的。
所以,从头开始要多久?
别被吓到。第一集最慢,第二集砍半。这是我的实际数据:

工序

第一集(你在学)

第二集起(你会了)

出角色(1个主要角色)

1.5h

0.5h

出场景(1个场景)

1h

0.5h

出俯视图(从主图推导)

0.5h

0.5h

出九宫格(生成+检查)

0.5h

0.5h

拆分镜(一集约30镜)

2h

1h

出调度图(每批分镜一张)

0.5h

0.5h

生成视频

1h

1h

合计

约7小时

约4.5小时

换句话说:第一个周末做一集,以后的每个晚上做一集。
而且这7个小时不是连续干——角色设定板跑图的时候你可以切出去干别的。实际你在屏幕前的时间大概就4-5小时。剩下是AI的渲染时间。
对比一下:传统手绘动画一集需要一整个团队干两周。AI短剧一个人一个晚上。这个效率差,才是你来学AI短剧的理由。
现在你可以开始了
第一步就是第一步——先出一个角色试试。
别想着"等我学完所有东西再动手"。你第一个角色设定板大概率会翻车——翻就翻了。翻完你才知道"身高写数字"和"身高写形容词"出来的差别在哪里。
我见过最接近成功的新手,是第一天就翻车的那个人。

下一篇预告:我花3小时画了一个角色设定板,它为什么在7个角度里变成了7个人?拆解我第1版翻车的全部原因。

予禾漫剧 · 做AI短剧的,不是教AI短剧的。每周二、四更新。