画面挺好,人物不崩,运镜居然还有点电影感。你脑子里冒出三个问题:"这是用什么工具做的?" "做一个出来要多久?" "我能学会吗?"下面是我自己跑通的全流程。不是什么理论框架——是我正在做的项目,每一步都踩过坑,每一步都有能直接用的东西。先看全景:7步工序
做一集AI短剧,本质上不是"拍视频",是"组装拼图"。你的拼图有这些:1️⃣出角色 ─→ 2️⃣ 出场景 ─→ 3️⃣ 出俯视图 ─→ 4️⃣ 出多角度视图5️⃣拆分镜 ─→ 6️⃣出调度图 ─→ 7️⃣ 生成视频每一步单独拎出来都不难。难点在于——每一步出来的东西,下一步必须能用。角色图要和场景图比例一致;俯视图要和分镜里的机位对得上;调度图上的走位不能穿模。一旦中间断链,你就得从头来。1️⃣出角色:别画"好看的人",画"这个人的说明书"
新人最常犯的错:花三个小时调一个好看的AI头像,然后换一个角度它就变成别人了。角色不是头像。角色是一份在任何角度、任何光线、任何表情下都能认出是同一个人的文档。所以你需要的不叫"立绘",叫角色设定板(character design sheet)。侧面全身 + 背面全身(发型、服装从背后看什么样)7个分区,纯白背景,极细黑线分隔。没有任何文字、水印、logo。第一,能数字化的不要用形容词。别说"身材高挑"——AI不知道什么叫高挑。说你的人身高172cm、八头身、腰围60cm。别说"宽腰带"——说腰封宽15cm。第二,材质必须写因果链。别只写"月白外袍"——AI不知道月白外袍应该是什么质感。你应该写"月白底大袖长袍,冰蚕丝质感——轻透、飘逸、有冷色偏光。"材质名→物理属性→视觉结果。三个环节缺一个,出来的质感就飘。第三,每个角色需要一个内置矛盾。这是很多人忽略但最值钱的技巧。一个角色如果从头到脚都是同一个形容词,AI画出来会非常"平"。比如一个掌门——"冷、白、无情绪",这是对的。但如果你加一句"但曲线致命"——AI会在无情绪的脸上同时渲染贴合曲线的衣服。这就是张力。一个老妇人——"虚弱的身体"+"年轻的眼神"。一个剑修——"骄傲的表情"+"被击败后重新站稳的姿态"。矛盾让画面成立。新人能踩的坑:角色设定板用一次就扔。不行。你的每一个角色设定板,是接下来的俯视图、分镜图、视频提示词里反复调用的"身份证"。没有它,后面每一步都在赌AI能不能画得像。2️⃣ 出场景:先有"主图",再有其他
但你不能一上来就生成10张不同角度的场景图。为什么?因为AI每次生成都是独立采样——10张图就是10个不同的房间。Step 1:生成场景主图。一张正面平视全景。房间里有什么家具、光从哪里来、什么色调——这一张图定死。Step 2:从主图推导俯视结构图。不用AI画——是你自己画。用一张俯视图把主图里所有家具的位置、门窗的位置、光柱的角度全部标在二维平面上。这张图不漂亮,但它管用。Step 3:生成多角度视图。有主图确定了"这个房间长什么样",有俯视图标清了"东西都在哪",这时候你再让AI从别的角度拍同一个房间,它才不会穿帮。新人能踩的坑:跳步。一上来就"给我生成6个角度的房间"。不行。没有主图锁定DNA,6张图6个房间。后面你的人物一走进去就穿模——因为场景和场景对不上。3️⃣ 出俯视图:这是你的"地图"
这张图不是用来"好看"的。它是你的空间数据库。后面分镜脚本里写"机位在案几侧面1.5m处"——这个1.5m不是猜的,是从俯视图上量的。如果你不画俯视图就进分镜,你会发现你写"镜头从右侧拍摄"的时候自己都不知道右边有什么。4️⃣出多角度视图:测试场景有没有漏洞
有主图和俯视图之后,出9张不同角度的场景图——3×3九宫格:| 正面平视 | 45°斜侧 | 侧面 | | 低位仰拍 | 90°正俯 | 高空俯拍 | | 对向回望 | 极远景 | 极近特写 |这9张图的意义不只是"好看"。它是一个压力测试:如果9个角度拍出来的房间布局不一致——比如正面的椅子在左边、仰拍的椅子跑到右边了——说明你的场景提示词不稳。这时候你得回头改主图提示词,而不是硬着头皮进分镜。5️⃣ 拆分镜:把文字翻译成AI能看懂的指令
镜号 / 场景 / 时长 / 景别 / 机位 / 构图 / 人物站位 / 人物动作 / 表情变化 / 运镜 / 变速 / 光影 / 画面内容 / 台词 / 音效 / 情绪目标
听起来多,其实逻辑很直:你在告诉AI——"摄影机在哪、拍什么、怎么动、什么光、人说啥、什么声"。一段长对白不要全塞进一个镜头——镜头会死。每镜2-4秒,台词能拆就拆。别说"镜头推进"——说"镜头随他倒下的身体同步下沉20cm,速度0.15m/s"。摄影机是参与表演的第三个演员,不是旁观者。很多人只写画面不写声音。AI视频模型对音效的响应和你想象的不一样——你不写它就不加。环境音(风声、哭声、脚步)、关键音效(吐血、敲门、拔剑)必须逐镜标注。新人能踩的坑:分镜写得含糊。你写"近景,安佩兰很悲伤"——AI画出来大概率是另一个老太太。你要写"安佩兰面部正前方0.5m,平视,固定,右脸亮左脸暗,瞳孔缓慢收缩,嘴唇微动无声说了一句话"。6️⃣ 出调度图:提前检查会不会穿帮
这是全流程最关键的一步——也是大多数教程根本不提的一步。比如:第一场戏有5个镜头。你要在俯视图上画清楚——安佩兰站在哪、太监站在哪、每个镜头的摄影机放在哪、拍什么方向。如果第一个镜头安佩兰在案几右侧,第二个镜头她突然出现在左侧——你在俯视图上两秒就能看出来,不用等AI生成完才发现。每批分镜出一张调度图。每张独立。机位从C1开始重新编号。穿帮的最常见原因:人物在下一批镜头里凭空出现或消失。调度图上提前解决——人物只要进了这个空间就一直标在图上,不管镜头有没有拍到他。7️⃣ 生成视频:这一步最不重要
如果前面6步做扎实了,生成视频就是"把拼图放进去点一下"。你现在需要的不是一个完美的AI视频工具。你需要的是:角色设定板、场景主图、俯视图、九宫格、分镜脚本、调度图。这6样东西有了,你用任何工具生成视频都不会崩。工具可以换——今天用Seedance,明天用可灵,后天用Sora——但你的资产包、你的分镜流程、你的调度习惯是通用的。别被吓到。第一集最慢,第二集砍半。这是我的实际数据:工序 | 第一集(你在学) | 第二集起(你会了) |
出角色(1个主要角色) | 1.5h | 0.5h |
出场景(1个场景) | 1h | 0.5h |
出俯视图(从主图推导) | 0.5h | 0.5h |
出九宫格(生成+检查) | 0.5h | 0.5h |
拆分镜(一集约30镜) | 2h | 1h |
出调度图(每批分镜一张) | 0.5h | 0.5h |
生成视频 | 1h | 1h |
合计 | 约7小时 | 约4.5小时 |
换句话说:第一个周末做一集,以后的每个晚上做一集。而且这7个小时不是连续干——角色设定板跑图的时候你可以切出去干别的。实际你在屏幕前的时间大概就4-5小时。剩下是AI的渲染时间。对比一下:传统手绘动画一集需要一整个团队干两周。AI短剧一个人一个晚上。这个效率差,才是你来学AI短剧的理由。别想着"等我学完所有东西再动手"。你第一个角色设定板大概率会翻车——翻就翻了。翻完你才知道"身高写数字"和"身高写形容词"出来的差别在哪里。下一篇预告:我花3小时画了一个角色设定板,它为什么在7个角度里变成了7个人?拆解我第1版翻车的全部原因。
予禾漫剧 · 做AI短剧的,不是教AI短剧的。每周二、四更新。