真人AI短剧的核心逻辑,不是让AI凭空生成一切,而是用工业化流程管理创作过程——把编剧、导演、美术、后期的工作拆解成可执行的工序,让AI在每个环节扮演"超级执行者"的角色。
一、整体流程框架
真人AI短剧的全流程可划分为五个阶段:
成熟的团队通过标准化流程,可将单个项目制作周期压缩约70%。
二、分步详解与提示词
第一步:前期策划(动手前的3个问题)
在打开任何AI工具之前,先填立项表:做给谁看(受众)、为什么做(目标)、做到什么程度(质量档位)。
立项表核心要素:
💡 行业洞察:2025年Q4起,传统真人短剧订单断崖下跌,多数制片方全面转向AI。目前行业已形成"AI仿真剧+AI漫剧+真人精品剧"的三层结构。
第二步:剧本与分镜(AI只是效率工具,创意仍在你手中)
2.1 剧本生成
使用DeepSeek、Kimi等工具辅助生成剧本框架,但要记住:AI负责扩写和提供选项,你负责筛选和定调。
剧本提示词模板:
text
请帮我创作一个[题材]短剧大纲,要求:- 每集时长:1-2分钟- 前3秒必须有强钩子(冲突/悬念/意外)- 每15-20秒设置一个小反转- 结尾留钩子引导追更- 人物不超过3个主要角色- 场景不超过5个
2.2 分镜脚本搭建
分镜脚本是精品化的分水岭,不能跳过。一镜只做一件事,镜头越短越稳,动作越单一越真。
分镜脚本表结构:
分镜提示词模板(给Kimi/豆包):
text
请根据以下剧本生成分镜脚本:[粘贴剧本]要求:1. 每个镜头标注景别(远景/全景/中景/近景/特写)2. 标注镜头运动方式(推/拉/摇/移/跟/固定)3. 每个镜头时长控制在2-4秒4. 关键情绪节点使用特写镜头5. 总镜头数控制在15-25个/分钟
第三步:资产准备(决定角色一致性的核心)
这是整套流程中最重要的一步。AI真人短剧最常见的三个问题——人物变脸、服装漂移、风格不统一——根源都在于资产管理没做好。
3.1 角色资产包
每个主要角色建一张资产表,包含:
必做视觉资产:
中景标准图:纯白背景、自然站立、双臂下垂、正面朝镜头——这是所有后续生成的基准图
四视图/多视图:正面、侧面(左右)、背面
面部特写:清晰面部细节
默认服装版本
建议资产:
3-5种情绪状态图(平静、愤怒、悲伤、惊讶、喜悦)
替换服装版本
招牌动作参考
角色提示词标签区:
外貌描述词:发色、发型、面部特征、种族特征
服装描述词:款式、颜色、材质
质感材质词:防油腻关键——用matte surface、dry texture、natural complexion;避免glossy、shiny、oily、airbrushed
光线氛围词:用ambient diffuse、soft shadow;避免过强rim light
负面提示词:deformed、blurry、extra fingers、bad anatomy、oversaturated
💡 工具建议:先通过即梦AI或可灵AI生成角色基准图,通过合规校验后再作为后续生成的参考图输入。
3.2 场景资产包
防穿帮的关键:同一个场景必须生成多视角素材。
必做视角:正向视角(主机位)、反打视角(180度反向)、广角/全景
建议视角:近景/局部、45度侧视角(左右各一)
生成顺序:先全景定调 → 再正向中景 → 再反打视角 → 最后补细节和光线版本。
第四步:素材生成(视频片段+音频)
4.1 视频片段生成
使用即梦AI、可灵AI、Seedance 2.0等工具,以角色资产包中的基准图为参考图输入,生成动态视频片段。
结构化提示词模板(直接可复制使用):
text
① 基础参数:[时长]秒,[16:9/9:16]视频,[核心场景描述]② 画面内容:[场景]中,[人物动作描述],[核心情绪/氛围]③ 拍摄质感:[景别],[镜头运动方式],[光线描述],[整体色调]④ 统一约束:[人物参照角色资产包],[避免事项],[材质控制关键词]⑤ 负面提示词:deformed, blurry, bad anatomy, extra fingers, distorted face, oversaturated, glossy, shiny, oily
4.2 防违规操作(真人脸生成)
使用Seedance等工具生成真人视频时,常见的"内容安全政策违规"拦截可以通过合规校验功能规避——生成图片后,右键选择"合规校验",等待显示蓝色小图标后再继续生成视频。
4.3 音频创作
音频提示词模板:
text
生成一首[古风/现代/悬疑][甜宠/权谋/科幻]短剧配乐:- 情绪:[甜蜜/紧张/恢弘/忧伤]- 乐器偏好:[古筝/钢琴/电子合成]- 时长:30-60秒- 有明确的旋律记忆点
第五步:后期合成与QC
5.1 剪辑合成(剪映)
导入AI生成的视频片段、音频素材
按分镜脚本排列剪辑顺序
调整色彩统一性(AI生成的画面色调常有差异)
添加转场、特效、字幕
音画同步:AI生成的说话视频需与配音精准对齐
5.2 镜头级QC检查清单(逐镜头检查,⚠️项需要返工):
5.3 商用合规核查(决定能否上线的关键):
三、核心提示词模板速查
通用视频提示词四段式框架
这套框架可直接替换场景、人物、动作,适配任意题材:
text
① 基础参数:[时长]秒,[比例]视频,[核心画面融合形式]② 环境氛围+拍摄质感:[场景细节],[光线描述],[画质特征:手持/稳定/噪点/对焦]③ 分秒画面动作:[按时间分段,每段描述画面变化+镜头运动]④ 统一约束:[风格关键词],[禁止项],[运镜逻辑],[音效要求]
防油腻感速查表
| | |
|---|
| matte surface, dry texture, weathered | glossy, shiny, oily, wet-look |
| ambient diffuse, soft shadow, overcast | specular highlight, 过强rim light |
| desaturated tones, muted colors, film grain | |
| visible pores, subtle blemishes, natural | airbrushed, porcelain, dewy |
四、避坑指南
不要从零"手搓" ——把剧本、分镜、角色资产先准备好,AI只负责执行
不要指望AI全权构思创意 ——AI生成的内容四平八稳、缺乏"人味",人工把控故事线,AI仅做格式整理
镜头越短越稳 ——2-4秒/镜头,AI生成的质量最稳定
批量生成不如精修单条 ——打包成4-5秒视频节点再剪辑,而不是逐条提交
前期资产准备决定后期效率 ——80%的返工来自角色/场景资产没做好
AI原声不进最终混音 ——视频模型生成的音频质量不稳定,建议后期重新配音+混音
五、工具清单速查
💡 提示:AI不会取代真人剧,而是赋能真人精品剧。成熟团队的方向是"AI+真人"融合——用AI完成概念设计、分镜预演、虚拟勘景,保留真人演员的核心表演场次,用AI补拍B-roll、空镜、大场面。