2026年做AI短剧,角色稳定是第一步,也是最容易被忽略的一步。 换镜头就换脸、表情飘忽、动作变形——90%的翻车问题都不在模型,而在角色设定阶段没把”这个人是谁”写清楚。下面是我自己跑完整套流程后沉淀下来的方法,按这套走,主角可以稳定撑起一整季。

一、先搞清楚:AI角色稳定的完整链路

AI短剧的角色稳定,不是靠提示词写得更长,而是要建一套”角色资产”。整套链路分七步:

  1. 先做项目副本——上次的画布保留作对照,新画布从零起,避免误删前一讲素材
  2. 写125角色设定卡——把”一个名字”变成”可被脚本和图片共用的设定”
  3. 打磨定装照提示词——五要素锁质感,先打半身定装照
  4. 锁一张主参考图——所有后续图都引用这一张,这是角色稳定的核心
  5. 生成三层角色资产——脸部三视图/全身设定图/表情图
  6. 场景验证四检——换景别、换场景看角色还稳不稳
  7. 可选:声音设定——用平台官方音色或合规克隆,给角色第二个身份证

下面按顺序展开每一步。

二、125角色设定卡:把名字变成可用的角色

稳定角色的第一步,不是写更长的提示词,而是先知道哪些信息必须具备。我把这套最小可用模型叫”125”——1、2、5三个数字对应三个层次的设定。

1 = 一句话标签

用最简单的话归纳出”他是谁”。

例:一名追寻失踪妻子的退役神探。

2 = 渴望 + 行动 + 底线

让角色遇到事情时不会随机反应,而是有真实且合理的动机与行为。这一层有两个关键:

5 = 性格 + 样貌 + 喜恶 + 能力 + 经历

让他拥有可以被观察、能表演出来的细节。例:

群演只需要写1,主角三个都要写。

设定卡的三个注意事项

几个实用小技巧:设定卡写完后问自己一句——“这个设定能不能影响他至少三个不同的行为决策?“如果只能影响一个,那就还不是好设定。真正好的设定会持续改变角色的动作、选择、命运。

三、人像质感五要素:让AI出图告别滤镜脸

角色设定卡写完,开始给它捏脸。这里有一个很容易踩的坑:直接生成图片,然后问”哪张最好看”。但更稳的路线是——先把提示词打磨好,再生成图片

光提示词就够了?不够。要让AI出图看起来像真实的人、而不是滤镜脸,提示词里必须加五个关键东西:

① 不均匀的皮肤纹理(关键)

千万不要写”光滑的皮肤”或”水光肌”——模型一看到光滑就会自动磨皮。改写为:

有瑕疵的皮肤才像真人。

② 具体光位描述(关键)

不要笼统地写”灯光柔和”。直接写:

环形光 人物侧面约30到45度 略高于视线 鼻子下方留轻微的阴影

具体的光位描述可以立刻提升脸部立体度。

③ 写实风格词(关键)

风格词里用:

这些词会触发模型的真实感参数。不要写”商业写真""杂志大片”——那些词会把你拉回抹皮加滤镜的套路。

④ 明确镜头焦段(关键)

焦段相当于脸的”尺子”:

不写焦段,模型默认值容易导致脸部变形。写对焦段,脸的状态才会对

⑤ 反向约束(关键)

末尾永远加一行:

禁止美颜 / 禁止磨皮 / 禁止滤镜

这些反向约束往往最有效。

几个实用小技巧:第一次只生成半身定装照,不加全身、动作、场景等其他元素。变量越少,越容易判断脸到底对不对。如果第一轮生成4张,按角色设定逐张检查——先看年龄感和长相是否符合设定卡 → 再看服装和道具是否固定 → 再看皮肤质感是否自然 → 最后看整体气质能不能”装下”角色的所有性格和行为。

四、角色资产三层:脸/全身/表情全部锁住

单张定装照还不能叫角色资产,因为它只锁了一个角度。

接下来从同一张主参考图出发,把角色从脸到全身、从静态到表情全部补齐。这一步和传统影视动画的”角色设定集、表情表”是一个逻辑——编剧、美术、分镜、动画师要对同一个人形成共同标准。

第一层:脸部三视图

锁脸——确认角色的脸型、五官、肤色、发型等细节。

检查重点:转过去以后还是不是他?正面好看,但侧面鼻型、下颌线、发型完全变了,那这套图就不能进入下一步。

第二层:全身设定图

锁身——保证角色的着装、体态、身高、道具。

这一步最容易翻车——模型生成全身时很容易把服装自动升级成”更帅的款式”。所以提示词要描述得尽可能具体

第三层:表情图

锁表情——做几个基础表情:开心、愤怒、忧伤、焦虑、怀疑、难过等。

每个表情对应具体身体细节:

表情细节描述
愤怒皱眉、嘴角下压、鼻翼扩张、眼神带火
害怕身体后撤、眉间收紧、嘴角抿住、不要哭泣、不要夸张尖叫
怀疑头微侧、眉微挑、眼神聚焦

如果某个表情你不满意,可以针对单张优化提示词。表情图是后面所有表演动作的”标准表情库”。

五、场景验证四检:角色稳定性的真正考试

三层资产做完后不着急入库。稳定必须经过调用测试——把角色放到不同场景里看还能不能持续保持稳定。

我自己跑流程时用双场景验证:第一个放在熟悉的便利店里(变化的是景别和情绪),第二个放在深夜下雨的便利店后巷(变化的是环境、光线和动作)。两个场景的两张图放一起,只检查四件事:

  1. 同一性——你能否第一眼看出来这两个就是同一个人?
  2. 服装道具——发型、工作服、道具是不是稳定?
  3. 表情动作——是否符合角色设定?(如便利店里应该是轻微惊吓+疑惑,外面是疑惑+尝试性探索)
  4. 年龄感与质感——换了场景和景别,年龄感和皮肤质感有没有明显偏移?

四项都通过,恭喜,这套资产可以定版

如果验证没通过——按问题分层回溯

问题层修复方法
脸变了检查图片节点是否引用同一张定装照;引用了还差异大就回到主参考图选更稳定的一组
道具细节变了(眼镜消失等)为道具单独制作道具图,作为参考资产引入
整体形变回到角色设定图,重新设定服装、颜色、道具、配饰;场景提示词和图片同时重复固定
表情失控回到表情图优化,把情绪换成具体动作(“害怕”→“身体后撤、眉间收紧”)
皮肤光影失真检查灯光是否过于复杂,调整光位描述和皮肤纹理

几个实用小技巧:验证不过不要把问题全归结为模型不行。绝大多数情况是上游某一层没锁住。提示词可以告诉模型这张图要拍什么,主参考图和角色资产则告诉模型这个人真正是谁——这两者缺一不可。

六、声音设定:角色的第二个身份证

视觉稳定以后,如果还想让角色拥有固定的声音,可以做声音设定。声音是角色的第二个身份证——一个谨慎克制的夜班店员,如果一开口就是高亢的声音,观众肯定会出戏。

三种合规方式,从省时间到深度定制排序:

  1. 平台官方音色——大部分AI短剧平台的音频模型里有几十种内置音色,按语种、性别、年龄筛选,找一个年龄感、语速、音色都匹配的,把角色旁白放进去试听。我更推荐一个”不过度表演”的声音,因为后面还可以通过语速、停顿、情绪强度继续调整。
  2. 音色克隆——必须严格遵守合规边界:只能克隆自己有授权的声音(如自己的声音、获得授权的商用授权音色)。克隆明星或公众人物的声音涉及的不只是版权,还有肖像权、声音权等法律风险。AI短剧的合规翻车很多都出现在声音这一块。
  3. 直接生成——选Seed类音频模型,在台词后用文字描述你想要的声音感觉(如”低沉沙哑、语速偏慢、轻微疲惫感”),一次只要几秒积分,可以反复打磨。

七、写在最后:AI的角色资产意识

这一套流程跑完,我最想带走的不是几个写真人的关键词,而是一种角色资产意识

AI适合帮我们扩起设定、生成候选和执行变化。但人必须负责这三个决定:

  1. 哪个人物设定是真正成立的
  2. 哪一张图可以成为主参考图
  3. 跨场景测试是否达到继续生产的标准

把这三个决定做好了,你的AI短剧主角就真正”活了”——换镜头不换脸、换场景不变形、换情绪不飘忽。这就是稳定角色的全部秘密。


下一步行动建议

完成这套动作后,你就拥有了一个”有完整档案的AI演员”——随时可以登场开始表演。

想直接拿到一份完整的125角色设定卡模板 + 定装照提示词模板 + 三层资产提示词 + 场景验证清单?我整理成了一份资产包(含模板+示例+自检表),网盘链接:📦 立即领取


📦 配套资料:125模板 + 定装照提示词 + 三层资产提示词 + 场景验证清单(含示例)

👇 评论区置顶夸克网盘链接,扫码即可领取

(持续更新中,如果你跑通后有了自己的角色档案,欢迎在评论区分享)