先说结论:
视频一做就飘,通常不是模型突然变笨,是你让一段提示词同时当导演、化妆、摄影和调色。 它最省事的办法,就是每一秒都重新猜一次。
你习惯的操作大概是这样:
打开视频模型 → 把人、店、镜头、风格全写进同一个框 → 再补「人物一致、运镜流畅、电影感」→ 抽卡 → 前两秒还行,第四秒换了一个人
模型收到的不是拍摄计划,是一张许愿清单。清单越长,它越会从训练里东抄一截、西抄一截。于是你看见的是热闹,不是这一家店今晚正在发生的事。
记住一件事:最后那段视频词只负责整合。人、事、怎么拍、什么感觉,都要在进视频框之前变成图,变成能用眼睛检查的东西。
下面整晚只用一家店。不换城中村,不换这盏灯,不换这两张脸。谁觉得夜市炸串已经写腻了,正好。今晚我们去修手机。
晚上九点四十。城中村一楼,卷帘门拉到一半的「老周通讯」。柜台上一根冷白灯管,玻璃柜台里躺着拆开的机壳和螺丝刀。店员在给一块新屏贴膜。门外站着刚收车的出租司机,碎屏手机还在他手里,钥匙串叮一声。
店、灯、这两个人,全部锁死。今晚不练新风格,只练:生成之前,先让这条片子在纸上走完。
你要的验收,不是「词更长了」
过关标准很具体。你自己不许手写完整视频词。你要先后拿到这些东西:
- 两张人物钉死图,再加两张三视图
- 一段能拆成 6 到 8 格、每格都能拍出来的事
- 一页手绘线稿分镜,上一格能走到下一格
- 一张定调图,灯管的颜色不许中途换成暖黄广告光
- 按镜号写的几句人话,只供口型用,画面里不许出字
- 最后才出现的一小段整合词
成片里:店员的马尾不许第二镜变成短发;司机的车钥匙不许忽然消失;上一格人还在柜台里贴膜,下一格不许突然站到马路牙子上对镜头笑。
有人管那一页格子叫故事板,有人叫分镜草稿。叫什么无所谓。有用的地方只有一个:视频还没开始跑,你已经能用眼睛看出第四格会不会换人。
一、先看清楚,一段词到底在瞎猜什么
只靠提示词生成「好几镜」的短视频,翻车几乎都长一个样。别急着换模型,先对号。
它不知道镜头怎么拍。 你写「司机来取手机」。它不知道人是从卷帘门缝里侧身进来,还是已经趴在柜台上;不知道镜头该停在贴膜的手上,还是跟着人推近。于是给你训练里最常见的那种:人居中,镜头自己漂,再来一段无意义环绕。
它不知道人怎么保持一致。 五官你写了,店服你写了。一切两刀,马尾、胸前那几个字、司机的车钥匙,仍可能各镜各的。两个人的对手戏更明显:第三格常常会冒出一张训练里更「好看」的脸。
它不知道这条片子该是什么光。 第一秒是冷白灯管,第三秒变成美食暖光,第五秒又像手机广告。灯一换,这家店就不再是老周通讯。
所以提示词重要,但它扛不下四份工。今晚把活拆开:
| 这份材料 | 它只准管 | 你拿什么检查 |
|---|---|---|
| 人物钉死图 + 三视图 | 谁在画面里,脸和衣服不许改 | 遮住五官,仍能认出店服和车钥匙 |
| 剧情 | 这十几秒里发生了哪件能拍的事 | 每格都有手在干什么,没有「心事」 |
| 分镜图 | 从哪看、人站哪、镜头动不动 | 上一格能走到下一格,人不瞬移 |
| 定调图 | 灯、色、皮肤、柜台质感 | 遮住人,仍能说出「这是灯管,不是暖黄夜市」 |
| 对话 | 口型、停顿、谁先开口 | 句子短,画面里没有字幕 |
| 视频词 | 把上面这些拼进去,不许另发明 | 短。再写「电影感」就是在拆台 |
以前是你每条视频都重新解释。材料齐了以后,更像把活分给四个工种。视频模型只听见一句:按这些干,别自己加戏。
二、分镜先别画。先把人钉死,再写出能拍的事
很多人一听「先出分镜」,立刻让模型画六格小人。画出来一定空。格子里的人还没有主人,格子里的事还没有发生。
分镜围着人和事转。人不清,剧情就只能写「修手机很有生活感」;剧情不清,分镜就只能交「好看的店铺分镜作业」。
1. 先出两张半身,再出三视图
今晚就两个人。不许加店老板,不许写成「一个女生和一个男生」。
柜台里这个人:二十出头,马尾从深蓝色店服领口后面垂下来,胸前绣着发白的「老周通讯」,袖口卷到小臂,右手正在把气泡往贴膜边缘赶,左手按着手机。不看镜头。指甲剪短。脸上几乎没妆,灯管在额头上有一条细反光。
柜台外这个人:四十出头的出租司机,深色短袖衬衫皱着,车钥匙和门禁扣在同一串上,还攥在右手里。左手把碎屏手机递给柜台。眼下有青,胡茬是下班后没收拾的那种,不是造型。
店员这张,可以直接贴:
![图片[1]-【五十五】一切镜就换人?别再往视频框里塞八百字,先让这条片子在纸上走完-元界深掘](https://meta-1442323842.cos.ap-beijing.myqcloud.com/wp-content/uploads/2026/09/1-7-1024x576.png)
司机另开一张,灯和店必须同一套:
![图片[2]-【五十五】一切镜就换人?别再往视频框里塞八百字,先让这条片子在纸上走完-元界深掘](https://meta-1442323842.cos.ap-beijing.myqcloud.com/wp-content/uploads/2026/09/2-4-1024x576.png)
两张半身过了,再出三视图。三视图不是为了好看,是为了后面分镜一换角度,店服、马尾、钥匙串还在。白底。左:面部特写,毛孔和发丝要在。右:全身 A-pose,正、侧、背排开。店服、鞋子、钥匙、袖口,全部跟半身图一致。
![图片[3]-【五十五】一切镜就换人?别再往视频框里塞八百字,先让这条片子在纸上走完-元界深掘](https://meta-1442323842.cos.ap-beijing.myqcloud.com/wp-content/uploads/2026/09/3-3-1024x576.png)
![图片[4]-【五十五】一切镜就换人?别再往视频框里塞八百字,先让这条片子在纸上走完-元界深掘](https://meta-1442323842.cos.ap-beijing.myqcloud.com/wp-content/uploads/2026/09/4-3-1024x576.png)
女店员、男司机各跑一张。检查时把脸遮住:一张要仍能看出「深蓝色店服、刮板、贴膜」;一张要仍能看出「皱衬衫、钥匙串、碎屏」。说不出,就还是空壳,别往下画格子。
2. 人钉死了,把两张图丢给对话模型写剧情。你负责划掉拍不了的句子
不要自己先写八百字小说。小说爱写心事,心事拍不出来,模型就会用转头微笑充数。
把身份图丢给豆包、ChatGPT 或 Gemini,直接贴:
![图片[5]-【五十五】一切镜就换人?别再往视频框里塞八百字,先让这条片子在纸上走完-元界深掘](https://meta-1442323842.cos.ap-beijing.myqcloud.com/wp-content/uploads/2026/09/5-3-949x1024.png)
它交回来以后,别先看文笔。看它好不好拍。
好剧情:刮板、气泡、碎屏、钥匙、屏幕亮起,每一样都在画面里有位置。 差剧情:「她觉得这份工作很辛苦」「司机感到了温暖」。这些拍不出来。
对照用,下面这一版是改顺以后应有的样子,用来检查,不是拿去当万能剧情收藏:
1. 店门全景,固定。卷帘门拉到一半,灯管只照亮柜台一小块,巷子是暗的。店员在柜台里低头,司机从门缝侧身进来。 2. 柜台里中近景,固定。店员右手刮板赶气泡,左手按着新屏,没看镜头。 3. 柜台外中近景,固定。司机把碎屏手机放上台面,钥匙串碰到玻璃,响了一下。 4. 手部特写。刮板、膜、气泡被赶出边缘。 5. 两人同框,平视。店员把贴好膜的手机推过玻璃,司机的手还停在半空。 6. 屏幕特写。拇指按亮,冷白的屏幕光打在两只手上。 7. 司机近景。他低头看微信,嘴没动,钥匙还攥着。 8. 回到中近景,固定。屏幕还亮着,店员已经拿起下一张膜,司机还没离开柜台。两个人都停在这件事刚做完、还没结束的位置。
八格都能用眼睛看见。没有「生活感拉满」,没有「电影感」。能列成这样,才允许进入下一格。
三、人和事都有了,才允许它画出分镜。分镜管镜头,不管最终画质
不要直接去生成视频。让生图模型根据人物和剧情,画一页 6 到 8 格。
要的不是六张精修海报,也不是六张连着的店铺写真。是一页能看懂的拍摄草稿。手绘线稿、格子清楚、每格下面有短句,这就够了。格子画得太美,后面它会把每一格当成不同成片去抄,人更容易一段一个样。
每一格至少要能看出:人在柜台里还是外、这一刀是远中近还是特写、手在干什么、镜头动不动、这一格要看什么、格子下方有一句人话。
身份图和剧情留在同一个对话里,接着贴:
![图片[6]-【五十五】一切镜就换人?别再往视频框里塞八百字,先让这条片子在纸上走完-元界深掘](https://meta-1442323842.cos.ap-beijing.myqcloud.com/wp-content/uploads/2026/09/6-4-1024x683.png)
出图之后,先别问好不好看。问清不清楚。三件事,漏一个就打回去,别自己在视频框里补。
镜头顺序连不连。 上一格人还在柜台里贴膜,下一格突然出现在巷口对镜头笑,中间没有「司机从门缝进来」,这页就不够顺。短视频最怕瞬移。瞬移一次,人物一致基本完了。
动作看不看得懂。 赶气泡、放碎屏、推机子、按亮、看微信,这些要能在线稿里看出来。格子里只有「两人站着」,视频模型就会用转头、眨眼、微笑来填。
镜头运动合不合理。 推、拉、横移都可以,但必须为这一格的事服务。不要每一格都环绕。老周通讯更稳的默认值是:大多数格子固定,只在进门、推机这两下允许微动。
还假,就把问题说回去,只改分镜,别把人物图一起重出:
现在这页分镜有问题:第 2 格到第 3 格人瞬移了,第 5 格两个人都在看镜头,每格都在推近。 请只重画分镜,人物身份不要改。 要求:镜头顺序必须能走过去;动作必须看得出手在干什么;默认固定镜头,只允许 1 到 2 格微动;不要对镜头笑。
分镜真正要干的活,是把「怎么拍」讲清楚。五官和衣服交给身份图,灯管、玻璃反光、皮肤质感交给下一张定调图。你若逼它在格子里把脸画精,它就会把每一格当成一张新海报。
四、分镜告诉它怎么拍。还要一张定调图告诉它最终长什么样
有了分镜,仍不要打开视频框。还缺一张图:这条片子的光到底是什么。
三张材料现在分工已经清楚:
- 身份图:谁在画面里
- 分镜:这一刀从哪看,手往哪动
- 定调图:灯管什么颜色、玻璃怎么反、皮肤别发塑料、整条不许忽然变成手机广告
没有定调图,视频模型会按最常见的「小店短视频」去补:脸更干净,灯更均匀,柜台更像展台。你在分镜里写了冷白灯管也没用,它可能只在第一秒听话。
老周通讯要的感觉很具体:一根灯管,玻璃反光,屏幕亮起时多出一小块更冷的光,皮肤不要广告级,门外巷子要暗。把身份图和分镜一起丢给生图模型:
![图片[7]-【五十五】一切镜就换人?别再往视频框里塞八百字,先让这条片子在纸上走完-元界深掘](https://meta-1442323842.cos.ap-beijing.myqcloud.com/wp-content/uploads/2026/09/7-1-1024x576.png)
定调图不需要包含所有镜头。它更像一张风格样片:后面每一秒都来抄这张的光,而不是自己发明第二种光。
检查:把人的五官遮住,仍要能说出「这是灯管底下的维修柜台」。说成「夜市」或「手机发布会」,就打回去,只改定调图,别动分镜。
五、材料齐了,视频词要短。台词另写,别让它去认图上的字
四份材料都在了,还差一步。很多人在这里直接把分镜丢进视频模型,指望它把格子下面那行小字念出来。
分镜上的字又小又草。视频模型认图里的字本来就不稳。你若把「好了」写在格子上,它可能当成装饰,也可能把字烧进画面,变成字幕海报。
更稳的做法:分镜只管画面。对话模型再按格子补说话方式。这段只用来管口型、停顿、谁先开口。画面里仍然不许出现字幕、标题、对白气泡。
带声音的模型还有两个老坑:你不写无背景音乐,小店会自己配歌,人立刻变成广告;你不规定台词只作参考,店员可能对着镜头介绍套餐。
同一个对话里接着贴:
![图片[8]-【五十五】一切镜就换人?别再往视频框里塞八百字,先让这条片子在纸上走完-元界深掘](https://meta-1442323842.cos.ap-beijing.myqcloud.com/wp-content/uploads/2026/09/8-1-652x1024.png)
对照用,改顺以后大概是这种密度:
1. 无对白。卷帘门边箱带或钥匙轻响。 2. 无对白。刮板在膜上走。 3. 司机:「取一下。下午那个屏。」 4. 无对白。气泡被赶出去。 5. 店员没抬头:「好了。你点一下。」 6. 无对白。屏幕亮。 7. 司机很低地嗯了一声,没再说话。 8. 无对白。她已经拿起下一张膜。
有了这段,再把图和词一起放进视频生成框。哪张图是谁,要写死:
- 图 1:店员身份图
- 图 2:司机身份图
- 图 3:定调图
- 图 4:分镜图
- 对话:贴在提示词里
视频提示词从今晚起就要短。短不是偷懒,是前面四份工已经干完了。再写八百字「人物一致、电影感」,等于邀请它重新猜。
时长别开太短。剧情是 6 到 8 镜,去开 3 秒会逼它把八件事叠在同一秒里,人会抽。每一镜里仍然只干一件事。变的是:镜与镜之间的顺序,现在由分镜管,不由你在一段词里用逗号连接。
成片四步验收:
- 把声音关掉。仍要能看出「贴膜、递碎屏、推机、屏幕亮」。看不出,是分镜或剧情空了。
- 每一镜暂停。马尾还在不在,钥匙串还在不在。漂了,回身份图,别在视频词里加「不要换脸」。
- 灯是不是从头到尾同一根冷白。变暖了,回定调图。
- 画面里有没有字、有没有歌。有,就是最后那段词没写死。
六、三件最容易让材料白做的事
- 人还没钉死,就让它画分镜。 空格子看起来也像分镜,用上去会比没有更假:它给了模型六次重新发明人物的机会。顺序不许倒:人 → 事 → 分镜 → 定调图 → 对话 → 视频词。
- 把分镜画成六张精修海报。 分镜只负责镜头和动作。五官、刺绣、玻璃高光全压进去,每一格都会被当成不同参考。线稿清楚,胜过格子好看。
- 最后那段视频词和前面打架。 前面已经定了柜台里干活、冷白灯管、不看镜头,最后又写「氛围感、对镜头微笑、运镜华丽」,前面全白干。前面定过的事,后面只许重复,不许改方向。
还假的时候,别急着换视频模型。先看哪份材料空了:身份图能不能遮脸认出人,剧情能不能每镜都拍,分镜顺序连不连,定调图的灯在不在。哪份空,改哪份。整段重写,上次已经对的东西会被写丢。
过关表
| 成片什么样 | 别急着加 | 先改 |
|---|---|---|
| 一切镜就换脸、换店服、丢钥匙 | 「人物一致、不要换脸」 | 先出身份图和三视图,分镜里不许出现第三张脸 |
| 人会瞬移,镜头乱跳 | 「运镜流畅、多镜头」 | 先写能拍的剧情,再画分镜,检查上一格怎么走到下一格 |
| 灯每一段一个颜色 | 「电影感、色调统一」 | 出一张定调图,视频词只许参考这张 |
| 一进视频就唱歌、出字幕、对镜头笑 | 把视频词写更长 | 台词另写只管口型;写死无背景音乐、画面无字 |
可直接复制的简化模板如下。店可以换成你自己的,结构别拆。
1. 人物三视图
2. 剧情
3. 分镜图
4. 定调图
5. 对话(按分镜)
6. 视频生成
最后只记四句:
- 视频词管最后那一下拼装。材料管这条片子会不会稳。
- 先钉人,再写能拍的事,再画怎么拍,再定什么感觉。
- 分镜第一版只负责能看懂,不负责好看。
- 分镜还没在纸上走完,就先别抽卡。
今晚先不要换店。就用「老周通讯」,把六份材料摆齐,再进视频框。第四秒如果换了人,回身份图。灯如果变暖了,回定调图。别再往最后那段词里加「更自然一点」。



暂无评论内容