最近刷短视频,你应该也注意到了:一批「真人日常」感的 vlog 正在刷屏——手持镜头轻微晃动、窗边的自然光、素颜感的淡妆。唯一的区别是,画面里的人并不存在。
对普通创作者来说,这类内容的门槛正在快速下降。只需要一张人物图加一段提示词,就能生成一条 30 秒的写实感 vlog。更关键的是,人物图不会有版权纠纷,而且一分钱不花。
这篇文章就教教大家如何低成本的制作一个AI Vlog,每一步都配了可直接复制的提示词和参数建议。看完照着做一遍,你就能产出自己的第一条。
准备一张「面部清晰」的 AI 人物图
这一张图决定了整条视频的上限。脸不清楚,后面无论怎么生成都会糊,有两条路,按你的需求选。
路线 A:Herdsman 本地生成(零成本、不出网)
适合想批量试稿、注重隐私、或者不想消耗积分的场景。所有运算在本机完成,不联网也能跑。
操作要点:
▪ 打开 Herdsman,在工作区找到图片生成功能
▪ 把下面的提示词 A 粘进去,照着指引下载相关内容即可,一次出 2–4 张,挑一张脸部最清楚的
参数建议
表 1 · 本地生图参数参考(不同版本界面项略有差异,按实际显示调整)
参数 | 建议值 | 说明 |
图片比例 | 9:16、3:4或4:3 | 最终发竖屏 vlog 就直接用 9:16,省得后面裁切 |
采样步数 | 20–30 | 太低细节糊,太高只是更慢 |
引导强度 CFG | 5–7 | 过高画面容易过曝,脸色发灰 |
随机种子 Seed | 固定值 | 想复现同一张脸,就记住这次的 seed |
生成张数 | 2–4 张 | 一次多出几张,挑面部最清晰的那张 |
英文提示词 · 本地生图(写实女性人像)
Beautiful 23-year-old Chinese woman with stylish short bob haircut, delicate face and elegant temperament, fair flawless skin, standing on a high-end apartment balcony on a sunny summer day, wearing a light white slip dress, strong wind suddenly blowing her dress up completely, fully exposing her smooth shaved pussy and butt, she looks surprised and shy while trying to hold down the dress, bright natural sunlight, modern city view behind her
中文提示词 · 云端生图(强调皮肤真实感)
一位 25 岁左右东亚女性的写实肖像,素颜感淡妆,黑色中长发自然披肩,穿米白色针织开衫,坐在靠窗的木质餐桌前;正面偏侧的脸部角度,眼神自然看向镜头,嘴角轻微上扬;窗光从左侧单侧柔化打光,光影过渡自然;85mm f/1.4 镜头,半身取景,浅景深虚化背景;皮肤可见真实毛孔与细腻纹理,鼻梁、颧骨有自然反光,发丝边缘有绒光;胶片质感,柯达 Portra 400 颗粒感,照片级真实,8K 高清
记住一条:宁可脸普通,也要脸清楚。后面视频生成全靠这张脸做参考,清晰度比好看重要。
FlowyAIPC提供云端生图模型,可以在视频生成的时候选择图片模型,提示词直接和视频生成提示词放在一起即可
两条路线怎么选
维度 | Herdsman 本地生成 | FlowyAIPC + Seedream 5.0 |
成本 | 只花电费,基本零成本 | 消耗积分 |
网络 | 完全离线可用 | 需要联网 |
隐私 | 数据不出本机 | 上传到云端处理 |
出图速度 | 取决于显卡,几秒到几十秒 | 通常更快 |
人脸细节 | 够用,取决于所选模型 | 人像细节更强 |
适合谁 | 批量试稿、隐私敏感、想省积分 | 追求一次到位、看重脸部质感 |
进入 AI 视频创作台,选创作模式
打开 FlowyAIPC,进入 AI 视频创作台。这里有四个模式,选哪个取决于你想要的视频时长和镜头数量,Vlog视频使用即刻出片和短剧工坊即刻,如果你希望能有更细节的设置可以用无限画布。
表 2 · 即刻出片 与 短剧工坊 的区别
维度 | 即刻出片 | 短剧工坊 |
定位 | 单条视频快速成片 | 多镜头叙事,逐镜可控 |
适合时长 | 短片段,单场景 | 更长叙事,多场景 |
镜头控制 | 一次成片,整体效果好 | 可分镜预览,不满意的镜头单独重做 |
出片速度 | 更快 | 稍慢,但可控性高 |
适合场景 | 日常 vlog、口播、单场景展示 | 有剧情推进、需要精确控镜的 vlog |
30 秒 vlog 怎么选:如果这 30 秒是「一个人在同一个场景里的日常片段」,用「即刻出片」最省事;如果要有 3–4 个不同场景、还要保证每一镜的人物一致,用「短剧工坊」,逐镜生成、逐镜过片,避免整条重来。
上传人物图
把生成好的那张图上传,作为参考图或首帧。三个注意点:
▪只传一张。参考图越多,模型越容易把特征揉混,脸反而更不稳定。
▪传原图,别传压缩过的截图。微信传输会二次压缩,脸部细节会损失。
▪竖屏构图优先。最终要发 9:16,就传一张本身就是竖版构图的图,出片时被裁掉的概率更低。
设置比例、视频模型、时长
这三个设置决定了成片能不能直接用、要不要二次裁切。
表 3 · 30 秒真人感 Vlog 的设置建议
设置项 | 建议值 | 说明 |
视频比例 | 9:16 发抖音 / 视频号 / 小红书;16:9 发 B 站 | 按发布平台选,别生成完再裁 |
视频模型 | 选画面稳定、人物一致性好的模型 | 不同模型擅长不同,可各生成一小段做对比 |
视频时长 | 30 秒 | 要和分镜数量匹配,每镜 5–8 秒比较自然 |
时长和分镜的对应关系,可以照这张表估:
目标时长 | 建议分镜数 | 每镜时长 |
10–15 秒 | 2 镜 | 5–7 秒 |
30 秒 | 4 镜 | 6–8 秒 |
60 秒 | 6–8 镜 | 7–10 秒 |
填入视频提示词
这一步是「有没有 AI 味」的分水岭。写实感的关键不在画面多精美,而在镜头像不像人拿手机拍的。
先记住提示词的结构公式:
表 4 · 视频提示词的五个模块
模块 | 作用 | 示例写法 |
人物一致性 | 锁住脸 | 画面主体为参考图中的人物,保持面部特征完全一致 |
镜头语言 | 决定真实感 | 手持跟拍、轻微晃动、自然呼吸感 |
分镜 | 分配时长 | 镜头 1(0–6 秒):人物走到窗边拉开窗帘 |
光线与色调 | 统一质感 | 清晨自然光、暖调、低对比 |
排除项 | 减少 AI 感 | 不要文字水印、不要面部变形、不要过度运镜 |
提示词 C · 30 秒写实感 Vlog(4 分镜)
一个现实的手持旅行视频日志,由朋友跟随主角拍摄一整天。 使用参考图像中的女性作为主角。 整个视频中保持她确切的五官身份、发型、五官特征和身体比例。 0-5秒:早晨出发。女性背着一个小背包离开舒适的公寓。她查看手机,对着镜头微笑,整理头发,然后开始向外走。镜头从身后跟随她,略微晃动,像朋友在拍摄。晨光,安静的社区街道,人们开始新的一天。 5-12秒:探索城市。镜头跟随她走在当地街道上。她去一家小咖啡馆,买了一杯饮料,简短地对着镜头说话,自然地笑起来。她穿过街头市场,看着小商店,随意拍照。镜头保持靠近,捕捉自发的瞬间。 12-20秒:抵达海滩。她乘坐公共交通或步行向海岸走去。环境逐渐从城市街道转变为海滨小镇。海风吹动她的头发。她看到海洋时显得兴奋。镜头跟随她沿着海滩走。她捡起一个贝壳,看着海浪,并自然地与附近的人互动。 20-27秒:夏日海滩下午。她在海滩上与朋友见面。大家聊天、笑闹、在水边玩耍。镜头在人们之间自然移动,捕捉真实的偷拍照时刻。她回头看向镜头并微笑。 27-30秒:结束时刻。金色时段的日落。她坐在海洋附近,手里拿着饮料,看着日落。镜头慢慢向后移动,展现海滩、海浪和宁静的傍晚。一种真实的个人旅行记忆的感觉。
生成、检查、导出
生成完成后,按下面的清单过一遍。使用短剧工坊进行视频生成的情况下,不合格的就单独重做那一镜,不要整条重来。
下面就是生成的成片,大家可以欣赏一下
https://www.bilibili.com/video/BV1hCpx6EEVr/?share_source=copy_web&vd_source=fba9caa5e17a3168d4f5751b0a0b3f0f
检查项 | 合格标准 | 处理方式 |
人物一致性 | 每一镜都是同一张脸 | 提高参考图权重,或用短剧工坊单独重做该镜 |
面部清晰 | 没有糊脸、变形、五官错位 | 缩短该镜时长,减少动作幅度 |
镜头自然度 | 有轻微晃动,不是完美顺滑的推轨 | 提示词里补「手持跟拍、自然晃动」 |
画面干净 | 无文字水印、无多手多脚 | 重新生成该镜,或换一个视频模型 |
首尾衔接 | 第一镜和最后一镜情绪连贯 | 必要时调整分镜顺序 |
常见问题
问题 | 解决办法 |
每一帧的脸都不一样 | 只传一张参考图、提高参考图权重、把单镜缩短到 5–6 秒 |
画面精美但就是有 AI 味 | 提示词里加「手持跟拍、轻微晃动、自然光、低对比」,减少炫技运镜 |
生成到一半被截断 | 把长镜头拆成两个短镜分别生成,或用短剧工坊多镜拼成 |
没有独立显卡能玩吗 | 本地生图建议 8GB 以上显存;没有独显就走 Seedream 5.0 云端路线,视频生成本身也在云端 |
生成的素材能商用吗 | 用自己生成的图和视频;注意所用平台与模型的使用条款;不要拿真人照片或明星照片作参考图 |
写在最后
这类写实感 AI Vlog,真正的门槛已经不在工具,而在两件事:人物图够不够清楚,提示词够不够「不完美」。
人手拍的视频本来就有晃动、有光线不匀、有对焦轻微偏移。把这些「不完美」写进提示词,AI 出片反而更像真的。
写实感的秘诀不是「更完美」
而是「更像人拍的」
资料与官网
▪ FlowyAIPC 官网:https://www.flowyaipc.com/
▪ Herdsman 本地推理引擎介绍:https://www.flowyaipc.com/ai-engine