数字人形象克隆的效果,很大程度上取决于源素材。模型可以学习表情和口型,但无法稳定修复严重过曝、频繁遮挡、强滤镜或低清压缩造成的信息缺失。
不同平台的采集时长和动作要求可能不同,正式拍摄前应先取得项目专用采集规范。本文提供的是通用准备方法,帮助一次拍摄获得更高的可用率。
拍摄前先完成授权确认
在开机之前,先确认出镜人已经理解并同意:
- 素材用于训练何种数字人;
- 可以在哪些账号、渠道和地区使用;
- 是否允许商业推广和二次编辑;
- 授权期限及终止方式;
- 声音是否同时克隆;
- 原始素材和模型如何保存、访问与删除。
形象和声音都具有明确的人格与个人信息属性。企业项目建议保留书面授权和素材交接记录。
详细风险清单可参考:声音与肖像克隆合规指南。
设备不必昂贵,但必须稳定
相机
可以使用相机或画质稳定的手机。重点不是设备型号,而是:
- 分辨率满足平台要求;
- 帧率固定;
- 对焦锁定在人物面部;
- 曝光和白平衡不要自动跳变;
- 拍摄过程中机位不移动。
使用手机时建议固定在三脚架上,关闭美颜、滤镜和动态贴纸。
收音
如果训练声音,尽量使用安静空间和稳定麦克风。避免空调、风扇、键盘、道路和混响。不要把带背景音乐、降调、变声或强降噪的成片当作声音训练素材。
灯光
面部光线应均匀、柔和,眼睛和嘴部细节清楚。避免:
- 一侧脸过亮、另一侧完全黑;
- 背后有强窗光;
- 彩色灯不断变化;
- 眼镜上出现大面积反光;
- 面部过曝失去皮肤细节。
构图与背景怎么设置
常见口播数字人建议使用正面或接近正面的机位。镜头高度与眼睛接近,人物保持在画面中心,头顶和肩部留出安全空间。
背景应简洁稳定,与人物服装有明显区分。绿幕并非所有方案都必需,是否使用应以平台采集要求为准。
服装方面建议:
- 避免与背景同色;
- 避免高频细条纹和容易产生摩尔纹的面料;
- 避免大面积反光材质;
- 首饰、头发不要频繁遮挡嘴部和脸部;
- 拍摄期间不要更换服装和发型。
表演时注意什么
数字人需要学习自然说话状态,不需要夸张表演。建议:
- 目视镜头,保持自然交流感;
- 语速稳定,清晰完成每个音节;
- 表情自然变化,不要全程僵硬;
- 头部和身体避免突然大幅移动;
- 不要频繁摸脸、扶眼镜或遮挡嘴部;
- 按采集脚本完整拍摄,不自行删减句子。
如果方案需要手势或半身动作,应确认手臂不会移出安全区域,也不要让手长时间遮挡面部。
一次拍摄的推荐流程
- 清理镜头,固定相机和灯光;
- 录制十秒测试片;
- 放大检查眼睛、嘴部、头发边缘和对焦;
- 戴耳机检查底噪、爆音和混响;
- 锁定曝光、白平衡和对焦;
- 按平台脚本完整录制;
- 结束后立即备份原始文件;
- 在电脑上完整播放一次再提交。
不要只在手机小屏幕上判断质量。很多轻微失焦、噪声和反光问题,放大后才会明显。
常见失败原因
使用剪辑过的宣传片
多机位切换、转场、字幕、背景音乐和画面缩放会破坏连续采集信息。应提交未经剪辑的原始素材。
强美颜和滤镜
美颜会改变面部边缘和皮肤纹理,训练结果可能不稳定,也可能与本人差异较大。
自动曝光反复变化
人物轻微移动就导致画面忽明忽暗,会让模型学习到不一致的视觉特征。
嘴部被遮挡
手、麦克风、头发或口罩遮挡嘴部,会直接影响口型学习。
文件被聊天软件压缩
通过部分聊天工具转发会降低码率和分辨率。建议使用网盘、对象存储或平台上传入口传递原文件。
提交前检查表
- 出镜人与声音授权已确认;
- 原始文件未剪辑、未加字幕、未加水印;
- 无美颜和强滤镜;
- 人物全程清晰对焦;
- 曝光、色温和背景稳定;
- 嘴部、眼睛和脸部没有遮挡;
- 音频无明显底噪、爆音和音乐;
- 动作和台词符合平台采集规范;
- 文件可正常播放并已备份;
- 使用无损或低压缩方式提交。
高质量素材不仅能提高首次训练成功率,也能减少返工和沟通成本。
如需在正式拍摄前获取与具体形象类型匹配的采集规范,可前往预约数字人方案说明出镜场景;批量企业形象和 API 项目可通过商务合作页面沟通。
相关阅读: