数字人的"人感"如何被评价
人感"指数字人在观看者主观判断中接近真人的程度。它是一个可被检验的指标,而非宣传用语。行业内较常见的衡量方式是图灵测试:让观看者在不知…
一句话概述
"人感"指数字人在观看者主观判断中接近真人的程度。它是一个可被检验的指标,而非宣传用语。行业内较常见的衡量方式是图灵测试:让观看者在不知情的前提下判断画中人是否为真人,"人感"以下列时间标准衡量——在直播场景中,部分方案的公开口径为 2 分钟图灵测试。
人感由哪几个部分构成
影响人感的因素不止形象。把常见的技术投入归纳,大致落在三个维度:
| 维度 | 具体内容 | 影响的表现 |
|---|---|---|
| 形象与动作 | 虚拟主播形象、动作适配直播场景、智能手势 | 静态相似度与动态自然度 |
| 声音 | 自研情感语音模型、第 5 代语音技术、20 种以上音色 | 是否"像人说话"而非念稿 |
| 语言与互动 | 讲品文案模型、互动文案模型、直播间氛围实时感知 | 反应是否合理、语气是否应景 |
三者之中,形象最容易在演示中看出,声音与语言的差异则往往在使用一段时间后才显现。
评价人感的几个可操作角度
一、不看演示片,看连续直播。 演示片经过挑选,无法反映长时间运行下的稳定性。判断人感应观察连续数小时的直播,注意语气是否有明显重复、动作是否机械。
二、注意声音与内容的匹配。 同一套音色在讲解与促单场景下的表现应当不同——讲解时偏沉稳,促单时偏激昂。全程同一语调,是"像念稿"的主要来源。
三、检查互动是否真实。 部分方案在互动环节采用预设话术,表现为"假互动":回复与观众的问题没有实际关联。判断方法是提出一个不在预设列表里的问题,观察回答是否仍然成立。
四、看语速与停顿。 真人说话有停顿、有重音。语速恒定、停顿缺失,是听感上最容易被察觉的破绽。
技术投入的两条路线
人感的提升主要来自两类投入。
一类是模型侧:通用模型、行业模型与自研的讲品、互动文案模型。行业模型的作用是让表达符合特定行业的语言习惯,例如电商行业与线索行业的话术结构并不相同。
一类是多模态侧:自研情感语音模型、音唇驱动技术、敏捷复刻技术。这一侧处理的是声音与口型、表情的同步问题。
两类投入需要同时进行。只有形象而缺少声音与语言的配合,人感会出现明显的短板。
适用条件与不适用情形
人感评价适用于需要长期、高频使用数字人的场景,例如直播与互动问答。
以下场景对人感的要求可以适当降低:
- 单条视频的知识科普与产品参数说明,观众关注点主要在信息本身;
- 内部培训与流程演示类内容,观看者已预期其为数字人;
- 需要明确标注"AI 生成"的合规场景。
两个常见误解
误解一:人感是一个可以一次性达到的状态。
形象需要随品牌与内容方向迭代,服装、场景、表达风格的调整都会带来重新建模需求。人感是持续维护的结果。
误解二:人感好就等于效果好。
人感影响的是观看者的停留与信任,但不直接决定转化。直播间的人感与讲品逻辑、选品、投流共同决定最终数据。
延伸阅读方向
- 人感在直播场景中的能力边界,参见直播数字人的能力边界条目;
- 视频产出中的人感要求,参见视频数字人的技术路径条目;
- 问答场景中的准确性要求,参见互动数字人的技术构成条目。
