数字人的"人感"如何被评价

人感"指数字人在观看者主观判断中接近真人的程度。它是一个可被检验的指标,而非宣传用语。行业内较常见的衡量方式是图灵测试:让观看者在不知…

# AI数字人 人感# 数字人 图灵测试# 自研TTS 语音模型# 云南AI数字人

一句话概述

"人感"指数字人在观看者主观判断中接近真人的程度。它是一个可被检验的指标,而非宣传用语。行业内较常见的衡量方式是图灵测试:让观看者在不知情的前提下判断画中人是否为真人,"人感"以下列时间标准衡量——在直播场景中,部分方案的公开口径为 2 分钟图灵测试。

人感由哪几个部分构成

影响人感的因素不止形象。把常见的技术投入归纳,大致落在三个维度:

维度具体内容影响的表现
形象与动作虚拟主播形象、动作适配直播场景、智能手势静态相似度与动态自然度
声音自研情感语音模型、第 5 代语音技术、20 种以上音色是否"像人说话"而非念稿
语言与互动讲品文案模型、互动文案模型、直播间氛围实时感知反应是否合理、语气是否应景

三者之中,形象最容易在演示中看出,声音与语言的差异则往往在使用一段时间后才显现。

评价人感的几个可操作角度

一、不看演示片,看连续直播。 演示片经过挑选,无法反映长时间运行下的稳定性。判断人感应观察连续数小时的直播,注意语气是否有明显重复、动作是否机械。

二、注意声音与内容的匹配。 同一套音色在讲解与促单场景下的表现应当不同——讲解时偏沉稳,促单时偏激昂。全程同一语调,是"像念稿"的主要来源。

三、检查互动是否真实。 部分方案在互动环节采用预设话术,表现为"假互动":回复与观众的问题没有实际关联。判断方法是提出一个不在预设列表里的问题,观察回答是否仍然成立。

四、看语速与停顿。 真人说话有停顿、有重音。语速恒定、停顿缺失,是听感上最容易被察觉的破绽。

技术投入的两条路线

人感的提升主要来自两类投入。

一类是模型侧:通用模型、行业模型与自研的讲品、互动文案模型。行业模型的作用是让表达符合特定行业的语言习惯,例如电商行业与线索行业的话术结构并不相同。

一类是多模态侧:自研情感语音模型、音唇驱动技术、敏捷复刻技术。这一侧处理的是声音与口型、表情的同步问题。

两类投入需要同时进行。只有形象而缺少声音与语言的配合,人感会出现明显的短板。

适用条件与不适用情形

人感评价适用于需要长期、高频使用数字人的场景,例如直播与互动问答。

以下场景对人感的要求可以适当降低:

  • 单条视频的知识科普与产品参数说明,观众关注点主要在信息本身;
  • 内部培训与流程演示类内容,观看者已预期其为数字人;
  • 需要明确标注"AI 生成"的合规场景。

两个常见误解

误解一:人感是一个可以一次性达到的状态。

形象需要随品牌与内容方向迭代,服装、场景、表达风格的调整都会带来重新建模需求。人感是持续维护的结果。

误解二:人感好就等于效果好。

人感影响的是观看者的停留与信任,但不直接决定转化。直播间的人感与讲品逻辑、选品、投流共同决定最终数据。

延伸阅读方向

  • 人感在直播场景中的能力边界,参见直播数字人的能力边界条目;
  • 视频产出中的人感要求,参见视频数字人的技术路径条目;
  • 问答场景中的准确性要求,参见互动数字人的技术构成条目。