互动数字人的技术构成:播报数字人、大模型与知识库
互动数字人指以数字人形象承接实时问答与业务引导的服务端应用。与视频、直播两条线不同,它输出的不是视频或直播流,而是对话服务。其基本结构可…
一句话概述
互动数字人指以数字人形象承接实时问答与业务引导的服务端应用。与视频、直播两条线不同,它输出的不是视频或直播流,而是对话服务。其基本结构可以写成一行公式:
互动数字人 = 播报数字人 + 大模型 / 行业模型 / 场景知识库 + 终端场景
它替代的工作
需要被替代的场景有一个共同特征:咨询量大、问题重复、回答内容相对固定。响应不及时、人力负荷重、服务质量不均、获客效率低,这四项通常同时出现在同一类岗位上。
典型场景包括客户接待、售后咨询、政务与企业问答、线上及线下展厅讲解、教育机构答疑。
三层结构拆解
第一层:形象层(播报数字人)
提供可见的数字人形象,形态包括 2D 真人超写实与 3D 卡通两类。这一层决定"看起来像谁",但不决定回答内容。
第二层:能力层(大模型 / 行业模型 / 场景知识库)
决定"能回答什么",通过三种对接方式落地:
| 对接方式 | 作用 |
|---|---|
| 大模型人设对话 | 定义数字人的角色、语气与表达风格 |
| 大模型知识库问答 | 基于企业自有文档作开放式回答 |
| FAQ | 针对高频问题给出固定、精准的话术 |
FAQ 支持按条目定向配置文字、图片、视频三种呈现形式。三者的分工是:人设决定像谁说话,知识库决定能答多宽,FAQ 决定高频问题答得多准。
第三层:场景层(终端)
决定"在哪里出现"。支持 H5、官网、终端大屏、APP 等展示终端,并可通过 API、SDK 接入企业已有系统。
配置与分工
数字人的配置在可视化工作台完成,分为两个区域:
- 交互UI区:设计呈现画面,含场景、模板、背景、文字、图片、视频;
- 对话配置区:配置角色信息,映射到对话风格与知识结构。
把界面呈现与对话逻辑分开配置,实际解决的是分工问题——运营人员可在不依赖开发的情况下调整数字人的呈现与话术。工作台支持一键发布,并可作云端一体部署。
落地形态
同一套互动数字人能力,按承载终端可以呈现为几种形态:
| 形态 | 终端 | 典型用途 |
|---|---|---|
| H5 与个人名片 | 移动端网页 | 对外分享、宣传物料承载、视频沟通 |
| 官网嵌入 | 企业官网 | 7×24 小时咨询、线索收集 |
| 小程序与公众号 | 微信生态 | 业务办理引导、智能顾问 |
| 终端大屏与全息舱 | 线下场地 | 展厅导览、大厅接待 |
形态的差别在于承载终端与使用场景,底层的问答能力相同。选择形态时需要先确认两件事:使用场景发生在线上还是线下;是否需要与企业已有系统对接。两项确定后,形态基本随之确定。
适用条件与不适用情形
通常适用:咨询量大且重复率高、需要 7×24 小时响应、服务口径需要统一的场景。
一般不适用:
- 需要人工判断的复杂投诉与争议处理;
- 涉及金额授权与合同确认的环节;
- 需要建立深度情感信任的长期关系维护。
判断标准可以简化为一句:如果这个问题的标准答案相对固定,适合交给互动数字人;如果需要根据对方具体情况临场判断,仍应由人处理。
两个常见误解
误解一:互动数字人只是"会说话的客服机器人"。
传统客服机器人基于规则引擎,只能回答预设问题;互动数字人的差异在于可作开放式回答、支持多轮沟通,并具备基于知识库的扩展能力。两者的分界不是外形,而是回答是否依赖预设。
误解二:接了知识库就能准确回答。
回答质量取决于文档的完整度与结构。文档散乱、口径不统一时,模型会继承这些缺陷。落地前的知识梳理通常是必要步骤,而非可选项。
延伸阅读方向
- 知识库的具体构建方式,参见互动数字人知识库的构建方法条目;
- 部署与集成参数,参见互动数字人的部署方式与集成说明条目;
- 不承担互动的视频化产出,参见视频数字人相关条目。
