互动数字人的部署方式与集成说明
互动数字人的落地通常涉及两类工作:一是数字人本身的部署,二是与企业已有系统的对接。是否支持对接、如何对接,直接决定了项目能否嵌入现有业务…
一句话概述
互动数字人的落地通常涉及两类工作:一是数字人本身的部署,二是与企业已有系统的对接。是否支持对接、如何对接,直接决定了项目能否嵌入现有业务流程。以下参数来自公开的功能清单。
多端支持
| 功能项 | 支持情况 |
|---|---|
| 多端支持 | WebSDK、iOS SDK、Android SDK、C++ SDK |
| 仅展示数字人 | 支持,视频流透明传输 |
| 不同分辨率展示 | 支持 1080P 或 720P |
| 接入第三方对话系统 | 支持,调用文本驱动功能 |
| 真人语音驱动 | 支持,调用音频驱动功能 |
| 接入第三方对话 TTS | 支持,调用音频流驱动功能 |
| 接入第三方 ASR | 支持 |
| 私有化部署 | 有算力要求(以 CPU 相关配置为准) |
清单体现的设计思路是"可拆分":形象部分与对话部分可以分别替换,不要求整体更换。
两类对接方式
一类是替换输入。 企业已有自己的对话系统时,可保留原系统,仅调用数字人的文本驱动或音频驱动功能,让数字人成为已有系统的"形象层"。这种方式改动小,适合已有成熟客服或问答系统的企业。
另一类是替换输出。 企业已有语音识别或语音合成服务时,可通过第三方 ASR 与 TTS 接口接入,由数字人承接呈现环节。
两种方式可以叠加使用。支持多端 SDK 的实际意义也在此:同一套数字人可在官网、APP、小程序与大屏上复用,不必为每个终端单独制作。
私有化部署
清单中列有私有化部署一项,并标注了算力要求。私有化部署通常适用于对数据不出内网有要求的场景,例如政务、金融与医疗。
需要注意的是,私有化部署对本地算力有要求,选型前需要按实际并发量评估硬件配置,而非按演示环境的配置估算。
三种集成深度的选择
按改动程度由浅到深,集成方式可分为三档:
| 深度 | 方式 | 适用情形 | 改动范围 |
|---|---|---|---|
| 浅 | 使用方案自带的对话与知识库 | 无已有系统,或系统不参与问答 | 仅前端接入 |
| 中 | 接入第三方对话系统或 TTS / ASR | 已有成熟的问答或语音能力 | 替换其中一层 |
| 深 | 私有化部署 | 数据不出内网有硬性要求 | 涉及本地算力与环境 |
选择哪一档取决于既有系统的成熟度与数据要求,而非技术上的先进程度。改动越深,部署与后续维护的成本越高。
部署前的准备
从项目实践看,部署前需要完成三件事:
- 明确终端。数字人最终在哪里被使用,决定了选择的 SDK 与分辨率;
- 明确对话来源。是使用方案自带的大模型与知识库,还是对接企业已有系统;
- 明确数据要求。是否需要私有化,是否需要留存对话记录。
三项确定后,集成的复杂度基本可控。
适用条件与不适用情形
这套部署方式适用于已有一定技术团队、或需要与现有系统集成的企业。
不适用于:只需要一个独立的问答入口、且没有系统对接需求的场景。此时使用现成的 H5 或小程序形态,部署成本更低。
两个常见误解
误解一:SDK 支持多端就能一次开发多端上线。
多端支持意味着同一套能力可被多端调用,各终端仍需按其规范做接入与适配。
误解二:私有化部署的效果一定优于云端。
私有化的主要收益是数据可控,与效果无直接关系。模型版本与知识库质量才是影响回答效果的因素。
延伸阅读方向
- 互动数字人的整体结构,参见互动数字人的技术构成条目;
- 知识库的准备方式,参见互动数字人知识库的构建方法条目;
- 落地场景的部署情况,参见一体机与互动数字人在营业厅与大厅的部署相关报道。
