数字人面试是一个典型的多技术栈融合场景,核心链路是"听懂 → 想清楚 → 说出来 → 演出来"。先看一张整体架构图:
以上就是数字人面试的完整技术栈拆解。补充几个落地时容易被低估的难点:
- 打断与抢话:候选人中途插话时,数字人要停止播报并切回倾听状态——这需要 ASR/VAD 与 TTS 播放器的双向状态同步,是"像不像真人"的分水岭。
- 延迟预算分配:端到端 1.5s 内,通常 ASR 尾点确认 ~300ms、LLM 首 token ~400ms、TTS 首包 ~200ms、口型驱动+合帧 ~300ms,任何一环超时都会"尬场"。
- 评估的可信度:AI 打分存在偏差风险(口音、表达风格干扰评分),成熟方案会做人工抽检校准 + 评分一致性回测。
- 合规红线:情绪识别、生物特征在国内属敏感个人信息处理,需单独告知并取得同意,面试报告用于淘汰决策时还要保留人工复核通道。