实时语音轮次与 Barge-in 序列

建议链路与降级策略;真实口音、噪声、设备及供应商时延未验证

01 / 正常轮次 02 / BARGE-IN 03 / 降级与恢复 上行音频帧 解码后的语音帧 speech start + frames partial / final 文本 turn committed 仅 committed turn 进入评分事实 流式 token 音频块 + generation id 播放面试官语音 候选人再次开口 新语音帧 先降低播放音量 先 duck,避免背景噪声立即切断 达到 VAD 门槛 形成转写词 取消旧 generation 清空未播放 buffer 停止旧音频 语义 EOU 失败 降为静音 endpointing,并记录 provenance STT 失败 → 文本输入 超时 → 受限重试 / 备用 TTS 失败 → 显示文本 浏览器 音频 / 文本 UI LiveKit WebRTC 媒体 VAD 起止音检测 STT 流式转写 EOU 语义端点 LLM 可取消生成 TTS 流式合成 Legend request return security async trace

正常轮次

  • • 浏览器 → LiveKit → VAD → STT → EOU → LLM → TTS
  • • token、音频块和取消操作均携带 generation id

Barge-in

  • • 先降低音量;形成转写词后确认中断
  • • 取消旧生成并清空未播放音频,记录 assistant.interrupted

透明降级

  • • EOU 回静音判定;STT 回备用或文本;TTS 保留文字
  • • LLM 仅受限重试或备用;仍失败则透明暂停或结束