
2026 年 9 月 24 日Google 发布 Gemini 3.8 Live with Live Avatar在上周 Gemini 3.8 Live 的基础上为原生实时对话模型加上近实时视觉存在感。该功能由 Gemini Audio Team 的 Shuo-yiin ChangResearch Scientist与 CJ ZhengSoftware Engineer署名发布即日起在 Gemini Enterprise 中可用。官方对场景的描述集中在两处客户服务以及交互式导览interactive walkthroughs。\n\n## 官方给出的能力\n\n视觉与语音同时输入。官方称 Live Avatar 将低延迟流式视频与实时对话能力原生耦合同时处理视觉与音频输入再以带表情的音频和视频回应。官方强调的体验特征是三点精准唇同步、自然表情、流畅的轮流对话turn-taking。官方在开篇给出的理由是对话本身就是多模态的——人会一边听、一边看、一边说并用表情辅助沟通。\n\n异步工具调用。这可能是对企业 Agent 场景更关键的一条。官方说明 Live Avatar 支持异步工具调用在对话继续进行的同时于后台触发工具调用并获取数据。官方给出的示例是酒店入住办理——工具在后台执行对话不中断。换句话讲复杂任务的执行不阻塞会话流。\n\n97 种语言的语音到语音同步。官方称该功能具备原生多语言语音到语音同步能力可动态调整唇同步与表情在 97 种语言之间无缝切换且不降低视频保真度、不引入视觉漂移visual drift。\n\n头像可预设、可定制。官方提供多样化预设头像库企业还可从一张高质量参考图生成完整动画、可响应的头像并保留参考相似度、品牌视觉风格或角色身份。自定义头像目前仅通过企业 allowlist 开放。\n\n## 安全与内容可追溯\n\n官方把身份保护与透明度作为设计前提所有 AI 产品输出都带有 SynthID 水印该不可感知水印直接织入音频与视频输出用于让 AI 生成内容保持可检测以便减少错误信息和错误归属。官方同时提供了 Gemini 3.8 Audio 的模型卡作为安全与负责任部署的说明入口。\n\n## 官方措辞里的边界\n\n值得注意的是官方通篇使用 near real-time近实时而非 real-time并用 low-latency streaming video 描述视频侧。这一措辞保留了工程余量视觉回路的抖动是被允许在一定范围内的。对做方案的团队来说这意味着不能默认视频与语音严格同步是官方承诺的指标实际表现需要用真实网络条件验证。\n\n## 工程视角难点在哪里\n\n以下为工程分析不属于官方披露内容。\n\n把视频放进对话回路与把视频做成一段离线渲染的成片是两类不同的问题。前者要求生成与播放处在同一个流式时序里音频输入、视觉输入、语音输出、视频输出在时间轴上互相约束任何一环的抖动都会直接体现在唇同步与表情上。官方文案中反复出现的三个表述——低延迟流式视频、近实时视频生成、同时处理视觉与音频输入——描述的正是这条链路。这也意味着上行侧要按多模态设计而不只是把麦克风数据推上去。\n\n异步工具调用则更接近 Agent 架构问题。官方说法是对话持续、工具在后台执行这要求会话循环与工具执行解耦会话不能停在一次函数调用的往返上等待结果。对做实时音视频 Agent 的团队而言这通常对应任务编排、状态管理、超时与失败回退策略的重新设计而不仅是换一个模型接口。\n\n97 种语言切换而不引入视觉漂移说明唇同步由语音侧驱动、视觉侧跟随而非按语种预制视频资产。对出海业务而言这一点价值直接新增语种不必新增一套视觉素材。同理从单张参考图生成可动头像把身份一致性与水印可检测性放在同一个约束下也是定制头像必须同时满足的条件。\n\n## 接入路径与选型注意\n\n官方给出的入口有两个在 Gemini Enterprise 中直接使用以及参考 Gemini Enterprise Agent Platform 的 Live API 文档进行接入。企业侧还有一条路——通过 allowlist 申请自定义头像把品牌形象或角色身份映射到实时对话形象上。\n\n需要提醒的是官方本次披露中未提及的信息包括具体延迟指标、帧率与分辨率等质量参数、定价、配额、区域可用性与 SLA、自定义头像的审核周期与限制。这些属于选型时必须向官方确认而非自行推测的项目。国内团队如果评估实时音视频 Agent 方案可把会话是否会被工具调用阻塞多语言切换下唇同步是否漂移生成内容是否可检测这三条作为与官方材料直接对应的验证点其余则需以实际接入测试为准。