Google发布Gemini 3.8 Live Live Avatar数字人交互功能 赋予AI实时视频面孔
Google公司宣布,正式在Gemini Enterprise企业级平台中全面上线“Live Avatar”(实时数字人)功能。该技术深度集成了Google最新的Gemini 3.8 Live大模型架构,在原有近乎零延迟的高流畅语音对谈基础上,首次引入了近乎实时的生成式视频生成能力,使对话式人工智能拥有了能够“边听、边看、边说”的动态视觉形象。

根据官方介绍,Gemini 3.8 Live Live Avatar旨在为企业客户打造更加直观且具沉浸感的虚拟服务助手。系统通过将音频流与底层视频生成模型精准同步,能够实现高精度的唇形匹配(Lip-syncing)、自然的面部表情变化以及流畅的跨语种对话转换。目前,该数字人系统已原生支持多达97种语言,且在 mid-conversation 跨语言切换时不会出现视频失真或面部漂移等问题。
除了视觉方面的突破,该平台还配备了强大的异步工具调用能力。在与用户保持自然连贯对谈的同时,数字人能够默默在后台调用各种外部API与企业数据接口,处理诸如酒店入住登记、保险理赔单据填报等复杂的多步骤业务,彻底告别以往AI处理后台任务时出现的“死机”或长时间无声等待现象。同时,结合终端设备的摄像头与屏幕共享功能,数字人还能实时对用户展示的实体物体或软件界面进行视觉理解与交互指导。
在安全与合规保障方面,为了防止人工智能深度伪造(Deepfake)与身份冒用风险,Google为Live Avatar设置了多重安全防线。系统默认仅向企业用户开放经官方审查预置的数字人形象库,而定制专属品牌形象或特定人物面孔的权限则被置于严格的白名单审核机制之下。此外,由该系统生成的所有实时语音与动态视频流均已被嵌入不可见且不可篡改的SynthID数字水印,以确保AI生成内容的透明度与可溯源性。
目前,Gemini 3.8 Live与Live Avatar功能已通过美国及欧洲数据中心服务节点正式面向企业级订阅客户开放,并同步提供开发者API接入支持。业内分析人士指出,将生成式视频技术直接融入底层语音模型,不仅消除了传统视频渲染套件带来的高延迟,也标志着AI虚拟客服与智能互动终端正全面迈入“真人和实时视觉对谈”的全新时代。
