Agora 与 Gemini 达成合作,发布 Gemini 3.5 Transcribe 与 Agora Conversational AI 集成方案。此次合作将 Gemini 最新的实时语音转写能力与 Agora 面向全球的 RTC 和对话式 AI 能力相结合,帮助企业更高效地打造自然、实时且可规模化落地的语音智能体。

此前,我们已与 OpenAI 合作推出了全球首个Realtime API,旨在为开发者提供超低延迟、高保真、拟人化的 AI 实时语音交互能力。

强强联合,连接“智能”与“实时互动”
随着生成式 AI 从文本交互加速走向语音交互,模型能否在真实场景中及时听懂用户、准确理解表达,并持续保持自然流畅的交流体验,正成为对话式 AI 落地的关键。

Gemini 3.5 Transcribe 是 Google 面向智能语音交互推出的新一代实时语音转写模型,可以更好地应对背景噪声、专业词汇、口语停顿和表达修正等复杂情况。
Agora Conversational AI 则为语音智能体提供稳定的实时音频传输、会话连接和交互基础设施。
双方的合作,连接了前沿模型能力与面向全球用户的实时互动体验,让语音智能不再停留在模型演示阶段,而是能够更快进入真实的产品与业务场景。
开放灵活,降低企业构建对话式 AI 的门槛
通过此次集成,开发者可以在 Agora Agents SDK 中使用 Gemini 3.5 Transcribe,并根据自身业务需求灵活组合大语言模型与语音合成服务。
这种开放、可组合的方式,有助于企业避免被单一技术方案绑定,也能随着模型能力和业务需求变化持续迭代。对已经拥有 AI 技术栈的团队而言,可以在保留原有能力的基础上补齐实时交互环节;对刚刚进入对话式 AI 的企业而言,也可以更快完成从原型验证到产品上线。
Agora 还计划进一步支持 Gemini 3.5 Transcribe 的 Smart Transcription 能力,让转写结果能够自动处理口语停顿、重复、临时改口以及数字、日期和段落格式,为 CRM、信息采集、日程管理和业务系统提供更加清晰、可直接使用的信息。
未来,我们将继续与全球更多领先的 AI 模型、语音服务及应用生态伙伴深化合作,推动对话式 AI 从“能听会说”进一步走向自然、实时、可靠的智能交互,让 AI 真正成为连接人与数字世界的新入口。
