正文内容 评论(0)
近日,Agora 与 Google Gemini 达成合作,发布 Gemini 3.5 Transcribe 与 Agora Conversational AI 集成方案。此次合作将 Gemini 最新的实时语音转写能力与 Agora 面向全球的RTC 和对话式 AI 能力相结合,帮助企业更高效地打造自然、实时且可规模化落地的语音智能体。
![[MD:Title]](http://img1.mydrivers.com/img/20260831/136b1053-9aec-4e85-ab93-7bf946f477de.jpg)
此前,Agora已与 OpenAI 合作推出了全球首个 Realtime API,旨在为开发者提供超低延迟、高保真、拟人化的 AI 实时语音交互能力 。
![[MD:Title]](http://img1.mydrivers.com/img/20260831/9b771676-2c16-4657-93c2-f5647feed241.jpg)
强强联合,连接“智能”与“实时互动”
随着生成式 AI 从文本交互加速走向语音交互,模型能否在真实场景中及时听懂用户、准确理解表达,并持续保持自然流畅的交流体验,正成为对话式 AI 落地的关键。
![[MD:Title]](http://img1.mydrivers.com/img/20260831/e6bd37c3-8788-4e00-9318-d00b26aa7aad.jpg)
Gemini 3.5 Transcribe 是 Google 面向智能语音交互推出的新一代实时语音转写模型,可以更好地应对背景噪声、专业词汇、口语停顿和表达修正等复杂情况。Agora Conversational AI 则为语音智能体提供稳定的实时音频传输、会话连接和交互基础设施。
双方的合作,连接了前沿模型能力与面向全球用户的实时互动体验,让语音智能不再停留在模型演示阶段,而是能够更快进入真实的产品与业务场景。
开放、灵活,降低企业构建对话式 AI 的门槛
通过此次集成,开发者可以在 Agora Agents SDK 中使用 Gemini 3.5 Transcribe,并根据自身业务需求灵活组合大语言模型与语音合成服务。
这种开放、可组合的方式,有助于企业避免被单一技术方案绑定,也能随着模型能力和业务需求变化持续迭代。对已经拥有 AI 技术栈的团队而言,可以在保留原有能力的基础上补齐实时交互环节;对刚刚进入对话式 AI 的企业而言,也可以更快完成从原型验证到产品上线。
Agora 还计划进一步支持 Gemini 3.5 Transcribe 的 Smart Transcription 能力,让转写结果能够自动处理口语停顿、重复、临时改口以及数字、日期和段落格式,为 CRM、信息采集、日程管理和业务系统提供更加清晰、可直接使用的信息。
未来,Agora将继续与全球更多领先的 AI 模型、语音服务及应用生态伙伴深化合作,推动对话式 AI 从“能听会说”进一步走向自然、实时、可靠的智能交互,让 AI 真正成为连接人与数字世界的新入口。
本文收录在
#快讯
- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...
