正文内容 评论(0)

网易实时AI模型双登顶Hugging Face 全球开发者开始抢着适配
2026-09-30 14:08:09  作者:cici 编辑:cici     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

网易在全球 AI 开源社区交出重磅成果。近日,网易有道开源的子曰 Live 系列两款模型 —— 真流式语音识别模型 Confucius4-R2T2、流式翻译模型Confucius4-T3PO,先后登顶全球 AI 开源社区 Hugging Face 语音识别(ASR)、机器翻译两大细分 Trending 热榜,实现国产实时 AI 模型 “双登顶”。

在两个榜单中,OpenAI Whisper、Google、Meta等全球科技公司的相关模型也同时在列。网易此次连续拿下两个细分榜第一,也让中国团队在实时语音AI方向受到全球开发者集中关注。

[MD:Title]
图注:语音识别Trending榜,R2T2登顶(左);翻译Trending榜,T3PO登顶(右)

双榜登顶:全球开发者深度参与模型适配

登顶之后,网易两款开源模型很快获得开发者社区进一步响应。截至9月30日,Hugging Face页面显示,R2T2主模型近30天下载量超过1万次,T3PO主模型超过1300次;据相关数据统计,R2T2、T3PO及其官方GGUF版本近30天累计下载量已超过3万次。

开源之后,全球开发者不再只是简单下载模型权重,而是投入力量开展工程化适配。R2T2发布后,Hugging Face 官方主动搭建ZeroGPU在线Demo,提供免费算力降低测试门槛。海外开发者在纯C++音频推理框架audio.cpp 完成原生适配,不仅重新实现了Longest Stable Prefix流式状态机和稳定文本提交机制,还加入GGUF、本地实时麦克风识别和Streaming API等能力。

[MD:Title]
图注:Hugging Face上的ZeroGPU在线Demo

T3PO同样完成多档位GGUF量化适配,让140亿参数级实时翻译模型具备端侧部署条件。从在线体验、模型量化到原生Runtime适配,两款模型正在从Hugging Face上的开源模型,进一步进入开发者的实际开发工具链。

直击 Voice Agent 痛点:一套链路实现 “边说边听边译”

两款模型能够快速出圈,核心解决了实时语音交互领域两大技术难题。

R2T2 瞄准传统流式识别 “输出文字反复改写” 的行业顽疾。多数伪流式识别会随着后续音频修改已输出内容,普通字幕仅会出现文字闪烁,但对于需要执行指令的语音智能体,识别结果来回变动会造成大模型意图判断、工具调用出错。

依托最长稳定前缀机制,R2T2做到输出文本只增不改、落子无悔:模型判断音频信息足够可靠才提交结果,支持 80毫秒?2 秒灵活流式输入。官方测试显示,R2T2 在保持接近离线 ASR 准确率的同时,平均识别延迟(平均说完每个字到识别出这个字的时间)约为 200 至 600 毫秒。

进一步的公开评测显示,在多个中英文测试集上,R2T2 相较 WhisperRT、Nemotron、Voxtral 等同类方案,在低延迟条件下保持了更优或具有竞争力的识别表现。这意味着,模型并非单纯追求 “更快出字”,而是在响应速度、识别准确率和输出稳定性之间取得平衡,也让下游大模型能够在用户尚未说完话时,提前获得稳定文本并开展后续处理。

[MD:Title]
图注:英文测试集质量和延迟结果对比 来源:github

[MD:Title]
图注:中文测试集质量和延迟结果对比 来源:github

T3PO则进一步解决实时翻译中“速度与质量”的平衡问题。模型将实时翻译建模为持续的READ/WRITE决策:当上下文信息不足时继续等待,当信息已经足够时立即输出译文,并通过Pareto-aware Policy Optimization(帕累托策略优化)同时优化翻译质量与等待延迟,在低延迟下接近离线翻译的效果,译文同样不回溯改写。

当R2T2与T3PO串联后,一条完整的实时翻译链路由此形成:语音持续进入R2T2,生成稳定增量文本;T3PO再基于这些文本持续判断并输出译文。AI语音交互也由传统的“说完—识别—翻译”,进一步向“边说—边听—边理解—边翻译”演进。

补齐实时 AI 技术底座,国产方案走向全球开源生态

此次双登顶,是网易有道 “子曰” 大模型矩阵持续迭代的重要里程碑。从2023年国内首个教育大模型发布开始,有道已经搭建起包含多模态推理、语音生成、实时识别、流式翻译的完整能力矩阵,打通 “说、听、理解、翻译” 全链条。

此次R2T2与T3PO分别补充实时语音识别和流式翻译能力,并通过开源进一步进入全球开发者生态。相关能力可应用于实时字幕、会议同传、直播翻译、AI客服和Voice Agent等场景。

行业普遍认为,AI正在从对话问答走向可感知、可执行任务的Voice Agent,稳定低时延的流式语音,正是智能体对接现实世界的关键底座。此次网易两款模型登顶Hugging Face,并获得全球开发者持续下载和工程适配,意味着网易实时AI技术正进一步进入全球开发者工具链和实际应用场景,也让中国团队更深地参与全球AI开源生态建设。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:

文章内容举报

  • 支持打赏
  • 支持0人

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |
本文收录在
#快讯

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...