正文内容 评论(0

科大讯飞全新语音识别大模型Spark-ASR-2.0:从“准确转写”迈向“流畅成文”
2026-09-23 18:13:38  作者:cici 编辑:cici     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

9月23日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。

据了解,该模型延续并深化了Spark-Audio-1.0-Preview语音基座大模型的技术能力,通过非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术,实现了整体语音识别效果的大幅提升,尤其在通用识别(中英文混合、方言、专业术语)、复杂声学场景识别(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面改善明;与当前业界最好水平相比在主要任务上的效果均好于业界最优水平。在效果提升的同时,Spark-ASR-2.0的推理成本相对前一代模型仅增加了10%。

Spark-ASR-2.0使语音识别从以前追求的一字不差还原所说内容,到现在让识别结果直接“流畅成文”,在提升识别准确率的同时,结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,让文字更连贯、语义更清晰。

Spark-ASR-2.0将从9月24日开始逐步上线讯飞输入法,并且通过讯飞开放平台提供API服务,后续将陆续应用在讯飞AI眼镜、讯飞智能办公本、讯飞听见等产品上。

科大讯飞表示,未来还将重点关注语音识别三个方向的体验提升:一是无关说话人拒识,能在多人交谈和复杂噪声中精准锁定目标用户;二是语音内容编辑,基于对语音语义的理解,可通过语音指令对识别内容进行灵活修改;三是情感化结果呈现,结合情感表征和用户的情感表达,在标点、措辞、语气和格式等方面输出更贴合用户当前态度的识别结果。


 

 

【本文结束】如需转载请务必注明出处:快科技

责任编辑:

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |
本文收录在
#快讯

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...