正文内容 评论(0

黄仁勋终于出招了!RTX 5090跑200 token/秒:成本大降67%
2026-08-12 11:18:44  出处:快科技 作者:红茶 编辑:红茶     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

快科技8月12日消息,当地时间8月11日,英伟达宣布为DGX与RTX系统推出一系列重大AI更新。

Meta开源的Muse Glimmer模型(300亿参数稠密架构)针对英伟达平台深度优化,在RTX 5090上推理速度超过每秒200个token。同时发布的NeMo Switchyard开源模型路由库可将智能体任务成本降低67%。

黄仁勋终于出招了!RTX 5090跑200 token/秒:成本大降67%

在模型和路由工具之外,英伟达同期还推出了另一款主打极致效率的开源模型Nemotron 3.5 Lightning。这是一款300亿参数的MoE开源模型,官方宣称其token生成速度是同类模型的4倍,智能体任务完成时间缩短30%。

该模型采用开放权重,支持开发者使用自有数据进行微调,可直接在RTX PC、DGX Spark、DGX Station及Jetson平台上本地运行。

NeMo Switchyard是此次发布的另一重磅工具。这个开源路由库可根据任务复杂度、成本和延迟,为智能体工作流的每一步动态选择最优模型。

英伟达内部测试显示,在保持前沿水平准确性的情况下,任务成本可降至单独使用Opus 4.8的近三分之一。LangChain报告称跨145个多轮Deep Agent任务实现74%成本降低。

在视频生成领域,LTX 2.5开源视频模型新增多镜头生成与生成式编辑功能。在英伟达RTX GPU、DGX Spark和DGX Station上,该模型实现2倍性能提升和40%显存节省。RTX 5090在Wan-Animate-2模型上较苹果M3 Ultra带来最高26倍性能优势。

黄仁勋终于出招了!RTX 5090跑200 token/秒:成本大降67%

DGX Spark平台同步获得多项增强。Sync Cluster Assistant支持将多台DGX Spark组成高速集群。此外,Sync Resource Monitor可提供跨单系统或整个集群的CPU与GPU实时及历史视图。

目前,英伟达RTX平台已全面支持Cosmos 3 Edge、MiniMax-H3、DeepSeek V4-Flash等多款开源模型。

黄仁勋终于出招了!RTX 5090跑200 token/秒:成本大降67%

【本文结束】如需转载请务必注明出处:快科技

责任编辑:红茶

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...