正文内容 评论(0

对话AI Agent 直达视频名场面:当虹科技在WAIC重塑人与视频交互新方式
2026-07-19 18:24:35  作者:cici 编辑:cici     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

“我想看哪吒、敖丙共渡天劫的片段。”体验者话音刚落,眼前的屏幕画面,便开始乌云翻涌,毁灭性的雷霆如巨龙咆哮,直击陈塘关。

这一幕,发生在7月17日开幕的2026世界人工智能大会(WAIC)现场。当虹科技的视频AI Agent交互展项前,不少观众排队体验这一全新的视频交互方式。

与传统的视频搜索不同,体验者无需输入片名或关键词,也不用反复拖动进度条。哪怕只记得一个演员、一句台词,或某个经典画面,只要观众用自然语言描述出来,视频AI Agent便能迅速理解用户意图,准确定位到对应视频片段及具体时间点。

例如,“我想看《狂飙》最后一集”“帮我找张艺谋的最新电影”等指令,都能快速响应。观看过程中,用户还可以围绕画面内容随时提问,真正实现“边看边聊”。

“与以文本为主的语言模型相比,这项技术的难点在于,视频包含的信息更加复杂。”当虹科技工作人员介绍,除了画面本身,视频还包含人物、场景、动作、音乐、字幕等丰富的多模态信息。如何让AI真正理解这些内容,并准确定位用户想要的片段,是视频AI交互最核心的挑战。

为此,当虹科技展示的视频AI Agent融合了多维内容理解与多轮语义交互能力,能够深度解析人物、场景、事件及其上下文关系,将传统的“用文本搜索视频”升级为“直接和视频对话”。同时,依托当虹科技在视听传媒领域的多年沉淀,与内容生产平台建立了丰富的生态合作,模型能够持续优化理解与检索能力,为更加精准、自然的视频交互提供支撑。

“我们的视频AI Agent看似是改变了视频搜索的方式,实际上改变的是人与视频之间的交互逻辑。”当虹科技工作人员表示。

长期以来,视频更多是一种被动播放的内容载体,用户只能依赖关键词搜索、菜单选择或手动定位来获取想要的内容。而随着多模态大模型的发展,视频正从扁平的内容载体演变为可理解、可检索、可调用的信息空间。

借助视频AI Agent,视频中的人物、场景、事件等内容都成为了可理解、可检索的信息单元,用户面对的不再只是播放器,而是一个能够理解内容、持续对话的智能交互入口,从而实现与视频内容更深度的互动。

不少观众体验后表示:“太方便了,非常适合我这种总记不住片名、却记得剧情的人。”“以后不知道看什么的时候,直接让Agent根据我的心情推荐就行了。”相比过去依赖关键词搜索、反复拖动进度条寻找片段,如今一句话就能找到想看的内容,这种交互方式更加自然,也更符合日常使用习惯。

据了解,目前当虹科技已将该视频AI Agent引入智能座舱,让车主在车内通过语音即可获取想要的视频片段,充分利用停车、驻车等碎片化时间享受娱乐体验。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:子莹

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |
本文收录在
#快讯

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...