正文内容 评论(0)
近日,智象未来(HiDream.ai)正式推出最新力作HiDream-O1-World。作为一款原生全模态世界模型,该模型集漫游、编辑、交互三大核心能力于一体,支持文本、图像、交互操控等多种输入方式,用户可一键生成一个时空连续、符合物理规律、支持长时推演的完整虚拟世界。
在技术底座层面,HiDream-O1-World搭载了智象自研的原生全模态架构(UiT)。此次发布标志着UiT架构的又一次重大升级,尤其针对交互式世界模型领域公认的两大核心挑战,时空一致性与物理一致性,取得了关键性突破。这种突破在实际体验中表现为:当用户进行镜头推拉摇移时,场景空间的几何结构始终保持高度稳定,物体不会无故消失或发生畸变;同时,物体间的碰撞、遮挡、重力响应等行为高度契合真实世界的因果逻辑,而非依赖统计平均“猜”出的随机拼接画面。
智象未来CTO姚霆强调:“交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。HiDream-O1-World,正是这场系统性重塑的第一道桥梁,让每一次交互,都通往一个从未抵达的世界。它的突破性效果,既坚定了我们推动原生全模态架构技术路线纵深发展的信心,也为智象持续构建世界模型的核心技术壁垒提供了关键支撑。”
首次参评即登顶,WBench榜单验证硬核实力
在正式发布前不久,HiDream-O1-World已在第三方评测中交出首份亮眼成绩单。由美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench,公布了最新榜单。该基准是业内首个面向交互式世界模型的系统性评测体系,涵盖289个多轮交互案例、共计1058个交互轮次,并基于五大维度、22项指标构建起严谨的量化评测框架。评测分为Navi与Full两个分榜,其中Navi分榜聚焦空间导航与视角控制,被公认为衡量世界模型空间理解能力的核心标尺。
智象HiDream-O1-World在Navi分榜中以平均分80.9的成绩登顶榜首,其中物理(Physical)维度斩获73.3分,位列第一;一致性(Consistency)维度高达88.0分,两项关键指标均位居前列,综合表现排名第一。这是HiDream-O1-World首次参评即登顶,刷新了交互式世界模型的性能上限。这一成绩的背后,正是智象自研UiT架构在时空一致性与物理一致性上的本质突破,为构建可信交互世界提供了坚实的技术支点。
![[MD:Title]](http://img1.mydrivers.com/img/20260817/26f7adf2-ed57-428e-9d9c-cdb2d96a4aaf.jpg)
一键生成,沉浸交互:从“进入世界”到“创造世界”
在功能体验层面,HiDream-O1-World支持文本、图像、交互式操控等多模态输入。用户只需一段文字描述、一张图片或简单的拖拽操作,即可一键生成结构完整、质感细腻、风格多元的交互世界。对使用者而言,这并非简单的“进入”一个预设场景,而是亲手“创造”一个专属的数字空间。例如,上传一张室内照片,模型能够快速构建出高精度的数字孪生空间,自动补全整间卧室的全景图,空间比例精准协调,细节质感高度写实,令人产生强烈的临场感。
![[MD:Title]](http://img1.mydrivers.com/img/20260817/5092fdd9-8126-45d4-9268-9b58639fe66c.png)
在视角漫游方面,模型同时提供第一人称和第三人称两种体验模式,用户可自由驱动角色行走并任意调整视角方向。以潜水场景为例,当视角移动时,水面光影与海底碎光同步变幻,珊瑚礁色彩分明、鱼群游弋自如;镜头拉近后,珊瑚的纹理细节清晰可见,画面全程稳定无漂移,沉浸感十足。
![[MD:Title]](http://img1.mydrivers.com/img/20260817/4c4ac712-be24-4463-81ec-c6557e5f9268.png)
除了漫游,HiDream-O1-World还赋予用户实时编辑能力。用户可驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或调度环境变化,如触发降雨、物体坠落等动态事件。这些操作并非孤立的局部微调,而是基于几何、光照、材质到物理逻辑的全局统一响应,确保每一次交互都不出现割裂感。
![[MD:Title]](http://img1.mydrivers.com/img/20260817/0cd0a7a3-882a-4e8c-8627-1c8f7d4b3772.png)
模型的泛化能力同样出色,支持人类、动物、虚构角色等多种角色的构建。无论是街头漫步的行人、空中盘旋的飞鸟,还是幻想中的异兽,模型都能精准适配其形态与运动规律,让每一种角色都踩准自己“应有”的节奏。以登雪山场景为例:登山人行走时,脚印在雪面上压出真实凹陷;雪花随风飘落的动作缓急有致;远处群山轮廓与脚下岩石纹理随视角推移,衔接自然流畅。
![[MD:Title]](http://img1.mydrivers.com/img/20260817/fe8929e1-486b-4f2f-8895-015d2106afaf.png)
此外,模型拥有极其丰富的场景与风格化创造空间。它既能高度还原真实城市街景、自然地貌、室内空间等实景,让光影、材质、空间结构贴合现实物理世界;也可自由解锁幻想异世界、二次元卡通、3A游戏渲染等多元艺术风格,轻松打造极具想象力的风格化数字场景。
![[MD:Title]](http://img1.mydrivers.com/img/20260817/e8139b3b-c4e7-4ec7-90df-40de75541236.png)
核心技术解码:长时程时空一致性与全局稳态物理一致性
交互式世界模型长期受制于空间、物理与记忆三大核心难题。动态交互中,相机视角切换常引发画面模糊畸变、场景漂移乃至空间结构紊乱;同时,画面中极易出现人物穿墙、物体悬浮等违背物理规律的错误,严重折损可信度;更棘手的是,模型缺乏长效记忆,视角稍作转动,已生成物件便可能凭空消失或细节飘忽,世界状态始终无法忠实留存。
HiDream-O1-World基于自研原生全模态UiT架构,在上述挑战上实现了关键突破。其核心在于两大能力的协同:长时程时空一致性与物理一致性。
在时空一致性方面,模型创新性地将“3D先验注入Memory上下文”与“Test-Time Training在线维护”进行协同设计。一方面,模型在生成过程中维护一个持续更新的空间记忆上下文,将场景的几何结构、物体空间关系等3D先验信息编码并存储于Memory中,使模型在长时序交互中能够“记住”已探索过的场景结构,即便历经多轮视角切换,仍能保持物体尺寸、空间位置及遮挡关系的几何一致性,从根本上规避视角漂移与场景“重置”。另一方面,在推理阶段,模型针对当前交互序列进行轻量级在线自适应优化,通过动态注入并优化适配器,使内部表征与当前场景的3D几何约束持续对齐,确保在面对不同场景与相机轨迹时,均能动态维系稳定的3D一致性。
传统世界模型每次交互都要重新绘制整幅画面,几何与外观深度耦合,微小偏差在长序列中被不断放大,最终导致漂移或消失。而HiDream-O1-World则如同一位拥有“空间记忆”的导演:每到一个新场景,模型不是每步重新揣测环境,而是在Memory中持续记录空间结构;当镜头移动时,依据记忆快速调取对应视角的呈现,再通过实时在线微调确保准确无误。
在物理一致性方面,模型从训练数据与推理机制两端同时发力。训练阶段,借助生成式世界模拟器批量产出涵盖刚体碰撞、流体运动、柔性形变、重力抛射、光影变化等复杂物理交互的合成视频数据,强化模型的归纳偏置;同时通过时序因果建模强化跨帧依赖,确保运动轨迹的时间轴合理性。推理阶段,TTT机制同样作用于物理层面,通过轻量级在线自适应,针对当前场景的特定物理属性进行快速微调,使模型即使在训练数据未完全覆盖的物理情景下,仍能保持较高的物理合理性。
重构三大产业,向新世界迈进
技术突破的同时,HiDream-O1-World正在重塑多个产业,为其带来新的可能性。
以影视级视听叙事为外壳、用户交互为内核的AI互动影游,长期受困于线性剧情与自由探索之间的矛盾。HiDream-O1-World让用户不再被动跟随预设情节,而是成为叙事的主动参与者,世界随其探索持续沿不同分支剧情演进,在影视级视觉质感中获得前所未有的沉浸感。
具身智能仿真方面,模型能够高效搭建高度还原、遵循物理规则的城市、工厂、室内等多类型仿真空间,为智能机器人训练、自动驾驶、智能制造等场景提供高质量虚拟试验底座,使高成本、高风险的实景测试可由智能仿真替代,加速具身智能产业发展。
面向创作者与设计师,HiDream-O1-World可轻松生成3D手办、家居场景及艺术空间,结构完整、细节丰富,支持结构微调、风格秒换与智能补全,大幅缩短创意到成品的迭代路径。更具想象空间的是其向微观世界的延伸,借助高精度生成能力,可精准模拟细胞行为、蛋白相互作用等生命过程,为药物发现与疾病机理研究开辟全新的数字仿真路径。
当物理世界可以被一键生成、自由交互,许多行业都值得被重新想象。而这些领域仅是冰山一角,随着开发者与创作者不断涌入,交互式世界模型的应用边界将远超想象。
本文收录在
#快讯
- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...

