当AI学会“记住”世界:智象未来HiDream-O1-World开启交互式生成新纪元

互联网
2026
08/17
14:56
分享
评论

在人工智能竞逐的赛道上,真正的难点从来不是生成一张静态的写实图片,而是让模型在持续变化的动态场景中,始终记得物体的位置、尊重物理的法则、回应每一次交互的预期。近日,智象未来交出了自己的答卷,正式推出原生全模态交互式世界模型HiDream-O1-World,试图在空间、时间与物理因果的交织中,搭建一座通往物理世界的桥梁。

这款模型并非传统视频生成工具的简单延伸,而是集漫游、编辑、交互于一体,支持文本、图像乃至实时操控等多模态输入。用户只需一段描述、一张照片或一组动作指令,即可生成一个时空连贯、符合物理规律且可长期演进的完整世界。更关键的是,它搭载了智象自研的原生全模态架构UiT,后者在此次发布中迎来重要升级,在交互式世界模型公认的两大硬核挑战,时空一致性与物理一致性上,实现了实质性突破。简单来说,当镜头推拉摇移时,场景的几何结构保持稳定,物体不会凭空消失或扭曲;物体间的碰撞、遮挡、重力反应也遵循真实世界的因果链条,而非靠概率“猜”出下一帧。

智象未来CTO姚霆对此阐释:“交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。”

首战登顶WBench,交互式世界模型新标杆

由美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench近期公布了最新榜单,HiDream-O1-World首次参评便以平均分80.9的成绩登顶核心的Navi分榜,该分榜聚焦空间导航与视角控制,被业内视为衡量模型空间理解能力的标尺。其中,物理维度得分73.3,位列第一;一致性维度高达88.0,综合表现排名榜首。这份成绩单的背后,正是UiT架构在时空记忆与物理模拟上的协同突破,为“可信交互世界”提供了坚实的技术支点。

一键生成,自由编辑,为用户打造沉浸式创造体验

从用户视角看,HiDream-O1-World的操作门槛极低,但体验维度极为丰富。上传一张室内照片,模型可快速构建出高精度的数字孪生空间,自动补全全景图,空间比例与材质细节精准协调,令人如临其境。在漫游功能中,用户可自由切换第一人称与第三人称视角,驱动角色行走并任意调整方向。例如在潜水场景中,视角移动时水面光影与海底碎光同步变幻,珊瑚纹理随镜头拉近清晰可辨,全程稳定无漂移。而编辑能力同样实时在线,用户可驱动角色完成抓取、奔跑、跳跃等动作,或触发降雨、物体坠落等动态事件,且所有变化并非局部修图,而是基于几何、光照、材质与物理逻辑的全局统一响应。

泛化能力是HiDream-O1-World的另一张底牌,它支持人类、动物、虚构角色等多种角色构建,登山场景中,行人的脚印在雪面压出真实凹陷,雪花飘落缓急有致,远景与近景纹理过渡自然。风格层面,模型既可高度还原城市街景、自然地貌等写实场景,也能自由切换二次元卡通、3A游戏渲染等幻想风格。

长时程时空一致性与物理一致性再突破

HiDream-O1-World的核心在于同时解决“空间记忆”与“物理直觉”两大难题。针对长时程交互中常见的视角漂移、场景重置、物体消失等顽疾,模型采用“3D先验注入Memory上下文”与“Test-Time Training在线维护”协同设计的方案,前者在生成过程中维护持续更新的空间记忆,将几何结构与物体关系编码存储,使模型在多轮视角切换后仍能“记住”已探索的区域;后者则在推理阶段进行轻量级在线自适应优化,通过动态注入适配器(如LoRA),让模型内部表征与当前场景的3D几何约束持续对齐。这种“边推理边适应”的机制,使模型如同一名拥有空间记忆的导演,而非逐帧重绘的画师,镜头移动时,物体不漂移、不变形、不“失忆”。

物理一致性方面,模型从训练数据和推理机制两端发力。训练阶段,借助生成式模拟器批量产出涵盖刚体碰撞、流体运动、柔性形变、重力抛射等复杂物理场景的合成视频,强化模型的归纳偏置,并在扩散过程中加强跨帧因果依赖。推理阶段,TTT机制同样作用于物理维度,针对新物体类型或材料特性进行快速微调,使后续生成帧符合特定物理规律。这种“架构+数据”双轮驱动,使模型在视觉合理性评测中相比行业平均提升13.6%,在因果保真度评测中跃升12.7%。值得一提的是,智象未来相关空间一致性研究论文此前已入选2026年欧洲计算机视觉国际会议,获得国际学术界高度认可。

三大产业场景,推开智能时代新大门

HiDream-O1-World的发布,正式打开了三重想象空间。AI互动影游让用户不再被动跟随线性剧情,而是主动参与叙事,世界随探索行为持续演进,分支剧情与影视级视觉质感结合,带来沉浸式多重结局体验。具身智能仿真可高效搭建遵循物理规则的城市、工厂、室内等虚拟试验场,为机器人训练、自动驾驶、智能制造提供高精度仿真底座,大幅降低实景测试成本与风险。3D场景生产让创作者可轻松生成手办、家居、艺术空间等结构完整、细节丰富的三维内容,支持微调、风格秒换与智能补全,甚至延伸至微观世界,模拟细胞行为与蛋白相互作用,为药物研发开辟数字仿真新路径。

当然,这些应用还只是冰山一角。当物理世界可以被一键生成、自由交互,许多行业都值得被重新想象。HiDream-O1-World的发布,既是原生全模态技术路线的纵深推进,也是向“可信世界模型”迈出的关键一步。它让我们看到,AI不仅能够“看见”世界,更开始“理解”世界运行的深层逻辑,而这,或许才是智能时代真正的分水岭。

THE END
广告、内容合作请点击这里 寻求合作
免责声明:本文系转载,版权归原作者所有;旨在传递信息,不代表砍柴网的观点和立场。

相关热点

相关推荐

1
3