来源于:从“模拟”到“交互” 智象未来世界模型成为具身智能的认知中枢-开云app官方在线入口
发布时间:2026-08-25 00:01:54
文章摘要:
从“模拟”到“交互” 智象未来世界模型成为具身智能的认知中枢-开云app官方在线入口:从“模拟”到“交互” 智象未来世界模型成为具身智能的认知中枢-开云app官方在线入口 从“模拟”到“交互” 智象未来世界模型成为具身智能的认知中枢-开云app官方在线入口
2026年被许多人称为世界模型的模拟元年,大语言模型、交互界模多模态模型与具身智能,智象中枢开云链接官方网站这三条曾各自狂奔的未世为具技术路线正以前所未有的速度交汇。然而,型成一个IQ逼近140的身智顶级大模型,依然无法可靠地完成一个简单的认知家务操作,这背后的模拟落差恰恰是Physical AI必须直面的命题,即高智商不等于“全能”,交互界模AI要改变世界,智象中枢必须先学会与世界交互。未世为具 在近日举行的型成世界机器人大会物理AI引领者论坛上,智象未来(HiDream.ai)创始人梅涛提出了一条清晰的身智开云链接官方网站破局路径——原生全模态世界模型,它不是认知将文本、图像、模拟视频、操控指令简单拼接,而是从底层架构上统一多种模态,让模型同时具备对世界的完整表达、物理规律的推演能力,以及动态交互的生成能力。这种“统一”,正是从“模拟世界”走向“交互世界”的关键一跃。 原生全模态:统一架构与核心突破 智象未来自研的UiT(Unified Transformer)架构正是这一理念的技术载体。基于该架构推出的HiDream-O1-World模型,首次参评便在权威榜单WBench的Navi分榜中登顶。该模型支持文本、图像及交互式操控等多模态输入,并凝练出漫游、编辑、交互三项核心能力。无论是高度还原的真实空间,还是二次元卡通、3A游戏渲染等风格化世界,它都能在长时程交互中保持时空一致性与物理合理性,简单说,它“记住”了探索过的场景结构,也能让后续动作符合直觉上的物理常识。 产业落地:从数字娱乐到具身仿真 这一突破,迅速打开了多个产业场景的想象空间。在AI互动影游中,用户不再是被动观看者,而是可以主动影响叙事走向;在具身智能仿真中,模型可搭建高保真虚拟训练底座,让机器人在“元宇宙”里先摔打千百次,再到真实环境里精准执行;在3D场景生成中,创作者只需输入少量描述,即可获得结构完整的立体空间,创意到成品的周期大幅缩短。而智象未来的野心不止于此,他们正围绕世界模型的定义,逐步完善覆盖图像、视频、交互式世界模型的完整矩阵,让“统一”成为贯穿所有产品的基因。 认知中枢:数据-模型-智能体-具身闭环 梅涛强调,世界模型不能孤立存在,他将Physical AI的能力底座概括为一个闭环飞轮:数据—世界模型—智能体—具身本体—反馈。最底层是三类数据,互联网的先验数据、仿真的物理试错数据、真实交互的闭环数据,三者缺一不可。中间层是世界模型,它作为认知中枢,回答“世界是什么”和“接下来会发生什么”。最上层是智能体与具身系统,基于世界模型的预测做决策,再由物理本体执行动作。真实环境的反馈又回流为新的训练数据,驱动飞轮持续加速。 在这个闭环中,世界模型的角色尤为关键,没有高质量的世界模型,仿真就难以逼近真实物理规律,具身智能的数据飞轮也转不起来。梅涛以智象未来与诺亦腾机器人的合作为例:利用原生全模态模型对真实采集的人体动作数据进行增强,可以生成大量符合物理约束的视频,同一动作在不同背景、肤色、光照下都保持自然一致。这种能力大幅降低了真实数据采集的成本,让机器人先在仿真中“预习”,再到现实中“实战”,训练效率提升显著。 从长远来看,大模型让AI理解世界,智能体与具身系统让AI行动于世界,而原生全模态世界模型则将认知、行动与反馈融为一体,赋予AI在物理世界中持续学习与进化的能力。这不再是静态的“模拟”,而是动态的“交互”,AI不再只是观察者或生成者,而是参与者。智象未来的实践表明,当统一架构同时拥抱文本、图像、操控指令和物理规律时,世界模型便从“数字玩具”蜕变为“物理基石”。它既服务数字智能,让影游、设计、仿真更生动;也加速具身智能,让机器人在真实环境中的训练与执行更可靠、更经济。 梅涛表示,智象未来将持续深耕原生全模态路线,以技术创新与生态协同双轮驱动,助力Physical AI从技术探索迈入规模化、商业化的全新阶段。从模拟到理解,从推演到交互,这条路的终点,或许正是AI真正“活”在物理世界的那一天。
返回首页