EchoWM: Open and Enterable Omnimodal World Models
Tech Report · 2026
Songchun Zhang*, Yaowei Li*, Junhao Zhuang*, Weiyang Jin*, Haoyu Wang, Xin Lu, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yumin Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan
An omnimodal world model for generative media that responds to continuous navigation while video, environmental sound, music, and speech evolve together. I proposed Short-Horizon and Long-Horizon Audio-Visual Self-Gradient Forcing and was responsible for EchoWM’s causal training.