Yuanli Lingji released its embodied world model DW0.5, moving reinforcement learning into the virtual world. The core innovation is treating action as a strong prior (MoT attention + group-diagonal mask) and explicitly modeling failure trajectories to provide dense RL rewards. Post-training real-robot data requirement drops 60%, with EWMBench 4.73 and WorldArena 73.54 both SOTA. Code is open-sourced.