DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
Published in arXiv preprint arXiv:2603.10448, 2026
A video-action Diffusion Transformer framework for generalizable robot control.
Recommended citation: Ma, Teli and Zheng, Jia and Wang, Zifan and Jiang, Chunli and Cui, Andy and Liang, Junwei and Yang, Shuo. "DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control." arXiv preprint arXiv:2603.10448, 2026. https://arxiv.org/abs/2603.10448
