Research
I work on generative video systems for long-horizon, controllable, and real-time
generation. My recent work studies structured RL post-training for diffusion models,
streaming audio-visual generation, fast video initialization, and multimodal world models.
|
Selected Research
|
|
Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds
Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, et al.
Core Contributor
JoyAI-Echo-1.5 · Technical Report, August 2026
project page /
arXiv /
code
A unified audio-visual system for persistent multi-shot stories and interactive 6-DoF worlds, powered by composable cross-shot memory and few-step causal generation.
|
|
JoyAI-Echo: Pushing the Frontier of Long Audio-Visual Generation
Echo Team @ Joy Future Academy, JD; Yuming Li* (co-first author, listed second)
* Equal contribution
Technical Report, 2026 · 1.9k GitHub stars
project page /
technical report /
code /
Hugging Face
A memory-driven audio-visual generation framework for minute-level coherent video and interactive generation.
|
|
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
Yaofeng Su*, Yuming Li*, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Haoyang Huang, Nan Duan
* Equal contribution
ECCV 2026 · Oral Presentation
project page /
arXiv /
code /
model
A real-time streaming framework for joint audio-visual generation with long-form multimodal consistency.
|
|
BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models
Yuming Li*, Yikai Wang*, Yuying Zhu, Zhongyu Zhao, Ming Lu, Qi She, Shanghang Zhang
* Equal contribution
ICLR 2026
OpenReview /
arXiv /
project page /
code
A structured branching rollout strategy for stable and efficient GRPO training in diffusion models.
|
Publications
AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models.
Yuming Li*, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang.
CVPR 2026 submission.
A-ToMe: Adaptive Token Merge for Diffusion Models.
Yuming Li*, Ming Lu, Zeyue Li, Xiaowei Chi, Qi She, Shanghang Zhang.
arXiv.
ASGDiffusion: Parallel High-Resolution Generation with Asynchronous Structure Guidance.
Yuming Li*, Peidong Jia, Dongyu Hong, Yixuan Jia, Qi She, Rui Zhao, Ming Lu, Shanghang Zhang.
arXiv:2412.06163.
FastInit: Fast Noise Initialization for Temporally Consistent Video Generation.
Chengyu Bai, Yuming Li*, Zhongyu Zhao, Jintao Chen, Peidong Jia, Qi She, Ming Lu, Shanghang Zhang.
arXiv:2506.16119.
ManipDreamer3D: Synthesizing Plausible Robotic Manipulation Video with Occupancy-aware 3D Trajectory.
Ying Li, Xiaobao Wei, Xiaowei Chi, Zhongyu Zhao, Yuming Li, Hao Wang, Ningning Ma, Sirui Han, Ming Lu.
AAAI 2026 poster.
|
Experience
JD.com Exploratory Research Institute / Research Intern, 2025-present.
Kuaishou - Kling AI / Research Intern, 2025.
Hedra AI / Research Intern, 2025.
ByteDance / Research Intern, 2024-2025.
Tencent Robotics X / Research Intern, 2024.
|
Template inspired by Andrew Luo. Last updated August 2026.
|
|