Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Wang, Jia, Liyu, Hu, Wentao, Pan, Kaihang, Yue, Zhongqi, Zhao, Wei, Chen, Jingyuan, Wu, Fei, Zhang, Hanwang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
por: Pan, Kaihang, et al.
Publicado: (2025)
por: Pan, Kaihang, et al.
Publicado: (2025)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
por: Wang, Bohan, et al.
Publicado: (2025)
por: Wang, Bohan, et al.
Publicado: (2025)
Few-shot Learner Parameterization by Diffusion Time-steps
por: Yue, Zhongqi, et al.
Publicado: (2024)
por: Yue, Zhongqi, et al.
Publicado: (2024)
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
por: Yu, Qifan, et al.
Publicado: (2024)
por: Yu, Qifan, et al.
Publicado: (2024)
Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers
por: You, Haoran, et al.
Publicado: (2024)
por: You, Haoran, et al.
Publicado: (2024)
Exploring Diffusion Time-steps for Unsupervised Representation Learning
por: Yue, Zhongqi, et al.
Publicado: (2024)
por: Yue, Zhongqi, et al.
Publicado: (2024)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
por: Liu, Feng, et al.
Publicado: (2024)
por: Liu, Feng, et al.
Publicado: (2024)
Auto-Encoding Morph-Tokens for Multimodal LLM
por: Pan, Kaihang, et al.
Publicado: (2024)
por: Pan, Kaihang, et al.
Publicado: (2024)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
por: Fei, Hao, et al.
Publicado: (2023)
por: Fei, Hao, et al.
Publicado: (2023)
Characterizing Motion Encoding in Video Diffusion Timesteps
por: Baherwani, Vatsal, et al.
Publicado: (2025)
por: Baherwani, Vatsal, et al.
Publicado: (2025)
Non-confusing Generation of Customized Concepts in Diffusion Models
por: Lin, Wang, et al.
Publicado: (2024)
por: Lin, Wang, et al.
Publicado: (2024)
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
por: Fei, Hao, et al.
Publicado: (2024)
por: Fei, Hao, et al.
Publicado: (2024)
Video-KTR: Reinforcing Video Reasoning via Key Token Attribution
por: Wang, Ziyue, et al.
Publicado: (2026)
por: Wang, Ziyue, et al.
Publicado: (2026)
ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule
por: Huang, Yilie, et al.
Publicado: (2026)
por: Huang, Yilie, et al.
Publicado: (2026)
Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
por: Pan, Kaihang, et al.
Publicado: (2025)
por: Pan, Kaihang, et al.
Publicado: (2025)
Don't Let It Fade: Preserving Edits in Diffusion Language Models via Token Timestep Allocation
por: Kim, Woojin, et al.
Publicado: (2025)
por: Kim, Woojin, et al.
Publicado: (2025)
Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation
por: Liu, Yaofang, et al.
Publicado: (2025)
por: Liu, Yaofang, et al.
Publicado: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
por: Zhao, Kesen, et al.
Publicado: (2026)
por: Zhao, Kesen, et al.
Publicado: (2026)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
por: Chow, Wei, et al.
Publicado: (2024)
por: Chow, Wei, et al.
Publicado: (2024)
Redefining Temporal Modeling in Video Diffusion: The Vectorized Timestep Approach
por: Liu, Yaofang, et al.
Publicado: (2024)
por: Liu, Yaofang, et al.
Publicado: (2024)
ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion
por: Peng, Xurui, et al.
Publicado: (2025)
por: Peng, Xurui, et al.
Publicado: (2025)
TASR: Timestep-Aware Diffusion Model for Image Super-Resolution
por: Lin, Qinwei, et al.
Publicado: (2024)
por: Lin, Qinwei, et al.
Publicado: (2024)
Timestep-Aware Correction for Quantized Diffusion Models
por: Yao, Yuzhe, et al.
Publicado: (2024)
por: Yao, Yuzhe, et al.
Publicado: (2024)
OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning
por: Pan, Kaihang, et al.
Publicado: (2026)
por: Pan, Kaihang, et al.
Publicado: (2026)
Timestep-Aware Diffusion Model for Extreme Image Rescaling
por: Wang, Ce, et al.
Publicado: (2024)
por: Wang, Ce, et al.
Publicado: (2024)
Fine-tuning Diffusion Policies with Backpropagation Through Diffusion Timesteps
por: Yang, Ningyuan, et al.
Publicado: (2025)
por: Yang, Ningyuan, et al.
Publicado: (2025)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
por: Ge, Haonan, et al.
Publicado: (2025)
por: Ge, Haonan, et al.
Publicado: (2025)
Manifold-Aware Exploration for Reinforcement Learning in Video Generation
por: Zheng, Mingzhe, et al.
Publicado: (2026)
por: Zheng, Mingzhe, et al.
Publicado: (2026)
DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation
por: Zhao, Wangbo, et al.
Publicado: (2025)
por: Zhao, Wangbo, et al.
Publicado: (2025)
EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning
por: Liu, Xiaoqian, et al.
Publicado: (2025)
por: Liu, Xiaoqian, et al.
Publicado: (2025)
Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph
por: Wang, Wentao, et al.
Publicado: (2025)
por: Wang, Wentao, et al.
Publicado: (2025)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
por: Chen, Sirui, et al.
Publicado: (2026)
por: Chen, Sirui, et al.
Publicado: (2026)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
por: Zhao, Kesen, et al.
Publicado: (2025)
por: Zhao, Kesen, et al.
Publicado: (2025)
Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
por: Zheng, Zhixin, et al.
Publicado: (2025)
por: Zheng, Zhixin, et al.
Publicado: (2025)
Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
por: Pan, Jiadong, et al.
Publicado: (2025)
por: Pan, Jiadong, et al.
Publicado: (2025)
RDPM: Solve Diffusion Probabilistic Models via Recurrent Token Prediction
por: Wu, Xiaoping, et al.
Publicado: (2024)
por: Wu, Xiaoping, et al.
Publicado: (2024)
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
por: Gao, Kaifeng, et al.
Publicado: (2024)
por: Gao, Kaifeng, et al.
Publicado: (2024)
Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep
por: Liu, Tianyi, et al.
Publicado: (2026)
por: Liu, Tianyi, et al.
Publicado: (2026)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
por: Zhang, Hongzhi, et al.
Publicado: (2025)
por: Zhang, Hongzhi, et al.
Publicado: (2025)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
por: Jiang, Jingjing, et al.
Publicado: (2025)
por: Jiang, Jingjing, et al.
Publicado: (2025)
Ejemplares similares
-
Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
por: Pan, Kaihang, et al.
Publicado: (2025) -
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
por: Wang, Bohan, et al.
Publicado: (2025) -
Few-shot Learner Parameterization by Diffusion Time-steps
por: Yue, Zhongqi, et al.
Publicado: (2024) -
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
por: Yu, Qifan, et al.
Publicado: (2024) -
Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers
por: You, Haoran, et al.
Publicado: (2024)