Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pan, Kaihang, Lin, Wang, Yue, Zhongqi, Ao, Tenglong, Jia, Liyu, Zhao, Wei, Li, Juncheng, Tang, Siliang, Zhang, Hanwang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
par: Lin, Wang, et autres
Publié: (2025)
par: Lin, Wang, et autres
Publié: (2025)
Auto-Encoding Morph-Tokens for Multimodal LLM
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
par: Wang, Bohan, et autres
Publié: (2025)
par: Wang, Bohan, et autres
Publié: (2025)
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
par: Yu, Qifan, et autres
Publié: (2024)
par: Yu, Qifan, et autres
Publié: (2024)
Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
par: Li, Juncheng, et autres
Publié: (2023)
par: Li, Juncheng, et autres
Publié: (2023)
SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness
par: Qiu, Haiyi, et autres
Publié: (2026)
par: Qiu, Haiyi, et autres
Publié: (2026)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
par: Chow, Wei, et autres
Publié: (2024)
par: Chow, Wei, et autres
Publié: (2024)
Few-shot Learner Parameterization by Diffusion Time-steps
par: Yue, Zhongqi, et autres
Publié: (2024)
par: Yue, Zhongqi, et autres
Publié: (2024)
WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
Body of Her: A Preliminary Study on End-to-End Humanoid Agent
par: Ao, Tenglong
Publié: (2024)
par: Ao, Tenglong
Publié: (2024)
OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
par: Gao, Minghe, et autres
Publié: (2025)
par: Gao, Minghe, et autres
Publié: (2025)
Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
par: Fan, Zhaoyu, et autres
Publié: (2025)
par: Fan, Zhaoyu, et autres
Publié: (2025)
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
On Path to Multimodal Generalist: General-Level and General-Bench
par: Fei, Hao, et autres
Publié: (2025)
par: Fei, Hao, et autres
Publié: (2025)
Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Exploring Diffusion Time-steps for Unsupervised Representation Learning
par: Yue, Zhongqi, et autres
Publié: (2024)
par: Yue, Zhongqi, et autres
Publié: (2024)
DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation
par: Zhao, Wangbo, et autres
Publié: (2025)
par: Zhao, Wangbo, et autres
Publié: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
par: Zhao, Kesen, et autres
Publié: (2026)
par: Zhao, Kesen, et autres
Publié: (2026)
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
par: Ge, Zhiqi, et autres
Publié: (2024)
par: Ge, Zhiqi, et autres
Publié: (2024)
Instruction Tuning-free Visual Token Complement for Multimodal LLMs
par: Wang, Dongsheng, et autres
Publié: (2024)
par: Wang, Dongsheng, et autres
Publié: (2024)
Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers
par: You, Haoran, et autres
Publié: (2024)
par: You, Haoran, et autres
Publié: (2024)
Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation
par: Liu, Yaofang, et autres
Publié: (2025)
par: Liu, Yaofang, et autres
Publié: (2025)
Mastering Collaborative Multi-modal Data Selection: A Focus on Informativeness, Uniqueness, and Representativeness
par: Yu, Qifan, et autres
Publié: (2024)
par: Yu, Qifan, et autres
Publié: (2024)
TASR: Timestep-Aware Diffusion Model for Image Super-Resolution
par: Lin, Qinwei, et autres
Publié: (2024)
par: Lin, Qinwei, et autres
Publié: (2024)
Timestep-Aware Correction for Quantized Diffusion Models
par: Yao, Yuzhe, et autres
Publié: (2024)
par: Yao, Yuzhe, et autres
Publié: (2024)
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
par: Wang, Yuqing, et autres
Publié: (2026)
par: Wang, Yuqing, et autres
Publié: (2026)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
par: Liu, Feng, et autres
Publié: (2024)
par: Liu, Feng, et autres
Publié: (2024)
ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion
par: Peng, Xurui, et autres
Publié: (2025)
par: Peng, Xurui, et autres
Publié: (2025)
Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
par: Zheng, Zhixin, et autres
Publié: (2025)
par: Zheng, Zhixin, et autres
Publié: (2025)
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2024)
par: Wu, Shengqiong, et autres
Publié: (2024)
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
par: Qiu, Haiyi, et autres
Publié: (2024)
par: Qiu, Haiyi, et autres
Publié: (2024)
Post-Training Quantization for Diffusion Transformer via Hierarchical Timestep Grouping
par: Ding, Ning, et autres
Publié: (2025)
par: Ding, Ning, et autres
Publié: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
par: Jin, Yang, et autres
Publié: (2023)
par: Jin, Yang, et autres
Publié: (2023)
Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
par: Miao, Zichen, et autres
Publié: (2024)
par: Miao, Zichen, et autres
Publié: (2024)
OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning
par: Pan, Kaihang, et autres
Publié: (2026)
par: Pan, Kaihang, et autres
Publié: (2026)
Documents similaires
-
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
par: Lin, Wang, et autres
Publié: (2025) -
Auto-Encoding Morph-Tokens for Multimodal LLM
par: Pan, Kaihang, et autres
Publié: (2024) -
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
par: Wang, Bohan, et autres
Publié: (2025) -
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
par: Yu, Qifan, et autres
Publié: (2024) -
Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
par: Pan, Kaihang, et autres
Publié: (2024)