Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Kaihang, Lin, Wang, Yue, Zhongqi, Ao, Tenglong, Jia, Liyu, Zhao, Wei, Li, Juncheng, Tang, Siliang, Zhang, Hanwang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
di: Lin, Wang, et al.
Pubblicazione: (2025)
di: Lin, Wang, et al.
Pubblicazione: (2025)
Auto-Encoding Morph-Tokens for Multimodal LLM
di: Pan, Kaihang, et al.
Pubblicazione: (2024)
di: Pan, Kaihang, et al.
Pubblicazione: (2024)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
di: Wang, Bohan, et al.
Pubblicazione: (2025)
di: Wang, Bohan, et al.
Pubblicazione: (2025)
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
di: Yu, Qifan, et al.
Pubblicazione: (2024)
di: Yu, Qifan, et al.
Pubblicazione: (2024)
Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
di: Pan, Kaihang, et al.
Pubblicazione: (2024)
di: Pan, Kaihang, et al.
Pubblicazione: (2024)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
di: Li, Juncheng, et al.
Pubblicazione: (2023)
di: Li, Juncheng, et al.
Pubblicazione: (2023)
SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness
di: Qiu, Haiyi, et al.
Pubblicazione: (2026)
di: Qiu, Haiyi, et al.
Pubblicazione: (2026)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
di: Chow, Wei, et al.
Pubblicazione: (2024)
di: Chow, Wei, et al.
Pubblicazione: (2024)
Few-shot Learner Parameterization by Diffusion Time-steps
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation
di: Chow, Wei, et al.
Pubblicazione: (2025)
di: Chow, Wei, et al.
Pubblicazione: (2025)
Body of Her: A Preliminary Study on End-to-End Humanoid Agent
di: Ao, Tenglong
Pubblicazione: (2024)
di: Ao, Tenglong
Pubblicazione: (2024)
OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions
di: Bu, Wendong, et al.
Pubblicazione: (2025)
di: Bu, Wendong, et al.
Pubblicazione: (2025)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
di: Pan, Kaihang, et al.
Pubblicazione: (2025)
di: Pan, Kaihang, et al.
Pubblicazione: (2025)
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
di: Gao, Minghe, et al.
Pubblicazione: (2025)
di: Gao, Minghe, et al.
Pubblicazione: (2025)
Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
di: Fan, Zhaoyu, et al.
Pubblicazione: (2025)
di: Fan, Zhaoyu, et al.
Pubblicazione: (2025)
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
di: Pan, Kaihang, et al.
Pubblicazione: (2025)
di: Pan, Kaihang, et al.
Pubblicazione: (2025)
On Path to Multimodal Generalist: General-Level and General-Bench
di: Fei, Hao, et al.
Pubblicazione: (2025)
di: Fei, Hao, et al.
Pubblicazione: (2025)
Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
di: Pan, Kaihang, et al.
Pubblicazione: (2025)
di: Pan, Kaihang, et al.
Pubblicazione: (2025)
Exploring Diffusion Time-steps for Unsupervised Representation Learning
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation
di: Zhao, Wangbo, et al.
Pubblicazione: (2025)
di: Zhao, Wangbo, et al.
Pubblicazione: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
di: Zhao, Kesen, et al.
Pubblicazione: (2026)
di: Zhao, Kesen, et al.
Pubblicazione: (2026)
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
Instruction Tuning-free Visual Token Complement for Multimodal LLMs
di: Wang, Dongsheng, et al.
Pubblicazione: (2024)
di: Wang, Dongsheng, et al.
Pubblicazione: (2024)
Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers
di: You, Haoran, et al.
Pubblicazione: (2024)
di: You, Haoran, et al.
Pubblicazione: (2024)
Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation
di: Liu, Yaofang, et al.
Pubblicazione: (2025)
di: Liu, Yaofang, et al.
Pubblicazione: (2025)
Mastering Collaborative Multi-modal Data Selection: A Focus on Informativeness, Uniqueness, and Representativeness
di: Yu, Qifan, et al.
Pubblicazione: (2024)
di: Yu, Qifan, et al.
Pubblicazione: (2024)
TASR: Timestep-Aware Diffusion Model for Image Super-Resolution
di: Lin, Qinwei, et al.
Pubblicazione: (2024)
di: Lin, Qinwei, et al.
Pubblicazione: (2024)
Timestep-Aware Correction for Quantized Diffusion Models
di: Yao, Yuzhe, et al.
Pubblicazione: (2024)
di: Yao, Yuzhe, et al.
Pubblicazione: (2024)
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
di: Wang, Yuqing, et al.
Pubblicazione: (2026)
di: Wang, Yuqing, et al.
Pubblicazione: (2026)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
di: Liu, Feng, et al.
Pubblicazione: (2024)
di: Liu, Feng, et al.
Pubblicazione: (2024)
ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion
di: Peng, Xurui, et al.
Pubblicazione: (2025)
di: Peng, Xurui, et al.
Pubblicazione: (2025)
Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
di: Zheng, Zhixin, et al.
Pubblicazione: (2025)
di: Zheng, Zhixin, et al.
Pubblicazione: (2025)
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
di: Bu, Wendong, et al.
Pubblicazione: (2025)
di: Bu, Wendong, et al.
Pubblicazione: (2025)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
di: Qiu, Haiyi, et al.
Pubblicazione: (2024)
di: Qiu, Haiyi, et al.
Pubblicazione: (2024)
Post-Training Quantization for Diffusion Transformer via Hierarchical Timestep Grouping
di: Ding, Ning, et al.
Pubblicazione: (2025)
di: Ding, Ning, et al.
Pubblicazione: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2023)
di: Jin, Yang, et al.
Pubblicazione: (2023)
Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
di: Miao, Zichen, et al.
Pubblicazione: (2024)
di: Miao, Zichen, et al.
Pubblicazione: (2024)
OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning
di: Pan, Kaihang, et al.
Pubblicazione: (2026)
di: Pan, Kaihang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
di: Lin, Wang, et al.
Pubblicazione: (2025) -
Auto-Encoding Morph-Tokens for Multimodal LLM
di: Pan, Kaihang, et al.
Pubblicazione: (2024) -
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
di: Wang, Bohan, et al.
Pubblicazione: (2025) -
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
di: Yu, Qifan, et al.
Pubblicazione: (2024) -
Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
di: Pan, Kaihang, et al.
Pubblicazione: (2024)