LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Shufan, Zhu, Yuchen, Gu, Jiuxiang, Liu, Kangning, Lin, Zhe, Chen, Yongxin, Tao, Molei, Grover, Aditya, Kuen, Jason |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
by: Li, Shufan, et al.
Published: (2025)
by: Li, Shufan, et al.
Published: (2025)
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
by: Li, Shufan, et al.
Published: (2025)
by: Li, Shufan, et al.
Published: (2025)
Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
by: Li, Shufan, et al.
Published: (2025)
by: Li, Shufan, et al.
Published: (2025)
SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation
by: Li, Shufan, et al.
Published: (2026)
by: Li, Shufan, et al.
Published: (2026)
PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
by: Li, Shufan, et al.
Published: (2025)
by: Li, Shufan, et al.
Published: (2025)
Proximal Diffusion Neural Sampler
by: Guo, Wei, et al.
Published: (2025)
by: Guo, Wei, et al.
Published: (2025)
InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following
by: Li, Shufan, et al.
Published: (2023)
by: Li, Shufan, et al.
Published: (2023)
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
by: Zhu, Yuchen, et al.
Published: (2025)
by: Zhu, Yuchen, et al.
Published: (2025)
Plug-and-Play Controllable Generation for Discrete Masked Models
by: Guo, Wei, et al.
Published: (2024)
by: Guo, Wei, et al.
Published: (2024)
Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces
by: Rojas, Kevin, et al.
Published: (2025)
by: Rojas, Kevin, et al.
Published: (2025)
ImageFolder: Autoregressive Image Generation with Folded Tokens
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
MDNS: Masked Diffusion Neural Sampler via Stochastic Optimal Control
by: Zhu, Yuchen, et al.
Published: (2025)
by: Zhu, Yuchen, et al.
Published: (2025)
From Masks to Worlds: A Hitchhiker's Guide to World Models
by: Bai, Jinbin, et al.
Published: (2025)
by: Bai, Jinbin, et al.
Published: (2025)
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
by: Li, Shufan, et al.
Published: (2024)
by: Li, Shufan, et al.
Published: (2024)
Mamba-ND: Selective State Space Modeling for Multi-Dimensional Data
by: Li, Shufan, et al.
Published: (2024)
by: Li, Shufan, et al.
Published: (2024)
Diffusion Generative Modeling for Spatially Resolved Gene Expression Inference from Histology Images
by: Zhu, Sichen, et al.
Published: (2025)
by: Zhu, Sichen, et al.
Published: (2025)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
by: Cao, Shengcao, et al.
Published: (2025)
by: Cao, Shengcao, et al.
Published: (2025)
XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning for Discrete Diffusion
by: Tang, Sophia, et al.
Published: (2025)
by: Tang, Sophia, et al.
Published: (2025)
Provable Benefit of Annealed Langevin Monte Carlo for Non-log-concave Sampling
by: Guo, Wei, et al.
Published: (2024)
by: Guo, Wei, et al.
Published: (2024)
Complexity Analysis of Normalizing Constant Estimation: from Jarzynski Equality to Annealed Importance Sampling and beyond
by: Guo, Wei, et al.
Published: (2025)
by: Guo, Wei, et al.
Published: (2025)
PhysiX: A Foundation Model for Physics Simulations
by: Nguyen, Tung, et al.
Published: (2025)
by: Nguyen, Tung, et al.
Published: (2025)
Accelerating Inference of Masked Image Generators via Reinforcement Learning
by: Subbaraman, Pranav, et al.
Published: (2025)
by: Subbaraman, Pranav, et al.
Published: (2025)
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
by: Kang, Weitai, et al.
Published: (2025)
by: Kang, Weitai, et al.
Published: (2025)
Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
by: Rojas, Kevin, et al.
Published: (2025)
by: Rojas, Kevin, et al.
Published: (2025)
Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms
by: Ren, Yinuo, et al.
Published: (2025)
by: Ren, Yinuo, et al.
Published: (2025)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
by: Zhao, Siyan, et al.
Published: (2025)
by: Zhao, Siyan, et al.
Published: (2025)
Quantum State Generation with Structure-Preserving Diffusion Model
by: Zhu, Yuchen, et al.
Published: (2024)
by: Zhu, Yuchen, et al.
Published: (2024)
Trivialized Momentum Facilitates Diffusion Generative Modeling on Lie Groups
by: Zhu, Yuchen, et al.
Published: (2024)
by: Zhu, Yuchen, et al.
Published: (2024)
Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design
by: Choi, Jaemoo, et al.
Published: (2026)
by: Choi, Jaemoo, et al.
Published: (2026)
Automatic Method Illustration Generation for AI Scientific Papers via Drawing Middleware Creation, Evolution, and Orchestration
by: Li, Zhuoling, et al.
Published: (2026)
by: Li, Zhuoling, et al.
Published: (2026)
Image Tokenizer Needs Post-Training
by: Qiu, Kai, et al.
Published: (2025)
by: Qiu, Kai, et al.
Published: (2025)
Robust Latent Matters: Boosting Image Generation with Sampling Error Synthesis
by: Qiu, Kai, et al.
Published: (2025)
by: Qiu, Kai, et al.
Published: (2025)
Generative modeling assisted simulation of measurement-altered quantum criticality
by: Zhu, Yuchen, et al.
Published: (2024)
by: Zhu, Yuchen, et al.
Published: (2024)
Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization
by: Li, Shufan, et al.
Published: (2026)
by: Li, Shufan, et al.
Published: (2026)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
by: Li, Shufan, et al.
Published: (2025)
by: Li, Shufan, et al.
Published: (2025)
Non-equilibrium Annealed Adjoint Sampler
by: Choi, Jaemoo, et al.
Published: (2025)
by: Choi, Jaemoo, et al.
Published: (2025)
Provable Separations between Memorization and Generalization in Diffusion Models
by: Ye, Zeqi, et al.
Published: (2025)
by: Ye, Zeqi, et al.
Published: (2025)
DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation
by: Li, Zhuoling, et al.
Published: (2026)
by: Li, Zhuoling, et al.
Published: (2026)
LICO: Large Language Models for In-Context Molecular Optimization
by: Nguyen, Tung, et al.
Published: (2024)
by: Nguyen, Tung, et al.
Published: (2024)
Similar Items
-
Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
by: Li, Shufan, et al.
Published: (2025) -
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
by: Li, Shufan, et al.
Published: (2025) -
Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
by: Li, Shufan, et al.
Published: (2025) -
SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation
by: Li, Shufan, et al.
Published: (2026) -
PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
by: Li, Shufan, et al.
Published: (2025)