LaViDa: A Large Diffusion Language Model for Multimodal Understanding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Shufan, Kallidromitis, Konstantinos, Bansal, Hritik, Gokul, Akash, Kato, Yusuke, Kozuka, Kazuki, Kuen, Jason, Lin, Zhe, Chang, Kai-Wei, Grover, Aditya |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MobileWorldBench: Towards Semantic World Modeling For Mobile Agents
von: Li, Shufan, et al.
Veröffentlicht: (2025)
von: Li, Shufan, et al.
Veröffentlicht: (2025)
Aligning Diffusion Models by Optimizing Human Utility
von: Li, Shufan, et al.
Veröffentlicht: (2024)
von: Li, Shufan, et al.
Veröffentlicht: (2024)
Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
von: Li, Shufan, et al.
Veröffentlicht: (2025)
von: Li, Shufan, et al.
Veröffentlicht: (2025)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
von: Li, Shufan, et al.
Veröffentlicht: (2025)
von: Li, Shufan, et al.
Veröffentlicht: (2025)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
von: Li, Shufan, et al.
Veröffentlicht: (2024)
von: Li, Shufan, et al.
Veröffentlicht: (2024)
LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models
von: Li, Shufan, et al.
Veröffentlicht: (2026)
von: Li, Shufan, et al.
Veröffentlicht: (2026)
Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization
von: Li, Shufan, et al.
Veröffentlicht: (2026)
von: Li, Shufan, et al.
Veröffentlicht: (2026)
Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
von: Li, Shufan, et al.
Veröffentlicht: (2025)
von: Li, Shufan, et al.
Veröffentlicht: (2025)
SegLLM: Multi-round Reasoning Segmentation
von: Wang, XuDong, et al.
Veröffentlicht: (2024)
von: Wang, XuDong, et al.
Veröffentlicht: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
von: Bansal, Hritik, et al.
Veröffentlicht: (2023)
von: Bansal, Hritik, et al.
Veröffentlicht: (2023)
MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation
von: Li, Shufan, et al.
Veröffentlicht: (2026)
von: Li, Shufan, et al.
Veröffentlicht: (2026)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
von: Li, Shufan, et al.
Veröffentlicht: (2025)
von: Li, Shufan, et al.
Veröffentlicht: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation
von: Bansal, Hritik, et al.
Veröffentlicht: (2025)
von: Bansal, Hritik, et al.
Veröffentlicht: (2025)
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
von: Wadhawan, Rohan, et al.
Veröffentlicht: (2024)
von: Wadhawan, Rohan, et al.
Veröffentlicht: (2024)
InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following
von: Li, Shufan, et al.
Veröffentlicht: (2023)
von: Li, Shufan, et al.
Veröffentlicht: (2023)
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
von: Singhi, Nishad, et al.
Veröffentlicht: (2025)
von: Singhi, Nishad, et al.
Veröffentlicht: (2025)
Hyperbolic Learning with Multimodal Large Language Models
von: Mandica, Paolo, et al.
Veröffentlicht: (2024)
von: Mandica, Paolo, et al.
Veröffentlicht: (2024)
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
von: Li, Shufan, et al.
Veröffentlicht: (2024)
von: Li, Shufan, et al.
Veröffentlicht: (2024)
Mamba-ND: Selective State Space Modeling for Multi-Dimensional Data
von: Li, Shufan, et al.
Veröffentlicht: (2024)
von: Li, Shufan, et al.
Veröffentlicht: (2024)
HoneyBee: Data Recipes for Vision-Language Reasoners
von: Bansal, Hritik, et al.
Veröffentlicht: (2025)
von: Bansal, Hritik, et al.
Veröffentlicht: (2025)
Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators
von: Bansal, Hritik, et al.
Veröffentlicht: (2025)
von: Bansal, Hritik, et al.
Veröffentlicht: (2025)
GenEARL: A Training-Free Generative Framework for Multimodal Event Argument Role Labeling
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
PhysiX: A Foundation Model for Physics Simulations
von: Nguyen, Tung, et al.
Veröffentlicht: (2025)
von: Nguyen, Tung, et al.
Veröffentlicht: (2025)
Accelerating Inference of Masked Image Generators via Reinforcement Learning
von: Subbaraman, Pranav, et al.
Veröffentlicht: (2025)
von: Subbaraman, Pranav, et al.
Veröffentlicht: (2025)
VideoPhy: Evaluating Physical Commonsense for Video Generation
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
Scaling transformer neural networks for skillful and reliable medium-range weather forecasting
von: Nguyen, Tung, et al.
Veröffentlicht: (2023)
von: Nguyen, Tung, et al.
Veröffentlicht: (2023)
LICO: Large Language Models for In-Context Molecular Optimization
von: Nguyen, Tung, et al.
Veröffentlicht: (2024)
von: Nguyen, Tung, et al.
Veröffentlicht: (2024)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
von: Zhao, Siyan, et al.
Veröffentlicht: (2025)
von: Zhao, Siyan, et al.
Veröffentlicht: (2025)
Mercury: Ultra-Fast Language Models Based on Diffusion
von: Labs, Inception, et al.
Veröffentlicht: (2025)
von: Labs, Inception, et al.
Veröffentlicht: (2025)
BootPIG: Bootstrapping Zero-shot Personalized Image Generation Capabilities in Pretrained Diffusion Models
von: Purushwalkam, Senthil, et al.
Veröffentlicht: (2024)
von: Purushwalkam, Senthil, et al.
Veröffentlicht: (2024)
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
von: Li, Yifan, et al.
Veröffentlicht: (2026)
von: Li, Yifan, et al.
Veröffentlicht: (2026)
ArtifactGen: Benchmarking WGAN-GP vs Diffusion for Label-Aware EEG Artifact Synthesis
von: Arasu, Hritik, et al.
Veröffentlicht: (2025)
von: Arasu, Hritik, et al.
Veröffentlicht: (2025)
Probing the Decision Boundaries of In-context Learning in Large Language Models
von: Zhao, Siyan, et al.
Veröffentlicht: (2024)
von: Zhao, Siyan, et al.
Veröffentlicht: (2024)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
von: Zhao, Siyan, et al.
Veröffentlicht: (2023)
von: Zhao, Siyan, et al.
Veröffentlicht: (2023)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
von: Rawte, Vipula, et al.
Veröffentlicht: (2024)
von: Rawte, Vipula, et al.
Veröffentlicht: (2024)
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
von: Suvarna, Ashima, et al.
Veröffentlicht: (2026)
von: Suvarna, Ashima, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
MobileWorldBench: Towards Semantic World Modeling For Mobile Agents
von: Li, Shufan, et al.
Veröffentlicht: (2025) -
Aligning Diffusion Models by Optimizing Human Utility
von: Li, Shufan, et al.
Veröffentlicht: (2024) -
Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
von: Li, Shufan, et al.
Veröffentlicht: (2025) -
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
von: Li, Shufan, et al.
Veröffentlicht: (2025) -
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
von: Li, Shufan, et al.
Veröffentlicht: (2024)