LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | You, Zebin, Nie, Shen, Zhang, Xiaolu, Hu, Jun, Zhou, Jun, Lu, Zhiwu, Wen, Ji-Rong, Li, Chongxuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
por: You, Zebin, et al.
Publicado: (2026)
por: You, Zebin, et al.
Publicado: (2026)
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
por: Zhu, Fengqi, et al.
Publicado: (2025)
por: Zhu, Fengqi, et al.
Publicado: (2025)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
por: Zhu, Fengqi, et al.
Publicado: (2025)
por: Zhu, Fengqi, et al.
Publicado: (2025)
Large Language Diffusion Models
por: Nie, Shen, et al.
Publicado: (2025)
por: Nie, Shen, et al.
Publicado: (2025)
LLaDA-Rec: Discrete Diffusion for Parallel Semantic ID Generation in Generative Recommendation
por: Shi, Teng, et al.
Publicado: (2025)
por: Shi, Teng, et al.
Publicado: (2025)
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
por: Bie, Tiwei, et al.
Publicado: (2025)
por: Bie, Tiwei, et al.
Publicado: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
Effective and Efficient Masked Image Generation Models
por: You, Zebin, et al.
Publicado: (2025)
por: You, Zebin, et al.
Publicado: (2025)
LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
por: Dong, Xuanzhao, et al.
Publicado: (2025)
por: Dong, Xuanzhao, et al.
Publicado: (2025)
Efficient Token Pruning for LLaDA-V
por: Wan, Zhewen, et al.
Publicado: (2026)
por: Wan, Zhewen, et al.
Publicado: (2026)
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
por: Huang, Sterling, et al.
Publicado: (2026)
por: Huang, Sterling, et al.
Publicado: (2026)
Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
por: AI, Inclusion, et al.
Publicado: (2026)
por: AI, Inclusion, et al.
Publicado: (2026)
UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models
por: He, Guangxin, et al.
Publicado: (2025)
por: He, Guangxin, et al.
Publicado: (2025)
DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs
por: Yu, Longxuan, et al.
Publicado: (2026)
por: Yu, Longxuan, et al.
Publicado: (2026)
Bridging Writing Manner Gap in Visual Instruction Tuning by Creating LLM-aligned Instructions
por: Jing, Dong, et al.
Publicado: (2025)
por: Jing, Dong, et al.
Publicado: (2025)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
por: Du, Yifan, et al.
Publicado: (2023)
por: Du, Yifan, et al.
Publicado: (2023)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
por: Liu, Zikang, et al.
Publicado: (2025)
por: Liu, Zikang, et al.
Publicado: (2025)
Masked Diffusion Models as Energy Minimization
por: Chen, Sitong, et al.
Publicado: (2025)
por: Chen, Sitong, et al.
Publicado: (2025)
Less is More: High-value Data Selection for Visual Instruction Tuning
por: Liu, Zikang, et al.
Publicado: (2024)
por: Liu, Zikang, et al.
Publicado: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
por: Liu, Wenzhuo, et al.
Publicado: (2025)
por: Liu, Wenzhuo, et al.
Publicado: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
por: Zhang, Wenqiao, et al.
Publicado: (2024)
por: Zhang, Wenqiao, et al.
Publicado: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
por: Sun, Shenghuan, et al.
Publicado: (2024)
por: Sun, Shenghuan, et al.
Publicado: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
LLaMoCo: Instruction Tuning of Large Language Models for Optimization Code Generation
por: Ma, Zeyuan, et al.
Publicado: (2024)
por: Ma, Zeyuan, et al.
Publicado: (2024)
LLaDA2.1: Speeding Up Text Diffusion via Token Editing
por: Bie, Tiwei, et al.
Publicado: (2026)
por: Bie, Tiwei, et al.
Publicado: (2026)
Adaptive Task Balancing for Visual Instruction Tuning via Inter-Task Contribution and Intra-Task Difficulty
por: Dai, Yanqi, et al.
Publicado: (2024)
por: Dai, Yanqi, et al.
Publicado: (2024)
Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions
por: Bianchi, Federico, et al.
Publicado: (2023)
por: Bianchi, Federico, et al.
Publicado: (2023)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
por: Cocchi, Federico, et al.
Publicado: (2025)
por: Cocchi, Federico, et al.
Publicado: (2025)
INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning
por: Zhu, Yutao, et al.
Publicado: (2024)
por: Zhu, Yutao, et al.
Publicado: (2024)
LLaFS: When Large Language Models Meet Few-Shot Segmentation
por: Zhu, Lanyun, et al.
Publicado: (2023)
por: Zhu, Lanyun, et al.
Publicado: (2023)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
Are Images Indistinguishable to Humans Also Indistinguishable to Classifiers?
por: You, Zebin, et al.
Publicado: (2024)
por: You, Zebin, et al.
Publicado: (2024)
HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
por: Guo, Haiyang, et al.
Publicado: (2025)
por: Guo, Haiyang, et al.
Publicado: (2025)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
por: Liang, Han, et al.
Publicado: (2024)
por: Liang, Han, et al.
Publicado: (2024)
The Blessing of Randomness: SDE Beats ODE in General Diffusion-based Image Editing
por: Nie, Shen, et al.
Publicado: (2023)
por: Nie, Shen, et al.
Publicado: (2023)
Deterministic Differentiable Structured Pruning for Large Language Models
por: Huang, Weiyu, et al.
Publicado: (2026)
por: Huang, Weiyu, et al.
Publicado: (2026)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
Ejemplares similares
-
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
por: You, Zebin, et al.
Publicado: (2026) -
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
por: Zhu, Fengqi, et al.
Publicado: (2025) -
LLaDA-MoE: A Sparse MoE Diffusion Language Model
por: Zhu, Fengqi, et al.
Publicado: (2025) -
Large Language Diffusion Models
por: Nie, Shen, et al.
Publicado: (2025) -
LLaDA-Rec: Discrete Diffusion for Parallel Semantic ID Generation in Generative Recommendation
por: Shi, Teng, et al.
Publicado: (2025)