MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Haozhe, Cai, Zefan, Si, Shuzheng, Chen, Liang, Gu, Jiuxiang, Xiao, Wen, Zhang, Minjia, Hu, Junjie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
MMGR: Multi-Modal Generative Reasoning
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning
por: Zhao, Haozhe, et al.
Publicado: (2023)
por: Zhao, Haozhe, et al.
Publicado: (2023)
A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
por: Zhao, Haozhe, et al.
Publicado: (2026)
por: Zhao, Haozhe, et al.
Publicado: (2026)
Mitigating Language-Level Performance Disparity in mPLMs via Teacher Language Selection and Cross-lingual Self-Distillation
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
Improving the Robustness of Distantly-Supervised Named Entity Recognition via Uncertainty-Aware Teacher Learning and Student-Student Collaborative Learning
por: Si, Shuzheng, et al.
Publicado: (2023)
por: Si, Shuzheng, et al.
Publicado: (2023)
A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Tasks
por: Si, Shuzheng, et al.
Publicado: (2025)
por: Si, Shuzheng, et al.
Publicado: (2025)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
BabyVision: Visual Reasoning Beyond Language
por: Chen, Liang, et al.
Publicado: (2026)
por: Chen, Liang, et al.
Publicado: (2026)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
por: Zhou, Shijie, et al.
Publicado: (2025)
por: Zhou, Shijie, et al.
Publicado: (2025)
SANTA: Separate Strategies for Inaccurate and Incomplete Annotation Noise in Distantly-Supervised Named Entity Recognition
por: Si, Shuzheng, et al.
Publicado: (2023)
por: Si, Shuzheng, et al.
Publicado: (2023)
JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation
por: Ma, Yiyang, et al.
Publicado: (2024)
por: Ma, Yiyang, et al.
Publicado: (2024)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
por: Wang, Zihang, et al.
Publicado: (2026)
por: Wang, Zihang, et al.
Publicado: (2026)
Rethinking Semantic Parsing for Large Language Models: Enhancing LLM Performance with Semantic Hints
por: An, Kaikai, et al.
Publicado: (2024)
por: An, Kaikai, et al.
Publicado: (2024)
UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning
por: Tang, Hongxuan, et al.
Publicado: (2025)
por: Tang, Hongxuan, et al.
Publicado: (2025)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
por: Chen, Liang, et al.
Publicado: (2025)
por: Chen, Liang, et al.
Publicado: (2025)
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
DiSA: Diffusion Step Annealing in Autoregressive Image Generation
por: Zhao, Qinyu, et al.
Publicado: (2025)
por: Zhao, Qinyu, et al.
Publicado: (2025)
METAL: A Multi-Agent Framework for Chart Generation with Test-Time Scaling
por: Li, Bingxuan, et al.
Publicado: (2025)
por: Li, Bingxuan, et al.
Publicado: (2025)
Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning
por: Koleilat, Taha, et al.
Publicado: (2026)
por: Koleilat, Taha, et al.
Publicado: (2026)
Autoregressive Models in Vision: A Survey
por: Xiong, Jing, et al.
Publicado: (2024)
por: Xiong, Jing, et al.
Publicado: (2024)
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
por: Liu, Wenjie, et al.
Publicado: (2026)
por: Liu, Wenjie, et al.
Publicado: (2026)
From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
por: Wang, Qidong, et al.
Publicado: (2026)
por: Wang, Qidong, et al.
Publicado: (2026)
Delta Attention Residuals
por: Luo, Cheng, et al.
Publicado: (2026)
por: Luo, Cheng, et al.
Publicado: (2026)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
por: Zhong, Weihong, et al.
Publicado: (2024)
por: Zhong, Weihong, et al.
Publicado: (2024)
MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation
por: Huang, Jinsheng, et al.
Publicado: (2024)
por: Huang, Jinsheng, et al.
Publicado: (2024)
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
por: Liu, Ting, et al.
Publicado: (2024)
por: Liu, Ting, et al.
Publicado: (2024)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
por: Wei, Xinyu, et al.
Publicado: (2025)
por: Wei, Xinyu, et al.
Publicado: (2025)
FaithLens: Detecting and Explaining Faithfulness Hallucination
por: Si, Shuzheng, et al.
Publicado: (2025)
por: Si, Shuzheng, et al.
Publicado: (2025)
Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024)
por: Ye, Yaoqin, et al.
Publicado: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
por: Hao, Tianxiang, et al.
Publicado: (2023)
por: Hao, Tianxiang, et al.
Publicado: (2023)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
por: Chern, Ethan, et al.
Publicado: (2024)
por: Chern, Ethan, et al.
Publicado: (2024)
ImageFolder: Autoregressive Image Generation with Folded Tokens
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Ejemplares similares
-
From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models
por: Cai, Zefan, et al.
Publicado: (2025) -
MMGR: Multi-Modal Generative Reasoning
por: Cai, Zefan, et al.
Publicado: (2025) -
MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning
por: Zhao, Haozhe, et al.
Publicado: (2023) -
A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation
por: Chen, Liang, et al.
Publicado: (2024) -
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
por: Zhao, Haozhe, et al.
Publicado: (2024)