Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Shengzhi, Lin, Rongyu, Pei, Shichao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reconstructive Visual Instruction Tuning
von: Wang, Haochen, et al.
Veröffentlicht: (2024)
von: Wang, Haochen, et al.
Veröffentlicht: (2024)
Self-Supervised Visual Preference Alignment
von: Zhu, Ke, et al.
Veröffentlicht: (2024)
von: Zhu, Ke, et al.
Veröffentlicht: (2024)
LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding
von: Fujitake, Masato
Veröffentlicht: (2024)
von: Fujitake, Masato
Veröffentlicht: (2024)
Improved Baselines with Visual Instruction Tuning
von: Liu, Haotian, et al.
Veröffentlicht: (2023)
von: Liu, Haotian, et al.
Veröffentlicht: (2023)
Learning to Instruct for Visual Instruction Tuning
von: Zhou, Zhihan, et al.
Veröffentlicht: (2025)
von: Zhou, Zhihan, et al.
Veröffentlicht: (2025)
Parrot: Multilingual Visual Instruction Tuning
von: Sun, Hai-Long, et al.
Veröffentlicht: (2024)
von: Sun, Hai-Long, et al.
Veröffentlicht: (2024)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
von: He, Hulingxiao, et al.
Veröffentlicht: (2025)
von: He, Hulingxiao, et al.
Veröffentlicht: (2025)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
von: Sun, Shenghuan, et al.
Veröffentlicht: (2024)
von: Sun, Shenghuan, et al.
Veröffentlicht: (2024)
SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
von: Liu, Dongyang, et al.
Veröffentlicht: (2024)
von: Liu, Dongyang, et al.
Veröffentlicht: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
von: Luo, Run, et al.
Veröffentlicht: (2025)
von: Luo, Run, et al.
Veröffentlicht: (2025)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
von: Khaki, Saeed, et al.
Veröffentlicht: (2024)
von: Khaki, Saeed, et al.
Veröffentlicht: (2024)
Preference Alignment for Diffusion Model via Explicit Denoised Distribution Estimation
von: Shi, Dingyuan, et al.
Veröffentlicht: (2024)
von: Shi, Dingyuan, et al.
Veröffentlicht: (2024)
Unified Lexical Representation for Interpretable Visual-Language Alignment
von: Li, Yifan, et al.
Veröffentlicht: (2024)
von: Li, Yifan, et al.
Veröffentlicht: (2024)
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
von: Kumar, Somnath, et al.
Veröffentlicht: (2024)
von: Kumar, Somnath, et al.
Veröffentlicht: (2024)
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
von: Zhang, Renrui, et al.
Veröffentlicht: (2024)
von: Zhang, Renrui, et al.
Veröffentlicht: (2024)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
von: Lyu, Mengyao, et al.
Veröffentlicht: (2025)
von: Lyu, Mengyao, et al.
Veröffentlicht: (2025)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
von: Qin, Yulei, et al.
Veröffentlicht: (2025)
von: Qin, Yulei, et al.
Veröffentlicht: (2025)
Visual Hallucinations of Multi-modal Large Language Models
von: Huang, Wen, et al.
Veröffentlicht: (2024)
von: Huang, Wen, et al.
Veröffentlicht: (2024)
Visual Language Model based Cross-modal Semantic Communication Systems
von: Jiang, Feibo, et al.
Veröffentlicht: (2024)
von: Jiang, Feibo, et al.
Veröffentlicht: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
von: Wang, Fei, et al.
Veröffentlicht: (2024)
von: Wang, Fei, et al.
Veröffentlicht: (2024)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
von: Lin, Yuanze, et al.
Veröffentlicht: (2024)
von: Lin, Yuanze, et al.
Veröffentlicht: (2024)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
von: Lu, Shiyin, et al.
Veröffentlicht: (2024)
von: Lu, Shiyin, et al.
Veröffentlicht: (2024)
Unified Vision-Language Modeling via Concept Space Alignment
von: Qiu, Yifu, et al.
Veröffentlicht: (2026)
von: Qiu, Yifu, et al.
Veröffentlicht: (2026)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
von: Kim, Donghoon, et al.
Veröffentlicht: (2024)
von: Kim, Donghoon, et al.
Veröffentlicht: (2024)
MuMA-ToM: Multi-modal Multi-Agent Theory of Mind
von: Shi, Haojun, et al.
Veröffentlicht: (2024)
von: Shi, Haojun, et al.
Veröffentlicht: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
von: Zhai, Yuexiang, et al.
Veröffentlicht: (2024)
von: Zhai, Yuexiang, et al.
Veröffentlicht: (2024)
The Labyrinth of Links: Navigating the Associative Maze of Multi-modal LLMs
von: Li, Hong, et al.
Veröffentlicht: (2024)
von: Li, Hong, et al.
Veröffentlicht: (2024)
SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions
von: Horawalavithana, Sameera, et al.
Veröffentlicht: (2023)
von: Horawalavithana, Sameera, et al.
Veröffentlicht: (2023)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
von: Panos, Aristeidis, et al.
Veröffentlicht: (2024)
von: Panos, Aristeidis, et al.
Veröffentlicht: (2024)
VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments
von: Yang, Bufang, et al.
Veröffentlicht: (2024)
von: Yang, Bufang, et al.
Veröffentlicht: (2024)
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
GET: Unlocking the Multi-modal Potential of CLIP for Generalized Category Discovery
von: Wang, Enguang, et al.
Veröffentlicht: (2024)
von: Wang, Enguang, et al.
Veröffentlicht: (2024)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
von: Zhu, Kangyu, et al.
Veröffentlicht: (2024)
von: Zhu, Kangyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Reconstructive Visual Instruction Tuning
von: Wang, Haochen, et al.
Veröffentlicht: (2024) -
Self-Supervised Visual Preference Alignment
von: Zhu, Ke, et al.
Veröffentlicht: (2024) -
LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding
von: Fujitake, Masato
Veröffentlicht: (2024) -
Improved Baselines with Visual Instruction Tuning
von: Liu, Haotian, et al.
Veröffentlicht: (2023) -
Learning to Instruct for Visual Instruction Tuning
von: Zhou, Zhihan, et al.
Veröffentlicht: (2025)