Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xiyao, Chen, Jiuhai, Wang, Zhaoyang, Zhou, Yuhang, Zhou, Yiyang, Yao, Huaxiu, Zhou, Tianyi, Goldstein, Tom, Bhatia, Parminder, Huang, Furong, Xiao, Cao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Calibrated Self-Rewarding Vision Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
Multi-Objective Linguistic Control of Large Language Models
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
Improving Alignment in LVLMs with Debiased Self-Judgment
di: Yang, Sihan, et al.
Pubblicazione: (2025)
di: Yang, Sihan, et al.
Pubblicazione: (2025)
Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning
di: Chang, Aofei, et al.
Pubblicazione: (2025)
di: Chang, Aofei, et al.
Pubblicazione: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024)
di: Huang, Qidong, et al.
Pubblicazione: (2024)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
GenQA: Generating Millions of Instructions from a Handful of Prompts
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
Verifiable Format Control for Large Language Model Generations
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
MammoDINO: Anatomically Aware Self-Supervision for Mammographic Images
di: Zhou, Sicheng, et al.
Pubblicazione: (2025)
di: Zhou, Sicheng, et al.
Pubblicazione: (2025)
Linear Spaces of Meanings: Compositional Structures in Vision-Language Models
di: Trager, Matthew, et al.
Pubblicazione: (2023)
di: Trager, Matthew, et al.
Pubblicazione: (2023)
Dynamic Uncertainty Ranking: Enhancing Retrieval-Augmented In-Context Learning for Long-Tail Knowledge in LLMs
di: Yu, Shuyang, et al.
Pubblicazione: (2024)
di: Yu, Shuyang, et al.
Pubblicazione: (2024)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
TriSum: Learning Summarization Ability from Large Language Models with Structured Rationale
di: Jiang, Pengcheng, et al.
Pubblicazione: (2024)
di: Jiang, Pengcheng, et al.
Pubblicazione: (2024)
GATES: Self-Distillation under Privileged Context with Consensus Gating
di: Stein, Alex, et al.
Pubblicazione: (2026)
di: Stein, Alex, et al.
Pubblicazione: (2026)
Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction
di: Zhang, Yuanhong, et al.
Pubblicazione: (2026)
di: Zhang, Yuanhong, et al.
Pubblicazione: (2026)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
di: Wang, Xiyao, et al.
Pubblicazione: (2025)
MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models
di: Chang, Aofei, et al.
Pubblicazione: (2025)
di: Chang, Aofei, et al.
Pubblicazione: (2025)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
di: Liu, Jiaxiang, et al.
Pubblicazione: (2025)
di: Liu, Jiaxiang, et al.
Pubblicazione: (2025)
Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities
di: Yao, Yuang, et al.
Pubblicazione: (2025)
di: Yao, Yuang, et al.
Pubblicazione: (2025)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
di: Zhou, Yiyun, et al.
Pubblicazione: (2025)
di: Zhou, Yiyun, et al.
Pubblicazione: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
CREAM: Consistency Regularized Self-Rewarding Language Models
di: Wang, Zhaoyang, et al.
Pubblicazione: (2024)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2024)
Self-Improvement of Large Language Models: A Technical Overview and Future Outlook
di: Yang, Haoyan, et al.
Pubblicazione: (2026)
di: Yang, Haoyan, et al.
Pubblicazione: (2026)
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
di: Zhou, Lijie
Pubblicazione: (2026)
di: Zhou, Lijie
Pubblicazione: (2026)
Quantifying Cross-Modality Memorization in Vision-Language Models
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
Bridging Human Oversight and Black-box Driver Assistance: Vision-Language Models for Predictive Alerting in Lane Keeping Assist Systems
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
di: Zhang, Chunhui, et al.
Pubblicazione: (2023)
di: Zhang, Chunhui, et al.
Pubblicazione: (2023)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Effectively Enhancing Vision Language Large Models by Prompt Augmentation and Caption Utilization
di: Zhao, Minyi, et al.
Pubblicazione: (2024)
di: Zhao, Minyi, et al.
Pubblicazione: (2024)
Efficient Long CoT Reasoning in Small Language Models
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
OPTune: Efficient Online Preference Tuning
di: Chen, Lichang, et al.
Pubblicazione: (2024)
di: Chen, Lichang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Calibrated Self-Rewarding Vision Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2024) -
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
di: Zhou, Yiyang, et al.
Pubblicazione: (2024) -
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
di: Cui, Chenhang, et al.
Pubblicazione: (2024) -
Multi-Objective Linguistic Control of Large Language Models
di: Nguyen, Dang, et al.
Pubblicazione: (2024) -
Improving Alignment in LVLMs with Debiased Self-Judgment
di: Yang, Sihan, et al.
Pubblicazione: (2025)