LPOI: Listwise Preference Optimization for Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zadeh, Fatemeh Pesaran, Oh, Yoojin, Kim, Gunhee |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
par: An, Na Min, et autres
Publié: (2025)
par: An, Na Min, et autres
Publié: (2025)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
par: Liu, Chaohu, et autres
Publié: (2025)
par: Liu, Chaohu, et autres
Publié: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
par: Wu, Sihao, et autres
Publié: (2025)
par: Wu, Sihao, et autres
Publié: (2025)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
par: Xie, Yuxi, et autres
Publié: (2024)
par: Xie, Yuxi, et autres
Publié: (2024)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation
par: Kim, Jisoo, et autres
Publié: (2026)
par: Kim, Jisoo, et autres
Publié: (2026)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
par: Liang, Xiwen, et autres
Publié: (2025)
par: Liang, Xiwen, et autres
Publié: (2025)
Understanding Counting Mechanisms in Large Language and Vision-Language Models
par: Hasani, Hosein, et autres
Publié: (2025)
par: Hasani, Hosein, et autres
Publié: (2025)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
par: Lu, Yujie, et autres
Publié: (2024)
par: Lu, Yujie, et autres
Publié: (2024)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
par: Wu, Jiulong, et autres
Publié: (2025)
par: Wu, Jiulong, et autres
Publié: (2025)
ChartCap: Mitigating Hallucination of Dense Chart Captioning
par: Lim, Junyoung, et autres
Publié: (2025)
par: Lim, Junyoung, et autres
Publié: (2025)
TopP&R: Robust Support Estimation Approach for Evaluating Fidelity and Diversity in Generative Models
par: Kim, Pum Jun, et autres
Publié: (2023)
par: Kim, Pum Jun, et autres
Publié: (2023)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
par: Oh, Changdae, et autres
Publié: (2023)
par: Oh, Changdae, et autres
Publié: (2023)
HiPP-Prune: Hierarchical Preference-Conditioned Structured Pruning for Vision-Language Models
par: Bai, Lincen, et autres
Publié: (2026)
par: Bai, Lincen, et autres
Publié: (2026)
LogicQA: Logical Anomaly Detection with Vision Language Model Generated Questions
par: Kwon, Yejin, et autres
Publié: (2025)
par: Kwon, Yejin, et autres
Publié: (2025)
Towards Better Optimization For Listwise Preference in Diffusion Models
par: Bai, Jiamu, et autres
Publié: (2025)
par: Bai, Jiamu, et autres
Publié: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
par: Zhang, Ruohong, et autres
Publié: (2024)
par: Zhang, Ruohong, et autres
Publié: (2024)
Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
par: Cheng, Min, et autres
Publié: (2025)
par: Cheng, Min, et autres
Publié: (2025)
Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models
par: Woo, Sangmin, et autres
Publié: (2024)
par: Woo, Sangmin, et autres
Publié: (2024)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
par: Kim, Eunki, et autres
Publié: (2025)
par: Kim, Eunki, et autres
Publié: (2025)
Collaborative Edge-to-Server Inference for Vision-Language Models
par: Song, Soochang, et autres
Publié: (2025)
par: Song, Soochang, et autres
Publié: (2025)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
par: Zhang, Jensen, et autres
Publié: (2025)
par: Zhang, Jensen, et autres
Publié: (2025)
VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models
par: Hyeon-Woo, Nam, et autres
Publié: (2024)
par: Hyeon-Woo, Nam, et autres
Publié: (2024)
VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving
par: Xu, Zhefan, et autres
Publié: (2026)
par: Xu, Zhefan, et autres
Publié: (2026)
PhysGaia: A Physics-Aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis
par: Kim, Mijeong, et autres
Publié: (2025)
par: Kim, Mijeong, et autres
Publié: (2025)
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
par: Sarowar, Md Selim, et autres
Publié: (2025)
par: Sarowar, Md Selim, et autres
Publié: (2025)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
par: Hung, Chia-Yu, et autres
Publié: (2025)
par: Hung, Chia-Yu, et autres
Publié: (2025)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
par: Park, Eunkyu, et autres
Publié: (2025)
par: Park, Eunkyu, et autres
Publié: (2025)
Frequency Composition for Compressed and Domain-Adaptive Neural Networks
par: Kwon, Yoojin, et autres
Publié: (2025)
par: Kwon, Yoojin, et autres
Publié: (2025)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
par: Zhang, Yongting, et autres
Publié: (2024)
par: Zhang, Yongting, et autres
Publié: (2024)
Environmental Understanding Vision-Language Model for Embodied Agent
par: Bang, Jinsik, et autres
Publié: (2026)
par: Bang, Jinsik, et autres
Publié: (2026)
CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
par: Lim, Sohwi, et autres
Publié: (2026)
par: Lim, Sohwi, et autres
Publié: (2026)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
par: Zhu, Kangyu, et autres
Publié: (2024)
par: Zhu, Kangyu, et autres
Publié: (2024)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
par: Li, Kaiyuan, et autres
Publié: (2025)
par: Li, Kaiyuan, et autres
Publié: (2025)
How to Move Your Dragon: Text-to-Motion Synthesis for Large-Vocabulary Objects
par: Lee, Wonkwang, et autres
Publié: (2025)
par: Lee, Wonkwang, et autres
Publié: (2025)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
par: Kim, Sohee, et autres
Publié: (2025)
par: Kim, Sohee, et autres
Publié: (2025)
Vision-Based Natural Language Scene Understanding for Autonomous Driving: An Extended Dataset and a New Model for Traffic Scene Description Generation
par: Zadeh, Danial Sadrian, et autres
Publié: (2026)
par: Zadeh, Danial Sadrian, et autres
Publié: (2026)
Intersectional Fairness in Vision-Language Models for Medical Image Disease Classification
par: Zhang, Yupeng, et autres
Publié: (2025)
par: Zhang, Yupeng, et autres
Publié: (2025)
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
par: Kim, Yeonju, et autres
Publié: (2024)
par: Kim, Yeonju, et autres
Publié: (2024)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
par: Lee, Dong-Jae, et autres
Publié: (2026)
par: Lee, Dong-Jae, et autres
Publié: (2026)
Documents similaires
-
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
par: An, Na Min, et autres
Publié: (2025) -
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
par: Liu, Chaohu, et autres
Publié: (2025) -
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
par: Wu, Sihao, et autres
Publié: (2025) -
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
par: Xie, Yuxi, et autres
Publié: (2024) -
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)