VaPR -- Vision-language Preference alignment for Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wadhawan, Rohan, Harel-Canada, Fabrice Y, Dou, Zi-Yi, Shakiah, Suhaila, Piramuthu, Robinson, Peng, Nanyun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
von: Wadhawan, Rohan, et al.
Veröffentlicht: (2024)
von: Wadhawan, Rohan, et al.
Veröffentlicht: (2024)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
von: Qiu, Haoyi, et al.
Veröffentlicht: (2024)
von: Qiu, Haoyi, et al.
Veröffentlicht: (2024)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation
von: He, Xuehai, et al.
Veröffentlicht: (2024)
von: He, Xuehai, et al.
Veröffentlicht: (2024)
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
von: Wu, Xueqing, et al.
Veröffentlicht: (2026)
von: Wu, Xueqing, et al.
Veröffentlicht: (2026)
Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward
von: Gong, Shizhan, et al.
Veröffentlicht: (2026)
von: Gong, Shizhan, et al.
Veröffentlicht: (2026)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
SLAM: Structural Linguistic Activation Marking for Language Models
von: Harel-Canada, Fabrice, et al.
Veröffentlicht: (2026)
von: Harel-Canada, Fabrice, et al.
Veröffentlicht: (2026)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
von: Dou, Zi-Yi, et al.
Veröffentlicht: (2024)
von: Dou, Zi-Yi, et al.
Veröffentlicht: (2024)
START: Spatial and Textual Learning for Chart Understanding
von: Liu, Zhuoming, et al.
Veröffentlicht: (2025)
von: Liu, Zhuoming, et al.
Veröffentlicht: (2025)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
von: Jeon, Byungwoo, et al.
Veröffentlicht: (2026)
von: Jeon, Byungwoo, et al.
Veröffentlicht: (2026)
"Don't forget to put the milk back!" Dataset for Enabling Embodied Agents to Detect Anomalous Situations
von: Mullen Jr, James F., et al.
Veröffentlicht: (2024)
von: Mullen Jr, James F., et al.
Veröffentlicht: (2024)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
von: Cheng, Silin, et al.
Veröffentlicht: (2025)
von: Cheng, Silin, et al.
Veröffentlicht: (2025)
Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models
von: Gong, Shizhan, et al.
Veröffentlicht: (2025)
von: Gong, Shizhan, et al.
Veröffentlicht: (2025)
T2V-Turbo-v2: Enhancing Video Generation Model Post-Training through Data, Reward, and Conditional Guidance Design
von: Li, Jiachen, et al.
Veröffentlicht: (2024)
von: Li, Jiachen, et al.
Veröffentlicht: (2024)
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
von: Tan, Alvin Wei Ming, et al.
Veröffentlicht: (2025)
von: Tan, Alvin Wei Ming, et al.
Veröffentlicht: (2025)
VaLiD: Mitigating the Hallucination of Large Vision Language Models by Visual Layer Fusion Contrastive Decoding
von: Wang, Jiaqi, et al.
Veröffentlicht: (2024)
von: Wang, Jiaqi, et al.
Veröffentlicht: (2024)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2026)
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2026)
Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization
von: Sarkar, Pritam, et al.
Veröffentlicht: (2025)
von: Sarkar, Pritam, et al.
Veröffentlicht: (2025)
Road Rage Reasoning with Vision-language Models (VLMs): Task Definition and Evaluation Dataset
von: Weng, Yibing, et al.
Veröffentlicht: (2025)
von: Weng, Yibing, et al.
Veröffentlicht: (2025)
ViVa-SAFELAND: a New Freeware for Safe Validation of Vision-based Navigation in Aerial Vehicles
von: Soriano-García, Miguel S., et al.
Veröffentlicht: (2025)
von: Soriano-García, Miguel S., et al.
Veröffentlicht: (2025)
VaViM and VaVAM: Autonomous Driving through Video Generative Modeling
von: Bartoccioni, Florent, et al.
Veröffentlicht: (2025)
von: Bartoccioni, Florent, et al.
Veröffentlicht: (2025)
Improving vision-language alignment with graph spiking hybrid Networks
von: Zhang, Siyu, et al.
Veröffentlicht: (2025)
von: Zhang, Siyu, et al.
Veröffentlicht: (2025)
From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models
von: Cai, Zefan, et al.
Veröffentlicht: (2025)
von: Cai, Zefan, et al.
Veröffentlicht: (2025)
Measuring Psychological Depth in Language Models
von: Harel-Canada, Fabrice, et al.
Veröffentlicht: (2024)
von: Harel-Canada, Fabrice, et al.
Veröffentlicht: (2024)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
von: Liu, Yuanxin, et al.
Veröffentlicht: (2025)
von: Liu, Yuanxin, et al.
Veröffentlicht: (2025)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2025)
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2025)
Sandcastles in the Storm: Revisiting the (Im)possibility of Strong Watermarking
von: Harel-Canada, Fabrice Y, et al.
Veröffentlicht: (2025)
von: Harel-Canada, Fabrice Y, et al.
Veröffentlicht: (2025)
Vision-Language Memory for Spatial Reasoning
von: Liu, Zuntao, et al.
Veröffentlicht: (2025)
von: Liu, Zuntao, et al.
Veröffentlicht: (2025)
Pixel-aligned RGB-NIR Stereo Imaging and Dataset for Robot Vision
von: Kim, Jinnyeong, et al.
Veröffentlicht: (2024)
von: Kim, Jinnyeong, et al.
Veröffentlicht: (2024)
Feature Projection Learning for Better Vision-Language Reasoning
von: Zhang, Yi, et al.
Veröffentlicht: (2026)
von: Zhang, Yi, et al.
Veröffentlicht: (2026)
MoDiPO: text-to-motion alignment via AI-feedback-driven Direct Preference Optimization
von: Pappa, Massimiliano, et al.
Veröffentlicht: (2024)
von: Pappa, Massimiliano, et al.
Veröffentlicht: (2024)
Visual representations in the human brain are aligned with large language models
von: Doerig, Adrien, et al.
Veröffentlicht: (2022)
von: Doerig, Adrien, et al.
Veröffentlicht: (2022)
Improving Vision-language Models with Perception-centric Process Reward Models
von: Min, Yingqian, et al.
Veröffentlicht: (2026)
von: Min, Yingqian, et al.
Veröffentlicht: (2026)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
von: Li, Wenyu, et al.
Veröffentlicht: (2025)
von: Li, Wenyu, et al.
Veröffentlicht: (2025)
OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning
von: Qiu, Liuxiang, et al.
Veröffentlicht: (2026)
von: Qiu, Liuxiang, et al.
Veröffentlicht: (2026)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
von: Halacheva, Anna-Maria, et al.
Veröffentlicht: (2025)
von: Halacheva, Anna-Maria, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
von: Zhang, Junyi, et al.
Veröffentlicht: (2025) -
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
von: Wadhawan, Rohan, et al.
Veröffentlicht: (2024) -
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
von: Qiu, Haoyi, et al.
Veröffentlicht: (2024) -
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
von: Zhang, Yichi, et al.
Veröffentlicht: (2024) -
Matryoshka Query Transformer for Large Vision-Language Models
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)