Guardado en:
| Autores principales: | Giannone, Giorgio, Li, Ruoteng, Feng, Qianli, Perevodchikov, Evgeny, Chen, Rui, Martinez, Aleix |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2501.04568 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
por: Zhang, Yongting, et al.
Publicado: (2024)
por: Zhang, Yongting, et al.
Publicado: (2024)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
por: Lu, Yujie, et al.
Publicado: (2024)
por: Lu, Yujie, et al.
Publicado: (2024)
Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
por: Han, Zongbo, et al.
Publicado: (2024)
por: Han, Zongbo, et al.
Publicado: (2024)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting
por: Omri, Yasmine, et al.
Publicado: (2025)
por: Omri, Yasmine, et al.
Publicado: (2025)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
por: Barsellotti, Luca, et al.
Publicado: (2024)
por: Barsellotti, Luca, et al.
Publicado: (2024)
IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment
por: Qu, Bowen, et al.
Publicado: (2025)
por: Qu, Bowen, et al.
Publicado: (2025)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
por: Chen, Kesheng, et al.
Publicado: (2026)
por: Chen, Kesheng, et al.
Publicado: (2026)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
por: Jiang, Ziyan, et al.
Publicado: (2024)
por: Jiang, Ziyan, et al.
Publicado: (2024)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
Cross-Modal Adapter for Vision-Language Retrieval
por: Jiang, Haojun, et al.
Publicado: (2022)
por: Jiang, Haojun, et al.
Publicado: (2022)
DOTA: Distributional Test-Time Adaptation of Vision-Language Models
por: Han, Zongbo, et al.
Publicado: (2024)
por: Han, Zongbo, et al.
Publicado: (2024)
Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
por: He, Zoe Wanying, et al.
Publicado: (2025)
por: He, Zoe Wanying, et al.
Publicado: (2025)
Flexible Tool Selection through Low-dimensional Attribute Alignment of Vision and Language
por: Hao, Guangfu, et al.
Publicado: (2025)
por: Hao, Guangfu, et al.
Publicado: (2025)
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
por: Zhou, Yucheng, et al.
Publicado: (2025)
por: Zhou, Yucheng, et al.
Publicado: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Unified Vision-Language Modeling via Concept Space Alignment
por: Qiu, Yifu, et al.
Publicado: (2026)
por: Qiu, Yifu, et al.
Publicado: (2026)
Self-Supervised Visual Preference Alignment
por: Zhu, Ke, et al.
Publicado: (2024)
por: Zhu, Ke, et al.
Publicado: (2024)
Preference Tuning with Human Feedback on Language, Speech, and Vision Tasks: A Survey
por: Winata, Genta Indra, et al.
Publicado: (2024)
por: Winata, Genta Indra, et al.
Publicado: (2024)
Can Vision Language Models Judge Action Quality? An Empirical Evaluation
por: Freitas, Miguel Monte e, et al.
Publicado: (2026)
por: Freitas, Miguel Monte e, et al.
Publicado: (2026)
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
por: Qu, Kevin, et al.
Publicado: (2026)
por: Qu, Kevin, et al.
Publicado: (2026)
Revisiting the Role of Language Priors in Vision-Language Models
por: Lin, Zhiqiu, et al.
Publicado: (2023)
por: Lin, Zhiqiu, et al.
Publicado: (2023)
Panoptic Vision-Language Feature Fields
por: Chen, Haoran, et al.
Publicado: (2023)
por: Chen, Haoran, et al.
Publicado: (2023)
Polos: Multimodal Metric Learning from Human Feedback for Image Captioning
por: Wada, Yuiga, et al.
Publicado: (2024)
por: Wada, Yuiga, et al.
Publicado: (2024)
Retrieval-based Disentangled Representation Learning with Natural Language Supervision
por: Zhou, Jiawei, et al.
Publicado: (2022)
por: Zhou, Jiawei, et al.
Publicado: (2022)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
por: Deniz, Omer Faruk, et al.
Publicado: (2026)
por: Deniz, Omer Faruk, et al.
Publicado: (2026)
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
por: An, Wenbin, et al.
Publicado: (2024)
por: An, Wenbin, et al.
Publicado: (2024)
Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images
por: Wu, Shengguang, et al.
Publicado: (2025)
por: Wu, Shengguang, et al.
Publicado: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
por: Jiang, Jiachen, et al.
Publicado: (2025)
por: Jiang, Jiachen, et al.
Publicado: (2025)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation
por: Rajabi, Navid, et al.
Publicado: (2025)
por: Rajabi, Navid, et al.
Publicado: (2025)
Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
por: Zou, Chengke, et al.
Publicado: (2024)
por: Zou, Chengke, et al.
Publicado: (2024)
Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
por: Zhang, Juntian, et al.
Publicado: (2025)
por: Zhang, Juntian, et al.
Publicado: (2025)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
Multi-Object Hallucination in Vision-Language Models
por: Chen, Xuweiyi, et al.
Publicado: (2024)
por: Chen, Xuweiyi, et al.
Publicado: (2024)
Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback
por: Xiao, Wenyi, et al.
Publicado: (2024)
por: Xiao, Wenyi, et al.
Publicado: (2024)
Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
por: He, Lixuan, et al.
Publicado: (2025)
por: He, Lixuan, et al.
Publicado: (2025)
VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View
por: Schumann, Raphael, et al.
Publicado: (2023)
por: Schumann, Raphael, et al.
Publicado: (2023)
Ejemplares similares
-
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
por: Zhang, Yongting, et al.
Publicado: (2024) -
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
por: Lu, Yujie, et al.
Publicado: (2024) -
Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
por: Han, Zongbo, et al.
Publicado: (2024) -
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
por: Li, Lei, et al.
Publicado: (2024) -
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
por: Yang, Rui, et al.
Publicado: (2025)