Same or Not? Enhancing Visual Perception in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Marsili, Damiano, Mehta, Aditya, Lin, Ryan Y., Gkioxari, Georgia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
par: Marsili, Damiano, et autres
Publié: (2025)
par: Marsili, Damiano, et autres
Publié: (2025)
Visual Agentic AI for Spatial Reasoning with a Dynamic API
par: Marsili, Damiano, et autres
Publié: (2025)
par: Marsili, Damiano, et autres
Publié: (2025)
Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models
par: Kang, Raphi, et autres
Publié: (2026)
par: Kang, Raphi, et autres
Publié: (2026)
Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision
par: Sahoo, Aadarsh, et autres
Publié: (2026)
par: Sahoo, Aadarsh, et autres
Publié: (2026)
Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models
par: Ma, Ziqi, et autres
Publié: (2026)
par: Ma, Ziqi, et autres
Publié: (2026)
Aligning Text, Images, and 3D Structure Token-by-Token
par: Sahoo, Aadarsh, et autres
Publié: (2025)
par: Sahoo, Aadarsh, et autres
Publié: (2025)
Is This Tracker On? A Benchmark Protocol for Dynamic Tracking
par: Demler, Ilona, et autres
Publié: (2025)
par: Demler, Ilona, et autres
Publié: (2025)
Find Any Part in 3D
par: Ma, Ziqi, et autres
Publié: (2024)
par: Ma, Ziqi, et autres
Publié: (2024)
Reconstructing Hand-Held Objects in 3D from Images and Videos
par: Wu, Jane, et autres
Publié: (2024)
par: Wu, Jane, et autres
Publié: (2024)
MonoTher-Depth: Enhancing Thermal Depth Estimation via Confidence-Aware Distillation
par: Zuo, Xingxing, et autres
Publié: (2025)
par: Zuo, Xingxing, et autres
Publié: (2025)
Feedforward 3D Editing via Text-Steerable Image-to-3D
par: Ma, Ziqi, et autres
Publié: (2025)
par: Ma, Ziqi, et autres
Publié: (2025)
Is CLIP ideal? No. Can we fix it? Yes!
par: Kang, Raphi, et autres
Publié: (2025)
par: Kang, Raphi, et autres
Publié: (2025)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
par: Shourya, Aditya, et autres
Publié: (2025)
par: Shourya, Aditya, et autres
Publié: (2025)
Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models
par: Waseda, Futa, et autres
Publié: (2025)
par: Waseda, Futa, et autres
Publié: (2025)
Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models
par: Quan, Rong, et autres
Publié: (2026)
par: Quan, Rong, et autres
Publié: (2026)
Refining Skewed Perceptions in Vision-Language Contrastive Models through Visual Representations
par: Dai, Haocheng, et autres
Publié: (2024)
par: Dai, Haocheng, et autres
Publié: (2024)
Do Vision-Language Foundational models show Robust Visual Perception?
par: Chandhok, Shivam, et autres
Publié: (2024)
par: Chandhok, Shivam, et autres
Publié: (2024)
LDFaceNet: Latent Diffusion-based Network for High-Fidelity Deepfake Generation
par: Mehta, Dwij, et autres
Publié: (2024)
par: Mehta, Dwij, et autres
Publié: (2024)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
par: Ma, Martin Q., et autres
Publié: (2026)
par: Ma, Martin Q., et autres
Publié: (2026)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
par: Zhang, Juntian, et autres
Publié: (2025)
par: Zhang, Juntian, et autres
Publié: (2025)
Visual Perception by Large Language Model's Weights
par: Ma, Feipeng, et autres
Publié: (2024)
par: Ma, Feipeng, et autres
Publié: (2024)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
par: Wen, Yuxin, et autres
Publié: (2024)
par: Wen, Yuxin, et autres
Publié: (2024)
Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs
par: Kanade, Aditya, et autres
Publié: (2025)
par: Kanade, Aditya, et autres
Publié: (2025)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models
par: Zhou, Xirui, et autres
Publié: (2025)
par: Zhou, Xirui, et autres
Publié: (2025)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
par: Wu, Xueqing, et autres
Publié: (2026)
par: Wu, Xueqing, et autres
Publié: (2026)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
par: Shan, Haozhe, et autres
Publié: (2026)
par: Shan, Haozhe, et autres
Publié: (2026)
Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment
par: Li, Yuan, et autres
Publié: (2025)
par: Li, Yuan, et autres
Publié: (2025)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
par: Qi, Yukun, et autres
Publié: (2026)
par: Qi, Yukun, et autres
Publié: (2026)
AR as an Evaluation Playground: Bridging Metrics and Visual Perception of Computer Vision Models
par: Ganj, Ashkan, et autres
Publié: (2025)
par: Ganj, Ashkan, et autres
Publié: (2025)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
par: Zhou, Yikang, et autres
Publié: (2025)
par: Zhou, Yikang, et autres
Publié: (2025)
Caltech Aerial RGB-Thermal Dataset in the Wild
par: Lee, Connor, et autres
Publié: (2024)
par: Lee, Connor, et autres
Publié: (2024)
VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
par: Kamoi, Ryo, et autres
Publié: (2024)
par: Kamoi, Ryo, et autres
Publié: (2024)
Contextualized Visual Personalization in Vision-Language Models
par: Oh, Yeongtak, et autres
Publié: (2026)
par: Oh, Yeongtak, et autres
Publié: (2026)
ObjectTransforms for Uncertainty Quantification and Reduction in Vision-Based Perception for Autonomous Vehicles
par: Sahu, Nishad, et autres
Publié: (2025)
par: Sahu, Nishad, et autres
Publié: (2025)
Understanding Depth and Height Perception in Large Visual-Language Models
par: Azad, Shehreen, et autres
Publié: (2024)
par: Azad, Shehreen, et autres
Publié: (2024)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
par: Rahman, Amirul, et autres
Publié: (2025)
par: Rahman, Amirul, et autres
Publié: (2025)
Not There Yet: Evaluating Vision Language Models in Simulating the Visual Perception of People with Low Vision
par: Natalie, Rosiana, et autres
Publié: (2025)
par: Natalie, Rosiana, et autres
Publié: (2025)
MegaCOIN: Enhancing Medium-Grained Color Perception for Vision-Language Models
par: Chiu, Ming-Chang, et autres
Publié: (2024)
par: Chiu, Ming-Chang, et autres
Publié: (2024)
Documents similaires
-
No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
par: Marsili, Damiano, et autres
Publié: (2025) -
Visual Agentic AI for Spatial Reasoning with a Dynamic API
par: Marsili, Damiano, et autres
Publié: (2025) -
Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models
par: Kang, Raphi, et autres
Publié: (2026) -
Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision
par: Sahoo, Aadarsh, et autres
Publié: (2026) -
Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models
par: Ma, Ziqi, et autres
Publié: (2026)