VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
Fuente:
arXiv
Saved in:
| Main Authors: | Gavrikov, Paul, Lin, Wei, Mirza, M. Jehanzeb, Jahagirdar, Soumya, Huzaifa, Muhammad, Doveh, Sivan, Yeung-Levy, Serena, Glass, James, Kuehne, Hilde |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TTRV: Test-Time Reinforcement Learning for Vision Language Models
by: Singh, Akshit, et al.
Published: (2025)
by: Singh, Akshit, et al.
Published: (2025)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
by: Mirza, M. Jehanzeb, et al.
Published: (2024)
by: Mirza, M. Jehanzeb, et al.
Published: (2024)
Teaching VLMs to Localize Specific Objects from In-context Examples
by: Doveh, Sivan, et al.
Published: (2024)
by: Doveh, Sivan, et al.
Published: (2024)
Comparison Visual Instruction Tuning
by: Lin, Wei, et al.
Published: (2024)
by: Lin, Wei, et al.
Published: (2024)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
by: Jahagirdar, Soumya, et al.
Published: (2026)
by: Jahagirdar, Soumya, et al.
Published: (2026)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
by: Araujo, Edson, et al.
Published: (2026)
by: Araujo, Edson, et al.
Published: (2026)
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
by: Jahagirdar, Soumya Shamarao, et al.
Published: (2026)
by: Jahagirdar, Soumya Shamarao, et al.
Published: (2026)
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
by: Selch, Lukas, et al.
Published: (2025)
by: Selch, Lukas, et al.
Published: (2025)
ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs
by: Huang, Irene, et al.
Published: (2024)
by: Huang, Irene, et al.
Published: (2024)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
by: Mehta, Videet, et al.
Published: (2026)
by: Mehta, Videet, et al.
Published: (2026)
Exploring Modality Guidance to Enhance VFM-based Feature Fusion for UDA in 3D Semantic Segmentation
by: Spoecklberger, Johannes, et al.
Published: (2025)
by: Spoecklberger, Johannes, et al.
Published: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
by: Rouditchenko, Andrew, et al.
Published: (2025)
by: Rouditchenko, Andrew, et al.
Published: (2025)
Neuromorphic Visual Scene Understanding with Resonator Networks
by: Renner, Alpha, et al.
Published: (2022)
by: Renner, Alpha, et al.
Published: (2022)
BoMuDANet: Unsupervised Adaptation for Visual Scene Understanding in Unstructured Driving Environments
by: Kothandaraman, Divya, et al.
Published: (2020)
by: Kothandaraman, Divya, et al.
Published: (2020)
Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions
by: Sun, Xiaoxiao, et al.
Published: (2026)
by: Sun, Xiaoxiao, et al.
Published: (2026)
Multi-Agent Visual-Language Reasoning for Comprehensive Highway Scene Understanding
by: Yang, Yunxiang, et al.
Published: (2025)
by: Yang, Yunxiang, et al.
Published: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
by: Rouditchenko, Andrew, et al.
Published: (2024)
by: Rouditchenko, Andrew, et al.
Published: (2024)
Language-EXtended Indoor SLAM (LEXIS): A Versatile System for Real-time Visual Scene Understanding
by: Kassab, Christina, et al.
Published: (2023)
by: Kassab, Christina, et al.
Published: (2023)
CSI-Inpainter: Enabling Visual Scene Recovery from CSI Time Sequences for Occlusion Removal
by: Chen, Cheng, et al.
Published: (2023)
by: Chen, Cheng, et al.
Published: (2023)
Towards Multimodal In-Context Learning for Vision & Language Models
by: Doveh, Sivan, et al.
Published: (2024)
by: Doveh, Sivan, et al.
Published: (2024)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
by: Rouditchenko, Andrew, et al.
Published: (2025)
by: Rouditchenko, Andrew, et al.
Published: (2025)
A Multimodal Approach for Fluid Overload Prediction: Integrating Lung Ultrasound and Clinical Data
by: Yang, Tianqi, et al.
Published: (2024)
by: Yang, Tianqi, et al.
Published: (2024)
OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation
by: Zhang, Letian, et al.
Published: (2026)
by: Zhang, Letian, et al.
Published: (2026)
Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion
by: Hansen, Jacob, et al.
Published: (2025)
by: Hansen, Jacob, et al.
Published: (2025)
GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
by: Mirza, M. Jehanzeb, et al.
Published: (2024)
by: Mirza, M. Jehanzeb, et al.
Published: (2024)
Dense Dispersed Structured Light for Hyperspectral 3D Imaging of Dynamic Scenes
by: Shin, Suhyun, et al.
Published: (2024)
by: Shin, Suhyun, et al.
Published: (2024)
Deterministic fast and stable phase retrieval in multiple dimensions
by: Brabec, Cole, et al.
Published: (2024)
by: Brabec, Cole, et al.
Published: (2024)
Adaptively Placed Multi-Grid Scene Representation Networks for Large-Scale Data Visualization
by: Wurster, Skylar Wolfgang, et al.
Published: (2023)
by: Wurster, Skylar Wolfgang, et al.
Published: (2023)
Compact Visual Data Representation for Green Multimedia -- A Human Visual System Perspective
by: Chen, Peilin, et al.
Published: (2024)
by: Chen, Peilin, et al.
Published: (2024)
Rate-Accuracy Bounds in Visual Coding for Machines
by: Bajić, Ivan V.
Published: (2025)
by: Bajić, Ivan V.
Published: (2025)
Foveated Compression for Immersive Telepresence Visualization
by: Schwarz, Max, et al.
Published: (2025)
by: Schwarz, Max, et al.
Published: (2025)
Bitrate Ladder Construction using Visual Information Fidelity
by: Durbha, Krishna Srikar, et al.
Published: (2023)
by: Durbha, Krishna Srikar, et al.
Published: (2023)
Language-Free Generative Editing from One Visual Example
by: Elezabi, Omar, et al.
Published: (2026)
by: Elezabi, Omar, et al.
Published: (2026)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
by: Endo, Mark, et al.
Published: (2024)
by: Endo, Mark, et al.
Published: (2024)
Fréchet Wavelet Distance: A Domain-Agnostic Metric for Image Generation
by: Veeramacheneni, Lokesh, et al.
Published: (2023)
by: Veeramacheneni, Lokesh, et al.
Published: (2023)
Constructing Per-Shot Bitrate Ladders using Visual Information Fidelity
by: Durbha, Krishna Srikar, et al.
Published: (2024)
by: Durbha, Krishna Srikar, et al.
Published: (2024)
Can Generalist Vision Language Models (VLMs) Rival Specialist Medical VLMs? Benchmarking and Strategic Insights
by: Zhong, Yuan, et al.
Published: (2025)
by: Zhong, Yuan, et al.
Published: (2025)
Multi-Aperture Fusion of Transformer-Convolutional Network (MFTC-Net) for 3D Medical Image Segmentation and Visualization
by: Shabani, Siyavash, et al.
Published: (2024)
by: Shabani, Siyavash, et al.
Published: (2024)
Foundation Models Secretly Understand Neural Network Weights: Enhancing Hypernetwork Architectures with Foundation Models
by: Gu, Jeffrey, et al.
Published: (2025)
by: Gu, Jeffrey, et al.
Published: (2025)
Towards Audio Token Compression in Large Audio Language Models
by: Bhati, Saurabhchand, et al.
Published: (2025)
by: Bhati, Saurabhchand, et al.
Published: (2025)
Similar Items
-
TTRV: Test-Time Reinforcement Learning for Vision Language Models
by: Singh, Akshit, et al.
Published: (2025) -
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
by: Mirza, M. Jehanzeb, et al.
Published: (2024) -
Teaching VLMs to Localize Specific Objects from In-context Examples
by: Doveh, Sivan, et al.
Published: (2024) -
Comparison Visual Instruction Tuning
by: Lin, Wei, et al.
Published: (2024) -
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
by: Jahagirdar, Soumya, et al.
Published: (2026)