Do Vision-Language Foundational models show Robust Visual Perception?
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chandhok, Shivam, Tandon, Pranav |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SceneGPT: A Language Model for 3D Scene Understanding
von: Chandhok, Shivam
Veröffentlicht: (2024)
von: Chandhok, Shivam
Veröffentlicht: (2024)
Response Wide Shut: Surprising Observations in Basic Vision Language Model Capabilities
von: Chandhok, Shivam, et al.
Veröffentlicht: (2024)
von: Chandhok, Shivam, et al.
Veröffentlicht: (2024)
Test-Time Consistency in Vision Language Models
von: Chou, Shih-Han, et al.
Veröffentlicht: (2025)
von: Chou, Shih-Han, et al.
Veröffentlicht: (2025)
MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)
von: Chou, Shih-Han, et al.
Veröffentlicht: (2024)
von: Chou, Shih-Han, et al.
Veröffentlicht: (2024)
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
von: Sharma, Shivam, et al.
Veröffentlicht: (2026)
von: Sharma, Shivam, et al.
Veröffentlicht: (2026)
Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection
von: Chandhok, Shivam, et al.
Veröffentlicht: (2025)
von: Chandhok, Shivam, et al.
Veröffentlicht: (2025)
Same or Not? Enhancing Visual Perception in Vision-Language Models
von: Marsili, Damiano, et al.
Veröffentlicht: (2025)
von: Marsili, Damiano, et al.
Veröffentlicht: (2025)
DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture
von: He, Xiangteng, et al.
Veröffentlicht: (2025)
von: He, Xiangteng, et al.
Veröffentlicht: (2025)
Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models
von: Waseda, Futa, et al.
Veröffentlicht: (2025)
von: Waseda, Futa, et al.
Veröffentlicht: (2025)
Do Vision-Language Models Really Understand Visual Language?
von: Hou, Yifan, et al.
Veröffentlicht: (2024)
von: Hou, Yifan, et al.
Veröffentlicht: (2024)
ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes
von: Kumar, Shivam
Veröffentlicht: (2026)
von: Kumar, Shivam
Veröffentlicht: (2026)
Do Vision-Language Models Understand Visual Persuasiveness?
von: Park, Gyuwon
Veröffentlicht: (2025)
von: Park, Gyuwon
Veröffentlicht: (2025)
Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR
von: Li, Zhenyang, et al.
Veröffentlicht: (2024)
von: Li, Zhenyang, et al.
Veröffentlicht: (2024)
TransNeXt: Robust Foveal Visual Perception for Vision Transformers
von: Shi, Dai
Veröffentlicht: (2023)
von: Shi, Dai
Veröffentlicht: (2023)
Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment
von: Li, Yuan, et al.
Veröffentlicht: (2025)
von: Li, Yuan, et al.
Veröffentlicht: (2025)
Mirage: Unveiling Hidden Artifacts in Synthetic Images with Large Vision-Language Models
von: Sharma, Pranav, et al.
Veröffentlicht: (2025)
von: Sharma, Pranav, et al.
Veröffentlicht: (2025)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
von: Mushkani, Rashid
Veröffentlicht: (2025)
von: Mushkani, Rashid
Veröffentlicht: (2025)
Refining Skewed Perceptions in Vision-Language Contrastive Models through Visual Representations
von: Dai, Haocheng, et al.
Veröffentlicht: (2024)
von: Dai, Haocheng, et al.
Veröffentlicht: (2024)
Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation
von: Hoche, Joseph, et al.
Veröffentlicht: (2026)
von: Hoche, Joseph, et al.
Veröffentlicht: (2026)
Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions
von: Sun, Xiaoxiao, et al.
Veröffentlicht: (2026)
von: Sun, Xiaoxiao, et al.
Veröffentlicht: (2026)
Temporal-Guided Visual Foundation Models for Event-Based Vision
von: Xia, Ruihao, et al.
Veröffentlicht: (2025)
von: Xia, Ruihao, et al.
Veröffentlicht: (2025)
DynamicVis: Dynamic Visual Perception for Efficient Remote Sensing Foundation Models
von: Chen, Keyan, et al.
Veröffentlicht: (2025)
von: Chen, Keyan, et al.
Veröffentlicht: (2025)
UAV-VLN: End-to-End Vision Language guided Navigation for UAVs
von: Saxena, Pranav, et al.
Veröffentlicht: (2025)
von: Saxena, Pranav, et al.
Veröffentlicht: (2025)
ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models
von: Saxena, Pranav, et al.
Veröffentlicht: (2025)
von: Saxena, Pranav, et al.
Veröffentlicht: (2025)
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?
von: Liu, Qing'an, et al.
Veröffentlicht: (2026)
von: Liu, Qing'an, et al.
Veröffentlicht: (2026)
Visual Perception by Large Language Model's Weights
von: Ma, Feipeng, et al.
Veröffentlicht: (2024)
von: Ma, Feipeng, et al.
Veröffentlicht: (2024)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
von: Shan, Haozhe, et al.
Veröffentlicht: (2026)
von: Shan, Haozhe, et al.
Veröffentlicht: (2026)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
von: Duan, Yuchen, et al.
Veröffentlicht: (2024)
von: Duan, Yuchen, et al.
Veröffentlicht: (2024)
Robust SAM: On the Adversarial Robustness of Vision Foundation Models
von: Long, Jiahuan, et al.
Veröffentlicht: (2025)
von: Long, Jiahuan, et al.
Veröffentlicht: (2025)
Do You See What I Say? Generalizable Deepfake Detection based on Visual Speech Recognition
von: Bora, Maheswar, et al.
Veröffentlicht: (2025)
von: Bora, Maheswar, et al.
Veröffentlicht: (2025)
Test-Time Canonicalization by Foundation Models for Robust Perception
von: Singhal, Utkarsh, et al.
Veröffentlicht: (2025)
von: Singhal, Utkarsh, et al.
Veröffentlicht: (2025)
Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs
von: Orjuela, Daniel Yezid Guarnizo, et al.
Veröffentlicht: (2026)
von: Orjuela, Daniel Yezid Guarnizo, et al.
Veröffentlicht: (2026)
AD-SAM: Fine-Tuning the Segment Anything Vision Foundation Model for Autonomous Driving Perception
von: Camarena, Mario, et al.
Veröffentlicht: (2025)
von: Camarena, Mario, et al.
Veröffentlicht: (2025)
VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
von: Kamoi, Ryo, et al.
Veröffentlicht: (2024)
von: Kamoi, Ryo, et al.
Veröffentlicht: (2024)
AR as an Evaluation Playground: Bridging Metrics and Visual Perception of Computer Vision Models
von: Ganj, Ashkan, et al.
Veröffentlicht: (2025)
von: Ganj, Ashkan, et al.
Veröffentlicht: (2025)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
von: Liu, Yuqi, et al.
Veröffentlicht: (2025)
von: Liu, Yuqi, et al.
Veröffentlicht: (2025)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
von: Wang, Zeyu, et al.
Veröffentlicht: (2025)
von: Wang, Zeyu, et al.
Veröffentlicht: (2025)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
Adapting Vision Foundation Models for Robust Cloud Segmentation in Remote Sensing Images
von: Zou, Xuechao, et al.
Veröffentlicht: (2024)
von: Zou, Xuechao, et al.
Veröffentlicht: (2024)
Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs
von: Kanade, Aditya, et al.
Veröffentlicht: (2025)
von: Kanade, Aditya, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SceneGPT: A Language Model for 3D Scene Understanding
von: Chandhok, Shivam
Veröffentlicht: (2024) -
Response Wide Shut: Surprising Observations in Basic Vision Language Model Capabilities
von: Chandhok, Shivam, et al.
Veröffentlicht: (2024) -
Test-Time Consistency in Vision Language Models
von: Chou, Shih-Han, et al.
Veröffentlicht: (2025) -
MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)
von: Chou, Shih-Han, et al.
Veröffentlicht: (2024) -
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
von: Sharma, Shivam, et al.
Veröffentlicht: (2026)