Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Jiaao, Li, Shenwei, Han, Mingjie, Yin, Yifei, Song, Wenzheng, Jia, Chenghao, Lan, Man |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Frame-Difference Guided Dynamic Region Perception for CLIP Adaptation in Text-Video Retrieval
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
Semantic Relation-Enhanced CLIP Adapter for Domain Adaptive Zero-Shot Learning
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
Causal Debiasing for Visual Commonsense Reasoning
par: Zou, Jiayi, et autres
Publié: (2025)
par: Zou, Jiayi, et autres
Publié: (2025)
EventLens: Leveraging Event-Aware Pretraining and Cross-modal Linking Enhances Visual Commonsense Reasoning
par: Ma, Mingjie, et autres
Publié: (2024)
par: Ma, Mingjie, et autres
Publié: (2024)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
par: Zhang, Xintong, et autres
Publié: (2025)
par: Zhang, Xintong, et autres
Publié: (2025)
Better Reasoning with Less Data: Enhancing VLMs Through Unified Modality Scoring
par: Xu, Mingjie, et autres
Publié: (2025)
par: Xu, Mingjie, et autres
Publié: (2025)
SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks
par: Song, Zijian, et autres
Publié: (2025)
par: Song, Zijian, et autres
Publié: (2025)
Decomposing Visual Classification: Assessing Tree-Based Reasoning in VLMs
par: Elmansoury, Sary, et autres
Publié: (2025)
par: Elmansoury, Sary, et autres
Publié: (2025)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
par: Törtei, Brigitta Malagurski, et autres
Publié: (2025)
par: Törtei, Brigitta Malagurski, et autres
Publié: (2025)
A Study of Commonsense Reasoning over Visual Object Properties
par: Kolari, Abhishek, et autres
Publié: (2025)
par: Kolari, Abhishek, et autres
Publié: (2025)
ALGO: Object-Grounded Visual Commonsense Reasoning for Open-World Egocentric Action Recognition
par: Kundu, Sanjoy, et autres
Publié: (2024)
par: Kundu, Sanjoy, et autres
Publié: (2024)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
par: Chen, Kaitao, et autres
Publié: (2025)
par: Chen, Kaitao, et autres
Publié: (2025)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
par: Ge, Yuyao, et autres
Publié: (2025)
par: Ge, Yuyao, et autres
Publié: (2025)
VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
par: Khezresmaeilzadeh, Tina, et autres
Publié: (2026)
par: Khezresmaeilzadeh, Tina, et autres
Publié: (2026)
Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames
par: Ravi, Sahithya, et autres
Publié: (2025)
par: Ravi, Sahithya, et autres
Publié: (2025)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
par: Guo, Hao, et autres
Publié: (2026)
par: Guo, Hao, et autres
Publié: (2026)
Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators
par: Lunia, Harsh
Publié: (2024)
par: Lunia, Harsh
Publié: (2024)
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
par: Chen, Zhuohao, et autres
Publié: (2026)
par: Chen, Zhuohao, et autres
Publié: (2026)
NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics
par: Lan, Jian, et autres
Publié: (2026)
par: Lan, Jian, et autres
Publié: (2026)
Discovering Novel Actions from Open World Egocentric Videos with Object-Grounded Visual Commonsense Reasoning
par: Kundu, Sanjoy, et autres
Publié: (2023)
par: Kundu, Sanjoy, et autres
Publié: (2023)
HIVTP: A Training-Free Method to Improve VLMs Efficiency via Hierarchical Visual Token Pruning Using Middle-Layer-Based Importance Score
par: Xu, Jingqi, et autres
Publié: (2025)
par: Xu, Jingqi, et autres
Publié: (2025)
Explicit Context Reasoning with Supervision for Visual Tracking
par: Zeng, Fansheng, et autres
Publié: (2025)
par: Zeng, Fansheng, et autres
Publié: (2025)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
par: Tekin, Selim Furkan, et autres
Publié: (2026)
par: Tekin, Selim Furkan, et autres
Publié: (2026)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
par: Liu, Huabin, et autres
Publié: (2025)
par: Liu, Huabin, et autres
Publié: (2025)
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
par: Wang, Eileen, et autres
Publié: (2024)
par: Wang, Eileen, et autres
Publié: (2024)
Robust Disentangled Counterfactual Learning for Physical Audiovisual Commonsense Reasoning
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
VisualActBench: Can VLMs See and Act like a Human?
par: Zhang, Daoan, et autres
Publié: (2025)
par: Zhang, Daoan, et autres
Publié: (2025)
An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted Observations
par: Bai, Weimin, et autres
Publié: (2024)
par: Bai, Weimin, et autres
Publié: (2024)
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
par: Chen, Jiali, et autres
Publié: (2024)
par: Chen, Jiali, et autres
Publié: (2024)
SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios
par: Cheng, Ning, et autres
Publié: (2025)
par: Cheng, Ning, et autres
Publié: (2025)
Trustworthy Few-Shot Transfer of Medical VLMs through Split Conformal Prediction
par: Silva-Rodríguez, Julio, et autres
Publié: (2025)
par: Silva-Rodríguez, Julio, et autres
Publié: (2025)
CLGRPO: Reasoning Ability Enhancement for Small VLMs
par: Wang, Fanyi, et autres
Publié: (2025)
par: Wang, Fanyi, et autres
Publié: (2025)
Robust Egocentric Visual Attention Prediction Through Language-guided Scene Context-aware Learning
par: Park, Sungjune, et autres
Publié: (2026)
par: Park, Sungjune, et autres
Publié: (2026)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
par: Izadi, Amirmohammad, et autres
Publié: (2025)
par: Izadi, Amirmohammad, et autres
Publié: (2025)
ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
par: Zhang, Ben, et autres
Publié: (2025)
par: Zhang, Ben, et autres
Publié: (2025)
Deep Pre-Alignment for VLMs
par: Yu, Tianyu, et autres
Publié: (2026)
par: Yu, Tianyu, et autres
Publié: (2026)
MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
par: Pan, Zhenyu, et autres
Publié: (2025)
par: Pan, Zhenyu, et autres
Publié: (2025)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
par: Zhou, Kaiwen, et autres
Publié: (2023)
par: Zhou, Kaiwen, et autres
Publié: (2023)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
par: Li, Yiwei, et autres
Publié: (2026)
par: Li, Yiwei, et autres
Publié: (2026)
Documents similaires
-
Frame-Difference Guided Dynamic Region Perception for CLIP Adaptation in Text-Video Retrieval
par: Yu, Jiaao, et autres
Publié: (2025) -
Semantic Relation-Enhanced CLIP Adapter for Domain Adaptive Zero-Shot Learning
par: Yu, Jiaao, et autres
Publié: (2025) -
Causal Debiasing for Visual Commonsense Reasoning
par: Zou, Jiayi, et autres
Publié: (2025) -
EventLens: Leveraging Event-Aware Pretraining and Cross-modal Linking Enhances Visual Commonsense Reasoning
par: Ma, Mingjie, et autres
Publié: (2024) -
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)