Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators
Fuente:
arXiv
Salvato in:
| Autore principale: | Lunia, Harsh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IndicSTR12: A Dataset for Indic Scene Text Recognition
di: Lunia, Harsh, et al.
Pubblicazione: (2024)
di: Lunia, Harsh, et al.
Pubblicazione: (2024)
Multi-model learning by sequential reading of untrimmed videos for action recognition
di: Kamiya, Kodai, et al.
Pubblicazione: (2024)
di: Kamiya, Kodai, et al.
Pubblicazione: (2024)
Decomposing Visual Classification: Assessing Tree-Based Reasoning in VLMs
di: Elmansoury, Sary, et al.
Pubblicazione: (2025)
di: Elmansoury, Sary, et al.
Pubblicazione: (2025)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs
di: Ballout, Mohamad, et al.
Pubblicazione: (2025)
di: Ballout, Mohamad, et al.
Pubblicazione: (2025)
Can masking background and object reduce static bias for zero-shot action recognition?
di: Fukuzawa, Takumi, et al.
Pubblicazione: (2025)
di: Fukuzawa, Takumi, et al.
Pubblicazione: (2025)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
di: Berman, Shmuel, et al.
Pubblicazione: (2025)
di: Berman, Shmuel, et al.
Pubblicazione: (2025)
VisualActBench: Can VLMs See and Act like a Human?
di: Zhang, Daoan, et al.
Pubblicazione: (2025)
di: Zhang, Daoan, et al.
Pubblicazione: (2025)
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?
di: Park, Simon, et al.
Pubblicazione: (2025)
di: Park, Simon, et al.
Pubblicazione: (2025)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
di: Guo, Hao, et al.
Pubblicazione: (2026)
di: Guo, Hao, et al.
Pubblicazione: (2026)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
di: Ge, Yuyao, et al.
Pubblicazione: (2025)
di: Ge, Yuyao, et al.
Pubblicazione: (2025)
VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
di: Khezresmaeilzadeh, Tina, et al.
Pubblicazione: (2026)
di: Khezresmaeilzadeh, Tina, et al.
Pubblicazione: (2026)
Contrastive learning-based video quality assessment-jointed video vision transformer for video recognition
di: Sun, Jian, et al.
Pubblicazione: (2026)
di: Sun, Jian, et al.
Pubblicazione: (2026)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
di: Zhang, Xintong, et al.
Pubblicazione: (2025)
di: Zhang, Xintong, et al.
Pubblicazione: (2025)
Can VLMs Recall Factual Associations From Visual References?
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
Egocentric zone-aware action recognition across environments
di: Peirone, Simone Alberto, et al.
Pubblicazione: (2024)
di: Peirone, Simone Alberto, et al.
Pubblicazione: (2024)
CLGRPO: Reasoning Ability Enhancement for Small VLMs
di: Wang, Fanyi, et al.
Pubblicazione: (2025)
di: Wang, Fanyi, et al.
Pubblicazione: (2025)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
di: Tan, Zhangyun, et al.
Pubblicazione: (2026)
di: Tan, Zhangyun, et al.
Pubblicazione: (2026)
iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs
di: Mayer, Julius, et al.
Pubblicazione: (2025)
di: Mayer, Julius, et al.
Pubblicazione: (2025)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
di: Yu, Jiaao, et al.
Pubblicazione: (2025)
di: Yu, Jiaao, et al.
Pubblicazione: (2025)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
di: Chen, Kaitao, et al.
Pubblicazione: (2025)
di: Chen, Kaitao, et al.
Pubblicazione: (2025)
Can VLMs Reason Robustly? A Neuro-Symbolic Investigation
di: Chen, Weixin, et al.
Pubblicazione: (2026)
di: Chen, Weixin, et al.
Pubblicazione: (2026)
How Auxiliary Reasoning Unleashes GUI Grounding in VLMs
di: Li, Weiming, et al.
Pubblicazione: (2025)
di: Li, Weiming, et al.
Pubblicazione: (2025)
ADHD diagnosis based on action characteristics recorded in videos using machine learning
di: Li, Yichun, et al.
Pubblicazione: (2024)
di: Li, Yichun, et al.
Pubblicazione: (2024)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
di: Li, Yiwei, et al.
Pubblicazione: (2026)
di: Li, Yiwei, et al.
Pubblicazione: (2026)
Test-Time Reasoning Through Visual Human Preferences with VLMs and Soft Rewards
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
di: Izadi, Amirmohammad, et al.
Pubblicazione: (2025)
di: Izadi, Amirmohammad, et al.
Pubblicazione: (2025)
[De|Re]constructing VLMs' Reasoning in Counting
di: Alghisi, Simone, et al.
Pubblicazione: (2025)
di: Alghisi, Simone, et al.
Pubblicazione: (2025)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
Emotion recognition in talking-face videos using persistent entropy and neural networks
di: Paluzo-Hidalgo, Eduardo, et al.
Pubblicazione: (2021)
di: Paluzo-Hidalgo, Eduardo, et al.
Pubblicazione: (2021)
CFE-PPAR: Compression-friendly encryption for privacy-preserving action recognition leveraging video transformers
di: Lin, Haiwei, et al.
Pubblicazione: (2026)
di: Lin, Haiwei, et al.
Pubblicazione: (2026)
ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs
di: Huang, Irene, et al.
Pubblicazione: (2024)
di: Huang, Irene, et al.
Pubblicazione: (2024)
TIR-Flow: Active Video Search and Reasoning with Frozen VLMs
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
di: Lee, Naeun, et al.
Pubblicazione: (2026)
di: Lee, Naeun, et al.
Pubblicazione: (2026)
Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs
di: Nasser, Abdelmoamen, et al.
Pubblicazione: (2026)
di: Nasser, Abdelmoamen, et al.
Pubblicazione: (2026)
Deep learning for action spotting in association football videos
di: Giancola, Silvio, et al.
Pubblicazione: (2024)
di: Giancola, Silvio, et al.
Pubblicazione: (2024)
Deep kernel video approximation for unsupervised action segmentation
di: Pintea, Silvia L., et al.
Pubblicazione: (2026)
di: Pintea, Silvia L., et al.
Pubblicazione: (2026)
Caption This, Reason That: VLMs Caught in the Middle
di: Weng, Zihan, et al.
Pubblicazione: (2025)
di: Weng, Zihan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
IndicSTR12: A Dataset for Indic Scene Text Recognition
di: Lunia, Harsh, et al.
Pubblicazione: (2024) -
Multi-model learning by sequential reading of untrimmed videos for action recognition
di: Kamiya, Kodai, et al.
Pubblicazione: (2024) -
Decomposing Visual Classification: Assessing Tree-Based Reasoning in VLMs
di: Elmansoury, Sary, et al.
Pubblicazione: (2025) -
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025) -
Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs
di: Ballout, Mohamad, et al.
Pubblicazione: (2025)