Are Visual-Language Models Effective in Action Recognition? A Comparative Study
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ali, Mahmoud, Yang, Di, Brémond, François |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AM Flow: Adapters for Temporal Processing in Action Recognition
par: Agrawal, Tanay, et autres
Publié: (2024)
par: Agrawal, Tanay, et autres
Publié: (2024)
LAC: Latent Action Composition for Skeleton-based Action Segmentation
par: Yang, Di, et autres
Publié: (2023)
par: Yang, Di, et autres
Publié: (2023)
Temporally Propagated Masks and Bounding Boxes: Combining the Best of Both Worlds for Multi-Object Tracking
par: Stanczyk, Tomasz, et autres
Publié: (2024)
par: Stanczyk, Tomasz, et autres
Publié: (2024)
B-MoE: A Body-Part-Aware Mixture-of-Experts "All Parts Matter" Approach to Micro-Action Recognition
par: Poddar, Nishit, et autres
Publié: (2026)
par: Poddar, Nishit, et autres
Publié: (2026)
Introducing Gating and Context into Temporal Action Detection
par: Reka, Aglind, et autres
Publié: (2024)
par: Reka, Aglind, et autres
Publié: (2024)
Weakly-supervised Autism Severity Assessment in Long Videos
par: Ali, Abid, et autres
Publié: (2024)
par: Ali, Abid, et autres
Publié: (2024)
SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living
par: Sinha, Arkaprava, et autres
Publié: (2025)
par: Sinha, Arkaprava, et autres
Publié: (2025)
No Train Yet Gain: Towards Generic Multi-Object Tracking in Sports and Beyond
par: Stanczyk, Tomasz, et autres
Publié: (2025)
par: Stanczyk, Tomasz, et autres
Publié: (2025)
Loose Social-Interaction Recognition in Real-world Therapy Scenarios
par: Ali, Abid, et autres
Publié: (2024)
par: Ali, Abid, et autres
Publié: (2024)
LIA-X: Interpretable Latent Portrait Animator
par: Wang, Yaohui, et autres
Publié: (2025)
par: Wang, Yaohui, et autres
Publié: (2025)
What Matters in Autonomous Driving Anomaly Detection: A Weakly Supervised Horizon
par: Tiwari, Utkarsh, et autres
Publié: (2024)
par: Tiwari, Utkarsh, et autres
Publié: (2024)
MuSACo: Multimodal Subject-Specific Selection and Adaptation for Expression Recognition with Co-Training
par: Zeeshan, Muhammad Osama, et autres
Publié: (2025)
par: Zeeshan, Muhammad Osama, et autres
Publié: (2025)
MMIS: Multimodal Dataset for Interior Scene Visual Generation and Recognition
par: Kassab, Hozaifa, et autres
Publié: (2024)
par: Kassab, Hozaifa, et autres
Publié: (2024)
An Effective End-to-End Solution for Multimodal Action Recognition
par: Wang, Songping, et autres
Publié: (2025)
par: Wang, Songping, et autres
Publié: (2025)
SBF: An Effective Representation to Augment Skeleton for Video-based Human Action Recognition
par: Peng, Zhuoxuan, et autres
Publié: (2026)
par: Peng, Zhuoxuan, et autres
Publié: (2026)
Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition
par: Sun, Baoli, et autres
Publié: (2025)
par: Sun, Baoli, et autres
Publié: (2025)
EmoTalkingGaussian: Continuous Emotion-conditioned Talking Head Synthesis
par: Cha, Junuk, et autres
Publié: (2025)
par: Cha, Junuk, et autres
Publié: (2025)
Zero-Shot Skeleton-based Action Recognition with Dual Visual-Text Alignment
par: Kuang, Jidong, et autres
Publié: (2024)
par: Kuang, Jidong, et autres
Publié: (2024)
A Comparative Study of Continuous Sign Language Recognition Techniques
par: Alyami, Sarah, et autres
Publié: (2024)
par: Alyami, Sarah, et autres
Publié: (2024)
TIM: A Time Interval Machine for Audio-Visual Action Recognition
par: Chalk, Jacob, et autres
Publié: (2024)
par: Chalk, Jacob, et autres
Publié: (2024)
Multimodal Large Models Are Effective Action Anticipators
par: Wang, Binglu, et autres
Publié: (2025)
par: Wang, Binglu, et autres
Publié: (2025)
Anti-Forgetting Adaptation for Unsupervised Person Re-identification
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition
par: Salehi, Mohammadreza, et autres
Publié: (2024)
par: Salehi, Mohammadreza, et autres
Publié: (2024)
ScenarioCLIP: Pretrained Transferable Visual Language Models and Action-Genome Dataset for Natural Scene Analysis
par: Sinha, Advik, et autres
Publié: (2025)
par: Sinha, Advik, et autres
Publié: (2025)
Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs
par: Orjuela, Daniel Yezid Guarnizo, et autres
Publié: (2026)
par: Orjuela, Daniel Yezid Guarnizo, et autres
Publié: (2026)
Advancing Human Action Recognition with Foundation Models trained on Unlabeled Public Videos
par: Qian, Yang, et autres
Publié: (2024)
par: Qian, Yang, et autres
Publié: (2024)
A Heterogeneous Two-Stream Framework for Video Action Recognition with Comparative Fusion Analysis
par: Rahaman, Md. Afzalur, et autres
Publié: (2026)
par: Rahaman, Md. Afzalur, et autres
Publié: (2026)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
par: Gao, Mingjian, et autres
Publié: (2026)
par: Gao, Mingjian, et autres
Publié: (2026)
Grounding Language Models for Visual Entity Recognition
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition
par: Ye, Qilang, et autres
Publié: (2025)
par: Ye, Qilang, et autres
Publié: (2025)
Towards Unified Facial Action Unit Recognition Framework by Large Language Models
par: Hu, Guohong, et autres
Publié: (2024)
par: Hu, Guohong, et autres
Publié: (2024)
Noise-Tolerant Learning for Audio-Visual Action Recognition
par: Han, Haochen, et autres
Publié: (2022)
par: Han, Haochen, et autres
Publié: (2022)
Democratizing Fine-grained Visual Recognition with Large Language Models
par: Liu, Mingxuan, et autres
Publié: (2024)
par: Liu, Mingxuan, et autres
Publié: (2024)
Prompting Visual-Language Models for Dynamic Facial Expression Recognition
par: Zhao, Zengqun, et autres
Publié: (2023)
par: Zhao, Zengqun, et autres
Publié: (2023)
A Comprehensive Survey of Masked Faces: Recognition, Detection, and Unmasking
par: Mahmoud, Mohamed, et autres
Publié: (2024)
par: Mahmoud, Mohamed, et autres
Publié: (2024)
Beyond Label Semantics: Language-Guided Action Anatomy for Few-shot Action Recognition
par: Qian, Zefeng, et autres
Publié: (2025)
par: Qian, Zefeng, et autres
Publié: (2025)
ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
A Comprehensive Review of Few-shot Action Recognition
par: Wanyan, Yuyang, et autres
Publié: (2024)
par: Wanyan, Yuyang, et autres
Publié: (2024)
LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model
par: Wang, Ruosi, et autres
Publié: (2026)
par: Wang, Ruosi, et autres
Publié: (2026)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
par: Peng, Jingwei, et autres
Publié: (2025)
par: Peng, Jingwei, et autres
Publié: (2025)
Documents similaires
-
AM Flow: Adapters for Temporal Processing in Action Recognition
par: Agrawal, Tanay, et autres
Publié: (2024) -
LAC: Latent Action Composition for Skeleton-based Action Segmentation
par: Yang, Di, et autres
Publié: (2023) -
Temporally Propagated Masks and Bounding Boxes: Combining the Best of Both Worlds for Multi-Object Tracking
par: Stanczyk, Tomasz, et autres
Publié: (2024) -
B-MoE: A Body-Part-Aware Mixture-of-Experts "All Parts Matter" Approach to Micro-Action Recognition
par: Poddar, Nishit, et autres
Publié: (2026) -
Introducing Gating and Context into Temporal Action Detection
par: Reka, Aglind, et autres
Publié: (2024)