Language Model Guided Interpretable Video Action Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Ning, Zhu, Guangming, Li, HS, Zhang, Liang, Shah, Syed Afaq Ali, Bennamoun, Mohammed |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DailyDVS-200: A Comprehensive Benchmark Dataset for Event-Based Action Recognition
di: Wang, Qi, et al.
Pubblicazione: (2024)
di: Wang, Qi, et al.
Pubblicazione: (2024)
Multi-Granularity Mutual Refinement Network for Zero-Shot Learning
di: Wang, Ning, et al.
Pubblicazione: (2025)
di: Wang, Ning, et al.
Pubblicazione: (2025)
Flowmind2Digital: The First Comprehensive Flowmind Recognition and Conversion Approach
di: Liu, Huanyu, et al.
Pubblicazione: (2024)
di: Liu, Huanyu, et al.
Pubblicazione: (2024)
SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition
di: Wang, Ning, et al.
Pubblicazione: (2026)
di: Wang, Ning, et al.
Pubblicazione: (2026)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
di: Miao, Bo, et al.
Pubblicazione: (2024)
di: Miao, Bo, et al.
Pubblicazione: (2024)
Admitting Ignorance Helps the Video Question Answering Models to Answer
di: Li, Haopeng, et al.
Pubblicazione: (2025)
di: Li, Haopeng, et al.
Pubblicazione: (2025)
Prompt-guided Disentangled Representation for Action Recognition
di: Wu, Tianci, et al.
Pubblicazione: (2025)
di: Wu, Tianci, et al.
Pubblicazione: (2025)
Joint Self-Supervised Video Alignment and Action Segmentation
di: Ali, Ali Shah, et al.
Pubblicazione: (2025)
di: Ali, Ali Shah, et al.
Pubblicazione: (2025)
TSkel-Mamba: Temporal Dynamic Modeling via State Space Model for Human Skeleton-based Action Recognition
di: Liu, Yanan, et al.
Pubblicazione: (2025)
di: Liu, Yanan, et al.
Pubblicazione: (2025)
Answering from Sure to Uncertain: Uncertainty-Aware Curriculum Learning for Video Question Answering
di: Li, Haopeng, et al.
Pubblicazione: (2024)
di: Li, Haopeng, et al.
Pubblicazione: (2024)
Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation
di: Ning, Zhenhua, et al.
Pubblicazione: (2025)
di: Ning, Zhenhua, et al.
Pubblicazione: (2025)
Boosting Skeleton-based Zero-Shot Action Recognition with Training-Free Test-Time Adaptation
di: Zhu, Jingmin, et al.
Pubblicazione: (2025)
di: Zhu, Jingmin, et al.
Pubblicazione: (2025)
Kronecker Mask and Interpretive Prompts are Language-Action Video Learners
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing
di: Shabbir, Akashah, et al.
Pubblicazione: (2025)
di: Shabbir, Akashah, et al.
Pubblicazione: (2025)
Multi-Resolution Pathology-Language Pre-training Model with Text-Guided Visual Representation
di: Albastaki, Shahad, et al.
Pubblicazione: (2025)
di: Albastaki, Shahad, et al.
Pubblicazione: (2025)
A multimodal gesture recognition dataset for desktop human-computer interaction
di: Wang, Qi, et al.
Pubblicazione: (2024)
di: Wang, Qi, et al.
Pubblicazione: (2024)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
From Graphs to Gates: DNS-HyXNet, A Lightweight and Deployable Sequential Model for Real-Time DNS Tunnel Detection
di: Ali, Faraz, et al.
Pubblicazione: (2025)
di: Ali, Faraz, et al.
Pubblicazione: (2025)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
di: Taghipour, Ashkan, et al.
Pubblicazione: (2026)
di: Taghipour, Ashkan, et al.
Pubblicazione: (2026)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
di: Ye, Angen, et al.
Pubblicazione: (2025)
di: Ye, Angen, et al.
Pubblicazione: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
Video-ToC: Video Tree-of-Cue Reasoning
di: Tan, Qizhong, et al.
Pubblicazione: (2026)
di: Tan, Qizhong, et al.
Pubblicazione: (2026)
Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
di: Li, Jiaqi, et al.
Pubblicazione: (2026)
di: Li, Jiaqi, et al.
Pubblicazione: (2026)
AdaRD-key: Adaptive Relevance-Diversity Keyframe Sampling for Long-form Video understanding
di: Zhang, Xian, et al.
Pubblicazione: (2025)
di: Zhang, Xian, et al.
Pubblicazione: (2025)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
di: Wen, Junwei, et al.
Pubblicazione: (2026)
di: Wen, Junwei, et al.
Pubblicazione: (2026)
Action-Guided Attention for Video Action Anticipation
di: Tai, Tsung-Ming, et al.
Pubblicazione: (2026)
di: Tai, Tsung-Ming, et al.
Pubblicazione: (2026)
Implicit to Explicit Entropy Regularization: Benchmarking ViT Fine-tuning under Noisy Labels
di: Marrium, Maria, et al.
Pubblicazione: (2024)
di: Marrium, Maria, et al.
Pubblicazione: (2024)
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
di: Ye, Wencheng, et al.
Pubblicazione: (2025)
di: Ye, Wencheng, et al.
Pubblicazione: (2025)
DynaPURLS: Dynamic Refinement of Part-Aware Representations for Skeleton-Based Zero-Shot Action Recognition
di: Zhu, Jingmin, et al.
Pubblicazione: (2025)
di: Zhu, Jingmin, et al.
Pubblicazione: (2025)
Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition
di: Hu, Xiaodan, et al.
Pubblicazione: (2025)
di: Hu, Xiaodan, et al.
Pubblicazione: (2025)
LatentMove: Towards Complex Human Movement Video Generation
di: Taghipour, Ashkan, et al.
Pubblicazione: (2025)
di: Taghipour, Ashkan, et al.
Pubblicazione: (2025)
ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models
di: Yang, Cheng, et al.
Pubblicazione: (2026)
di: Yang, Cheng, et al.
Pubblicazione: (2026)
Sports-QA: A Large-Scale Video Question Answering Benchmark for Complex and Professional Sports
di: Li, Haopeng, et al.
Pubblicazione: (2024)
di: Li, Haopeng, et al.
Pubblicazione: (2024)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
Action-Based ADHD Diagnosis in Video
di: Li, Yichun, et al.
Pubblicazione: (2024)
di: Li, Yichun, et al.
Pubblicazione: (2024)
MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding
di: Alawode, Basit, et al.
Pubblicazione: (2026)
di: Alawode, Basit, et al.
Pubblicazione: (2026)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models
di: Sarkar, Pritam, et al.
Pubblicazione: (2025)
di: Sarkar, Pritam, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DailyDVS-200: A Comprehensive Benchmark Dataset for Event-Based Action Recognition
di: Wang, Qi, et al.
Pubblicazione: (2024) -
Multi-Granularity Mutual Refinement Network for Zero-Shot Learning
di: Wang, Ning, et al.
Pubblicazione: (2025) -
Flowmind2Digital: The First Comprehensive Flowmind Recognition and Conversion Approach
di: Liu, Huanyu, et al.
Pubblicazione: (2024) -
SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition
di: Wang, Ning, et al.
Pubblicazione: (2026) -
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
di: Miao, Bo, et al.
Pubblicazione: (2024)