Efficient Spatial-Temporal Modeling for Real-Time Video Analysis: A Unified Framework for Action Recognition and Object Tracking
Fuente:
arXiv
Salvato in:
| Autore principale: | John, Shahla |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
di: Cao, Tri, et al.
Pubblicazione: (2026)
di: Cao, Tri, et al.
Pubblicazione: (2026)
Temporal Alignment-Free Video Matching for Few-shot Action Recognition
di: Lee, SuBeen, et al.
Pubblicazione: (2025)
di: Lee, SuBeen, et al.
Pubblicazione: (2025)
PolypSegTrack: Unified Foundation Model for Colonoscopy Video Analysis
di: Choudhuri, Anwesa, et al.
Pubblicazione: (2025)
di: Choudhuri, Anwesa, et al.
Pubblicazione: (2025)
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
di: Lin, Yijing, et al.
Pubblicazione: (2025)
di: Lin, Yijing, et al.
Pubblicazione: (2025)
UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
di: Ma, Yinchao, et al.
Pubblicazione: (2025)
di: Ma, Yinchao, et al.
Pubblicazione: (2025)
One-Shot Action Recognition via Multi-Scale Spatial-Temporal Skeleton Matching
di: Yang, Siyuan, et al.
Pubblicazione: (2023)
di: Yang, Siyuan, et al.
Pubblicazione: (2023)
LSTC-MDA: A Unified Framework for Long-Short Term Temporal Convolution and Mixed Data Augmentation in Skeleton-Based Action Recognition
di: Ding, Feng, et al.
Pubblicazione: (2025)
di: Ding, Feng, et al.
Pubblicazione: (2025)
Temporal vs. Spatial: Comparing DINOv3 and V-JEPA2 Feature Representations for Video Action Analysis
di: Kodathala, Sai Varun, et al.
Pubblicazione: (2025)
di: Kodathala, Sai Varun, et al.
Pubblicazione: (2025)
EITNet: An IoT-Enhanced Framework for Real-Time Basketball Action Recognition
di: Liu, Jingyu, et al.
Pubblicazione: (2024)
di: Liu, Jingyu, et al.
Pubblicazione: (2024)
Temporal and Spatial Feature Fusion Framework for Dynamic Micro Expression Recognition
di: Liu, Feng, et al.
Pubblicazione: (2025)
di: Liu, Feng, et al.
Pubblicazione: (2025)
UASTrack: A Unified Adaptive Selection Framework with Modality-Customization in Single Object Tracking
di: Wang, He, et al.
Pubblicazione: (2025)
di: Wang, He, et al.
Pubblicazione: (2025)
Real-Time Manipulation Action Recognition with a Factorized Graph Sequence Encoder
di: Erdogan, Enes, et al.
Pubblicazione: (2025)
di: Erdogan, Enes, et al.
Pubblicazione: (2025)
Exploring Explainability in Video Action Recognition
di: Saha, Avinab, et al.
Pubblicazione: (2024)
di: Saha, Avinab, et al.
Pubblicazione: (2024)
Fire on Motion: Optimizing Video Pass-bands for Efficient Spiking Action Recognition
di: Ye, Shuhan, et al.
Pubblicazione: (2026)
di: Ye, Shuhan, et al.
Pubblicazione: (2026)
CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
di: Fiastre, Gabriel, et al.
Pubblicazione: (2025)
di: Fiastre, Gabriel, et al.
Pubblicazione: (2025)
RealWonder: Real-Time Physical Action-Conditioned Video Generation
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
Efficient Event-Based Object Detection: A Hybrid Neural Network with Spatial and Temporal Attention
di: Ahmed, Soikat Hasan, et al.
Pubblicazione: (2024)
di: Ahmed, Soikat Hasan, et al.
Pubblicazione: (2024)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
di: Xu, Huilin, et al.
Pubblicazione: (2025)
di: Xu, Huilin, et al.
Pubblicazione: (2025)
A Survey on Backbones for Deep Video Action Recognition
di: Tang, Zixuan, et al.
Pubblicazione: (2024)
di: Tang, Zixuan, et al.
Pubblicazione: (2024)
STAA: Spatio-Temporal Attention Attribution for Real-Time Interpreting Transformer-based Video Models
di: Wang, Zerui, et al.
Pubblicazione: (2024)
di: Wang, Zerui, et al.
Pubblicazione: (2024)
YOLO26: An Analysis of NMS-Free End to End Framework for Real-Time Object Detection
di: Chakrabarty, Sudip
Pubblicazione: (2026)
di: Chakrabarty, Sudip
Pubblicazione: (2026)
Real-Time Human Action Recognition on Embedded Platforms
di: Wang, Ruiqi, et al.
Pubblicazione: (2024)
di: Wang, Ruiqi, et al.
Pubblicazione: (2024)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
di: Yuan, Yuqian, et al.
Pubblicazione: (2024)
di: Yuan, Yuqian, et al.
Pubblicazione: (2024)
Towards Efficient Real-Time Video Motion Transfer via Generative Time Series Modeling
di: Haque, Tasmiah, et al.
Pubblicazione: (2025)
di: Haque, Tasmiah, et al.
Pubblicazione: (2025)
SV3.3B: A Sports Video Understanding Model for Action Recognition
di: Kodathala, Sai Varun, et al.
Pubblicazione: (2025)
di: Kodathala, Sai Varun, et al.
Pubblicazione: (2025)
EPAM-Net: An Efficient Pose-driven Attention-guided Multimodal Network for Video Action Recognition
di: Abdelkawy, Ahmed, et al.
Pubblicazione: (2024)
di: Abdelkawy, Ahmed, et al.
Pubblicazione: (2024)
Improving Skeleton-based Action Recognition with Interactive Object Information
di: Wen, Hao, et al.
Pubblicazione: (2025)
di: Wen, Hao, et al.
Pubblicazione: (2025)
Skeleton-Based Action Recognition with Spatial-Structural Graph Convolution
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
di: Wang, Jingyao, et al.
Pubblicazione: (2024)
Exploring Ordinal Bias in Action Recognition for Instructional Videos
di: Kim, Joochan, et al.
Pubblicazione: (2025)
di: Kim, Joochan, et al.
Pubblicazione: (2025)
SkateboardAI: The Coolest Video Action Recognition for Skateboarding
di: Chen, Hanxiao
Pubblicazione: (2023)
di: Chen, Hanxiao
Pubblicazione: (2023)
Flatten: Video Action Recognition is an Image Classification task
di: Chen, Junlin, et al.
Pubblicazione: (2024)
di: Chen, Junlin, et al.
Pubblicazione: (2024)
Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision
di: Zhang, Chenshuang, et al.
Pubblicazione: (2025)
di: Zhang, Chenshuang, et al.
Pubblicazione: (2025)
Highly Efficient and Unsupervised Framework for Moving Object Detection in Satellite Videos
di: Xiao, C., et al.
Pubblicazione: (2024)
di: Xiao, C., et al.
Pubblicazione: (2024)
Efficient Egocentric Action Recognition with Multimodal Data
di: Calzavara, Marco, et al.
Pubblicazione: (2025)
di: Calzavara, Marco, et al.
Pubblicazione: (2025)
Rethinking Video Human-Object Interaction: Set Prediction over Time for Unified Detection and Anticipation
di: Luo, Yuanhao, et al.
Pubblicazione: (2026)
di: Luo, Yuanhao, et al.
Pubblicazione: (2026)
7DGS: Unified Spatial-Temporal-Angular Gaussian Splatting
di: Gao, Zhongpai, et al.
Pubblicazione: (2025)
di: Gao, Zhongpai, et al.
Pubblicazione: (2025)
Action Recognition in Real-World Ambient Assisted Living Environment
di: Zakka, Vincent Gbouna, et al.
Pubblicazione: (2025)
di: Zakka, Vincent Gbouna, et al.
Pubblicazione: (2025)
Collaborative Learning for 3D Hand-Object Reconstruction and Compositional Action Recognition from Egocentric RGB Videos Using Superquadrics
di: Tse, Tze Ho Elden, et al.
Pubblicazione: (2025)
di: Tse, Tze Ho Elden, et al.
Pubblicazione: (2025)
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
di: Zhen, Yihao, et al.
Pubblicazione: (2025)
di: Zhen, Yihao, et al.
Pubblicazione: (2025)
Context-Aware Temporal Embedding of Objects in Video Data
di: Farhan, Ahnaf, et al.
Pubblicazione: (2024)
di: Farhan, Ahnaf, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
di: Cao, Tri, et al.
Pubblicazione: (2026) -
Temporal Alignment-Free Video Matching for Few-shot Action Recognition
di: Lee, SuBeen, et al.
Pubblicazione: (2025) -
PolypSegTrack: Unified Foundation Model for Colonoscopy Video Analysis
di: Choudhuri, Anwesa, et al.
Pubblicazione: (2025) -
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
di: Lin, Yijing, et al.
Pubblicazione: (2025) -
UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
di: Ma, Yinchao, et al.
Pubblicazione: (2025)