MultiCounter: Multiple Action Agnostic Repetition Counting in Untrimmed Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Yin, Luo, Wei, Zhang, Jinrui, Huang, Wei, Jing, Ruihai, Zhang, Deyu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Level LVLM Guidance for Untrimmed Video Action Recognition
par: Peng, Liyang, et autres
Publié: (2025)
par: Peng, Liyang, et autres
Publié: (2025)
Adapting Short-Term Transformers for Action Detection in Untrimmed Videos
par: Yang, Min, et autres
Publié: (2023)
par: Yang, Min, et autres
Publié: (2023)
Multi-Stage Boundary-Aware Transformer Network for Action Segmentation in Untrimmed Surgical Videos
par: Shuvo, Rezowan, et autres
Publié: (2025)
par: Shuvo, Rezowan, et autres
Publié: (2025)
FCA-RAC: First Cycle Annotated Repetitive Action Counting
par: Lu, Jiada, et autres
Publié: (2024)
par: Lu, Jiada, et autres
Publié: (2024)
Localization-Aware Multi-Scale Representation Learning for Repetitive Action Counting
par: Wang, Sujia, et autres
Publié: (2025)
par: Wang, Sujia, et autres
Publié: (2025)
Explainable Forensics of Manipulated Segments in Untrimmed Long Videos
par: Feng, Yue, et autres
Publié: (2026)
par: Feng, Yue, et autres
Publié: (2026)
EdgeOAR: Real-time Online Action Recognition On Edge Devices
par: Luo, Wei, et autres
Publié: (2024)
par: Luo, Wei, et autres
Publié: (2024)
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model
par: Yao, Ziyu, et autres
Publié: (2025)
par: Yao, Ziyu, et autres
Publié: (2025)
Localizing Moments of Actions in Untrimmed Videos of Infants with Autism Spectrum Disorder
par: Helvaci, Halil Ismail, et autres
Publié: (2024)
par: Helvaci, Halil Ismail, et autres
Publié: (2024)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
What, when, and where? -- Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated Instructions
par: Chen, Brian, et autres
Publié: (2023)
par: Chen, Brian, et autres
Publié: (2023)
Repetitive Action Counting with Hybrid Temporal Relation Modeling
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos
par: Sinha, Arkaprava, et autres
Publié: (2025)
par: Sinha, Arkaprava, et autres
Publié: (2025)
Advancements in Repetitive Action Counting: Joint-Based PoseRAC Model With Improved Performance
par: Chen, Haodong, et autres
Publié: (2023)
par: Chen, Haodong, et autres
Publié: (2023)
MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
par: Feng, Yue, et autres
Publié: (2025)
par: Feng, Yue, et autres
Publié: (2025)
ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
Skim then Focus: Integrating Contextual and Fine-grained Views for Repetitive Action Counting
par: Zhao, Zhengqi, et autres
Publié: (2024)
par: Zhao, Zhengqi, et autres
Publié: (2024)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
par: Zhang, Deyu, et autres
Publié: (2025)
par: Zhang, Deyu, et autres
Publié: (2025)
IVAC-P2L: Leveraging Irregular Repetition Priors for Improving Video Action Counting
par: Wang, Hang, et autres
Publié: (2024)
par: Wang, Hang, et autres
Publié: (2024)
GMFL-Net: A Global Multi-geometric Feature Learning Network for Repetitive Action Counting
par: Li, Jun, et autres
Publié: (2024)
par: Li, Jun, et autres
Publié: (2024)
Mitigating Error Accumulation in Continuous Navigation via Memory-Augmented Kalman Filtering
par: Tang, Yin, et autres
Publié: (2026)
par: Tang, Yin, et autres
Publié: (2026)
CountFormer: A Transformer Framework for Learning Visual Repetition and Structure in Class-Agnostic Object Counting
par: Hossain, Md Tanvir, et autres
Publié: (2025)
par: Hossain, Md Tanvir, et autres
Publié: (2025)
Every Shot Counts: Using Exemplars for Repetition Counting in Videos
par: Sinha, Saptarshi, et autres
Publié: (2024)
par: Sinha, Saptarshi, et autres
Publié: (2024)
Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting
par: Zhang, Xiaowen, et autres
Publié: (2026)
par: Zhang, Xiaowen, et autres
Publié: (2026)
VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?
par: Wang, Zeqing, et autres
Publié: (2025)
par: Wang, Zeqing, et autres
Publié: (2025)
Cutup and Detect: Human Fall Detection on Cutup Untrimmed Videos Using a Large Foundational Video Understanding Model
par: Grutschus, Till, et autres
Publié: (2024)
par: Grutschus, Till, et autres
Publié: (2024)
DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving
par: Shi, Chen, et autres
Publié: (2026)
par: Shi, Chen, et autres
Publié: (2026)
MobiFuse: A High-Precision On-device Depth Perception System with Multi-Data Fusion
par: Zhang, Jinrui, et autres
Publié: (2024)
par: Zhang, Jinrui, et autres
Publié: (2024)
Mamba-OTR: a Mamba-based Solution for Online Take and Release Detection from Untrimmed Egocentric Video
par: Catinello, Alessandro Sebastiano, et autres
Publié: (2025)
par: Catinello, Alessandro Sebastiano, et autres
Publié: (2025)
FocalCount: Towards Class-Count Imbalance in Class-Agnostic Counting
par: Zhu, Huilin, et autres
Publié: (2025)
par: Zhu, Huilin, et autres
Publié: (2025)
Modeling Multiple Normal Action Representations for Error Detection in Procedural Tasks
par: Huang, Wei-Jin, et autres
Publié: (2025)
par: Huang, Wei-Jin, et autres
Publié: (2025)
A Recipe for CAC: Mosaic-based Generalized Loss for Improved Class-Agnostic Counting
par: Chou, Tsung-Han, et autres
Publié: (2024)
par: Chou, Tsung-Han, et autres
Publié: (2024)
HabitAction: A Video Dataset for Human Habitual Behavior Recognition
par: Li, Hongwu, et autres
Publié: (2024)
par: Li, Hongwu, et autres
Publié: (2024)
TIIF-Bench: How Does Your T2I Model Follow Your Instructions?
par: Wei, Xinyu, et autres
Publié: (2025)
par: Wei, Xinyu, et autres
Publié: (2025)
Multi-Granularity Hand Action Detection
par: Zhe, Ting, et autres
Publié: (2023)
par: Zhe, Ting, et autres
Publié: (2023)
LineCounter: Learning Handwritten Text Line Segmentation by Counting
par: Li, Deng, et autres
Publié: (2021)
par: Li, Deng, et autres
Publié: (2021)
OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024)
par: Dwibedi, Debidatta, et autres
Publié: (2024)
Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors
par: Wang, Xiangchen, et autres
Publié: (2025)
par: Wang, Xiangchen, et autres
Publié: (2025)
MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition
par: Wei, Xinyu, et autres
Publié: (2025)
par: Wei, Xinyu, et autres
Publié: (2025)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
par: Tang, Yolo Yunlong, et autres
Publié: (2023)
par: Tang, Yolo Yunlong, et autres
Publié: (2023)
Documents similaires
-
Multi-Level LVLM Guidance for Untrimmed Video Action Recognition
par: Peng, Liyang, et autres
Publié: (2025) -
Adapting Short-Term Transformers for Action Detection in Untrimmed Videos
par: Yang, Min, et autres
Publié: (2023) -
Multi-Stage Boundary-Aware Transformer Network for Action Segmentation in Untrimmed Surgical Videos
par: Shuvo, Rezowan, et autres
Publié: (2025) -
FCA-RAC: First Cycle Annotated Repetitive Action Counting
par: Lu, Jiada, et autres
Publié: (2024) -
Localization-Aware Multi-Scale Representation Learning for Repetitive Action Counting
par: Wang, Sujia, et autres
Publié: (2025)