Skim then Focus: Integrating Contextual and Fine-grained Views for Repetitive Action Counting
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Zhengqi, Huang, Xiaohu, Zhou, Hao, Yao, Kun, Ding, Errui, Wang, Jingdong, Wang, Xinggang, Liu, Wenyu, Feng, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Repetitive Action Counting with Hybrid Temporal Relation Modeling
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model
di: Yao, Ziyu, et al.
Pubblicazione: (2025)
di: Yao, Ziyu, et al.
Pubblicazione: (2025)
FROSTER: Frozen CLIP Is A Strong Teacher for Open-Vocabulary Action Recognition
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
di: Hu, Bin, et al.
Pubblicazione: (2024)
di: Hu, Bin, et al.
Pubblicazione: (2024)
MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
di: Zhang, Wenrui, et al.
Pubblicazione: (2025)
di: Zhang, Wenrui, et al.
Pubblicazione: (2025)
Causality-inspired Discriminative Feature Learning in Triple Domains for Gait Recognition
di: Xiong, Haijun, et al.
Pubblicazione: (2024)
di: Xiong, Haijun, et al.
Pubblicazione: (2024)
FCA-RAC: First Cycle Annotated Repetitive Action Counting
di: Lu, Jiada, et al.
Pubblicazione: (2024)
di: Lu, Jiada, et al.
Pubblicazione: (2024)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)
XLD: A Cross-Lane Dataset for Benchmarking Novel Driving View Synthesis
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
Gait Recognition via Collaborating Discriminative and Generative Diffusion Models
di: Xiong, Haijun, et al.
Pubblicazione: (2025)
di: Xiong, Haijun, et al.
Pubblicazione: (2025)
TriC-Motion: Tri-Domain Causal Modeling Grounded Text-to-Motion Generation
di: Cao, Yiyang, et al.
Pubblicazione: (2026)
di: Cao, Yiyang, et al.
Pubblicazione: (2026)
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
di: Yao, Jingfeng, et al.
Pubblicazione: (2024)
di: Yao, Jingfeng, et al.
Pubblicazione: (2024)
FullAnno: A Data Engine for Enhancing Image Comprehension of MLLMs
di: Hao, Jing, et al.
Pubblicazione: (2024)
di: Hao, Jing, et al.
Pubblicazione: (2024)
Towards Unified Multi-granularity Text Detection with Interactive Attention
di: Wan, Xingyu, et al.
Pubblicazione: (2024)
di: Wan, Xingyu, et al.
Pubblicazione: (2024)
GaitGS: Temporal Feature Learning in Granularity and Span Dimension for Gait Recognition
di: Xiong, Haijun, et al.
Pubblicazione: (2023)
di: Xiong, Haijun, et al.
Pubblicazione: (2023)
STP4D: Spatio-Temporal-Prompt Consistent Modeling for Text-to-4D Gaussian Splatting
di: Deng, Yunze, et al.
Pubblicazione: (2025)
di: Deng, Yunze, et al.
Pubblicazione: (2025)
Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation
di: Li, Yongkang, et al.
Pubblicazione: (2024)
di: Li, Yongkang, et al.
Pubblicazione: (2024)
Polar Parametrization for Vision-based Surround-View 3D Detection
di: Chen, Shaoyu, et al.
Pubblicazione: (2022)
di: Chen, Shaoyu, et al.
Pubblicazione: (2022)
Localization-Aware Multi-Scale Representation Learning for Repetitive Action Counting
di: Wang, Sujia, et al.
Pubblicazione: (2025)
di: Wang, Sujia, et al.
Pubblicazione: (2025)
Matte Anything: Interactive Natural Image Matting with Segment Anything Models
di: Yao, Jingfeng, et al.
Pubblicazione: (2023)
di: Yao, Jingfeng, et al.
Pubblicazione: (2023)
MultiCounter: Multiple Action Agnostic Repetition Counting in Untrimmed Videos
di: Tang, Yin, et al.
Pubblicazione: (2024)
di: Tang, Yin, et al.
Pubblicazione: (2024)
Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition
di: Sun, Baoli, et al.
Pubblicazione: (2025)
di: Sun, Baoli, et al.
Pubblicazione: (2025)
OVLW-DETR: Open-Vocabulary Light-Weighted Detection Transformer
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Bridging Sequential and Contextual Features with a Dual-View of Fine-grained Core-Behaviors and Global Interest-Distribution
di: Xu, Yi, et al.
Pubblicazione: (2026)
di: Xu, Yi, et al.
Pubblicazione: (2026)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
di: Zou, Jialv, et al.
Pubblicazione: (2024)
di: Zou, Jialv, et al.
Pubblicazione: (2024)
Every Subtlety Counts: Fine-grained Person Independence Micro-Action Recognition via Distributionally Robust Optimization
di: Cui, Feng-Qi, et al.
Pubblicazione: (2025)
di: Cui, Feng-Qi, et al.
Pubblicazione: (2025)
FGCL: Fine-grained Contrastive Learning For Mandarin Stuttering Event Detection
di: Jiang, Han, et al.
Pubblicazione: (2024)
di: Jiang, Han, et al.
Pubblicazione: (2024)
Fine-grained Analysis of Non-parametric Estimation for Pairwise Learning
di: Zhou, Junyu, et al.
Pubblicazione: (2023)
di: Zhou, Junyu, et al.
Pubblicazione: (2023)
Understanding Self-Supervised Pretraining with Part-Aware Representation Learning
di: Zhu, Jie, et al.
Pubblicazione: (2023)
di: Zhu, Jie, et al.
Pubblicazione: (2023)
StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond
di: Lyu, Pengyuan, et al.
Pubblicazione: (2024)
di: Lyu, Pengyuan, et al.
Pubblicazione: (2024)
PixelHacker: Image Inpainting with Structural and Semantic Consistency
di: Xu, Ziyang, et al.
Pubblicazione: (2025)
di: Xu, Ziyang, et al.
Pubblicazione: (2025)
Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
di: Yao, Jingfeng, et al.
Pubblicazione: (2025)
di: Yao, Jingfeng, et al.
Pubblicazione: (2025)
DeltaMIL: Gated Memory Integration for Efficient and Discriminative Whole Slide Image Analysis
di: Zhu, Yueting, et al.
Pubblicazione: (2025)
di: Zhu, Yueting, et al.
Pubblicazione: (2025)
MA-Bench: Towards Fine-grained Micro-Action Understanding
di: Li, Kun, et al.
Pubblicazione: (2026)
di: Li, Kun, et al.
Pubblicazione: (2026)
Dynamic 2D Gaussians: Geometrically Accurate Radiance Fields for Dynamic Objects
di: Zhang, Shuai, et al.
Pubblicazione: (2024)
di: Zhang, Shuai, et al.
Pubblicazione: (2024)
Vine Tea Extract Enhanced the Fermentation of Skimmed Milk by Lacticaseibacillus casei
di: Kun Wang, et al.
Pubblicazione: (2024)
di: Kun Wang, et al.
Pubblicazione: (2024)
MonoFormer: One Transformer for Both Diffusion and Autoregression
di: Zhao, Chuyang, et al.
Pubblicazione: (2024)
di: Zhao, Chuyang, et al.
Pubblicazione: (2024)
Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model
di: Fan, Yingying, et al.
Pubblicazione: (2025)
di: Fan, Yingying, et al.
Pubblicazione: (2025)
IVAC-P2L: Leveraging Irregular Repetition Priors for Improving Video Action Counting
di: Wang, Hang, et al.
Pubblicazione: (2024)
di: Wang, Hang, et al.
Pubblicazione: (2024)
GIR: 3D Gaussian Inverse Rendering for Relightable Scene Factorization
di: Shi, Yahao, et al.
Pubblicazione: (2023)
di: Shi, Yahao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Repetitive Action Counting with Hybrid Temporal Relation Modeling
di: Li, Kun, et al.
Pubblicazione: (2024) -
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model
di: Yao, Ziyu, et al.
Pubblicazione: (2025) -
FROSTER: Frozen CLIP Is A Strong Teacher for Open-Vocabulary Action Recognition
di: Huang, Xiaohu, et al.
Pubblicazione: (2024) -
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
di: Hu, Bin, et al.
Pubblicazione: (2024) -
MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
di: Zhang, Wenrui, et al.
Pubblicazione: (2025)