CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Yao, Ziyu, Cheng, Xuxin, Huang, Zhiqi, Li, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
di: Yao, Ziyu, et al.
Pubblicazione: (2024)
di: Yao, Ziyu, et al.
Pubblicazione: (2024)
Repetitive Action Counting with Hybrid Temporal Relation Modeling
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
Localization-Aware Multi-Scale Representation Learning for Repetitive Action Counting
di: Wang, Sujia, et al.
Pubblicazione: (2025)
di: Wang, Sujia, et al.
Pubblicazione: (2025)
Skim then Focus: Integrating Contextual and Fine-grained Views for Repetitive Action Counting
di: Zhao, Zhengqi, et al.
Pubblicazione: (2024)
di: Zhao, Zhengqi, et al.
Pubblicazione: (2024)
MultiCounter: Multiple Action Agnostic Repetition Counting in Untrimmed Videos
di: Tang, Yin, et al.
Pubblicazione: (2024)
di: Tang, Yin, et al.
Pubblicazione: (2024)
FCA-RAC: First Cycle Annotated Repetitive Action Counting
di: Lu, Jiada, et al.
Pubblicazione: (2024)
di: Lu, Jiada, et al.
Pubblicazione: (2024)
Advancements in Repetitive Action Counting: Joint-Based PoseRAC Model With Improved Performance
di: Chen, Haodong, et al.
Pubblicazione: (2023)
di: Chen, Haodong, et al.
Pubblicazione: (2023)
IVAC-P2L: Leveraging Irregular Repetition Priors for Improving Video Action Counting
di: Wang, Hang, et al.
Pubblicazione: (2024)
di: Wang, Hang, et al.
Pubblicazione: (2024)
GMFL-Net: A Global Multi-geometric Feature Learning Network for Repetitive Action Counting
di: Li, Jun, et al.
Pubblicazione: (2024)
di: Li, Jun, et al.
Pubblicazione: (2024)
Every Shot Counts: Using Exemplars for Repetition Counting in Videos
di: Sinha, Saptarshi, et al.
Pubblicazione: (2024)
di: Sinha, Saptarshi, et al.
Pubblicazione: (2024)
FocalCount: Towards Class-Count Imbalance in Class-Agnostic Counting
di: Zhu, Huilin, et al.
Pubblicazione: (2025)
di: Zhu, Huilin, et al.
Pubblicazione: (2025)
Count Anything
di: Lei, Mengqi, et al.
Pubblicazione: (2026)
di: Lei, Mengqi, et al.
Pubblicazione: (2026)
CountEx: Fine-Grained Counting via Exemplars and Exclusion
di: Huang, Yifeng, et al.
Pubblicazione: (2026)
di: Huang, Yifeng, et al.
Pubblicazione: (2026)
Every Subtlety Counts: Fine-grained Person Independence Micro-Action Recognition via Distributionally Robust Optimization
di: Cui, Feng-Qi, et al.
Pubblicazione: (2025)
di: Cui, Feng-Qi, et al.
Pubblicazione: (2025)
Efficient Action Counting with Dynamic Queries
di: Ma, Xiaoxuan, et al.
Pubblicazione: (2024)
di: Ma, Xiaoxuan, et al.
Pubblicazione: (2024)
CountFormer: A Transformer Framework for Learning Visual Repetition and Structure in Class-Agnostic Object Counting
di: Hossain, Md Tanvir, et al.
Pubblicazione: (2025)
di: Hossain, Md Tanvir, et al.
Pubblicazione: (2025)
AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
di: Lu, Lidong, et al.
Pubblicazione: (2025)
di: Lu, Lidong, et al.
Pubblicazione: (2025)
CountFormer: Multi-View Crowd Counting Transformer
di: Mo, Hong, et al.
Pubblicazione: (2024)
di: Mo, Hong, et al.
Pubblicazione: (2024)
CountZES: Counting via Zero-Shot Exemplar Selection
di: Siddiqui, Muhammad Ibraheem, et al.
Pubblicazione: (2025)
di: Siddiqui, Muhammad Ibraheem, et al.
Pubblicazione: (2025)
Count What You Want: Exemplar Identification and Few-shot Counting of Human Actions in the Wild
di: Huang, Yifeng, et al.
Pubblicazione: (2023)
di: Huang, Yifeng, et al.
Pubblicazione: (2023)
Understanding Counting Mechanisms in Large Language and Vision-Language Models
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
Point, Segment and Count: A Generalized Framework for Object Counting
di: Huang, Zhizhong, et al.
Pubblicazione: (2023)
di: Huang, Zhizhong, et al.
Pubblicazione: (2023)
CountSteer: Steering Attention for Object Counting in Diffusion Models
di: Boo, Hyemin, et al.
Pubblicazione: (2025)
di: Boo, Hyemin, et al.
Pubblicazione: (2025)
Counting Hallucinations in Diffusion Models
di: Fu, Shuai, et al.
Pubblicazione: (2025)
di: Fu, Shuai, et al.
Pubblicazione: (2025)
Rethinking Cell Counting Methods: Decoupling Counting and Localization
di: Zheng, Zixuan, et al.
Pubblicazione: (2025)
di: Zheng, Zixuan, et al.
Pubblicazione: (2025)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
di: Wang, Dongkai, et al.
Pubblicazione: (2024)
di: Wang, Dongkai, et al.
Pubblicazione: (2024)
CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models
di: Alzahrani, Reem, et al.
Pubblicazione: (2026)
di: Alzahrani, Reem, et al.
Pubblicazione: (2026)
STAT: Towards Generalizable Temporal Action Localization
di: Liu, Yangcen, et al.
Pubblicazione: (2024)
di: Liu, Yangcen, et al.
Pubblicazione: (2024)
YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
di: Zeng, Guanning, et al.
Pubblicazione: (2025)
di: Zeng, Guanning, et al.
Pubblicazione: (2025)
OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos
di: Dwibedi, Debidatta, et al.
Pubblicazione: (2024)
di: Dwibedi, Debidatta, et al.
Pubblicazione: (2024)
LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model
di: Wang, Ruosi, et al.
Pubblicazione: (2026)
di: Wang, Ruosi, et al.
Pubblicazione: (2026)
CountGD++: Generalized Prompting for Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
CountGD: Multi-Modal Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
di: Chen, Boyuan, et al.
Pubblicazione: (2026)
di: Chen, Boyuan, et al.
Pubblicazione: (2026)
CountMamba: Exploring Multi-directional Selective State-Space Models for Plant Counting
di: He, Hulingxiao, et al.
Pubblicazione: (2024)
di: He, Hulingxiao, et al.
Pubblicazione: (2024)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
di: Qharabagh, Muhammad Fetrat, et al.
Pubblicazione: (2024)
di: Qharabagh, Muhammad Fetrat, et al.
Pubblicazione: (2024)
Mamba-MOC: A Multicategory Remote Object Counting via State Space Model
di: Liu, Peng, et al.
Pubblicazione: (2025)
di: Liu, Peng, et al.
Pubblicazione: (2025)
CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion
di: Li, Yanyu, et al.
Pubblicazione: (2025)
di: Li, Yanyu, et al.
Pubblicazione: (2025)
Counting Stacked Objects
di: Dumery, Corentin, et al.
Pubblicazione: (2024)
di: Dumery, Corentin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
di: Yao, Ziyu, et al.
Pubblicazione: (2024) -
Repetitive Action Counting with Hybrid Temporal Relation Modeling
di: Li, Kun, et al.
Pubblicazione: (2024) -
Localization-Aware Multi-Scale Representation Learning for Repetitive Action Counting
di: Wang, Sujia, et al.
Pubblicazione: (2025) -
Skim then Focus: Integrating Contextual and Fine-grained Views for Repetitive Action Counting
di: Zhao, Zhengqi, et al.
Pubblicazione: (2024) -
MultiCounter: Multiple Action Agnostic Repetition Counting in Untrimmed Videos
di: Tang, Yin, et al.
Pubblicazione: (2024)