Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Tianyu, Wu, Junjie, Gao, Jingquan, Li, Shishuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
di: Barrios, Wayner, et al.
Pubblicazione: (2025)
di: Barrios, Wayner, et al.
Pubblicazione: (2025)
Wavelet-Decoupling Contrastive Enhancement Network for Fine-Grained Skeleton-Based Action Recognition
di: Chang, Haochen, et al.
Pubblicazione: (2024)
di: Chang, Haochen, et al.
Pubblicazione: (2024)
Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
di: Wang, Haoming, et al.
Pubblicazione: (2025)
di: Wang, Haoming, et al.
Pubblicazione: (2025)
Parameter-Efficient Subspace Decoupling ViT for Mitigating Multi-Task Negative Transfer in Histological Scoring
di: Huang, Youhan, et al.
Pubblicazione: (2026)
di: Huang, Youhan, et al.
Pubblicazione: (2026)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
di: Zhang, Renrui, et al.
Pubblicazione: (2023)
di: Zhang, Renrui, et al.
Pubblicazione: (2023)
DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation
di: Yin, Xiangchen, et al.
Pubblicazione: (2025)
di: Yin, Xiangchen, et al.
Pubblicazione: (2025)
PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification
di: Luo, Qiuming, et al.
Pubblicazione: (2026)
di: Luo, Qiuming, et al.
Pubblicazione: (2026)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
di: Liu, Luping, et al.
Pubblicazione: (2024)
di: Liu, Luping, et al.
Pubblicazione: (2024)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
di: Lin, Xiang, et al.
Pubblicazione: (2025)
di: Lin, Xiang, et al.
Pubblicazione: (2025)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
FineVQ: Fine-Grained User Generated Content Video Quality Assessment
di: Duan, Huiyu, et al.
Pubblicazione: (2024)
di: Duan, Huiyu, et al.
Pubblicazione: (2024)
Efficient Bitrate Ladder Construction using Transfer Learning and Spatio-Temporal Features
di: Falahati, Ali, et al.
Pubblicazione: (2024)
di: Falahati, Ali, et al.
Pubblicazione: (2024)
DPDETR: Decoupled Position Detection Transformer for Infrared-Visible Object Detection
di: Guo, Junjie, et al.
Pubblicazione: (2024)
di: Guo, Junjie, et al.
Pubblicazione: (2024)
M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention
di: Panta, Sanjeev, et al.
Pubblicazione: (2026)
di: Panta, Sanjeev, et al.
Pubblicazione: (2026)
Data relativistic uncertainty framework for low-illumination anime scenery image enhancement
di: Gao, Yiquan, et al.
Pubblicazione: (2025)
di: Gao, Yiquan, et al.
Pubblicazione: (2025)
MIP-GAF: A MLLM-annotated Benchmark for Most Important Person Localization and Group Context Understanding
di: Madan, Surbhi, et al.
Pubblicazione: (2024)
di: Madan, Surbhi, et al.
Pubblicazione: (2024)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
Semantic-Aware Adversarial Training for Reliable Deep Hashing Retrieval
di: Yuan, Xu, et al.
Pubblicazione: (2023)
di: Yuan, Xu, et al.
Pubblicazione: (2023)
Calibrating Multimodal Consensus for Emotion Recognition
di: Zhong, Guowei, et al.
Pubblicazione: (2025)
di: Zhong, Guowei, et al.
Pubblicazione: (2025)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
Relating CNN-Transformer Fusion Network for Change Detection
di: Gao, Yuhao, et al.
Pubblicazione: (2024)
di: Gao, Yuhao, et al.
Pubblicazione: (2024)
MTCAE-DFER: Multi-Task Cascaded Autoencoder for Dynamic Facial Expression Recognition
di: Xiang, Peihao, et al.
Pubblicazione: (2024)
di: Xiang, Peihao, et al.
Pubblicazione: (2024)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
Knowledge Bridger: Towards Training-free Missing Modality Completion
di: Ke, Guanzhou, et al.
Pubblicazione: (2025)
di: Ke, Guanzhou, et al.
Pubblicazione: (2025)
MST-Distill: Mixture of Specialized Teachers for Cross-Modal Knowledge Distillation
di: Li, Hui, et al.
Pubblicazione: (2025)
di: Li, Hui, et al.
Pubblicazione: (2025)
Does SpatioTemporal information benefit Two video summarization benchmarks?
di: Ganesh, Aashutosh, et al.
Pubblicazione: (2024)
di: Ganesh, Aashutosh, et al.
Pubblicazione: (2024)
VSTAR: Generative Temporal Nursing for Longer Dynamic Video Synthesis
di: Li, Yumeng, et al.
Pubblicazione: (2024)
di: Li, Yumeng, et al.
Pubblicazione: (2024)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
Boosting Facial Action Unit Detection Through Jointly Learning Facial Landmark Detection and Domain Separation and Reconstruction
di: Shang, Ziqiao, et al.
Pubblicazione: (2023)
di: Shang, Ziqiao, et al.
Pubblicazione: (2023)
Diversity-Guided MLP Reduction for Efficient Large Vision Transformers
di: Shen, Chengchao, et al.
Pubblicazione: (2025)
di: Shen, Chengchao, et al.
Pubblicazione: (2025)
4D Multimodal Co-attention Fusion Network with Latent Contrastive Alignment for Alzheimer's Diagnosis
di: Wei, Yuxiang, et al.
Pubblicazione: (2025)
di: Wei, Yuxiang, et al.
Pubblicazione: (2025)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
MVP: Winning Solution to SMP Challenge 2025 Video Track
di: Ye, Liliang, et al.
Pubblicazione: (2025)
di: Ye, Liliang, et al.
Pubblicazione: (2025)
A Novel FACS-Aligned Anatomical Text Description Paradigm for Fine-Grained Facial Behavior Synthesis
di: Wang, Jiahe, et al.
Pubblicazione: (2026)
di: Wang, Jiahe, et al.
Pubblicazione: (2026)
UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model
di: Li, Junzhe, et al.
Pubblicazione: (2025)
di: Li, Junzhe, et al.
Pubblicazione: (2025)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
di: Pang, Xingzhou, et al.
Pubblicazione: (2026)
di: Pang, Xingzhou, et al.
Pubblicazione: (2026)
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
di: Ouyang, Pengxiang, et al.
Pubblicazione: (2025)
di: Ouyang, Pengxiang, et al.
Pubblicazione: (2025)
Embracing Collaboration Over Competition: Condensing Multiple Prompts for Visual In-Context Learning
di: Wang, Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Jinpeng, et al.
Pubblicazione: (2025)
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
di: Fan, Yunfeng, et al.
Pubblicazione: (2023)
di: Fan, Yunfeng, et al.
Pubblicazione: (2023)
Regularized Contrastive Partial Multi-view Outlier Detection
di: Wang, Yijia, et al.
Pubblicazione: (2024)
di: Wang, Yijia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
di: Barrios, Wayner, et al.
Pubblicazione: (2025) -
Wavelet-Decoupling Contrastive Enhancement Network for Fine-Grained Skeleton-Based Action Recognition
di: Chang, Haochen, et al.
Pubblicazione: (2024) -
Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
di: Wang, Haoming, et al.
Pubblicazione: (2025) -
Parameter-Efficient Subspace Decoupling ViT for Mitigating Multi-Task Negative Transfer in Histological Scoring
di: Huang, Youhan, et al.
Pubblicazione: (2026) -
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
di: Zhang, Renrui, et al.
Pubblicazione: (2023)