Enhancing Spatio-Temporal Zero-shot Action Recognition with Language-driven Description Attributes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Yehna, Kim, Young-Eun, Lee, Seong-Whan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ID-EA: Identity-driven Text Enhancement and Adaptation with Textual Inversion for Personalized Text-to-Image Generation
par: Jin, Hyun-Jun, et autres
Publié: (2025)
par: Jin, Hyun-Jun, et autres
Publié: (2025)
FAR-Net: Multi-Stage Fusion Network with Enhanced Semantic Alignment and Adaptive Reconciliation for Composed Image Retrieval
par: Park, Jeong-Woo, et autres
Publié: (2025)
par: Park, Jeong-Woo, et autres
Publié: (2025)
DiGIT: Multi-Dilated Gated Encoder and Central-Adjacent Region Integrated Decoder for Temporal Action Detection Transformer
par: Kim, Ho-Joong, et autres
Publié: (2025)
par: Kim, Ho-Joong, et autres
Publié: (2025)
TE-TAD: Towards Full End-to-End Temporal Action Detection via Time-Aligned Coordinate Expression
par: Kim, Ho-Joong, et autres
Publié: (2024)
par: Kim, Ho-Joong, et autres
Publié: (2024)
Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition
par: Hu, Xiaodan, et autres
Publié: (2025)
par: Hu, Xiaodan, et autres
Publié: (2025)
Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition
par: So, Yerim, et autres
Publié: (2026)
par: So, Yerim, et autres
Publié: (2026)
ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
Temporal Alignment-Free Video Matching for Few-shot Action Recognition
par: Lee, SuBeen, et autres
Publié: (2025)
par: Lee, SuBeen, et autres
Publié: (2025)
ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval
par: Kim, Ji-Hyeon, et autres
Publié: (2026)
par: Kim, Ji-Hyeon, et autres
Publié: (2026)
Comprehensive Information Bottleneck for Unveiling Universal Attribution to Interpret Vision Transformers
par: Hong, Jung-Ho, et autres
Publié: (2025)
par: Hong, Jung-Ho, et autres
Publié: (2025)
Illuminating Salient Contributions in Neuron Activation with Attribution Equilibrium
par: Nam, Woo-Jeoung, et autres
Publié: (2022)
par: Nam, Woo-Jeoung, et autres
Publié: (2022)
AM-SORT: Adaptable Motion Predictor with Historical Trajectory Embedding for Multi-Object Tracking
par: Kim, Vitaliy, et autres
Publié: (2024)
par: Kim, Vitaliy, et autres
Publié: (2024)
D$^2$ST-Adapter: Disentangled-and-Deformable Spatio-Temporal Adapter for Few-shot Action Recognition
par: Pei, Wenjie, et autres
Publié: (2023)
par: Pei, Wenjie, et autres
Publié: (2023)
MCoT-RE: Multi-Faceted Chain-of-Thought and Re-Ranking for Training-Free Zero-Shot Composed Image Retrieval
par: Park, Jeong-Woo, et autres
Publié: (2025)
par: Park, Jeong-Woo, et autres
Publié: (2025)
Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition
par: Do, Jeonghyeok, et autres
Publié: (2024)
par: Do, Jeonghyeok, et autres
Publié: (2024)
FlipConcept: Tuning-Free Multi-Concept Personalization for Text-to-Image Generation
par: Woo, Young Beom, et autres
Publié: (2025)
par: Woo, Young Beom, et autres
Publié: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
par: Oh, Ju-Young, et autres
Publié: (2025)
par: Oh, Ju-Young, et autres
Publié: (2025)
Leveraging Temporal Contextualization for Video Action Recognition
par: Kim, Minji, et autres
Publié: (2024)
par: Kim, Minji, et autres
Publié: (2024)
Spatio-Temporal Proximity-Aware Dual-Path Model for Panoramic Activity Recognition
par: Lee, Sumin, et autres
Publié: (2024)
par: Lee, Sumin, et autres
Publié: (2024)
Modelling Spatio-Temporal Interactions For Compositional Action Recognition
par: Rajendiran, Ramanathan, et autres
Publié: (2023)
par: Rajendiran, Ramanathan, et autres
Publié: (2023)
Part-aware Unified Representation of Language and Skeleton for Zero-shot Action Recognition
par: Zhu, Anqi, et autres
Publié: (2024)
par: Zhu, Anqi, et autres
Publié: (2024)
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
par: Xu, Quanxing, et autres
Publié: (2025)
par: Xu, Quanxing, et autres
Publié: (2025)
Appearance Debiased Gaze Estimation via Stochastic Subject-Wise Adversarial Learning
par: Kim, Suneung, et autres
Publié: (2024)
par: Kim, Suneung, et autres
Publié: (2024)
PCBEAR: Pose Concept Bottleneck for Explainable Action Recognition
par: Lee, Jongseo, et autres
Publié: (2025)
par: Lee, Jongseo, et autres
Publié: (2025)
PoseBridge: Bridging the Skeletonization Gap for Zero-Shot Skeleton-Based Action Recognition
par: Lee, Sanghyeon, et autres
Publié: (2026)
par: Lee, Sanghyeon, et autres
Publié: (2026)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
par: Choi, Sun-Hyuk, et autres
Publié: (2025)
par: Choi, Sun-Hyuk, et autres
Publié: (2025)
Zero-shot Compositional Action Recognition with Neural Logic Constraints
par: Ye, Gefan, et autres
Publié: (2025)
par: Ye, Gefan, et autres
Publié: (2025)
EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges
par: Jon, Hyo Jin, et autres
Publié: (2026)
par: Jon, Hyo Jin, et autres
Publié: (2026)
SurgX: Neuron-Concept Association for Explainable Surgical Phase Recognition
par: Kim, Ka Young, et autres
Publié: (2025)
par: Kim, Ka Young, et autres
Publié: (2025)
Text-guided Weakly Supervised Framework for Dynamic Facial Expression Recognition
par: Jung, Gunho, et autres
Publié: (2025)
par: Jung, Gunho, et autres
Publié: (2025)
Disentangled Concepts Speak Louder Than Words: Explainable Video Action Recognition
par: Lee, Jongseo, et autres
Publié: (2025)
par: Lee, Jongseo, et autres
Publié: (2025)
SkateFormer: Skeletal-Temporal Transformer for Human Action Recognition
par: Do, Jeonghyeok, et autres
Publié: (2024)
par: Do, Jeonghyeok, et autres
Publié: (2024)
TIFu: Tri-directional Implicit Function for High-Fidelity 3D Character Reconstruction
par: Lim, Byoungsung, et autres
Publié: (2024)
par: Lim, Byoungsung, et autres
Publié: (2024)
Adaptive Prototype Model for Attribute-based Multi-label Few-shot Action Recognition
par: Xiao, Juefeng, et autres
Publié: (2025)
par: Xiao, Juefeng, et autres
Publié: (2025)
Unified Language-driven Zero-shot Domain Adaptation
par: Yang, Senqiao, et autres
Publié: (2024)
par: Yang, Senqiao, et autres
Publié: (2024)
MVAFormer: RGB-based Multi-View Spatio-Temporal Action Recognition with Transformer
par: Yamane, Taiga, et autres
Publié: (2025)
par: Yamane, Taiga, et autres
Publié: (2025)
Spatio-Temporal Joint Density Driven Learning for Skeleton-Based Action Recognition
par: Gunasekara, Shanaka Ramesh, et autres
Publié: (2025)
par: Gunasekara, Shanaka Ramesh, et autres
Publié: (2025)
Local Representative Token Guided Merging for Text-to-Image Generation
par: Lee, Min-Jeong, et autres
Publié: (2025)
par: Lee, Min-Jeong, et autres
Publié: (2025)
Flashback: Memory-Driven Zero-shot, Real-time Video Anomaly Detection
par: Lee, Hyogun, et autres
Publié: (2025)
par: Lee, Hyogun, et autres
Publié: (2025)
Spatio-Temporal Context Prompting for Zero-Shot Action Detection
par: Huang, Wei-Jhe, et autres
Publié: (2024)
par: Huang, Wei-Jhe, et autres
Publié: (2024)
Documents similaires
-
ID-EA: Identity-driven Text Enhancement and Adaptation with Textual Inversion for Personalized Text-to-Image Generation
par: Jin, Hyun-Jun, et autres
Publié: (2025) -
FAR-Net: Multi-Stage Fusion Network with Enhanced Semantic Alignment and Adaptive Reconciliation for Composed Image Retrieval
par: Park, Jeong-Woo, et autres
Publié: (2025) -
DiGIT: Multi-Dilated Gated Encoder and Central-Adjacent Region Integrated Decoder for Temporal Action Detection Transformer
par: Kim, Ho-Joong, et autres
Publié: (2025) -
TE-TAD: Towards Full End-to-End Temporal Action Detection via Time-Aligned Coordinate Expression
par: Kim, Ho-Joong, et autres
Publié: (2024) -
Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition
par: Hu, Xiaodan, et autres
Publié: (2025)