MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization
Fuente:
arXiv
Guardado en:
| Autores principales: | Fang, Zhenying, Hong, Richang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Boundary Discretization and Reliable Classification Network for Temporal Action Detection
por: Fang, Zhenying, et al.
Publicado: (2023)
por: Fang, Zhenying, et al.
Publicado: (2023)
MGCA-Net: Multi-Graph Contextual Attention Network for Two-View Correspondence Learning
por: Lin, Shuyuan, et al.
Publicado: (2025)
por: Lin, Shuyuan, et al.
Publicado: (2025)
Open-Vocabulary Temporal Action Localization using Multimodal Guidance
por: Gupta, Akshita, et al.
Publicado: (2024)
por: Gupta, Akshita, et al.
Publicado: (2024)
Open-Vocabulary Spatio-Temporal Action Detection
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
One-Stage Open-Vocabulary Temporal Action Detection Leveraging Temporal Multi-scale and Action Label Features
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)
Exploring Scalability of Self-Training for Open-Vocabulary Temporal Action Localization
por: Hyun, Jeongseok, et al.
Publicado: (2024)
por: Hyun, Jeongseok, et al.
Publicado: (2024)
Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition
por: So, Yerim, et al.
Publicado: (2026)
por: So, Yerim, et al.
Publicado: (2026)
Scaling Open-Vocabulary Action Detection
por: Sia, Zhen Hao, et al.
Publicado: (2025)
por: Sia, Zhen Hao, et al.
Publicado: (2025)
Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition
por: Liu, Haijing, et al.
Publicado: (2024)
por: Liu, Haijing, et al.
Publicado: (2024)
Open-Vocabulary Action Localization with Iterative Visual Prompting
por: Wake, Naoki, et al.
Publicado: (2024)
por: Wake, Naoki, et al.
Publicado: (2024)
Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection
por: Zhu, Sa, et al.
Publicado: (2026)
por: Zhu, Sa, et al.
Publicado: (2026)
Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization
por: Ullah, Hayat, et al.
Publicado: (2025)
por: Ullah, Hayat, et al.
Publicado: (2025)
SGC-Net: Stratified Granular Comparison Network for Open-Vocabulary HOI Detection
por: Lin, Xin, et al.
Publicado: (2025)
por: Lin, Xin, et al.
Publicado: (2025)
Novel Category Discovery with X-Agent Attention for Open-Vocabulary Semantic Segmentation
por: Li, Jiahao, et al.
Publicado: (2025)
por: Li, Jiahao, et al.
Publicado: (2025)
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
por: Zhu, Sa, et al.
Publicado: (2026)
por: Zhu, Sa, et al.
Publicado: (2026)
NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection
por: Zhang, Yupeng, et al.
Publicado: (2026)
por: Zhang, Yupeng, et al.
Publicado: (2026)
SynSeg: Feature Synergy for Multi-Category Contrastive Learning in End-to-End Open-Vocabulary Semantic Segmentation
por: Zhang, Weichen, et al.
Publicado: (2025)
por: Zhang, Weichen, et al.
Publicado: (2025)
Technical Report for ActivityNet Challenge 2022 -- Temporal Action Localization
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
DENOISER: Rethinking the Robustness for Open-Vocabulary Action Recognition
por: Cheng, Haozhe, et al.
Publicado: (2024)
por: Cheng, Haozhe, et al.
Publicado: (2024)
Unsupervised Open-Vocabulary Object Localization in Videos
por: Fan, Ke, et al.
Publicado: (2023)
por: Fan, Ke, et al.
Publicado: (2023)
Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools
por: Yuan, Zhenlong, et al.
Publicado: (2025)
por: Yuan, Zhenlong, et al.
Publicado: (2025)
Learning to Generalize without Bias for Open-Vocabulary Action Recognition
por: Yu, Yating, et al.
Publicado: (2025)
por: Yu, Yating, et al.
Publicado: (2025)
Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection
por: Bao, Wentao, et al.
Publicado: (2024)
por: Bao, Wentao, et al.
Publicado: (2024)
Multi-task Learning with Extended Temporal Shift Module for Temporal Action Localization
por: Duong, Anh-Kiet, et al.
Publicado: (2025)
por: Duong, Anh-Kiet, et al.
Publicado: (2025)
Enhancing Open-Vocabulary Object Detection through Multi-Level Fine-Grained Visual-Language Alignment
por: Zhang, Tianyi, et al.
Publicado: (2026)
por: Zhang, Tianyi, et al.
Publicado: (2026)
Video Self-Stitching Graph Network for Temporal Action Localization
por: Zhao, Chen, et al.
Publicado: (2020)
por: Zhao, Chen, et al.
Publicado: (2020)
Open Vocabulary Multi-Label Video Classification
por: Gupta, Rohit, et al.
Publicado: (2024)
por: Gupta, Rohit, et al.
Publicado: (2024)
Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
por: Xie, Jiangnan, et al.
Publicado: (2025)
por: Xie, Jiangnan, et al.
Publicado: (2025)
SLAck: Semantic, Location, and Appearance Aware Open-Vocabulary Tracking
por: Li, Siyuan, et al.
Publicado: (2024)
por: Li, Siyuan, et al.
Publicado: (2024)
Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
por: Unmesh, Asim, et al.
Publicado: (2026)
por: Unmesh, Asim, et al.
Publicado: (2026)
FGAseg: Fine-Grained Pixel-Text Alignment for Open-Vocabulary Semantic Segmentation
por: Li, Bingyu, et al.
Publicado: (2025)
por: Li, Bingyu, et al.
Publicado: (2025)
Fine-Grained Open-Vocabulary Object Recognition via User-Guided Segmentation
por: Ahn, Jinwoo, et al.
Publicado: (2024)
por: Ahn, Jinwoo, et al.
Publicado: (2024)
Improving Weakly Supervised Temporal Action Localization by Exploiting Multi-resolution Information in Temporal Domain
por: Su, Rui, et al.
Publicado: (2025)
por: Su, Rui, et al.
Publicado: (2025)
Towards Open-Vocabulary Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
Understanding Multi-Granularity for Open-Vocabulary Part Segmentation
por: Choi, Jiho, et al.
Publicado: (2024)
por: Choi, Jiho, et al.
Publicado: (2024)
OVMR: Open-Vocabulary Recognition with Multi-Modal References
por: Ma, Zehong, et al.
Publicado: (2024)
por: Ma, Zehong, et al.
Publicado: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
por: Wasim, Syed Talal, et al.
Publicado: (2023)
por: Wasim, Syed Talal, et al.
Publicado: (2023)
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
por: Han, Tingting, et al.
Publicado: (2026)
por: Han, Tingting, et al.
Publicado: (2026)
From Static to Dynamic: Adapting Landmark-Aware Image Models for Facial Expression Recognition in Videos
por: Chen, Yin, et al.
Publicado: (2023)
por: Chen, Yin, et al.
Publicado: (2023)
OV9D: Open-Vocabulary Category-Level 9D Object Pose and Size Estimation
por: Cai, Junhao, et al.
Publicado: (2024)
por: Cai, Junhao, et al.
Publicado: (2024)
Ejemplares similares
-
Boundary Discretization and Reliable Classification Network for Temporal Action Detection
por: Fang, Zhenying, et al.
Publicado: (2023) -
MGCA-Net: Multi-Graph Contextual Attention Network for Two-View Correspondence Learning
por: Lin, Shuyuan, et al.
Publicado: (2025) -
Open-Vocabulary Temporal Action Localization using Multimodal Guidance
por: Gupta, Akshita, et al.
Publicado: (2024) -
Open-Vocabulary Spatio-Temporal Action Detection
por: Wu, Tao, et al.
Publicado: (2024) -
One-Stage Open-Vocabulary Temporal Action Detection Leveraging Temporal Multi-scale and Action Label Features
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)