Exploring Scalability of Self-Training for Open-Vocabulary Temporal Action Localization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hyun, Jeongseok, Han, Su Ho, Kang, Hyolim, Lee, Joon-Young, Kim, Seon Joo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ActionSwitch: Class-agnostic Detection of Simultaneous Actions in Streaming Videos
par: Kang, Hyolim, et autres
Publié: (2024)
par: Kang, Hyolim, et autres
Publié: (2024)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
par: Hyun, Jeongseok, et autres
Publié: (2025)
par: Hyun, Jeongseok, et autres
Publié: (2025)
Object Aware Egocentric Online Action Detection
par: An, Joungbin, et autres
Publié: (2024)
par: An, Joungbin, et autres
Publié: (2024)
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
par: Han, Su Ho, et autres
Publié: (2025)
par: Han, Su Ho, et autres
Publié: (2025)
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
par: Kang, Hyolim, et autres
Publié: (2025)
par: Kang, Hyolim, et autres
Publié: (2025)
UniSkill: Imitating Human Videos via Cross-Embodiment Skill Representations
par: Kim, Hanjung, et autres
Publié: (2025)
par: Kim, Hanjung, et autres
Publié: (2025)
Open-Vocabulary Temporal Action Localization using Multimodal Guidance
par: Gupta, Akshita, et autres
Publié: (2024)
par: Gupta, Akshita, et autres
Publié: (2024)
Open-Vocabulary Spatio-Temporal Action Detection
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition
par: So, Yerim, et autres
Publié: (2026)
par: So, Yerim, et autres
Publié: (2026)
Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation
par: Shao, Tong, et autres
Publié: (2024)
par: Shao, Tong, et autres
Publié: (2024)
MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization
par: Fang, Zhenying, et autres
Publié: (2025)
par: Fang, Zhenying, et autres
Publié: (2025)
Exploring Temporally-Aware Features for Point Tracking
par: Kim, Inès Hyeonsu, et autres
Publié: (2025)
par: Kim, Inès Hyeonsu, et autres
Publié: (2025)
Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation
par: Bai, Sule, et autres
Publié: (2024)
par: Bai, Sule, et autres
Publié: (2024)
Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation
par: Lee, ByeongCheol, et autres
Publié: (2026)
par: Lee, ByeongCheol, et autres
Publié: (2026)
OVS Meets Continual Learning: Towards Sustainable Open-Vocabulary Segmentation
par: Hwang, Dongjun, et autres
Publié: (2024)
par: Hwang, Dongjun, et autres
Publié: (2024)
One-Stage Open-Vocabulary Temporal Action Detection Leveraging Temporal Multi-scale and Action Label Features
par: Nguyen, Trung Thanh, et autres
Publié: (2024)
par: Nguyen, Trung Thanh, et autres
Publié: (2024)
MFP: Making Full Use of Probability Maps for Interactive Image Segmentation
par: Lee, Chaewon, et autres
Publié: (2024)
par: Lee, Chaewon, et autres
Publié: (2024)
Taming Self-Training for Open-Vocabulary Object Detection
par: Zhao, Shiyu, et autres
Publié: (2023)
par: Zhao, Shiyu, et autres
Publié: (2023)
CR-QAT: Curriculum Relational Quantization-Aware Training for Open-Vocabulary Object Detection
par: Park, Jinyeong, et autres
Publié: (2026)
par: Park, Jinyeong, et autres
Publié: (2026)
Leveraging Image Augmentation for Object Manipulation: Towards Interpretable Controllability in Object-Centric Learning
par: Kim, Jinwoo, et autres
Publié: (2023)
par: Kim, Jinwoo, et autres
Publié: (2023)
Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
par: Unmesh, Asim, et autres
Publié: (2026)
par: Unmesh, Asim, et autres
Publié: (2026)
Scaling Open-Vocabulary Action Detection
par: Sia, Zhen Hao, et autres
Publié: (2025)
par: Sia, Zhen Hao, et autres
Publié: (2025)
Exploring OCR-augmented Generation for Bilingual VQA
par: Lee, JoonHo, et autres
Publié: (2025)
par: Lee, JoonHo, et autres
Publié: (2025)
Open-Vocabulary Action Localization with Iterative Visual Prompting
par: Wake, Naoki, et autres
Publié: (2024)
par: Wake, Naoki, et autres
Publié: (2024)
Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
par: Lee, Sanghoon, et autres
Publié: (2026)
par: Lee, Sanghoon, et autres
Publié: (2026)
ExploreGS: Explorable 3D Scene Reconstruction with Virtual Camera Samplings and Diffusion Priors
par: Kim, Minsu, et autres
Publié: (2025)
par: Kim, Minsu, et autres
Publié: (2025)
Prediction-Feedback DETR for Temporal Action Detection
par: Kim, Jihwan, et autres
Publié: (2024)
par: Kim, Jihwan, et autres
Publié: (2024)
Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection
par: Zhu, Sa, et autres
Publié: (2026)
par: Zhu, Sa, et autres
Publié: (2026)
LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds
par: Bang, Jaehun, et autres
Publié: (2026)
par: Bang, Jaehun, et autres
Publié: (2026)
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
par: Zhu, Sa, et autres
Publié: (2026)
par: Zhu, Sa, et autres
Publié: (2026)
Latent Space Super-Resolution for Higher-Resolution Image Generation with Diffusion Models
par: Jeong, Jinho, et autres
Publié: (2025)
par: Jeong, Jinho, et autres
Publié: (2025)
Enhancing Spatio-Temporal Zero-shot Action Recognition with Language-driven Description Attributes
par: Kim, Yehna, et autres
Publié: (2025)
par: Kim, Yehna, et autres
Publié: (2025)
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
par: Xu, Shilin, et autres
Publié: (2023)
par: Xu, Shilin, et autres
Publié: (2023)
DENOISER: Rethinking the Robustness for Open-Vocabulary Action Recognition
par: Cheng, Haozhe, et autres
Publié: (2024)
par: Cheng, Haozhe, et autres
Publié: (2024)
Learning to Enhance Aperture Phasor Field for Non-Line-of-Sight Imaging
par: Cho, In, et autres
Publié: (2024)
par: Cho, In, et autres
Publié: (2024)
Exploring the Temporal Consistency for Point-Level Weakly-Supervised Temporal Action Localization
par: Ma, Yunchuan, et autres
Publié: (2026)
par: Ma, Yunchuan, et autres
Publié: (2026)
DiGIT: Multi-Dilated Gated Encoder and Central-Adjacent Region Integrated Decoder for Temporal Action Detection Transformer
par: Kim, Ho-Joong, et autres
Publié: (2025)
par: Kim, Ho-Joong, et autres
Publié: (2025)
Effective SAM Combination for Open-Vocabulary Semantic Segmentation
par: Lee, Minhyeok, et autres
Publié: (2024)
par: Lee, Minhyeok, et autres
Publié: (2024)
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
par: Han, Tingting, et autres
Publié: (2026)
par: Han, Tingting, et autres
Publié: (2026)
Leveraging Temporal Contextualization for Video Action Recognition
par: Kim, Minji, et autres
Publié: (2024)
par: Kim, Minji, et autres
Publié: (2024)
Documents similaires
-
ActionSwitch: Class-agnostic Detection of Simultaneous Actions in Streaming Videos
par: Kang, Hyolim, et autres
Publié: (2024) -
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
par: Hyun, Jeongseok, et autres
Publié: (2025) -
Object Aware Egocentric Online Action Detection
par: An, Joungbin, et autres
Publié: (2024) -
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
par: Han, Su Ho, et autres
Publié: (2025) -
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
par: Kang, Hyolim, et autres
Publié: (2025)