AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Junyu, Han, Tengda, Bain, Max, Nagrani, Arsha, Varol, Gül, Xie, Weidi, Zisserman, Andrew |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AutoAD III: The Prequel -- Back to the Pixels
di: Han, Tengda, et al.
Pubblicazione: (2024)
di: Han, Tengda, et al.
Pubblicazione: (2024)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
di: Xie, Junyu, et al.
Pubblicazione: (2025)
di: Xie, Junyu, et al.
Pubblicazione: (2025)
More than a Moment: Towards Coherent Sequences of Audio Descriptions
di: Khandelwal, Eshika, et al.
Pubblicazione: (2025)
di: Khandelwal, Eshika, et al.
Pubblicazione: (2025)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
di: Xie, Junyu, et al.
Pubblicazione: (2026)
di: Xie, Junyu, et al.
Pubblicazione: (2026)
Character-Centric Understanding of Animated Movies
di: Gui, Zhongrui, et al.
Pubblicazione: (2025)
di: Gui, Zhongrui, et al.
Pubblicazione: (2025)
Appearance-Based Refinement for Object-Centric Motion Segmentation
di: Xie, Junyu, et al.
Pubblicazione: (2023)
di: Xie, Junyu, et al.
Pubblicazione: (2023)
Moving Object Segmentation: All You Need Is SAM (and Flow)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
Made to Order: Discovering monotonic temporal changes via self-supervised video ordering
di: Yang, Charig, et al.
Pubblicazione: (2024)
di: Yang, Charig, et al.
Pubblicazione: (2024)
Amodal Ground Truth and Completion in the Wild
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
CountGD: Multi-Modal Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
Lost in Translation, Found in Context: Sign Language Translation with Contextual Cues
di: Jang, Youngjoon, et al.
Pubblicazione: (2025)
di: Jang, Youngjoon, et al.
Pubblicazione: (2025)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
Inferring Dynamic Physical Properties from Video Foundation Models
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024)
di: Perrett, Toby, et al.
Pubblicazione: (2024)
VicTR: Video-conditioned Text Representations for Activity Recognition
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023)
Synchformer: Efficient Synchronization from Sparse Cues
di: Iashin, Vladimir, et al.
Pubblicazione: (2024)
di: Iashin, Vladimir, et al.
Pubblicazione: (2024)
Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment
di: Jang, Youngjoon, et al.
Pubblicazione: (2025)
di: Jang, Youngjoon, et al.
Pubblicazione: (2025)
LGD: Leveraging Generative Descriptions for Zero-Shot Referring Image Segmentation
di: Li, Jiachen, et al.
Pubblicazione: (2025)
di: Li, Jiachen, et al.
Pubblicazione: (2025)
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
Zero-shot Composed Text-Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2023)
di: Liu, Yikun, et al.
Pubblicazione: (2023)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
di: Sun, Luoyi, et al.
Pubblicazione: (2023)
di: Sun, Luoyi, et al.
Pubblicazione: (2023)
VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer
di: Hou, Yanning, et al.
Pubblicazione: (2026)
di: Hou, Yanning, et al.
Pubblicazione: (2026)
Multi-Sentence Grounding for Long-term Instructional Video
di: Li, Zeqian, et al.
Pubblicazione: (2023)
di: Li, Zeqian, et al.
Pubblicazione: (2023)
Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models
di: Han, Chaolei, et al.
Pubblicazione: (2025)
di: Han, Chaolei, et al.
Pubblicazione: (2025)
Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training
di: Zhou, Yunjiao, et al.
Pubblicazione: (2025)
di: Zhou, Yunjiao, et al.
Pubblicazione: (2025)
A Tale of Two Languages: Large-Vocabulary Continuous Sign Language Recognition from Spoken Language Supervision
di: Raude, Charles, et al.
Pubblicazione: (2024)
di: Raude, Charles, et al.
Pubblicazione: (2024)
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
di: Ge, Mingji, et al.
Pubblicazione: (2026)
di: Ge, Mingji, et al.
Pubblicazione: (2026)
VTG-GPT: Tuning-Free Zero-Shot Video Temporal Grounding with GPT
di: Xu, Yifang, et al.
Pubblicazione: (2024)
di: Xu, Yifang, et al.
Pubblicazione: (2024)
Training Free Zero-Shot Visual Anomaly Localization via Diffusion Inversion
di: Hicsonmez, Samet, et al.
Pubblicazione: (2026)
di: Hicsonmez, Samet, et al.
Pubblicazione: (2026)
Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval
di: Wang, Tong, et al.
Pubblicazione: (2026)
di: Wang, Tong, et al.
Pubblicazione: (2026)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
di: Min, Juhong, et al.
Pubblicazione: (2024)
di: Min, Juhong, et al.
Pubblicazione: (2024)
RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images
di: Li, Ke, et al.
Pubblicazione: (2025)
di: Li, Ke, et al.
Pubblicazione: (2025)
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting
di: Zhang, Da, et al.
Pubblicazione: (2026)
di: Zhang, Da, et al.
Pubblicazione: (2026)
Data-Free Generalized Zero-Shot Learning
di: Tang, Bowen, et al.
Pubblicazione: (2024)
di: Tang, Bowen, et al.
Pubblicazione: (2024)
MCL-AD: Multimodal Collaboration Learning for Zero-Shot 3D Anomaly Detection
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
Zero-Shot Aerial Object Detection with Visual Description Regularization
di: Zang, Zhengqing, et al.
Pubblicazione: (2024)
di: Zang, Zhengqing, et al.
Pubblicazione: (2024)
Improved Zero-Shot Classification by Adapting VLMs with Text Descriptions
di: Saha, Oindrila, et al.
Pubblicazione: (2024)
di: Saha, Oindrila, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AutoAD III: The Prequel -- Back to the Pixels
di: Han, Tengda, et al.
Pubblicazione: (2024) -
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
di: Xie, Junyu, et al.
Pubblicazione: (2025) -
More than a Moment: Towards Coherent Sequences of Audio Descriptions
di: Khandelwal, Eshika, et al.
Pubblicazione: (2025) -
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
di: Xie, Junyu, et al.
Pubblicazione: (2026) -
Character-Centric Understanding of Animated Movies
di: Gui, Zhongrui, et al.
Pubblicazione: (2025)