AutoAD III: The Prequel -- Back to the Pixels
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Tengda, Bain, Max, Nagrani, Arsha, Varol, Gül, Xie, Weidi, Zisserman, Andrew |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
par: Xie, Junyu, et autres
Publié: (2024)
par: Xie, Junyu, et autres
Publié: (2024)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
par: Xie, Junyu, et autres
Publié: (2025)
par: Xie, Junyu, et autres
Publié: (2025)
More than a Moment: Towards Coherent Sequences of Audio Descriptions
par: Khandelwal, Eshika, et autres
Publié: (2025)
par: Khandelwal, Eshika, et autres
Publié: (2025)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
par: Xie, Junyu, et autres
Publié: (2026)
par: Xie, Junyu, et autres
Publié: (2026)
Character-Centric Understanding of Animated Movies
par: Gui, Zhongrui, et autres
Publié: (2025)
par: Gui, Zhongrui, et autres
Publié: (2025)
Seeing without Pixels: Perception from Camera Trajectories
par: Xue, Zihui, et autres
Publié: (2025)
par: Xue, Zihui, et autres
Publié: (2025)
Appearance-Based Refinement for Object-Centric Motion Segmentation
par: Xie, Junyu, et autres
Publié: (2023)
par: Xie, Junyu, et autres
Publié: (2023)
CountGD: Multi-Modal Open-World Counting
par: Amini-Naieni, Niki, et autres
Publié: (2024)
par: Amini-Naieni, Niki, et autres
Publié: (2024)
Lost in Translation, Found in Context: Sign Language Translation with Contextual Cues
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
par: Perrett, Toby, et autres
Publié: (2024)
par: Perrett, Toby, et autres
Publié: (2024)
Moving Object Segmentation: All You Need Is SAM (and Flow)
par: Xie, Junyu, et autres
Publié: (2024)
par: Xie, Junyu, et autres
Publié: (2024)
Made to Order: Discovering monotonic temporal changes via self-supervised video ordering
par: Yang, Charig, et autres
Publié: (2024)
par: Yang, Charig, et autres
Publié: (2024)
Amodal Ground Truth and Completion in the Wild
par: Zhan, Guanqi, et autres
Publié: (2023)
par: Zhan, Guanqi, et autres
Publié: (2023)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
par: Zhan, Guanqi, et autres
Publié: (2023)
par: Zhan, Guanqi, et autres
Publié: (2023)
VicTR: Video-conditioned Text Representations for Activity Recognition
par: Kahatapitiya, Kumara, et autres
Publié: (2023)
par: Kahatapitiya, Kumara, et autres
Publié: (2023)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
Inferring Dynamic Physical Properties from Video Foundation Models
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
par: Shvetsova, Nina, et autres
Publié: (2025)
par: Shvetsova, Nina, et autres
Publié: (2025)
A Tale of Two Languages: Large-Vocabulary Continuous Sign Language Recognition from Spoken Language Supervision
par: Raude, Charles, et autres
Publié: (2024)
par: Raude, Charles, et autres
Publié: (2024)
Multi-Sentence Grounding for Long-term Instructional Video
par: Li, Zeqian, et autres
Publié: (2023)
par: Li, Zeqian, et autres
Publié: (2023)
A Cross-Dataset Study for Text-based 3D Human Motion Retrieval
par: Bensabath, Léore, et autres
Publié: (2024)
par: Bensabath, Léore, et autres
Publié: (2024)
Learning text-to-video retrieval from image captioning
par: Ventura, Lucas, et autres
Publié: (2024)
par: Ventura, Lucas, et autres
Publié: (2024)
Synchformer: Efficient Synchronization from Sparse Cues
par: Iashin, Vladimir, et autres
Publié: (2024)
par: Iashin, Vladimir, et autres
Publié: (2024)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
par: Min, Juhong, et autres
Publié: (2024)
par: Min, Juhong, et autres
Publié: (2024)
CAViAR: Critic-Augmented Video Agentic Reasoning
par: Menon, Sachit, et autres
Publié: (2025)
par: Menon, Sachit, et autres
Publié: (2025)
Streaming Dense Video Captioning
par: Zhou, Xingyi, et autres
Publié: (2024)
par: Zhou, Xingyi, et autres
Publié: (2024)
VoCap: Video Object Captioning and Segmentation from Any Prompt
par: Uijlings, Jasper, et autres
Publié: (2025)
par: Uijlings, Jasper, et autres
Publié: (2025)
Chapter-Llama: Efficient Chaptering in Hour-Long Videos with LLMs
par: Ventura, Lucas, et autres
Publié: (2025)
par: Ventura, Lucas, et autres
Publié: (2025)
CoVR-2: Automatic Data Construction for Composed Video Retrieval
par: Ventura, Lucas, et autres
Publié: (2023)
par: Ventura, Lucas, et autres
Publié: (2023)
Learning from Streaming Video with Orthogonal Gradients
par: Han, Tengda, et autres
Publié: (2025)
par: Han, Tengda, et autres
Publié: (2025)
The Manga Whisperer: Automatically Generating Transcriptions for Comics
par: Sachdeva, Ragav, et autres
Publié: (2024)
par: Sachdeva, Ragav, et autres
Publié: (2024)
Personalizing Retrieval using Joint Embeddings or "the Return of Fluffy"
par: Korbar, Bruno, et autres
Publié: (2025)
par: Korbar, Bruno, et autres
Publié: (2025)
Chirality in Action: Time-Aware Video Representation Learning by Latent Straightening
par: Bagad, Piyush, et autres
Publié: (2025)
par: Bagad, Piyush, et autres
Publié: (2025)
From Panels to Prose: Generating Literary Narratives from Comics
par: Sachdeva, Ragav, et autres
Publié: (2025)
par: Sachdeva, Ragav, et autres
Publié: (2025)
SINC: Spatial Composition of 3D Human Motions for Simultaneous Action Generation
par: Athanasiou, Nikos, et autres
Publié: (2023)
par: Athanasiou, Nikos, et autres
Publié: (2023)
InterPose: Learning to Generate Human-Object Interactions from Large-Scale Web Videos
par: Zhang, Yangsong, et autres
Publié: (2025)
par: Zhang, Yangsong, et autres
Publié: (2025)
MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning
par: Singh, Darshan, et autres
Publié: (2026)
par: Singh, Darshan, et autres
Publié: (2026)
CountGD++: Generalized Prompting for Open-World Counting
par: Amini-Naieni, Niki, et autres
Publié: (2025)
par: Amini-Naieni, Niki, et autres
Publié: (2025)
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
par: Yan, Yibin, et autres
Publié: (2024)
par: Yan, Yibin, et autres
Publié: (2024)
Documents similaires
-
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
par: Xie, Junyu, et autres
Publié: (2024) -
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
par: Xie, Junyu, et autres
Publié: (2025) -
More than a Moment: Towards Coherent Sequences of Audio Descriptions
par: Khandelwal, Eshika, et autres
Publié: (2025) -
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
par: Xie, Junyu, et autres
Publié: (2026) -
Character-Centric Understanding of Animated Movies
par: Gui, Zhongrui, et autres
Publié: (2025)