Learning text-to-video retrieval from image captioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ventura, Lucas, Schmid, Cordelia, Varol, Gül |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chapter-Llama: Efficient Chaptering in Hour-Long Videos with LLMs
par: Ventura, Lucas, et autres
Publié: (2025)
par: Ventura, Lucas, et autres
Publié: (2025)
CoVR-2: Automatic Data Construction for Composed Video Retrieval
par: Ventura, Lucas, et autres
Publié: (2023)
par: Ventura, Lucas, et autres
Publié: (2023)
Towards a multimodal framework for remote sensing image change retrieval and captioning
par: Ferrod, Roger, et autres
Publié: (2024)
par: Ferrod, Roger, et autres
Publié: (2024)
Fine-grained length controllable video captioning with ordinal embeddings
par: Nitta, Tomoya, et autres
Publié: (2024)
par: Nitta, Tomoya, et autres
Publié: (2024)
Multi-Modal interpretable automatic video captioning
par: Hanna-Asaad, Antoine, et autres
Publié: (2024)
par: Hanna-Asaad, Antoine, et autres
Publié: (2024)
A Cross-Dataset Study for Text-based 3D Human Motion Retrieval
par: Bensabath, Léore, et autres
Publié: (2024)
par: Bensabath, Léore, et autres
Publié: (2024)
Exploring text-to-image generation for historical document image retrieval
par: Cote, Melissa, et autres
Publié: (2025)
par: Cote, Melissa, et autres
Publié: (2025)
InterPose: Learning to Generate Human-Object Interactions from Large-Scale Web Videos
par: Zhang, Yangsong, et autres
Publié: (2025)
par: Zhang, Yangsong, et autres
Publié: (2025)
Leveraging image captions for selective whole slide image annotation
par: Qiu, Jingna, et autres
Publié: (2024)
par: Qiu, Jingna, et autres
Publié: (2024)
BrickNet: Graph-Backed Generative Brick Assembly
par: Kulits, Peter, et autres
Publié: (2026)
par: Kulits, Peter, et autres
Publié: (2026)
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
par: Bousselham, Walid, et autres
Publié: (2025)
par: Bousselham, Walid, et autres
Publié: (2025)
Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2024)
par: Kazakos, Evangelos, et autres
Publié: (2024)
ComposeAnything: Composite Object Priors for Text-to-Image Generation
par: Khan, Zeeshan, et autres
Publié: (2025)
par: Khan, Zeeshan, et autres
Publié: (2025)
Large-scale Pre-training for Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2025)
par: Kazakos, Evangelos, et autres
Publié: (2025)
Learning Correlation Structures for Vision Transformers
par: Kim, Manjin, et autres
Publié: (2024)
par: Kim, Manjin, et autres
Publié: (2024)
SINC: Spatial Composition of 3D Human Motions for Simultaneous Action Generation
par: Athanasiou, Nikos, et autres
Publié: (2023)
par: Athanasiou, Nikos, et autres
Publié: (2023)
Dense Video Object Captioning from Disjoint Supervision
par: Zhou, Xingyi, et autres
Publié: (2023)
par: Zhou, Xingyi, et autres
Publié: (2023)
Object-oriented backdoor attack against image captioning
par: Li, Meiling, et autres
Publié: (2024)
par: Li, Meiling, et autres
Publié: (2024)
Dense Optical Tracking: Connecting the Dots
par: Moing, Guillaume Le, et autres
Publié: (2023)
par: Moing, Guillaume Le, et autres
Publié: (2023)
Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
par: Garcia, Ricardo, et autres
Publié: (2024)
par: Garcia, Ricardo, et autres
Publié: (2024)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
par: Chen, Shizhe, et autres
Publié: (2026)
par: Chen, Shizhe, et autres
Publié: (2026)
Image captioning in different languages
par: van Miltenburg, Emiel
Publié: (2024)
par: van Miltenburg, Emiel
Publié: (2024)
Lost in Translation, Found in Context: Sign Language Translation with Contextual Cues
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach
par: Caron, Mathilde, et autres
Publié: (2024)
par: Caron, Mathilde, et autres
Publié: (2024)
SUGAR: Pre-training 3D Visual Representations for Robotics
par: Chen, Shizhe, et autres
Publié: (2024)
par: Chen, Shizhe, et autres
Publié: (2024)
A Generative Approach for Wikipedia-Scale Visual Entity Recognition
par: Caron, Mathilde, et autres
Publié: (2024)
par: Caron, Mathilde, et autres
Publié: (2024)
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
par: Wysoczańska, Monika, et autres
Publié: (2025)
par: Wysoczańska, Monika, et autres
Publié: (2025)
Retrieval-Enhanced Contrastive Vision-Text Models
par: Iscen, Ahmet, et autres
Publié: (2023)
par: Iscen, Ahmet, et autres
Publié: (2023)
Memory-Modular Classification: Learning to Generalize with Memory Replacement
par: Kang, Dahyun, et autres
Publié: (2025)
par: Kang, Dahyun, et autres
Publié: (2025)
HORT: Monocular Hand-held Objects Reconstruction with Transformers
par: Chen, Zerui, et autres
Publié: (2025)
par: Chen, Zerui, et autres
Publié: (2025)
LoFT: LoRA-fused Training Dataset Generation with Few-shot Guidance
par: Kim, Jae Myung, et autres
Publié: (2025)
par: Kim, Jae Myung, et autres
Publié: (2025)
Scaling Cross-Environment Failure Reasoning Data for Vision-Language Robotic Manipulation
par: Pacaud, Paul, et autres
Publié: (2025)
par: Pacaud, Paul, et autres
Publié: (2025)
Online 3D Scene Reconstruction Using Neural Object Priors
par: Chabal, Thomas, et autres
Publié: (2025)
par: Chabal, Thomas, et autres
Publié: (2025)
FOM-Nav: Frontier-Object Maps for Object Goal Navigation
par: Chabal, Thomas, et autres
Publié: (2025)
par: Chabal, Thomas, et autres
Publié: (2025)
AutoAD III: The Prequel -- Back to the Pixels
par: Han, Tengda, et autres
Publié: (2024)
par: Han, Tengda, et autres
Publié: (2024)
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
par: Lei, Youbo, et autres
Publié: (2023)
par: Lei, Youbo, et autres
Publié: (2023)
MotionFix: Text-Driven 3D Human Motion Editing
par: Athanasiou, Nikos, et autres
Publié: (2024)
par: Athanasiou, Nikos, et autres
Publié: (2024)
Disentangle and denoise: Tackling context misalignment for video moment retrieval
par: Ma, Kaijing, et autres
Publié: (2024)
par: Ma, Kaijing, et autres
Publié: (2024)
Cognitive resilience: Unraveling the proficiency of image-captioning models to interpret masked visual content
par: Du, Zhicheng, et autres
Publié: (2024)
par: Du, Zhicheng, et autres
Publié: (2024)
Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
Documents similaires
-
Chapter-Llama: Efficient Chaptering in Hour-Long Videos with LLMs
par: Ventura, Lucas, et autres
Publié: (2025) -
CoVR-2: Automatic Data Construction for Composed Video Retrieval
par: Ventura, Lucas, et autres
Publié: (2023) -
Towards a multimodal framework for remote sensing image change retrieval and captioning
par: Ferrod, Roger, et autres
Publié: (2024) -
Fine-grained length controllable video captioning with ordinal embeddings
par: Nitta, Tomoya, et autres
Publié: (2024) -
Multi-Modal interpretable automatic video captioning
par: Hanna-Asaad, Antoine, et autres
Publié: (2024)