CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Gyuwon, Jang, Young Kyun, Eom, Chanho |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GOAL: Global-local Object Alignment Learning
di: Choi, Hyungyu, et al.
Pubblicazione: (2025)
di: Choi, Hyungyu, et al.
Pubblicazione: (2025)
DiCo: Disentangled Concept Representation for Text-to-image Person Re-identification
di: Kim, Giyeol, et al.
Pubblicazione: (2026)
di: Kim, Giyeol, et al.
Pubblicazione: (2026)
Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
di: Park, Gyuwon
Pubblicazione: (2025)
di: Park, Gyuwon
Pubblicazione: (2025)
MoCHA-former: Moiré-Conditioned Hybrid Adaptive Transformer for Video Demoiréing
di: Sung, Jeahun, et al.
Pubblicazione: (2025)
di: Sung, Jeahun, et al.
Pubblicazione: (2025)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
AceVFI: A Comprehensive Survey of Advances in Video Frame Interpolation
di: Kye, Dahyeon, et al.
Pubblicazione: (2025)
di: Kye, Dahyeon, et al.
Pubblicazione: (2025)
CoVR-R:Reason-Aware Composed Video Retrieval
di: Thawakar, Omkar, et al.
Pubblicazione: (2026)
di: Thawakar, Omkar, et al.
Pubblicazione: (2026)
CoVR-2: Automatic Data Construction for Composed Video Retrieval
di: Ventura, Lucas, et al.
Pubblicazione: (2023)
di: Ventura, Lucas, et al.
Pubblicazione: (2023)
Domain Generalization for Person Re-identification: A Survey Towards Domain-Agnostic Person Matching
di: Lee, Hyeonseo, et al.
Pubblicazione: (2025)
di: Lee, Hyeonseo, et al.
Pubblicazione: (2025)
Zero-shot Composed Text-Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2023)
di: Liu, Yikun, et al.
Pubblicazione: (2023)
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking
di: Li, Zixu, et al.
Pubblicazione: (2026)
di: Li, Zixu, et al.
Pubblicazione: (2026)
Composed Object Retrieval: Object-level Retrieval via Composed Expressions
di: Wang, Tong, et al.
Pubblicazione: (2025)
di: Wang, Tong, et al.
Pubblicazione: (2025)
Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval
di: Jeong, Boseung, et al.
Pubblicazione: (2025)
di: Jeong, Boseung, et al.
Pubblicazione: (2025)
PREGEN: Uncovering Latent Thoughts in Composed Video Retrieval
di: Serussi, Gabriele, et al.
Pubblicazione: (2026)
di: Serussi, Gabriele, et al.
Pubblicazione: (2026)
SEAL: Semantic-aware Single-image Sticker Personalization with a Large-scale Sticker-tag Dataset
di: Roh, Changhyun, et al.
Pubblicazione: (2026)
di: Roh, Changhyun, et al.
Pubblicazione: (2026)
R3eVision: A Survey on Robust Rendering, Restoration, and Enhancement for 3D Low-Level Vision
di: Kwon, Weeyoung, et al.
Pubblicazione: (2025)
di: Kwon, Weeyoung, et al.
Pubblicazione: (2025)
Leveraging Prior Knowledge of Diffusion Model for Person Search
di: Kim, Giyeol, et al.
Pubblicazione: (2025)
di: Kim, Giyeol, et al.
Pubblicazione: (2025)
JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
di: Huang, Xiaohu, et al.
Pubblicazione: (2025)
di: Huang, Xiaohu, et al.
Pubblicazione: (2025)
Disentangled Representations for Short-Term and Long-Term Person Re-Identification
di: Eom, Chanho, et al.
Pubblicazione: (2024)
di: Eom, Chanho, et al.
Pubblicazione: (2024)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
di: Liu, Yunze, et al.
Pubblicazione: (2026)
di: Liu, Yunze, et al.
Pubblicazione: (2026)
MATE: Meet At The Embedding -- Connecting Images with Long Texts
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
di: Thawakar, Omkar, et al.
Pubblicazione: (2024)
di: Thawakar, Omkar, et al.
Pubblicazione: (2024)
Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
di: Thawakar, Omkar, et al.
Pubblicazione: (2025)
di: Thawakar, Omkar, et al.
Pubblicazione: (2025)
From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos
di: Gupta, Animesh, et al.
Pubblicazione: (2025)
di: Gupta, Animesh, et al.
Pubblicazione: (2025)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
di: Yu, Li, et al.
Pubblicazione: (2025)
di: Yu, Li, et al.
Pubblicazione: (2025)
X-Aligner: Composed Visual Retrieval without the Bells and Whistles
di: Zheng, Yuqian, et al.
Pubblicazione: (2026)
di: Zheng, Yuqian, et al.
Pubblicazione: (2026)
Towards Efficient and Effective Text-to-Video Retrieval with Coarse-to-Fine Visual Representation Learning
di: Tian, Kaibin, et al.
Pubblicazione: (2024)
di: Tian, Kaibin, et al.
Pubblicazione: (2024)
EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video Retrieval
di: Hummel, Thomas, et al.
Pubblicazione: (2024)
di: Hummel, Thomas, et al.
Pubblicazione: (2024)
Cerberus: Attribute-based person re-identification using semantic IDs
di: Eom, Chanho, et al.
Pubblicazione: (2024)
di: Eom, Chanho, et al.
Pubblicazione: (2024)
Pseudo-triplet Guided Few-shot Composed Image Retrieval
di: Hou, Bohan, et al.
Pubblicazione: (2024)
di: Hou, Bohan, et al.
Pubblicazione: (2024)
TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval
di: Li, Zixu, et al.
Pubblicazione: (2026)
di: Li, Zixu, et al.
Pubblicazione: (2026)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
Heterogeneous Uncertainty-Guided Composed Image Retrieval with Fine-Grained Probabilistic Learning
di: Tang, Haomiao, et al.
Pubblicazione: (2026)
di: Tang, Haomiao, et al.
Pubblicazione: (2026)
CoCoCo: Improving Text-Guided Video Inpainting for Better Consistency, Controllability and Compatibility
di: Zi, Bojia, et al.
Pubblicazione: (2024)
di: Zi, Bojia, et al.
Pubblicazione: (2024)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval
di: Yang, Bowen, et al.
Pubblicazione: (2025)
di: Yang, Bowen, et al.
Pubblicazione: (2025)
Visual Representation Alignment for Multimodal Large Language Models
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GOAL: Global-local Object Alignment Learning
di: Choi, Hyungyu, et al.
Pubblicazione: (2025) -
DiCo: Disentangled Concept Representation for Text-to-image Person Re-identification
di: Kim, Giyeol, et al.
Pubblicazione: (2026) -
Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024) -
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024) -
Do Vision-Language Models Understand Visual Persuasiveness?
di: Park, Gyuwon
Pubblicazione: (2025)