VeRVE: Versatile Retrieval for Videos via Unified Embeddings
Fuente:
arXiv
Saved in:
| Main Authors: | Halbe, Shaunak, Puranik, Bhagyashree, Unnikrishnan, Jayakrishnan, Thakkar, Kushan, Bhat, Vimal, Parag, Toufiq |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VIDEOP2R: Video Understanding from Perception to Reasoning
by: Jiang, Yifan, et al.
Published: (2025)
by: Jiang, Yifan, et al.
Published: (2025)
RefTok: Reference-Based Tokenization for Video Generation
by: Fan, Xiang, et al.
Published: (2025)
by: Fan, Xiang, et al.
Published: (2025)
ViLL-E: Video LLM Embeddings for Retrieval
by: Gupta, Rohit, et al.
Published: (2026)
by: Gupta, Rohit, et al.
Published: (2026)
Modality Agnostic Efficient Long Range Encoder
by: Parag, Toufiq, et al.
Published: (2025)
by: Parag, Toufiq, et al.
Published: (2025)
The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models
by: Chopra, Shivang, et al.
Published: (2026)
by: Chopra, Shivang, et al.
Published: (2026)
DiffSign: AI-Assisted Generation of Customizable Sign Language Videos With Enhanced Realism
by: Krishnamurthy, Sudha, et al.
Published: (2024)
by: Krishnamurthy, Sudha, et al.
Published: (2024)
Continual Adaptation of Vision Transformers for Federated Learning
by: Halbe, Shaunak, et al.
Published: (2023)
by: Halbe, Shaunak, et al.
Published: (2023)
What Happens Next? Next Scene Prediction with a Unified Video Model
by: Li, Xinjie, et al.
Published: (2025)
by: Li, Xinjie, et al.
Published: (2025)
Open Vocabulary Multi-Label Video Classification
by: Gupta, Rohit, et al.
Published: (2024)
by: Gupta, Rohit, et al.
Published: (2024)
VeGaS: Video Gaussian Splatting
by: Smolak-Dyżewska, Weronika, et al.
Published: (2024)
by: Smolak-Dyżewska, Weronika, et al.
Published: (2024)
Text-Guided Video Masked Autoencoder
by: Fan, David, et al.
Published: (2024)
by: Fan, David, et al.
Published: (2024)
Large Kernel MedNeXt for Breast Tumor Segmentation and Self-Normalizing Network for pCR Classification in Magnetic Resonance Images
by: Musah, Toufiq
Published: (2025)
by: Musah, Toufiq
Published: (2025)
Adaptive Memory Replay for Continual Learning
by: Smith, James Seale, et al.
Published: (2024)
by: Smith, James Seale, et al.
Published: (2024)
One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
by: Zhang, Zheyu, et al.
Published: (2026)
by: Zhang, Zheyu, et al.
Published: (2026)
Grounding Descriptions in Images informs Zero-Shot Visual Recognition
by: Halbe, Shaunak, et al.
Published: (2024)
by: Halbe, Shaunak, et al.
Published: (2024)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
by: Thawakar, Omkar, et al.
Published: (2024)
by: Thawakar, Omkar, et al.
Published: (2024)
VidLA: Video-Language Alignment at Scale
by: Rizve, Mamshad Nayeem, et al.
Published: (2024)
by: Rizve, Mamshad Nayeem, et al.
Published: (2024)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
by: Tang, Changli, et al.
Published: (2025)
by: Tang, Changli, et al.
Published: (2025)
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
by: Chen, Houyuan, et al.
Published: (2026)
by: Chen, Houyuan, et al.
Published: (2026)
GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning
by: Wang, Yicheng, et al.
Published: (2024)
by: Wang, Yicheng, et al.
Published: (2024)
Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation
by: Fang, Hao, et al.
Published: (2024)
by: Fang, Hao, et al.
Published: (2024)
Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval
by: Wang, Jiamian, et al.
Published: (2024)
by: Wang, Jiamian, et al.
Published: (2024)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
by: Liu, Haowei, et al.
Published: (2024)
by: Liu, Haowei, et al.
Published: (2024)
Fall Detection from Indoor Videos using MediaPipe and Handcrafted Feature
by: Ahmed, Fatima, et al.
Published: (2025)
by: Ahmed, Fatima, et al.
Published: (2025)
CityGuessr: City-Level Video Geo-Localization on a Global Scale
by: Kulkarni, Parth Parag, et al.
Published: (2024)
by: Kulkarni, Parth Parag, et al.
Published: (2024)
RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos
by: Hannan, Tanveer, et al.
Published: (2023)
by: Hannan, Tanveer, et al.
Published: (2023)
Splatter a Video: Video Gaussian Representation for Versatile Processing
by: Sun, Yang-Tian, et al.
Published: (2024)
by: Sun, Yang-Tian, et al.
Published: (2024)
VeCoR -- Velocity Contrastive Regularization for Flow Matching
by: Hong, Zong-Wei, et al.
Published: (2025)
by: Hong, Zong-Wei, et al.
Published: (2025)
Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding
by: Wang, Mengzhao, et al.
Published: (2024)
by: Wang, Mengzhao, et al.
Published: (2024)
Plug-and-Play Versatile Compressed Video Enhancement
by: Zeng, Huimin, et al.
Published: (2025)
by: Zeng, Huimin, et al.
Published: (2025)
Versatile Transition Generation with Image-to-Video Diffusion
by: Yang, Zuhao, et al.
Published: (2025)
by: Yang, Zuhao, et al.
Published: (2025)
VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension
by: Ling, Zeyu, et al.
Published: (2024)
by: Ling, Zeyu, et al.
Published: (2024)
T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval
by: Wang, Xiao, et al.
Published: (2026)
by: Wang, Xiao, et al.
Published: (2026)
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
by: Tzachor, Issar, et al.
Published: (2026)
by: Tzachor, Issar, et al.
Published: (2026)
VideoSketcher: Video Models Prior Enable Versatile Sequential Sketch Generation
by: Ren, Hui, et al.
Published: (2026)
by: Ren, Hui, et al.
Published: (2026)
OmniFD: A Unified Model for Versatile Face Forgery Detection
by: Liu, Haotian, et al.
Published: (2025)
by: Liu, Haotian, et al.
Published: (2025)
FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
by: Wen, Haokun, et al.
Published: (2026)
by: Wen, Haokun, et al.
Published: (2026)
OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation
by: Liang, Sen, et al.
Published: (2025)
by: Liang, Sen, et al.
Published: (2025)
Adaptive Human Trajectory Prediction via Latent Corridors
by: Thakkar, Neerja, et al.
Published: (2023)
by: Thakkar, Neerja, et al.
Published: (2023)
VeCAF: Vision-language Collaborative Active Finetuning with Training Objective Awareness
by: Zhang, Rongyu, et al.
Published: (2024)
by: Zhang, Rongyu, et al.
Published: (2024)
Similar Items
-
VIDEOP2R: Video Understanding from Perception to Reasoning
by: Jiang, Yifan, et al.
Published: (2025) -
RefTok: Reference-Based Tokenization for Video Generation
by: Fan, Xiang, et al.
Published: (2025) -
ViLL-E: Video LLM Embeddings for Retrieval
by: Gupta, Rohit, et al.
Published: (2026) -
Modality Agnostic Efficient Long Range Encoder
by: Parag, Toufiq, et al.
Published: (2025) -
The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models
by: Chopra, Shivang, et al.
Published: (2026)