Efficient Self-Supervised Video Hashing with Selective State Spaces
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jinpeng, Lian, Niu, Li, Jun, Wang, Yuting, Feng, Yan, Chen, Bin, Zhang, Yongbing, Xia, Shu-Tao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
par: Lian, Niu, et autres
Publié: (2025)
par: Lian, Niu, et autres
Publié: (2025)
GMMFormer: Gaussian-Mixture-Model Based Transformer for Efficient Partially Relevant Video Retrieval
par: Wang, Yuting, et autres
Publié: (2023)
par: Wang, Yuting, et autres
Publié: (2023)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
par: Lian, Niu, et autres
Publié: (2026)
par: Lian, Niu, et autres
Publié: (2026)
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
par: Luo, Tianci, et autres
Publié: (2026)
par: Luo, Tianci, et autres
Publié: (2026)
Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
PromptHash: Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval
par: Zou, Qiang, et autres
Publié: (2025)
par: Zou, Qiang, et autres
Publié: (2025)
Balancing Semantic Relevance and Engagement in Related Video Recommendations
par: Jaspal, Amit, et autres
Publié: (2025)
par: Jaspal, Amit, et autres
Publié: (2025)
Learning Partially-Decorrelated Common Spaces for Ad-hoc Video Search
par: Hu, Fan, et autres
Publié: (2025)
par: Hu, Fan, et autres
Publié: (2025)
Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale
par: Pan, Yongsen, et autres
Publié: (2026)
par: Pan, Yongsen, et autres
Publié: (2026)
From Swath to Full-Disc: Advancing Precipitation Retrieval with Multimodal Knowledge Expansion
par: Wang, Zheng, et autres
Publié: (2025)
par: Wang, Zheng, et autres
Publié: (2025)
Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval
par: Ning, Hailong, et autres
Publié: (2025)
par: Ning, Hailong, et autres
Publié: (2025)
CLEAR: Null-Space Projection for Cross-Modal De-Redundancy in Multimodal Recommendation
par: Zhan, Hao, et autres
Publié: (2026)
par: Zhan, Hao, et autres
Publié: (2026)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
Self-distilled Dynamic Fusion Network for Language-based Fashion Retrieval
par: Wu, Yiming, et autres
Publié: (2024)
par: Wu, Yiming, et autres
Publié: (2024)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
par: Liu, Han, et autres
Publié: (2025)
par: Liu, Han, et autres
Publié: (2025)
Frozen LVLMs for Micro-Video Recommendation: A Systematic Study of Feature Extraction and Fusion
par: Sun, Huatuan, et autres
Publié: (2025)
par: Sun, Huatuan, et autres
Publié: (2025)
Interactive Multi-Turn Retrieval for Health Videos
par: Wu, Chengzheng, et autres
Publié: (2026)
par: Wu, Chengzheng, et autres
Publié: (2026)
VCR: Video representation for Contextual Retrieval
par: Nir, Oron, et autres
Publié: (2024)
par: Nir, Oron, et autres
Publié: (2024)
Results of the 2025 Video Browser Showdown
par: Rossetto, Luca, et autres
Publié: (2025)
par: Rossetto, Luca, et autres
Publié: (2025)
Results of the 2024 Video Browser Showdown
par: Rossetto, Luca, et autres
Publié: (2024)
par: Rossetto, Luca, et autres
Publié: (2024)
VKIE: The Application of Key Information Extraction on Video Text
par: An, Siyu, et autres
Publié: (2023)
par: An, Siyu, et autres
Publié: (2023)
Leveraging Weak Cross-Modal Guidance for Coherence Modelling via Iterative Learning
par: Bin, Yi, et autres
Publié: (2024)
par: Bin, Yi, et autres
Publié: (2024)
Modality-Aware Identity Construction and Counterfactual Structure Learning for ID-Free Multimodal Recommendation
par: Ma, Hongjian, et autres
Publié: (2026)
par: Ma, Hongjian, et autres
Publié: (2026)
Cross-Modal Retrieval: A Systematic Review of Methods and Future Directions
par: Wang, Tianshi, et autres
Publié: (2023)
par: Wang, Tianshi, et autres
Publié: (2023)
The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval
par: Fu, Junchen, et autres
Publié: (2026)
par: Fu, Junchen, et autres
Publié: (2026)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2025)
par: Xiao, Jian, et autres
Publié: (2025)
Robust Relevance Feedback for Interactive Known-Item Video Search
par: Ma, Zhixin, et autres
Publié: (2025)
par: Ma, Zhixin, et autres
Publié: (2025)
MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
Leveraging User-Generated Metadata of Online Videos for Cover Song Identification
par: Hachmeier, Simon, et autres
Publié: (2024)
par: Hachmeier, Simon, et autres
Publié: (2024)
VisTopics: A Visual Semantic Unsupervised Approach to Topic Modeling of Video and Image Data
par: Lokmanoglu, Ayse D, et autres
Publié: (2025)
par: Lokmanoglu, Ayse D, et autres
Publié: (2025)
Towards Holistic Language-video Representation: the language model-enhanced MSR-Video to Text Dataset
par: Yang, Yuchen, et autres
Publié: (2024)
par: Yang, Yuchen, et autres
Publié: (2024)
3D-LMVIC: Learning-based Multi-View Image Coding with 3D Gaussian Geometric Priors
par: Huang, Yujun, et autres
Publié: (2024)
par: Huang, Yujun, et autres
Publié: (2024)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
par: Jiang, Haoyu, et autres
Publié: (2024)
par: Jiang, Haoyu, et autres
Publié: (2024)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
par: Kong, Fanheng, et autres
Publié: (2025)
par: Kong, Fanheng, et autres
Publié: (2025)
The State-of-the-Art in Lifelog Retrieval: A Review of Progress at the ACM Lifelog Search Challenge Workshop 2022-24
par: Tran, Allie, et autres
Publié: (2025)
par: Tran, Allie, et autres
Publié: (2025)
StePO-Rec: Towards Personalized Outfit Styling Assistant via Knowledge-Guided Multi-Step Reasoning
par: Bi, Yuxi, et autres
Publié: (2025)
par: Bi, Yuxi, et autres
Publié: (2025)
Documents similaires
-
AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
par: Lian, Niu, et autres
Publié: (2025) -
GMMFormer: Gaussian-Mixture-Model Based Transformer for Efficient Partially Relevant Video Retrieval
par: Wang, Yuting, et autres
Publié: (2023) -
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026) -
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
par: Li, Jun, et autres
Publié: (2025) -
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
par: Lian, Niu, et autres
Publié: (2026)