Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Ni, Liao, Dongliang, Xu, Xing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
par: Menapace, Willi, et autres
Publié: (2024)
par: Menapace, Willi, et autres
Publié: (2024)
Frame-Difference Guided Dynamic Region Perception for CLIP Adaptation in Text-Video Retrieval
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation
par: Vu, Huu-An, et autres
Publié: (2025)
par: Vu, Huu-An, et autres
Publié: (2025)
Multi-path Exploration and Feedback Adjustment for Text-to-Image Person Retrieval
par: Kang, Bin, et autres
Publié: (2024)
par: Kang, Bin, et autres
Publié: (2024)
Multi-scale Temporal Fusion Transformer for Incomplete Vehicle Trajectory Prediction
par: Liu, Zhanwen, et autres
Publié: (2024)
par: Liu, Zhanwen, et autres
Publié: (2024)
Retrieval, Refinement, and Ranking for Text-to-Video Generation via Prompt Optimization and Test-Time Scaling
par: Rahman, Zillur, et autres
Publié: (2026)
par: Rahman, Zillur, et autres
Publié: (2026)
GloTSFormer: Global Video Text Spotting Transformer
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
par: Tzachor, Issar, et autres
Publié: (2026)
par: Tzachor, Issar, et autres
Publié: (2026)
Learning Online Scale Transformation for Talking Head Video Generation
par: Hong, Fa-Ting, et autres
Publié: (2024)
par: Hong, Fa-Ting, et autres
Publié: (2024)
GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval
par: Yang, Bowen, et autres
Publié: (2025)
par: Yang, Bowen, et autres
Publié: (2025)
Ambiguity-Restrained Text-Video Representation Learning for Partially Relevant Video Retrieval
par: Cho, CH, et autres
Publié: (2025)
par: Cho, CH, et autres
Publié: (2025)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
par: Shu, Xiujun, et autres
Publié: (2023)
par: Shu, Xiujun, et autres
Publié: (2023)
CLIP-based Synergistic Knowledge Transfer for Text-based Person Retrieval
par: Liu, Yating, et autres
Publié: (2023)
par: Liu, Yating, et autres
Publié: (2023)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
par: Liu, Xiaolin, et autres
Publié: (2026)
par: Liu, Xiaolin, et autres
Publié: (2026)
GATS: Gaussian Aware Temporal Scaling Transformer for Invariant 4D Spatio-Temporal Point Cloud Representation
par: Tian, Jiayi, et autres
Publié: (2026)
par: Tian, Jiayi, et autres
Publié: (2026)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
par: Feng, Weixi, et autres
Publié: (2024)
par: Feng, Weixi, et autres
Publié: (2024)
SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video
par: Valdez, Hector A., et autres
Publié: (2024)
par: Valdez, Hector A., et autres
Publié: (2024)
Audio-Sync Video Generation with Multi-Stream Temporal Control
par: Weng, Shuchen, et autres
Publié: (2025)
par: Weng, Shuchen, et autres
Publié: (2025)
STAA: Spatio-Temporal Attention Attribution for Real-Time Interpreting Transformer-based Video Models
par: Wang, Zerui, et autres
Publié: (2024)
par: Wang, Zerui, et autres
Publié: (2024)
Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
par: Yin, Zixin, et autres
Publié: (2025)
par: Yin, Zixin, et autres
Publié: (2025)
Exposing and Mitigating Temporal Attack in Deepfake Video Detection
par: Gu, Zheyuan, et autres
Publié: (2026)
par: Gu, Zheyuan, et autres
Publié: (2026)
Learning Segment Similarity and Alignment in Large-Scale Content Based Video Retrieval
par: Jiang, Chen, et autres
Publié: (2023)
par: Jiang, Chen, et autres
Publié: (2023)
DM-Adapter: Domain-Aware Mixture-of-Adapters for Text-Based Person Retrieval
par: Liu, Yating, et autres
Publié: (2025)
par: Liu, Yating, et autres
Publié: (2025)
StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter
par: Liu, Gongye, et autres
Publié: (2023)
par: Liu, Gongye, et autres
Publié: (2023)
Temporal Object-Aware Vision Transformer for Few-Shot Video Object Detection
par: Kumar, Yogesh, et autres
Publié: (2025)
par: Kumar, Yogesh, et autres
Publié: (2025)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval
par: Paul, Dhiman, et autres
Publié: (2024)
par: Paul, Dhiman, et autres
Publié: (2024)
Video Text Preservation with Synthetic Text-Rich Videos
par: Liu, Ziyang, et autres
Publié: (2025)
par: Liu, Ziyang, et autres
Publié: (2025)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
par: Fu, Honghao, et autres
Publié: (2026)
par: Fu, Honghao, et autres
Publié: (2026)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Towards Unified Multi-granularity Text Detection with Interactive Attention
par: Wan, Xingyu, et autres
Publié: (2024)
par: Wan, Xingyu, et autres
Publié: (2024)
Temporal-Spatial Tubelet Embedding for Cloud-Robust MSI Reconstruction using MSI-SAR Fusion: A Multi-Head Self-Attention Video Vision Transformer Approach
par: Wang, Yiqun, et autres
Publié: (2025)
par: Wang, Yiqun, et autres
Publié: (2025)
Human-Centric Video Anomaly Detection Through Spatio-Temporal Pose Tokenization and Transformer
par: Noghre, Ghazal Alinezhad, et autres
Publié: (2024)
par: Noghre, Ghazal Alinezhad, et autres
Publié: (2024)
DOTA: Deformable Optimized Transformer Architecture for End-to-End Text Recognition with Retrieval-Augmented Generation
par: Nithisopa, Naphat, et autres
Publié: (2025)
par: Nithisopa, Naphat, et autres
Publié: (2025)
Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation
par: Cao, Yushe, et autres
Publié: (2025)
par: Cao, Yushe, et autres
Publié: (2025)
Text-based Aerial-Ground Person Retrieval
par: Zhou, Xinyu, et autres
Publié: (2025)
par: Zhou, Xinyu, et autres
Publié: (2025)
Fuse Your Latents: Video Editing with Multi-source Latent Diffusion Models
par: Lu, Tianyi, et autres
Publié: (2023)
par: Lu, Tianyi, et autres
Publié: (2023)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
par: Zhou, Ziwei, et autres
Publié: (2026)
par: Zhou, Ziwei, et autres
Publié: (2026)
Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
Documents similaires
-
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
par: Menapace, Willi, et autres
Publié: (2024) -
Frame-Difference Guided Dynamic Region Perception for CLIP Adaptation in Text-Video Retrieval
par: Yu, Jiaao, et autres
Publié: (2025) -
MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation
par: Vu, Huu-An, et autres
Publié: (2025) -
Multi-path Exploration and Feedback Adjustment for Text-to-Image Person Retrieval
par: Kang, Bin, et autres
Publié: (2024) -
Multi-scale Temporal Fusion Transformer for Incomplete Vehicle Trajectory Prediction
par: Liu, Zhanwen, et autres
Publié: (2024)