T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yili, Xiong, Gang, Gou, Gaopeng, Qu, Xiangyan, Zhuang, Jiamin, Li, Zhen, Shi, Junzheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual-Semantic Decomposition and Partial Alignment for Document-based Zero-Shot Learning
par: Qu, Xiangyan, et autres
Publié: (2024)
par: Qu, Xiangyan, et autres
Publié: (2024)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
par: Zhang, Long, et autres
Publié: (2025)
par: Zhang, Long, et autres
Publié: (2025)
ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
par: Qu, Xiangyan, et autres
Publié: (2025)
par: Qu, Xiangyan, et autres
Publié: (2025)
MADS: Multi-Attribute Document Supervision for Zero-Shot Image Classification
par: Qu, Xiangyan, et autres
Publié: (2025)
par: Qu, Xiangyan, et autres
Publié: (2025)
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
PRVR: Partially Relevant Video Retrieval
par: Chen, Xianke, et autres
Publié: (2022)
par: Chen, Xianke, et autres
Publié: (2022)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2025)
par: Xiao, Jian, et autres
Publié: (2025)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
par: Zhao, Haochen, et autres
Publié: (2025)
par: Zhao, Haochen, et autres
Publié: (2025)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
par: Yang, Rui, et autres
Publié: (2024)
par: Yang, Rui, et autres
Publié: (2024)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
par: Huang, Hailang, et autres
Publié: (2024)
par: Huang, Hailang, et autres
Publié: (2024)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
par: Zhang, Deyu, et autres
Publié: (2025)
par: Zhang, Deyu, et autres
Publié: (2025)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
par: Nishimura, Taichi, et autres
Publié: (2023)
par: Nishimura, Taichi, et autres
Publié: (2023)
Beyond Coarse-Grained Matching in Video-Text Retrieval
par: Chen, Aozhu, et autres
Publié: (2024)
par: Chen, Aozhu, et autres
Publié: (2024)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
Distilling Generative-Discriminative Representations for Very Low-Resolution Face Recognition
par: Zhang, Junzheng, et autres
Publié: (2024)
par: Zhang, Junzheng, et autres
Publié: (2024)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
Towards Emotion Analysis in Short-form Videos: A Large-Scale Dataset and Baseline
par: Wu, Xuecheng, et autres
Publié: (2023)
par: Wu, Xuecheng, et autres
Publié: (2023)
TAVGBench: Benchmarking Text to Audible-Video Generation
par: Mao, Yuxin, et autres
Publié: (2024)
par: Mao, Yuxin, et autres
Publié: (2024)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
par: Yu, Hang, et autres
Publié: (2025)
par: Yu, Hang, et autres
Publié: (2025)
Adaptive 3D Gaussian Splatting Video Streaming
par: Gong, Han, et autres
Publié: (2025)
par: Gong, Han, et autres
Publié: (2025)
CPSL: Representing Volumetric Video via Content-Promoted Scene Layers
par: Hu, Kaiyuan, et autres
Publié: (2025)
par: Hu, Kaiyuan, et autres
Publié: (2025)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
par: Qiao, Xiangshuo, et autres
Publié: (2024)
par: Qiao, Xiangshuo, et autres
Publié: (2024)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025)
par: Zhou, Sheng, et autres
Publié: (2025)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
par: Jiang, Chen, et autres
Publié: (2023)
par: Jiang, Chen, et autres
Publié: (2023)
Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
par: Qu, Mengxue, et autres
Publié: (2024)
par: Qu, Mengxue, et autres
Publié: (2024)
Beyond Alignment: Blind Video Face Restoration via Parsing-Guided Temporal-Coherent Transformer
par: Xu, Kepeng, et autres
Publié: (2024)
par: Xu, Kepeng, et autres
Publié: (2024)
HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval
par: Chen, Zhiwei, et autres
Publié: (2025)
par: Chen, Zhiwei, et autres
Publié: (2025)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
par: Liu, Luping, et autres
Publié: (2024)
par: Liu, Luping, et autres
Publié: (2024)
Learning Segment Similarity and Alignment in Large-Scale Content Based Video Retrieval
par: Jiang, Chen, et autres
Publié: (2023)
par: Jiang, Chen, et autres
Publié: (2023)
Riemann-based Multi-scale Attention Reasoning Network for Text-3D Retrieval
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
ContextBLIP: Doubly Contextual Alignment for Contrastive Image Retrieval from Linguistically Complex Descriptions
par: Lin, Honglin, et autres
Publié: (2024)
par: Lin, Honglin, et autres
Publié: (2024)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
Documents similaires
-
Visual-Semantic Decomposition and Partial Alignment for Document-based Zero-Shot Learning
par: Qu, Xiangyan, et autres
Publié: (2024) -
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
par: Zhang, Long, et autres
Publié: (2025) -
ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
par: Qu, Xiangyan, et autres
Publié: (2025) -
MADS: Multi-Attribute Document Supervision for Zero-Shot Image Classification
par: Qu, Xiangyan, et autres
Publié: (2025) -
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
par: Yuan, Shenghai, et autres
Publié: (2024)