ProTA: Probabilistic Token Aggregation for Text-Video Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Han, Zang, Xianghao, Ban, Chao, Feng, Zerun, Zhou, Lanxiang, He, Zhongjiang, Li, Yongxiang, Sun, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Disentangle and denoise: Tackling context misalignment for video moment retrieval
par: Ma, Kaijing, et autres
Publié: (2024)
par: Ma, Kaijing, et autres
Publié: (2024)
Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval
par: Huang, Haojian, et autres
Publié: (2025)
par: Huang, Haojian, et autres
Publié: (2025)
OmniEraser: Remove Objects and Their Effects in Images with Paired Video-Frame Data
par: Wei, Runpu, et autres
Publié: (2025)
par: Wei, Runpu, et autres
Publié: (2025)
Geometric Image Editing via Effects-Sensitive In-Context Inpainting with Diffusion Transformers
par: Zhang, Shuo, et autres
Publié: (2026)
par: Zhang, Shuo, et autres
Publié: (2026)
Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
par: Li, Baoteng, et autres
Publié: (2026)
par: Li, Baoteng, et autres
Publié: (2026)
Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding
par: Ma, Kaijing, et autres
Publié: (2024)
par: Ma, Kaijing, et autres
Publié: (2024)
Trusted Unified Feature-Neighborhood Dynamics for Multi-View Classification
par: Huang, Haojian, et autres
Publié: (2024)
par: Huang, Haojian, et autres
Publié: (2024)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
par: Shen, Leqi, et autres
Publié: (2024)
par: Shen, Leqi, et autres
Publié: (2024)
WAT: Online Video Understanding Needs Watching Before Thinking
par: Han, Zifan, et autres
Publié: (2026)
par: Han, Zifan, et autres
Publié: (2026)
Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation
par: Sun, Kedi, et autres
Publié: (2026)
par: Sun, Kedi, et autres
Publié: (2026)
ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
TokenBinder: Text-Video Retrieval with One-to-Many Alignment Paradigm
par: Zhang, Bingqing, et autres
Publié: (2024)
par: Zhang, Bingqing, et autres
Publié: (2024)
Structure-Aware Prototype Guided Trusted Multi-View Classification
par: Huang, Haojian, et autres
Publié: (2025)
par: Huang, Haojian, et autres
Publié: (2025)
Adversarial Video Promotion Against Text-to-Video Retrieval
par: Tian, Qiwei, et autres
Publié: (2025)
par: Tian, Qiwei, et autres
Publié: (2025)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
par: Liu, Yunze, et autres
Publié: (2026)
par: Liu, Yunze, et autres
Publié: (2026)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
par: Huang, Xiaohu, et autres
Publié: (2024)
par: Huang, Xiaohu, et autres
Publié: (2024)
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
par: Li, Yili, et autres
Publié: (2025)
par: Li, Yili, et autres
Publié: (2025)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
par: Zhou, Keyi, et autres
Publié: (2024)
par: Zhou, Keyi, et autres
Publié: (2024)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
par: Shen, Leqi, et autres
Publié: (2025)
par: Shen, Leqi, et autres
Publié: (2025)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
par: Li, Chenglin, et autres
Publié: (2025)
par: Li, Chenglin, et autres
Publié: (2025)
Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval
par: Wang, Jiamian, et autres
Publié: (2024)
par: Wang, Jiamian, et autres
Publié: (2024)
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
par: Xiong, Yizhe, et autres
Publié: (2025)
par: Xiong, Yizhe, et autres
Publié: (2025)
CPGA: Coding Priors-Guided Aggregation Network for Compressed Video Quality Enhancement
par: Zhu, Qiang, et autres
Publié: (2024)
par: Zhu, Qiang, et autres
Publié: (2024)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
par: Gao, Tianyi, et autres
Publié: (2025)
par: Gao, Tianyi, et autres
Publié: (2025)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
par: Jin, Xiaojie, et autres
Publié: (2023)
par: Jin, Xiaojie, et autres
Publié: (2023)
Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation
par: Cheng, Lechao, et autres
Publié: (2023)
par: Cheng, Lechao, et autres
Publié: (2023)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
par: Liu, Weijia, et autres
Publié: (2025)
par: Liu, Weijia, et autres
Publié: (2025)
LongProLIP: A Probabilistic Vision-Language Model with Long Context Text
par: Chun, Sanghyuk, et autres
Publié: (2025)
par: Chun, Sanghyuk, et autres
Publié: (2025)
Emotional Support with LLM-based Empathetic Dialogue Generation
par: Wang, Shiquan, et autres
Publié: (2025)
par: Wang, Shiquan, et autres
Publié: (2025)
VideoOrion: Tokenizing Object Dynamics in Videos
par: Feng, Yicheng, et autres
Publié: (2024)
par: Feng, Yicheng, et autres
Publié: (2024)
CLIPtortionist: Zero-shot Text-driven Deformation for Manufactured 3D Shapes
par: Xu, Xianghao, et autres
Publié: (2024)
par: Xu, Xianghao, et autres
Publié: (2024)
Towards Robustness and Diversity: Continual Learning in Dialog Generation with Text-Mixup and Batch Nuclear-Norm Maximization
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval
par: Jing, Xiaolun, et autres
Publié: (2024)
par: Jing, Xiaolun, et autres
Publié: (2024)
Implicit Priors Editing in Stable Diffusion via Targeted Token Adjustment
par: He, Feng, et autres
Publié: (2024)
par: He, Feng, et autres
Publié: (2024)
Boosting Robust AIGI Detection with LoRA-based Pairwise Training
par: Xia, Ruiyang, et autres
Publié: (2026)
par: Xia, Ruiyang, et autres
Publié: (2026)
Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing
par: Yin, Zijin, et autres
Publié: (2026)
par: Yin, Zijin, et autres
Publié: (2026)
Aggregated Text Transformer for Scene Text Detection
par: Zhou, Zhao, et autres
Publié: (2022)
par: Zhou, Zhao, et autres
Publié: (2022)
CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content
par: Han, Gyuwon, et autres
Publié: (2026)
par: Han, Gyuwon, et autres
Publié: (2026)
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
par: Luo, Yongdong, et autres
Publié: (2025)
par: Luo, Yongdong, et autres
Publié: (2025)
Documents similaires
-
Disentangle and denoise: Tackling context misalignment for video moment retrieval
par: Ma, Kaijing, et autres
Publié: (2024) -
Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval
par: Huang, Haojian, et autres
Publié: (2025) -
OmniEraser: Remove Objects and Their Effects in Images with Paired Video-Frame Data
par: Wei, Runpu, et autres
Publié: (2025) -
Geometric Image Editing via Effects-Sensitive In-Context Inpainting with Diffusion Transformers
par: Zhang, Shuo, et autres
Publié: (2026) -
Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
par: Li, Baoteng, et autres
Publié: (2026)