TVPR: Text-to-Video Person Retrieval and a New Benchmark
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xu, Ni, Fan, Dong, Guan-Nan, Zhu, Aichun, Wu, Jianhui, Ni, Mingcheng, Liu, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
di: Wang, Ni, et al.
Pubblicazione: (2024)
di: Wang, Ni, et al.
Pubblicazione: (2024)
Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark
di: Yang, Shuyu, et al.
Pubblicazione: (2025)
di: Yang, Shuyu, et al.
Pubblicazione: (2025)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
di: Liu, Weijia, et al.
Pubblicazione: (2025)
di: Liu, Weijia, et al.
Pubblicazione: (2025)
ITVTON: Virtual Try-On Diffusion Transformer Based on Integrated Image and Text
di: Ni, Haifeng, et al.
Pubblicazione: (2025)
di: Ni, Haifeng, et al.
Pubblicazione: (2025)
Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model
di: Wu, Peng, et al.
Pubblicazione: (2023)
di: Wu, Peng, et al.
Pubblicazione: (2023)
SA-Person: Text-Based Person Retrieval with Scene-aware Re-ranking
di: Xu, Yingjia, et al.
Pubblicazione: (2025)
di: Xu, Yingjia, et al.
Pubblicazione: (2025)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
di: Wang, Shaokun, et al.
Pubblicazione: (2026)
di: Wang, Shaokun, et al.
Pubblicazione: (2026)
Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval
di: Li, Wenjun, et al.
Pubblicazione: (2024)
di: Li, Wenjun, et al.
Pubblicazione: (2024)
Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark
di: Deng, Yifei, et al.
Pubblicazione: (2025)
di: Deng, Yifei, et al.
Pubblicazione: (2025)
SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
LongDPM: Overlap-Aware 4D Reconstruction from Long Monocular Videos
di: Xu, Chenyi, et al.
Pubblicazione: (2026)
di: Xu, Chenyi, et al.
Pubblicazione: (2026)
Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark
di: Deng, Yifei, et al.
Pubblicazione: (2026)
di: Deng, Yifei, et al.
Pubblicazione: (2026)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
di: Jin, Xiaojie, et al.
Pubblicazione: (2023)
di: Jin, Xiaojie, et al.
Pubblicazione: (2023)
Radiance Field Learners As UAV First-Person Viewers
di: Yan, Liqi, et al.
Pubblicazione: (2024)
di: Yan, Liqi, et al.
Pubblicazione: (2024)
T2VIndexer: A Generative Video Indexer for Efficient Text-Video Retrieval
di: Li, Yili, et al.
Pubblicazione: (2024)
di: Li, Yili, et al.
Pubblicazione: (2024)
Adversarial Video Promotion Against Text-to-Video Retrieval
di: Tian, Qiwei, et al.
Pubblicazione: (2025)
di: Tian, Qiwei, et al.
Pubblicazione: (2025)
RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection
di: Li, Hui, et al.
Pubblicazione: (2026)
di: Li, Hui, et al.
Pubblicazione: (2026)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
di: Liu, Yunze, et al.
Pubblicazione: (2026)
di: Liu, Yunze, et al.
Pubblicazione: (2026)
PersonaAnimator: Personalized Motion Transfer from Unconstrained Videos
di: Qian, Ziyun, et al.
Pubblicazione: (2025)
di: Qian, Ziyun, et al.
Pubblicazione: (2025)
UP-Person: Unified Parameter-Efficient Transfer Learning for Text-based Person Retrieval
di: Liu, Yating, et al.
Pubblicazione: (2025)
di: Liu, Yating, et al.
Pubblicazione: (2025)
Video-Bench: Human-Aligned Video Generation Benchmark
di: Han, Hui, et al.
Pubblicazione: (2025)
di: Han, Hui, et al.
Pubblicazione: (2025)
An Empirical Study of Validating Synthetic Data for Text-Based Person Retrieval
di: Cao, Min, et al.
Pubblicazione: (2025)
di: Cao, Min, et al.
Pubblicazione: (2025)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval
di: Yang, Shuyu, et al.
Pubblicazione: (2025)
di: Yang, Shuyu, et al.
Pubblicazione: (2025)
Cross-Platform Video Person ReID: A New Benchmark Dataset and Adaptation Approach
di: Zhang, Shizhou, et al.
Pubblicazione: (2024)
di: Zhang, Shizhou, et al.
Pubblicazione: (2024)
Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval
di: Wang, Jiamian, et al.
Pubblicazione: (2024)
di: Wang, Jiamian, et al.
Pubblicazione: (2024)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
di: Shen, Yiqing, et al.
Pubblicazione: (2025)
di: Shen, Yiqing, et al.
Pubblicazione: (2025)
EA-VTR: Event-Aware Video-Text Retrieval
di: Ma, Zongyang, et al.
Pubblicazione: (2024)
di: Ma, Zongyang, et al.
Pubblicazione: (2024)
Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods
di: Idan, Ofer, et al.
Pubblicazione: (2026)
di: Idan, Ofer, et al.
Pubblicazione: (2026)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2024)
di: Shen, Leqi, et al.
Pubblicazione: (2024)
Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing
di: Wu, Xiaodong, et al.
Pubblicazione: (2026)
di: Wu, Xiaodong, et al.
Pubblicazione: (2026)
Text-guided Image Restoration and Semantic Enhancement for Text-to-Image Person Retrieval
di: Liu, Delong, et al.
Pubblicazione: (2023)
di: Liu, Delong, et al.
Pubblicazione: (2023)
Kronecker Mask and Interpretive Prompts are Language-Action Video Learners
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
Text-based Aerial-Ground Person Retrieval
di: Zhou, Xinyu, et al.
Pubblicazione: (2025)
di: Zhou, Xinyu, et al.
Pubblicazione: (2025)
DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024)
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024)
What Makes for Text to 360-degree Panorama Generation with Stable Diffusion?
di: Ni, Jinhong, et al.
Pubblicazione: (2025)
di: Ni, Jinhong, et al.
Pubblicazione: (2025)
Who Can We Trust? Scope-Aware Video Moment Retrieval with Multi-Agent Conflict
di: Wu, Chaochen, et al.
Pubblicazione: (2025)
di: Wu, Chaochen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
di: Wang, Ni, et al.
Pubblicazione: (2024) -
Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark
di: Yang, Shuyu, et al.
Pubblicazione: (2025) -
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
di: Liu, Weijia, et al.
Pubblicazione: (2025) -
ITVTON: Virtual Try-On Diffusion Transformer Based on Integrated Image and Text
di: Ni, Haifeng, et al.
Pubblicazione: (2025) -
Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model
di: Wu, Peng, et al.
Pubblicazione: (2023)