TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Leqi, Hao, Tianxiang, He, Tao, Zhao, Sicheng, Zhang, Yifeng, Liu, Pengzhang, Bao, Yongjun, Ding, Guiguang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
di: Sun, Fengyuan, et al.
Pubblicazione: (2025)
di: Sun, Fengyuan, et al.
Pubblicazione: (2025)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
di: Hao, Tianxiang, et al.
Pubblicazione: (2023)
di: Hao, Tianxiang, et al.
Pubblicazione: (2023)
PYRA: Parallel Yielding Re-Activation for Training-Inference Efficient Task Adaptation
di: Xiong, Yizhe, et al.
Pubblicazione: (2024)
di: Xiong, Yizhe, et al.
Pubblicazione: (2024)
ProTA: Probabilistic Token Aggregation for Text-Video Retrieval
di: Fang, Han, et al.
Pubblicazione: (2024)
di: Fang, Han, et al.
Pubblicazione: (2024)
ReToMe-VA: Recursive Token Merging for Video Diffusion-based Unrestricted Adversarial Attack
di: Gao, Ziyi, et al.
Pubblicazione: (2024)
di: Gao, Ziyi, et al.
Pubblicazione: (2024)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
di: Tang, Zihan, et al.
Pubblicazione: (2026)
di: Tang, Zihan, et al.
Pubblicazione: (2026)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
Quantized Prompt for Efficient Generalization of Vision-Language Models
di: Hao, Tianxiang, et al.
Pubblicazione: (2024)
di: Hao, Tianxiang, et al.
Pubblicazione: (2024)
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
di: Xiong, Yizhe, et al.
Pubblicazione: (2025)
di: Xiong, Yizhe, et al.
Pubblicazione: (2025)
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
Importance-Based Token Merging for Efficient Image and Video Generation
di: Wu, Haoyu, et al.
Pubblicazione: (2024)
di: Wu, Haoyu, et al.
Pubblicazione: (2024)
Adversarial Video Promotion Against Text-to-Video Retrieval
di: Tian, Qiwei, et al.
Pubblicazione: (2025)
di: Tian, Qiwei, et al.
Pubblicazione: (2025)
Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
TempCompass: Do Video LLMs Really Understand Videos?
di: Liu, Yuanxin, et al.
Pubblicazione: (2024)
di: Liu, Yuanxin, et al.
Pubblicazione: (2024)
Video, How Do Your Tokens Merge?
di: Pollard, Sam, et al.
Pubblicazione: (2025)
di: Pollard, Sam, et al.
Pubblicazione: (2025)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
di: Hyun, Jeongseok, et al.
Pubblicazione: (2025)
di: Hyun, Jeongseok, et al.
Pubblicazione: (2025)
TempGlitch: Evaluating Vision-Language Models for Temporal Glitch Detection in Gameplay Videos
di: Yu, Yakun, et al.
Pubblicazione: (2026)
di: Yu, Yakun, et al.
Pubblicazione: (2026)
HoliTom: Holistic Token Merging for Fast Video Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
di: Han, Tingting, et al.
Pubblicazione: (2026)
di: Han, Tingting, et al.
Pubblicazione: (2026)
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
di: Li, Yunheng, et al.
Pubblicazione: (2025)
di: Li, Yunheng, et al.
Pubblicazione: (2025)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
di: Jin, Xiaojie, et al.
Pubblicazione: (2023)
di: Jin, Xiaojie, et al.
Pubblicazione: (2023)
TokenBinder: Text-Video Retrieval with One-to-Many Alignment Paradigm
di: Zhang, Bingqing, et al.
Pubblicazione: (2024)
di: Zhang, Bingqing, et al.
Pubblicazione: (2024)
More is Better: Deep Domain Adaptation with Multiple Sources
di: Zhao, Sicheng, et al.
Pubblicazione: (2024)
di: Zhao, Sicheng, et al.
Pubblicazione: (2024)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
di: Bagrov, Natan, et al.
Pubblicazione: (2025)
di: Bagrov, Natan, et al.
Pubblicazione: (2025)
Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding
di: Woo, Jongbhin, et al.
Pubblicazione: (2024)
di: Woo, Jongbhin, et al.
Pubblicazione: (2024)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
di: Liu, Yunze, et al.
Pubblicazione: (2026)
di: Liu, Yunze, et al.
Pubblicazione: (2026)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
di: Liu, Xinxin, et al.
Pubblicazione: (2026)
di: Liu, Xinxin, et al.
Pubblicazione: (2026)
T2VIndexer: A Generative Video Indexer for Efficient Text-Video Retrieval
di: Li, Yili, et al.
Pubblicazione: (2024)
di: Li, Yili, et al.
Pubblicazione: (2024)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
di: Wang, Ni, et al.
Pubblicazione: (2024)
di: Wang, Ni, et al.
Pubblicazione: (2024)
TTF: Temporal Token Fusion for Efficient Video-Language Model
di: Huo, Simin, et al.
Pubblicazione: (2026)
di: Huo, Simin, et al.
Pubblicazione: (2026)
TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models
di: Holtermann, Carolin, et al.
Pubblicazione: (2026)
di: Holtermann, Carolin, et al.
Pubblicazione: (2026)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
di: Wang, Ao, et al.
Pubblicazione: (2024)
di: Wang, Ao, et al.
Pubblicazione: (2024)
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
di: Li, Yili, et al.
Pubblicazione: (2025)
di: Li, Yili, et al.
Pubblicazione: (2025)
TIM: An Efficient Temporal Interaction Module for Spiking Transformer
di: Shen, Sicheng, et al.
Pubblicazione: (2024)
di: Shen, Sicheng, et al.
Pubblicazione: (2024)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
di: Kumar, Yogesh
Pubblicazione: (2025)
di: Kumar, Yogesh
Pubblicazione: (2025)
MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
Token Merging via Spatiotemporal Information Mining for Surgical Video Understanding
di: Jiang, Xixi, et al.
Pubblicazione: (2025)
di: Jiang, Xixi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2025) -
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
di: Shen, Leqi, et al.
Pubblicazione: (2025) -
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
di: Shen, Leqi, et al.
Pubblicazione: (2025) -
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
di: Sun, Fengyuan, et al.
Pubblicazione: (2025) -
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
di: Hao, Tianxiang, et al.
Pubblicazione: (2023)