Infinite Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Dell, Chen, Xiangyu, Luo, Jixiang, Jia, Mengxi, Sun, Changzhi, Ren, Ruilong, Liu, Jingren, Sun, Hao, Li, Xuelong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
di: Sun, Qianqian, et al.
Pubblicazione: (2025)
di: Sun, Qianqian, et al.
Pubblicazione: (2025)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2025)
di: Xiao, Jian, et al.
Pubblicazione: (2025)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022)
di: Fang, Xiang, et al.
Pubblicazione: (2022)
Very Efficient Listwise Multimodal Reranking for Long Documents
di: Sun, Yiqun, et al.
Pubblicazione: (2026)
di: Sun, Yiqun, et al.
Pubblicazione: (2026)
GMMFormer: Gaussian-Mixture-Model Based Transformer for Efficient Partially Relevant Video Retrieval
di: Wang, Yuting, et al.
Pubblicazione: (2023)
di: Wang, Yuting, et al.
Pubblicazione: (2023)
The CASTLE 2024 Dataset: Advancing the Art of Multimodal Understanding
di: Rossetto, Luca, et al.
Pubblicazione: (2025)
di: Rossetto, Luca, et al.
Pubblicazione: (2025)
AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
di: Lian, Niu, et al.
Pubblicazione: (2025)
di: Lian, Niu, et al.
Pubblicazione: (2025)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2024)
di: Xiao, Jian, et al.
Pubblicazione: (2024)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
di: Li, Minghan, et al.
Pubblicazione: (2026)
di: Li, Minghan, et al.
Pubblicazione: (2026)
VKIE: The Application of Key Information Extraction on Video Text
di: An, Siyu, et al.
Pubblicazione: (2023)
di: An, Siyu, et al.
Pubblicazione: (2023)
An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval
di: Jing, Xiaolun, et al.
Pubblicazione: (2024)
di: Jing, Xiaolun, et al.
Pubblicazione: (2024)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
di: Li, Jun, et al.
Pubblicazione: (2025)
di: Li, Jun, et al.
Pubblicazione: (2025)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
di: Liu, Han, et al.
Pubblicazione: (2025)
di: Liu, Han, et al.
Pubblicazione: (2025)
Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation
di: He, Xiao, et al.
Pubblicazione: (2025)
di: He, Xiao, et al.
Pubblicazione: (2025)
Efficient Self-Supervised Video Hashing with Selective State Spaces
di: Wang, Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Jinpeng, et al.
Pubblicazione: (2024)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
di: Jiang, Haoyu, et al.
Pubblicazione: (2024)
di: Jiang, Haoyu, et al.
Pubblicazione: (2024)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
di: Li, Jun, et al.
Pubblicazione: (2026)
di: Li, Jun, et al.
Pubblicazione: (2026)
Interactive Multi-Turn Retrieval for Health Videos
di: Wu, Chengzheng, et al.
Pubblicazione: (2026)
di: Wu, Chengzheng, et al.
Pubblicazione: (2026)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
di: Han, Haochen, et al.
Pubblicazione: (2024)
di: Han, Haochen, et al.
Pubblicazione: (2024)
LazyVLM: Neuro-Symbolic Approach to Video Analytics
di: Jian, Xiangru, et al.
Pubblicazione: (2025)
di: Jian, Xiangru, et al.
Pubblicazione: (2025)
Learning Partially-Decorrelated Common Spaces for Ad-hoc Video Search
di: Hu, Fan, et al.
Pubblicazione: (2025)
di: Hu, Fan, et al.
Pubblicazione: (2025)
PromptHash: Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval
di: Zou, Qiang, et al.
Pubblicazione: (2025)
di: Zou, Qiang, et al.
Pubblicazione: (2025)
Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval
di: Lin, Junan, et al.
Pubblicazione: (2025)
di: Lin, Junan, et al.
Pubblicazione: (2025)
VisTopics: A Visual Semantic Unsupervised Approach to Topic Modeling of Video and Image Data
di: Lokmanoglu, Ayse D, et al.
Pubblicazione: (2025)
di: Lokmanoglu, Ayse D, et al.
Pubblicazione: (2025)
Towards Holistic Language-video Representation: the language model-enhanced MSR-Video to Text Dataset
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
di: Luo, Tianci, et al.
Pubblicazione: (2026)
di: Luo, Tianci, et al.
Pubblicazione: (2026)
PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis
di: Pegia, Maria-Eirini, et al.
Pubblicazione: (2026)
di: Pegia, Maria-Eirini, et al.
Pubblicazione: (2026)
QuickGrasp: Responsive Video-Language Querying Service via Accelerated Tokenization and Edge-Augmented Inference
di: Zhang, Miao, et al.
Pubblicazione: (2026)
di: Zhang, Miao, et al.
Pubblicazione: (2026)
Cross-Modal Retrieval with Cauchy-Schwarz Divergence
di: Zhang, Jiahao, et al.
Pubblicazione: (2025)
di: Zhang, Jiahao, et al.
Pubblicazione: (2025)
Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation
di: Barrios, Wayner, et al.
Pubblicazione: (2026)
di: Barrios, Wayner, et al.
Pubblicazione: (2026)
VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking
di: Rothermel, Mark, et al.
Pubblicazione: (2026)
di: Rothermel, Mark, et al.
Pubblicazione: (2026)
A Matter of Time: Revealing the Structure of Time in Vision-Language Models
di: Tekaya, Nidham, et al.
Pubblicazione: (2025)
di: Tekaya, Nidham, et al.
Pubblicazione: (2025)
MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval
di: Ju, Yeong-Joon, et al.
Pubblicazione: (2024)
di: Ju, Yeong-Joon, et al.
Pubblicazione: (2024)
A Comprehensive Survey on Composed Image Retrieval
di: Song, Xuemeng, et al.
Pubblicazione: (2025)
di: Song, Xuemeng, et al.
Pubblicazione: (2025)
A Survey of Multimodal Composite Editing and Retrieval
di: Li, Suyan, et al.
Pubblicazione: (2024)
di: Li, Suyan, et al.
Pubblicazione: (2024)
Counteracting temporal attacks in Video Copy Detection
di: Fojcik, Katarzyna, et al.
Pubblicazione: (2025)
di: Fojcik, Katarzyna, et al.
Pubblicazione: (2025)
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
di: Lian, Niu, et al.
Pubblicazione: (2026)
di: Lian, Niu, et al.
Pubblicazione: (2026)
DSRAG: A Domain-Specific Retrieval Framework Based on Document-derived Multimodal Knowledge Graph
di: Yang, Mengzheng, et al.
Pubblicazione: (2025)
di: Yang, Mengzheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
di: Sun, Qianqian, et al.
Pubblicazione: (2025) -
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2025) -
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022) -
Very Efficient Listwise Multimodal Reranking for Long Documents
di: Sun, Yiqun, et al.
Pubblicazione: (2026) -
GMMFormer: Gaussian-Mixture-Model Based Transformer for Efficient Partially Relevant Video Retrieval
di: Wang, Yuting, et al.
Pubblicazione: (2023)