Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Xinlei, Peng, Xiulian, Li, Xiao, Xiong, Zhiwei, Lu, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
di: Ren, Xubin, et al.
Pubblicazione: (2025)
di: Ren, Xubin, et al.
Pubblicazione: (2025)
PEARL: Personalized Streaming Video Understanding Model
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026)
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
Smart Routing for Multimodal Video Retrieval: When to Search What
di: Rosa, Kevin Dela
Pubblicazione: (2025)
di: Rosa, Kevin Dela
Pubblicazione: (2025)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
di: Chu, Meng, et al.
Pubblicazione: (2025)
di: Chu, Meng, et al.
Pubblicazione: (2025)
$M^3EL$: A Multi-task Multi-topic Dataset for Multi-modal Entity Linking
di: Wang, Fang, et al.
Pubblicazione: (2024)
di: Wang, Fang, et al.
Pubblicazione: (2024)
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
di: Yu, Rongyi, et al.
Pubblicazione: (2026)
di: Yu, Rongyi, et al.
Pubblicazione: (2026)
Reverse Region-to-Entity Annotation for Pixel-Level Visual Entity Linking
di: Xu, Zhengfei, et al.
Pubblicazione: (2024)
di: Xu, Zhengfei, et al.
Pubblicazione: (2024)
Multi-Grained Query-Guided Set Prediction Network for Grounded Multimodal Named Entity Recognition
di: Tang, Jielong, et al.
Pubblicazione: (2024)
di: Tang, Jielong, et al.
Pubblicazione: (2024)
Video Enriched Retrieval Augmented Generation Using Aligned Video Captions
di: Rosa, Kevin Dela
Pubblicazione: (2024)
di: Rosa, Kevin Dela
Pubblicazione: (2024)
HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation
di: Luo, Linyin, et al.
Pubblicazione: (2025)
di: Luo, Linyin, et al.
Pubblicazione: (2025)
Infinite Video Understanding
di: Zhang, Dell, et al.
Pubblicazione: (2025)
di: Zhang, Dell, et al.
Pubblicazione: (2025)
Attribute-Aware Implicit Modality Alignment for Text Attribute Person Search
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
Efficient Logic Gate Networks for Video Copy Detection
di: Fojcik, Katarzyna
Pubblicazione: (2026)
di: Fojcik, Katarzyna
Pubblicazione: (2026)
Pailitao-VL: Unified Embedding and Reranker for Real-Time Multi-Modal Industrial Search
di: Chen, Lei, et al.
Pubblicazione: (2026)
di: Chen, Lei, et al.
Pubblicazione: (2026)
V-Agent: An Interactive Video Search System Using Vision-Language Models
di: Park, SunYoung, et al.
Pubblicazione: (2025)
di: Park, SunYoung, et al.
Pubblicazione: (2025)
CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora
di: Long, Zijun, et al.
Pubblicazione: (2024)
di: Long, Zijun, et al.
Pubblicazione: (2024)
Read and Think: An Efficient Step-wise Multimodal Language Model for Document Understanding and Reasoning
di: Zhang, Jinxu
Pubblicazione: (2024)
di: Zhang, Jinxu
Pubblicazione: (2024)
Enhancing Subsequent Video Retrieval via Vision-Language Models (VLMs)
di: Duan, Yicheng, et al.
Pubblicazione: (2025)
di: Duan, Yicheng, et al.
Pubblicazione: (2025)
AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency
di: Patel, Piyushkumar
Pubblicazione: (2025)
di: Patel, Piyushkumar
Pubblicazione: (2025)
ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2024)
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2024)
Dreaming User Multimodal Representation Guided by The Platonic Representation Hypothesis for Micro-Video Recommendation
di: Lin, Chengzhi, et al.
Pubblicazione: (2024)
di: Lin, Chengzhi, et al.
Pubblicazione: (2024)
From Videos to Indexed Knowledge Graphs -- Framework to Marry Methods for Multimodal Content Analysis and Understanding
di: Rizk, Basem, et al.
Pubblicazione: (2025)
di: Rizk, Basem, et al.
Pubblicazione: (2025)
Attributes Grouping and Mining Hashing for Fine-Grained Image Retrieval
di: Lu, Xin, et al.
Pubblicazione: (2023)
di: Lu, Xin, et al.
Pubblicazione: (2023)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
The CASTLE 2024 Dataset: Advancing the Art of Multimodal Understanding
di: Rossetto, Luca, et al.
Pubblicazione: (2025)
di: Rossetto, Luca, et al.
Pubblicazione: (2025)
Very Efficient Listwise Multimodal Reranking for Long Documents
di: Sun, Yiqun, et al.
Pubblicazione: (2026)
di: Sun, Yiqun, et al.
Pubblicazione: (2026)
Naiad: Novel Agentic Intelligent Autonomous System for Inland Water Monitoring
di: Baltzi, Eirini, et al.
Pubblicazione: (2025)
di: Baltzi, Eirini, et al.
Pubblicazione: (2025)
Sell It Before You Make It: Revolutionizing E-Commerce with Personalized AI-Generated Items
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
di: Zhang, Zhixin, et al.
Pubblicazione: (2024)
di: Zhang, Zhixin, et al.
Pubblicazione: (2024)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022)
di: Fang, Xiang, et al.
Pubblicazione: (2022)
Smart Multi-Modal Search: Contextual Sparse and Dense Embedding Integration in Adobe Express
di: Aroraa, Cherag, et al.
Pubblicazione: (2024)
di: Aroraa, Cherag, et al.
Pubblicazione: (2024)
Cross-Modal Retrieval with Cauchy-Schwarz Divergence
di: Zhang, Jiahao, et al.
Pubblicazione: (2025)
di: Zhang, Jiahao, et al.
Pubblicazione: (2025)
Zero-Shot Image Moderation in Google Ads with LLM-Assisted Textual Descriptions and Cross-modal Co-embeddings
di: Luo, Enming, et al.
Pubblicazione: (2024)
di: Luo, Enming, et al.
Pubblicazione: (2024)
EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection
di: Tang, Wenxin, et al.
Pubblicazione: (2026)
di: Tang, Wenxin, et al.
Pubblicazione: (2026)
GMMFormer: Gaussian-Mixture-Model Based Transformer for Efficient Partially Relevant Video Retrieval
di: Wang, Yuting, et al.
Pubblicazione: (2023)
di: Wang, Yuting, et al.
Pubblicazione: (2023)
DetailFusion: A Dual-branch Framework with Detail Enhancement for Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2025)
di: Yang, Yuxin, et al.
Pubblicazione: (2025)
An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval
di: Jing, Xiaolun, et al.
Pubblicazione: (2024)
di: Jing, Xiaolun, et al.
Pubblicazione: (2024)
VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
di: Kim, Dahun, et al.
Pubblicazione: (2025)
di: Kim, Dahun, et al.
Pubblicazione: (2025)
GENIUS: A Generative Framework for Universal Multimodal Search
di: Kim, Sungyeon, et al.
Pubblicazione: (2025)
di: Kim, Sungyeon, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
di: Ren, Xubin, et al.
Pubblicazione: (2025) -
PEARL: Personalized Streaming Video Understanding Model
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026) -
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
di: Wang, Xiaohan, et al.
Pubblicazione: (2024) -
Smart Routing for Multimodal Video Retrieval: When to Search What
di: Rosa, Kevin Dela
Pubblicazione: (2025) -
Understanding Long Videos via LLM-Powered Entity Relation Graphs
di: Chu, Meng, et al.
Pubblicazione: (2025)