WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yeo, Woongyeong, Kim, Kangsan, Yoon, Jaehong, Hwang, Sung Ju |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025)
VideoRAG: Retrieval-Augmented Generation over Video Corpus
di: Jeong, Soyeong, et al.
Pubblicazione: (2025)
di: Jeong, Soyeong, et al.
Pubblicazione: (2025)
VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video Understanding
di: Kim, Kangsan, et al.
Pubblicazione: (2024)
di: Kim, Kangsan, et al.
Pubblicazione: (2024)
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
di: Guo, Minghao, et al.
Pubblicazione: (2026)
di: Guo, Minghao, et al.
Pubblicazione: (2026)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
di: Lian, Niu, et al.
Pubblicazione: (2026)
di: Lian, Niu, et al.
Pubblicazione: (2026)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
OmniRetrieval: Unified Retrieval across Heterogeneous Knowledge Sources
di: Baek, Jinheon, et al.
Pubblicazione: (2026)
di: Baek, Jinheon, et al.
Pubblicazione: (2026)
Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
Progressive Multimodal Reasoning via Active Retrieval
di: Dong, Guanting, et al.
Pubblicazione: (2024)
di: Dong, Guanting, et al.
Pubblicazione: (2024)
ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
Personal Visual Memory from Explicit and Implicit Evidence
di: Nguyen, Viet, et al.
Pubblicazione: (2026)
di: Nguyen, Viet, et al.
Pubblicazione: (2026)
REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark
di: Wasserman, Navve, et al.
Pubblicazione: (2025)
di: Wasserman, Navve, et al.
Pubblicazione: (2025)
Beyond Unimodal Boundaries: Generative Recommendation with Multimodal Semantics
di: Zhu, Jing, et al.
Pubblicazione: (2025)
di: Zhu, Jing, et al.
Pubblicazione: (2025)
Windsock is Dancing: Adaptive Multimodal Retrieval-Augmented Generation
di: Zhao, Shu, et al.
Pubblicazione: (2025)
di: Zhao, Shu, et al.
Pubblicazione: (2025)
X-Reflect: Cross-Reflection Prompting for Multimodal Recommendation
di: Lyu, Hanjia, et al.
Pubblicazione: (2024)
di: Lyu, Hanjia, et al.
Pubblicazione: (2024)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
di: Hou, Bohan, et al.
Pubblicazione: (2026)
di: Hou, Bohan, et al.
Pubblicazione: (2026)
Indexing Multimodal Language Models for Large-scale Image Retrieval
di: Tharwat, Bahey, et al.
Pubblicazione: (2026)
di: Tharwat, Bahey, et al.
Pubblicazione: (2026)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval
di: Wan, David, et al.
Pubblicazione: (2025)
di: Wan, David, et al.
Pubblicazione: (2025)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval
di: Kim, Seonok
Pubblicazione: (2026)
di: Kim, Seonok
Pubblicazione: (2026)
Seeing Through the MiRAGE: Evaluating Multimodal Retrieval Augmented Generation
di: Martin, Alexander, et al.
Pubblicazione: (2025)
di: Martin, Alexander, et al.
Pubblicazione: (2025)
E5-V: Universal Embeddings with Multimodal Large Language Models
di: Jiang, Ting, et al.
Pubblicazione: (2024)
di: Jiang, Ting, et al.
Pubblicazione: (2024)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
di: Cai, Qifeng, et al.
Pubblicazione: (2025)
di: Cai, Qifeng, et al.
Pubblicazione: (2025)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction
di: Xiao, Zilin, et al.
Pubblicazione: (2025)
di: Xiao, Zilin, et al.
Pubblicazione: (2025)
VLM-KG: Multimodal Radiology Knowledge Graph Generation
di: Abdullah, Abdullah, et al.
Pubblicazione: (2025)
di: Abdullah, Abdullah, et al.
Pubblicazione: (2025)
VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
di: Kim, Dahun, et al.
Pubblicazione: (2025)
di: Kim, Dahun, et al.
Pubblicazione: (2025)
TransientTables: Evaluating LLMs' Reasoning on Temporally Evolving Semi-structured Tables
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025)
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025)
CollEX -- A Multimodal Agentic RAG System Enabling Interactive Exploration of Scientific Collections
di: Schneider, Florian, et al.
Pubblicazione: (2025)
di: Schneider, Florian, et al.
Pubblicazione: (2025)
From Videos to Indexed Knowledge Graphs -- Framework to Marry Methods for Multimodal Content Analysis and Understanding
di: Rizk, Basem, et al.
Pubblicazione: (2025)
di: Rizk, Basem, et al.
Pubblicazione: (2025)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
di: Xu, Tao
Pubblicazione: (2026)
di: Xu, Tao
Pubblicazione: (2026)
ReinPool: Reinforcement Learning Pooling Multi-Vector Embeddings for Retrieval System
di: Cha, Sungguk, et al.
Pubblicazione: (2026)
di: Cha, Sungguk, et al.
Pubblicazione: (2026)
Unified Multimodal Interleaved Document Representation for Retrieval
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
Multimodal Neural Databases
di: Trappolini, Giovanni, et al.
Pubblicazione: (2023)
di: Trappolini, Giovanni, et al.
Pubblicazione: (2023)
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
di: Yu, Shoubin, et al.
Pubblicazione: (2024)
di: Yu, Shoubin, et al.
Pubblicazione: (2024)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
di: Guo, Zhuoning, et al.
Pubblicazione: (2025)
di: Guo, Zhuoning, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities
di: Yeo, Woongyeong, et al.
Pubblicazione: (2025) -
VideoRAG: Retrieval-Augmented Generation over Video Corpus
di: Jeong, Soyeong, et al.
Pubblicazione: (2025) -
VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video Understanding
di: Kim, Kangsan, et al.
Pubblicazione: (2024) -
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
di: Guo, Minghao, et al.
Pubblicazione: (2026) -
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
di: Kim, Kangsan, et al.
Pubblicazione: (2026)