Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge
Fuente:
arXiv
Salvato in:
| Autori principali: | Lando, Giuseppe, Forte, Rosario, Furnari, Antonino |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?
di: Lando, Giuseppe, et al.
Pubblicazione: (2025)
di: Lando, Giuseppe, et al.
Pubblicazione: (2025)
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision
di: Forte, Rosario, et al.
Pubblicazione: (2026)
di: Forte, Rosario, et al.
Pubblicazione: (2026)
Online Episodic Memory Visual Query Localization with Egocentric Streaming Object Memory
di: Manigrasso, Zaira, et al.
Pubblicazione: (2024)
di: Manigrasso, Zaira, et al.
Pubblicazione: (2024)
Exploiting Multimodal Synthetic Data for Egocentric Human-Object Interaction Detection in an Industrial Scenario
di: Leonardi, Rosario, et al.
Pubblicazione: (2023)
di: Leonardi, Rosario, et al.
Pubblicazione: (2023)
Differentiable Task Graph Learning: Procedural Activity Representation and Online Mistake Detection from Egocentric Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2024)
di: Seminara, Luigi, et al.
Pubblicazione: (2024)
Mamba-OTR: a Mamba-based Solution for Online Take and Release Detection from Untrimmed Egocentric Video
di: Catinello, Alessandro Sebastiano, et al.
Pubblicazione: (2025)
di: Catinello, Alessandro Sebastiano, et al.
Pubblicazione: (2025)
Leveraging Synthetic Data for Enhancing Egocentric Hand-Object Interaction Detection
di: Leonardi, Rosario, et al.
Pubblicazione: (2026)
di: Leonardi, Rosario, et al.
Pubblicazione: (2026)
Are Synthetic Data Useful for Egocentric Hand-Object Interaction Detection?
di: Leonardi, Rosario, et al.
Pubblicazione: (2023)
di: Leonardi, Rosario, et al.
Pubblicazione: (2023)
RECIPE: Procedural Planning via Grounding in Instructional Video
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance
di: Ragusa, Francesco, et al.
Pubblicazione: (2025)
di: Ragusa, Francesco, et al.
Pubblicazione: (2025)
Task Graph Maximum Likelihood Estimation for Procedural Activity Understanding in Egocentric Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2025)
di: Seminara, Luigi, et al.
Pubblicazione: (2025)
Calisthenics Skills Temporal Video Segmentation
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
Efficient Calisthenics Skills Classification through Foreground Instance Selection and Depth Estimation
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
StillFast: An End-to-End Approach for Short-Term Object Interaction Anticipation
di: Ragusa, Francesco, et al.
Pubblicazione: (2023)
di: Ragusa, Francesco, et al.
Pubblicazione: (2023)
Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark
di: Santos-Villafranca, Maria, et al.
Pubblicazione: (2026)
di: Santos-Villafranca, Maria, et al.
Pubblicazione: (2026)
Gazing Into Missteps: Leveraging Eye-Gaze for Unsupervised Mistake Detection in Egocentric Videos of Skilled Human Activities
di: Mazzamuto, Michele, et al.
Pubblicazione: (2024)
di: Mazzamuto, Michele, et al.
Pubblicazione: (2024)
Multimodal Rationales for Explainable Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
MIBench: Evaluating LMMs on Multimodal Interaction
di: Miao, Yu, et al.
Pubblicazione: (2026)
di: Miao, Yu, et al.
Pubblicazione: (2026)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024)
di: Song, Enxin, et al.
Pubblicazione: (2024)
A Real-Time System for Egocentric Hand-Object Interaction Detection in Industrial Domains
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs
di: Yamao, Sosuke, et al.
Pubblicazione: (2024)
di: Yamao, Sosuke, et al.
Pubblicazione: (2024)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
di: Bai, Ziyi, et al.
Pubblicazione: (2024)
di: Bai, Ziyi, et al.
Pubblicazione: (2024)
Fully Authentic Visual Question Answering Dataset from Online Communities
di: Chen, Chongyan, et al.
Pubblicazione: (2023)
di: Chen, Chongyan, et al.
Pubblicazione: (2023)
Interactive Episodic Memory with User Feedback
di: Subedi, Nikesh, et al.
Pubblicazione: (2026)
di: Subedi, Nikesh, et al.
Pubblicazione: (2026)
Human vs. LMMs: Exploring the Discrepancy in Emoji Interpretation and Usage in Digital Communication
di: Lyu, Hanjia, et al.
Pubblicazione: (2024)
di: Lyu, Hanjia, et al.
Pubblicazione: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025)
di: Lee, Dosung, et al.
Pubblicazione: (2025)
Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering
di: Li, Peize, et al.
Pubblicazione: (2024)
di: Li, Peize, et al.
Pubblicazione: (2024)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
di: Xu, Zitong, et al.
Pubblicazione: (2025)
di: Xu, Zitong, et al.
Pubblicazione: (2025)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)
ProSkill: Segment-Level Skill Assessment in Procedural Videos
di: Mazzamuto, Michele, et al.
Pubblicazione: (2026)
di: Mazzamuto, Michele, et al.
Pubblicazione: (2026)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
di: Xu, Quanxing, et al.
Pubblicazione: (2026)
di: Xu, Quanxing, et al.
Pubblicazione: (2026)
Multimodal Integration of Human-Like Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
BitMar: Low-Bit Multimodal Fusion with Episodic Memory for Edge Devices
di: Aman, Euhid, et al.
Pubblicazione: (2025)
di: Aman, Euhid, et al.
Pubblicazione: (2025)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
di: Movva, Prahitha, et al.
Pubblicazione: (2025)
di: Movva, Prahitha, et al.
Pubblicazione: (2025)
LMME3DHF: Benchmarking and Evaluating Multimodal 3D Human Face Generation with LMMs
di: Yang, Woo Yi, et al.
Pubblicazione: (2025)
di: Yang, Woo Yi, et al.
Pubblicazione: (2025)
Synchronization is All You Need: Exocentric-to-Egocentric Transfer for Temporal Action Segmentation with Unlabeled Synchronized Video Pairs
di: Quattrocchi, Camillo, et al.
Pubblicazione: (2023)
di: Quattrocchi, Camillo, et al.
Pubblicazione: (2023)
Documenti analoghi
-
How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?
di: Lando, Giuseppe, et al.
Pubblicazione: (2025) -
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision
di: Forte, Rosario, et al.
Pubblicazione: (2026) -
Online Episodic Memory Visual Query Localization with Egocentric Streaming Object Memory
di: Manigrasso, Zaira, et al.
Pubblicazione: (2024) -
Exploiting Multimodal Synthetic Data for Egocentric Human-Object Interaction Detection in an Industrial Scenario
di: Leonardi, Rosario, et al.
Pubblicazione: (2023) -
Differentiable Task Graph Learning: Procedural Activity Representation and Online Mistake Detection from Egocentric Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2024)