EASG-Bench: Video Q&A Benchmark with Egocentric Action Scene Graphs
Fuente:
arXiv
Salvato in:
| Autori principali: | Rodin, Ivan, Wu, Tz-Ying, Min, Kyle, Sridhar, Sharath Nittur, Furnari, Antonino, Tripathi, Subarna, Farinella, Giovanni Maria |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Harnessing Object Grounding for Time-Sensitive Video Understanding
di: Wu, Tz-Ying, et al.
Pubblicazione: (2025)
di: Wu, Tz-Ying, et al.
Pubblicazione: (2025)
Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models
di: Wu, Tz-Ying, et al.
Pubblicazione: (2025)
di: Wu, Tz-Ying, et al.
Pubblicazione: (2025)
Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation
di: Wu, Tz-Ying, et al.
Pubblicazione: (2024)
di: Wu, Tz-Ying, et al.
Pubblicazione: (2024)
Task Graph Maximum Likelihood Estimation for Procedural Activity Understanding in Egocentric Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2025)
di: Seminara, Luigi, et al.
Pubblicazione: (2025)
Differentiable Task Graph Learning: Procedural Activity Representation and Online Mistake Detection from Egocentric Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2024)
di: Seminara, Luigi, et al.
Pubblicazione: (2024)
Mamba-OTR: a Mamba-based Solution for Online Take and Release Detection from Untrimmed Egocentric Video
di: Catinello, Alessandro Sebastiano, et al.
Pubblicazione: (2025)
di: Catinello, Alessandro Sebastiano, et al.
Pubblicazione: (2025)
Gazing Into Missteps: Leveraging Eye-Gaze for Unsupervised Mistake Detection in Egocentric Videos of Skilled Human Activities
di: Mazzamuto, Michele, et al.
Pubblicazione: (2024)
di: Mazzamuto, Michele, et al.
Pubblicazione: (2024)
Are Synthetic Data Useful for Egocentric Hand-Object Interaction Detection?
di: Leonardi, Rosario, et al.
Pubblicazione: (2023)
di: Leonardi, Rosario, et al.
Pubblicazione: (2023)
Synchronization is All You Need: Exocentric-to-Egocentric Transfer for Temporal Action Segmentation with Unlabeled Synchronized Video Pairs
di: Quattrocchi, Camillo, et al.
Pubblicazione: (2023)
di: Quattrocchi, Camillo, et al.
Pubblicazione: (2023)
Leveraging Synthetic Data for Enhancing Egocentric Hand-Object Interaction Detection
di: Leonardi, Rosario, et al.
Pubblicazione: (2026)
di: Leonardi, Rosario, et al.
Pubblicazione: (2026)
Calisthenics Skills Temporal Video Segmentation
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
Exploiting Multimodal Synthetic Data for Egocentric Human-Object Interaction Detection in an Industrial Scenario
di: Leonardi, Rosario, et al.
Pubblicazione: (2023)
di: Leonardi, Rosario, et al.
Pubblicazione: (2023)
SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video
di: Valdez, Hector A., et al.
Pubblicazione: (2024)
di: Valdez, Hector A., et al.
Pubblicazione: (2024)
VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
di: Dipta, Shubhashis Roy, et al.
Pubblicazione: (2025)
di: Dipta, Shubhashis Roy, et al.
Pubblicazione: (2025)
Semantically Guided Action Anticipation
di: Diko, Anxhelo, et al.
Pubblicazione: (2024)
di: Diko, Anxhelo, et al.
Pubblicazione: (2024)
Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark
di: Santos-Villafranca, Maria, et al.
Pubblicazione: (2026)
di: Santos-Villafranca, Maria, et al.
Pubblicazione: (2026)
Efficient Calisthenics Skills Classification through Foreground Instance Selection and Depth Estimation
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
StillFast: An End-to-End Approach for Short-Term Object Interaction Anticipation
di: Ragusa, Francesco, et al.
Pubblicazione: (2023)
di: Ragusa, Francesco, et al.
Pubblicazione: (2023)
A Real-Time System for Egocentric Hand-Object Interaction Detection in Industrial Domains
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
di: Finocchiaro, Antonio, et al.
Pubblicazione: (2025)
An Outlook into the Future of Egocentric Vision
di: Plizzari, Chiara, et al.
Pubblicazione: (2023)
di: Plizzari, Chiara, et al.
Pubblicazione: (2023)
EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision
di: Forte, Rosario, et al.
Pubblicazione: (2026)
di: Forte, Rosario, et al.
Pubblicazione: (2026)
Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations
di: Messina, Nicola, et al.
Pubblicazione: (2025)
di: Messina, Nicola, et al.
Pubblicazione: (2025)
How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?
di: Lando, Giuseppe, et al.
Pubblicazione: (2025)
di: Lando, Giuseppe, et al.
Pubblicazione: (2025)
ProSkill: Segment-Level Skill Assessment in Procedural Videos
di: Mazzamuto, Michele, et al.
Pubblicazione: (2026)
di: Mazzamuto, Michele, et al.
Pubblicazione: (2026)
Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search
di: Liu, Sainan, et al.
Pubblicazione: (2026)
di: Liu, Sainan, et al.
Pubblicazione: (2026)
Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance
di: Ragusa, Francesco, et al.
Pubblicazione: (2025)
di: Ragusa, Francesco, et al.
Pubblicazione: (2025)
Online Episodic Memory Visual Query Localization with Egocentric Streaming Object Memory
di: Manigrasso, Zaira, et al.
Pubblicazione: (2024)
di: Manigrasso, Zaira, et al.
Pubblicazione: (2024)
LLaMA-NAS: Efficient Neural Architecture Search for Large Language Models
di: Sarah, Anthony, et al.
Pubblicazione: (2024)
di: Sarah, Anthony, et al.
Pubblicazione: (2024)
LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression
di: Kundu, Souvik, et al.
Pubblicazione: (2025)
di: Kundu, Souvik, et al.
Pubblicazione: (2025)
VideoSAGE: Video Summarization with Graph Representation Learning
di: Chaves, Jose M. Rojas, et al.
Pubblicazione: (2024)
di: Chaves, Jose M. Rojas, et al.
Pubblicazione: (2024)
Contrastive Language Video Time Pre-training
di: Liu, Hengyue, et al.
Pubblicazione: (2024)
di: Liu, Hengyue, et al.
Pubblicazione: (2024)
Keystep Recognition using Graph Neural Networks
di: Romero, Julia Lee, et al.
Pubblicazione: (2025)
di: Romero, Julia Lee, et al.
Pubblicazione: (2025)
Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos
di: Materia, Daniele, et al.
Pubblicazione: (2026)
di: Materia, Daniele, et al.
Pubblicazione: (2026)
Graph-Based Multimodal and Multi-view Alignment for Keystep Recognition
di: Romero, Julia Lee, et al.
Pubblicazione: (2025)
di: Romero, Julia Lee, et al.
Pubblicazione: (2025)
AFF-ttention! Affordances and Attention models for Short-Term Object Interaction Anticipation
di: Mur-Labadia, Lorenzo, et al.
Pubblicazione: (2024)
di: Mur-Labadia, Lorenzo, et al.
Pubblicazione: (2024)
Integrating Affordances and Attention models for Short-Term Object Interaction Anticipation
di: Labadia, Lorenzo Mur, et al.
Pubblicazione: (2026)
di: Labadia, Lorenzo Mur, et al.
Pubblicazione: (2026)
RECIPE: Procedural Planning via Grounding in Instructional Video
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
di: Seminara, Luigi, et al.
Pubblicazione: (2026)
EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation
di: Leonardi, Rosario, et al.
Pubblicazione: (2026)
di: Leonardi, Rosario, et al.
Pubblicazione: (2026)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Harnessing Object Grounding for Time-Sensitive Video Understanding
di: Wu, Tz-Ying, et al.
Pubblicazione: (2025) -
Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models
di: Wu, Tz-Ying, et al.
Pubblicazione: (2025) -
Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation
di: Wu, Tz-Ying, et al.
Pubblicazione: (2024) -
Task Graph Maximum Likelihood Estimation for Procedural Activity Understanding in Egocentric Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2025) -
Differentiable Task Graph Learning: Procedural Activity Representation and Online Mistake Detection from Egocentric Videos
di: Seminara, Luigi, et al.
Pubblicazione: (2024)