ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yueqian, Meng, Xiaojun, Wang, Yifan, Zhang, Huishuai, Zhao, Dongyan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
di: Wang, Yueqian, et al.
Pubblicazione: (2025)
di: Wang, Yueqian, et al.
Pubblicazione: (2025)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
di: Wang, Yuxuan, et al.
Pubblicazione: (2025)
di: Wang, Yuxuan, et al.
Pubblicazione: (2025)
FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs
di: Yin, Zhihan, et al.
Pubblicazione: (2026)
di: Yin, Zhihan, et al.
Pubblicazione: (2026)
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
di: Liang, Jianxin, et al.
Pubblicazione: (2024)
di: Liang, Jianxin, et al.
Pubblicazione: (2024)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
di: De Min, Thomas, et al.
Pubblicazione: (2026)
di: De Min, Thomas, et al.
Pubblicazione: (2026)
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video
di: Zhang, Yulin, et al.
Pubblicazione: (2025)
di: Zhang, Yulin, et al.
Pubblicazione: (2025)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
di: Zhao, Yusong, et al.
Pubblicazione: (2026)
di: Zhao, Yusong, et al.
Pubblicazione: (2026)
Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation
di: Chen, Yuzhuo, et al.
Pubblicazione: (2026)
di: Chen, Yuzhuo, et al.
Pubblicazione: (2026)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
di: Wang, Haibo, et al.
Pubblicazione: (2025)
di: Wang, Haibo, et al.
Pubblicazione: (2025)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
di: Zheng, Yikai, et al.
Pubblicazione: (2026)
di: Zheng, Yikai, et al.
Pubblicazione: (2026)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
di: Li, Chenglin, et al.
Pubblicazione: (2024)
di: Li, Chenglin, et al.
Pubblicazione: (2024)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
di: Wang, Lehan, et al.
Pubblicazione: (2025)
di: Wang, Lehan, et al.
Pubblicazione: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
Proact-VL: A Proactive VideoLLM for Real-Time AI Companions
di: Yan, Weicai, et al.
Pubblicazione: (2026)
di: Yan, Weicai, et al.
Pubblicazione: (2026)
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams
di: Li, Jinzhao, et al.
Pubblicazione: (2026)
di: Li, Jinzhao, et al.
Pubblicazione: (2026)
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
di: Ma, Ke, et al.
Pubblicazione: (2026)
di: Ma, Ke, et al.
Pubblicazione: (2026)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)
di: Li, Jingyao, et al.
Pubblicazione: (2025)
MBench: A Comprehensive Benchmark on Memory Capability for Video World Models
di: Zhang, Shengjun, et al.
Pubblicazione: (2026)
di: Zhang, Shengjun, et al.
Pubblicazione: (2026)
Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
di: Han, Mingfei, et al.
Pubblicazione: (2023)
di: Han, Mingfei, et al.
Pubblicazione: (2023)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
EgoSocial: Benchmarking Proactive Intervention Ability of Omnimodal LLMs via Egocentric Social Interaction Perception
di: Wang, Xijun, et al.
Pubblicazione: (2025)
di: Wang, Xijun, et al.
Pubblicazione: (2025)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
di: Wang, Chendong, et al.
Pubblicazione: (2025)
di: Wang, Chendong, et al.
Pubblicazione: (2025)
TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models
di: Chen, Junzhe, et al.
Pubblicazione: (2026)
di: Chen, Junzhe, et al.
Pubblicazione: (2026)
On the Consistency of Video Large Language Models in Temporal Comprehension
di: Jung, Minjoon, et al.
Pubblicazione: (2024)
di: Jung, Minjoon, et al.
Pubblicazione: (2024)
CL-VISTA: Benchmarking Continual Learning in Video Large Language Models
di: Guo, Haiyang, et al.
Pubblicazione: (2026)
di: Guo, Haiyang, et al.
Pubblicazione: (2026)
EvalCrafter: Benchmarking and Evaluating Large Video Generation Models
di: Liu, Yaofang, et al.
Pubblicazione: (2023)
di: Liu, Yaofang, et al.
Pubblicazione: (2023)
SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models
di: Liu, Bo, et al.
Pubblicazione: (2025)
di: Liu, Bo, et al.
Pubblicazione: (2025)
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
SmartHome-Bench: A Comprehensive Benchmark for Video Anomaly Detection in Smart Homes Using Multi-Modal Large Language Models
di: Zhao, Xinyi, et al.
Pubblicazione: (2025)
di: Zhao, Xinyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
di: Wang, Yueqian, et al.
Pubblicazione: (2025) -
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
di: Liang, Jianxin, et al.
Pubblicazione: (2025) -
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
di: Wang, Yueqian, et al.
Pubblicazione: (2024) -
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
di: Liang, Jianxin, et al.
Pubblicazione: (2025) -
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)