LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Hongjie, Dong, Lu, Liu, Yi, Huang, Yifei, Wang, Yali, Wang, Limin, Qiao, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
di: Wang, Zikang, et al.
Pubblicazione: (2025)
di: Wang, Zikang, et al.
Pubblicazione: (2025)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
Multi-granularity Contrastive Cross-modal Collaborative Generation for End-to-End Long-term Video Question Answering
di: Yu, Ting, et al.
Pubblicazione: (2024)
di: Yu, Ting, et al.
Pubblicazione: (2024)
VideoChat: Chat-Centric Video Understanding
di: Li, KunChang, et al.
Pubblicazione: (2023)
di: Li, KunChang, et al.
Pubblicazione: (2023)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026)
EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
di: Huang, Yifei, et al.
Pubblicazione: (2024)
di: Huang, Yifei, et al.
Pubblicazione: (2024)
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
di: Wang, Zining, et al.
Pubblicazione: (2025)
di: Wang, Zining, et al.
Pubblicazione: (2025)
VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
di: Huang, Ziqi, et al.
Pubblicazione: (2024)
di: Huang, Ziqi, et al.
Pubblicazione: (2024)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
A Simple LLM Framework for Long-Range Video Question-Answering
di: Zhang, Ce, et al.
Pubblicazione: (2023)
di: Zhang, Ce, et al.
Pubblicazione: (2023)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
di: He, Yuping, et al.
Pubblicazione: (2025)
di: He, Yuping, et al.
Pubblicazione: (2025)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
di: Li, Xinhao, et al.
Pubblicazione: (2025)
di: Li, Xinhao, et al.
Pubblicazione: (2025)
Harvest Video Foundation Models via Efficient Post-Pretraining
di: Li, Yizhuo, et al.
Pubblicazione: (2023)
di: Li, Yizhuo, et al.
Pubblicazione: (2023)
MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
di: Song, Seokwon, et al.
Pubblicazione: (2025)
di: Song, Seokwon, et al.
Pubblicazione: (2025)
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
di: Chen, Siran, et al.
Pubblicazione: (2025)
di: Chen, Siran, et al.
Pubblicazione: (2025)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
CinePile: A Long Video Question Answering Dataset and Benchmark
di: Rawal, Ruchit, et al.
Pubblicazione: (2024)
di: Rawal, Ruchit, et al.
Pubblicazione: (2024)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024)
di: Song, Enxin, et al.
Pubblicazione: (2024)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
di: Zou, Bo, et al.
Pubblicazione: (2024)
di: Zou, Bo, et al.
Pubblicazione: (2024)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024) -
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023) -
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
di: Nie, Yuxiang, et al.
Pubblicazione: (2025) -
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024) -
Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining
di: Dong, Lu, et al.
Pubblicazione: (2025)