RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yuqi, Jin, Qin, Qu, Tianyuan, Liu, Xuan, Du, Yang, Yu, Bei, Jia, Jiaya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
di: Qu, Tianyuan, et al.
Pubblicazione: (2025)
di: Qu, Tianyuan, et al.
Pubblicazione: (2025)
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
di: Qu, Tianyuan, et al.
Pubblicazione: (2025)
di: Qu, Tianyuan, et al.
Pubblicazione: (2025)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval
di: Du, Yang, et al.
Pubblicazione: (2024)
di: Du, Yang, et al.
Pubblicazione: (2024)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
di: Wang, Yeyuan, et al.
Pubblicazione: (2024)
di: Wang, Yeyuan, et al.
Pubblicazione: (2024)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
di: Li, Yanwei, et al.
Pubblicazione: (2024)
di: Li, Yanwei, et al.
Pubblicazione: (2024)
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
di: Yang, Zhenyu, et al.
Pubblicazione: (2025)
di: Yang, Zhenyu, et al.
Pubblicazione: (2025)
Modular Customization of Diffusion Models via Blockwise-Parameterized Low-Rank Adaptation
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
di: Zhong, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhong, Zhisheng, et al.
Pubblicazione: (2024)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
AdsQA: Towards Advertisement Video Understanding
di: Long, Xinwei, et al.
Pubblicazione: (2025)
di: Long, Xinwei, et al.
Pubblicazione: (2025)
DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding
di: Ahmadian, Mona, et al.
Pubblicazione: (2025)
di: Ahmadian, Mona, et al.
Pubblicazione: (2025)
360+x: A Panoptic Multi-modal Scene Understanding Dataset
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
IRGPT: Understanding Real-world Infrared Image with Bi-cross-modal Curriculum on Large-scale Benchmark
di: Cao, Zhe, et al.
Pubblicazione: (2025)
di: Cao, Zhe, et al.
Pubblicazione: (2025)
Empowering Segmentation Ability to Multi-modal Large Language Models
di: Yang, Yuqi, et al.
Pubblicazione: (2024)
di: Yang, Yuqi, et al.
Pubblicazione: (2024)
HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization
di: Qiu, Xuerui, et al.
Pubblicazione: (2026)
di: Qiu, Xuerui, et al.
Pubblicazione: (2026)
Multi-modal Multi-task Pre-training for Improved Point Cloud Understanding
di: Liu, Liwen, et al.
Pubblicazione: (2025)
di: Liu, Liwen, et al.
Pubblicazione: (2025)
TimeLogic: A Temporal Logic Benchmark for Video QA
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
di: Yang, Qu, et al.
Pubblicazione: (2024)
di: Yang, Qu, et al.
Pubblicazione: (2024)
4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding
di: Zhu, Wenxuan, et al.
Pubblicazione: (2025)
di: Zhu, Wenxuan, et al.
Pubblicazione: (2025)
RoadSocial: A Diverse VideoQA Dataset and Benchmark for Road Event Understanding from Social Video Narratives
di: Parikh, Chirag, et al.
Pubblicazione: (2025)
di: Parikh, Chirag, et al.
Pubblicazione: (2025)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
di: Li, Zongxia, et al.
Pubblicazione: (2025)
di: Li, Zongxia, et al.
Pubblicazione: (2025)
MOODv2: Masked Image Modeling for Out-of-Distribution Detection
di: Li, Jingyao, et al.
Pubblicazione: (2024)
di: Li, Jingyao, et al.
Pubblicazione: (2024)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
di: Qin, Lixiong, et al.
Pubblicazione: (2025)
di: Qin, Lixiong, et al.
Pubblicazione: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
di: Wang, Chengyao, et al.
Pubblicazione: (2025)
di: Wang, Chengyao, et al.
Pubblicazione: (2025)
On the Multi-modal Vulnerability of Diffusion Models
di: Yang, Dingcheng, et al.
Pubblicazione: (2024)
di: Yang, Dingcheng, et al.
Pubblicazione: (2024)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
VLPose: Bridging the Domain Gap in Pose Estimation with Language-Vision Tuning
di: Li, Jingyao, et al.
Pubblicazione: (2024)
di: Li, Jingyao, et al.
Pubblicazione: (2024)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
di: Cheng, Zihui, et al.
Pubblicazione: (2024)
di: Cheng, Zihui, et al.
Pubblicazione: (2024)
M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding
di: Liu, Shenxi, et al.
Pubblicazione: (2025)
di: Liu, Shenxi, et al.
Pubblicazione: (2025)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
di: Zhu, Zifeng, et al.
Pubblicazione: (2024)
di: Zhu, Zifeng, et al.
Pubblicazione: (2024)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
di: Liu, Yuqi, et al.
Pubblicazione: (2025) -
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
di: Qu, Tianyuan, et al.
Pubblicazione: (2025) -
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
di: Qu, Tianyuan, et al.
Pubblicazione: (2025) -
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025) -
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
di: Yang, Senqiao, et al.
Pubblicazione: (2023)