ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hei, Xusen, Chen, Jiali, Yang, Jinyu, Zhao, Mengchen, Cai, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
di: Chen, Jiali, et al.
Pubblicazione: (2024)
di: Chen, Jiali, et al.
Pubblicazione: (2024)
ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments
di: Chen, Jiali, et al.
Pubblicazione: (2025)
di: Chen, Jiali, et al.
Pubblicazione: (2025)
CADReview: Automatically Reviewing CAD Programs with Error Detection and Correction
di: Chen, Jiali, et al.
Pubblicazione: (2025)
di: Chen, Jiali, et al.
Pubblicazione: (2025)
ViLLa: Video Reasoning Segmentation with Large Language Model
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
di: Zheng, Rongkun, et al.
Pubblicazione: (2024)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
di: Rawte, Vipula, et al.
Pubblicazione: (2024)
di: Rawte, Vipula, et al.
Pubblicazione: (2024)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
di: Zhao, Fufangchen, et al.
Pubblicazione: (2025)
di: Zhao, Fufangchen, et al.
Pubblicazione: (2025)
ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation
di: Zhang, Mengchen, et al.
Pubblicazione: (2025)
di: Zhang, Mengchen, et al.
Pubblicazione: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)
di: Li, Jingyao, et al.
Pubblicazione: (2025)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models
di: Guo, Yuxiang, et al.
Pubblicazione: (2024)
di: Guo, Yuxiang, et al.
Pubblicazione: (2024)
EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
di: Mou, Tingshu, et al.
Pubblicazione: (2026)
di: Mou, Tingshu, et al.
Pubblicazione: (2026)
The 1st Solution for 4th PVUW MeViS Challenge: Unleashing the Potential of Large Multimodal Models for Referring Video Segmentation
di: Fang, Hao, et al.
Pubblicazione: (2025)
di: Fang, Hao, et al.
Pubblicazione: (2025)
SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports
di: Xia, Haotian, et al.
Pubblicazione: (2025)
di: Xia, Haotian, et al.
Pubblicazione: (2025)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
di: Wang, Lehan, et al.
Pubblicazione: (2025)
di: Wang, Lehan, et al.
Pubblicazione: (2025)
SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models
di: Li, Shufan, et al.
Pubblicazione: (2026)
di: Li, Shufan, et al.
Pubblicazione: (2026)
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
di: Wang, Junjie, et al.
Pubblicazione: (2026)
di: Wang, Junjie, et al.
Pubblicazione: (2026)
LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology
di: Qin, Zhenyue, et al.
Pubblicazione: (2025)
di: Qin, Zhenyue, et al.
Pubblicazione: (2025)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
di: Deng, Andong, et al.
Pubblicazione: (2026)
di: Deng, Andong, et al.
Pubblicazione: (2026)
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
di: Luo, Jingnan, et al.
Pubblicazione: (2026)
di: Luo, Jingnan, et al.
Pubblicazione: (2026)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
Benchmarking Large and Small MLLMs
di: Feng, Xuelu, et al.
Pubblicazione: (2025)
di: Feng, Xuelu, et al.
Pubblicazione: (2025)
ViViD: Video Virtual Try-on using Diffusion Models
di: Fang, Zixun, et al.
Pubblicazione: (2024)
di: Fang, Zixun, et al.
Pubblicazione: (2024)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
di: Huang, Yu, et al.
Pubblicazione: (2025)
di: Huang, Yu, et al.
Pubblicazione: (2025)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
di: Luo, Yang, et al.
Pubblicazione: (2025)
di: Luo, Yang, et al.
Pubblicazione: (2025)
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
di: Cai, Huanqia, et al.
Pubblicazione: (2025)
di: Cai, Huanqia, et al.
Pubblicazione: (2025)
TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models
di: Chen, Junzhe, et al.
Pubblicazione: (2026)
di: Chen, Junzhe, et al.
Pubblicazione: (2026)
LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding
di: Wang, Xiaodong, et al.
Pubblicazione: (2026)
di: Wang, Xiaodong, et al.
Pubblicazione: (2026)
1st Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
di: Gao, Mingqi, et al.
Pubblicazione: (2024)
di: Gao, Mingqi, et al.
Pubblicazione: (2024)
Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models
di: Zhang, Linghao, et al.
Pubblicazione: (2026)
di: Zhang, Linghao, et al.
Pubblicazione: (2026)
Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
GRAB: A Challenging GRaph Analysis Benchmark for Large Multimodal Models
di: Roberts, Jonathan, et al.
Pubblicazione: (2024)
di: Roberts, Jonathan, et al.
Pubblicazione: (2024)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
di: Chen, Jiali, et al.
Pubblicazione: (2024) -
ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments
di: Chen, Jiali, et al.
Pubblicazione: (2025) -
CADReview: Automatically Reviewing CAD Programs with Error Detection and Correction
di: Chen, Jiali, et al.
Pubblicazione: (2025) -
ViLLa: Video Reasoning Segmentation with Large Language Model
di: Zheng, Rongkun, et al.
Pubblicazione: (2024) -
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)