Enregistré dans:
| Auteurs principaux: | Xu, Yichen, Liu, Yuanhang, Wang, Chuhan, Zhao, Zihan, luo, jinghan, Ma, Jianzhe, Wang, Wenxuan, Jin, Qin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.15736 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Survey of Deep Learning for Geometry Problem Solving
par: Ma, Jianzhe, et autres
Publié: (2025)
par: Ma, Jianzhe, et autres
Publié: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025)
par: Xu, Yichen, et autres
Publié: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
par: Ma, Jianzhe, et autres
Publié: (2026)
par: Ma, Jianzhe, et autres
Publié: (2026)
Referee: Reference-aware Audiovisual Deepfake Detection
par: Boo, Hyemin, et autres
Publié: (2025)
par: Boo, Hyemin, et autres
Publié: (2025)
Implicit Biases in Refereeing: Lessons from NBA Referees
par: Pelechrinis, Konstantinos
Publié: (2022)
par: Pelechrinis, Konstantinos
Publié: (2022)
Towards AI-Powered Video Assistant Referee System (VARS) for Association Football
par: Held, Jan, et autres
Publié: (2024)
par: Held, Jan, et autres
Publié: (2024)
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
par: Wang, Yueqian, et autres
Publié: (2025)
par: Wang, Yueqian, et autres
Publié: (2025)
ChartEditor: A Reinforcement Learning Framework for Robust Chart Editing
par: Chen, Liangyu, et autres
Publié: (2025)
par: Chen, Liangyu, et autres
Publié: (2025)
X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Model
par: Held, Jan, et autres
Publié: (2024)
par: Held, Jan, et autres
Publié: (2024)
VARS: Video Assistant Referee System for Automated Soccer Decision Making from Multiple Views
par: Held, Jan, et autres
Publié: (2023)
par: Held, Jan, et autres
Publié: (2023)
Unhackable Temporal Rewarding for Scalable Video MLLMs
par: Yu, En, et autres
Publié: (2025)
par: Yu, En, et autres
Publié: (2025)
Exploring the Design Space of Visual Context Representation in Video MLLMs
par: Du, Yifan, et autres
Publié: (2024)
par: Du, Yifan, et autres
Publié: (2024)
MileBench: Benchmarking MLLMs in Long Context
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
par: Wang, Junyang, et autres
Publié: (2023)
par: Wang, Junyang, et autres
Publié: (2023)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
par: Fang, I-Sheng, et autres
Publié: (2025)
par: Fang, I-Sheng, et autres
Publié: (2025)
SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs
par: Wang, Siting, et autres
Publié: (2025)
par: Wang, Siting, et autres
Publié: (2025)
VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs
par: Yeh, Chun-Hsiao, et autres
Publié: (2025)
par: Yeh, Chun-Hsiao, et autres
Publié: (2025)
Real-Time Multimodal Signal Processing for HRI in RoboCup: Understanding a Human Referee
par: Ansalone, Filippo, et autres
Publié: (2024)
par: Ansalone, Filippo, et autres
Publié: (2024)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
par: Qi, Yukun, et autres
Publié: (2025)
par: Qi, Yukun, et autres
Publié: (2025)
Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs
par: Huang, Jen-Tse, et autres
Publié: (2025)
par: Huang, Jen-Tse, et autres
Publié: (2025)
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
par: Anand, Dhruv, et autres
Publié: (2025)
par: Anand, Dhruv, et autres
Publié: (2025)
AdaCodec: A Predictive Visual Code for Video MLLMs
par: Hou, Haowen, et autres
Publié: (2026)
par: Hou, Haowen, et autres
Publié: (2026)
STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?
par: Li, Yun, et autres
Publié: (2025)
par: Li, Yun, et autres
Publié: (2025)
Learning How To Ask: Cycle-Consistency Refines Prompts in Multimodal Foundation Models
par: Diesendruck, Maurice, et autres
Publié: (2024)
par: Diesendruck, Maurice, et autres
Publié: (2024)
Linking Perception, Confidence and Accuracy in MLLMs
par: Du, Yuetian, et autres
Publié: (2026)
par: Du, Yuetian, et autres
Publié: (2026)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
par: Wang, Ye, et autres
Publié: (2025)
par: Wang, Ye, et autres
Publié: (2025)
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
par: Zheng, Naishan, et autres
Publié: (2025)
par: Zheng, Naishan, et autres
Publié: (2025)
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
par: Xu, Boshen, et autres
Publié: (2025)
par: Xu, Boshen, et autres
Publié: (2025)
The Power of Strong Linearizability: the Difficulty of Consistent Refereeing
par: Attiya, Hagit, et autres
Publié: (2025)
par: Attiya, Hagit, et autres
Publié: (2025)
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
par: Gao, Xiangbo, et autres
Publié: (2026)
par: Gao, Xiangbo, et autres
Publié: (2026)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs
par: Xu, Xiao, et autres
Publié: (2025)
par: Xu, Xiao, et autres
Publié: (2025)
An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability
par: Wu, Daiqing, et autres
Publié: (2025)
par: Wu, Daiqing, et autres
Publié: (2025)
Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal
par: Wang, Yuhao, et autres
Publié: (2024)
par: Wang, Yuhao, et autres
Publié: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
par: Huang, Jen-tse, et autres
Publié: (2025)
par: Huang, Jen-tse, et autres
Publié: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
par: Li, Baiqi, et autres
Publié: (2024)
par: Li, Baiqi, et autres
Publié: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
Documents similaires
-
A Survey of Deep Learning for Geometry Problem Solving
par: Ma, Jianzhe, et autres
Publié: (2025) -
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025) -
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
par: Ma, Jianzhe, et autres
Publié: (2026) -
Referee: Reference-aware Audiovisual Deepfake Detection
par: Boo, Hyemin, et autres
Publié: (2025) -
Implicit Biases in Refereeing: Lessons from NBA Referees
par: Pelechrinis, Konstantinos
Publié: (2022)