PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Qian, Yusu, Wan, Cheng, Jia, Chao, Yang, Yinfei, Zhao, Qingyu, Gan, Zhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
di: Qian, Yusu, et al.
Pubblicazione: (2024)
di: Qian, Yusu, et al.
Pubblicazione: (2024)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
di: Qian, Yusu, et al.
Pubblicazione: (2024)
di: Qian, Yusu, et al.
Pubblicazione: (2024)
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
di: Qian, Yusu, et al.
Pubblicazione: (2025)
di: Qian, Yusu, et al.
Pubblicazione: (2025)
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2025)
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2025)
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
di: Gao, Minghe, et al.
Pubblicazione: (2025)
di: Gao, Minghe, et al.
Pubblicazione: (2025)
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
di: Qian, Yusu, et al.
Pubblicazione: (2025)
di: Qian, Yusu, et al.
Pubblicazione: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
di: Ren, Yufan, et al.
Pubblicazione: (2025)
di: Ren, Yufan, et al.
Pubblicazione: (2025)
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
di: Wang, Lihong, et al.
Pubblicazione: (2025)
di: Wang, Lihong, et al.
Pubblicazione: (2025)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
di: Shao, Hao, et al.
Pubblicazione: (2024)
di: Shao, Hao, et al.
Pubblicazione: (2024)
AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions
di: Wei, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wei, Zhaoyang, et al.
Pubblicazione: (2025)
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
di: Amirloo, Elmira, et al.
Pubblicazione: (2024)
di: Amirloo, Elmira, et al.
Pubblicazione: (2024)
VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning
di: Jia, Zi-Yi, et al.
Pubblicazione: (2026)
di: Jia, Zi-Yi, et al.
Pubblicazione: (2026)
LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
di: Huang, Jing, et al.
Pubblicazione: (2025)
di: Huang, Jing, et al.
Pubblicazione: (2025)
BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users
di: Cheng, Wanyin, et al.
Pubblicazione: (2025)
di: Cheng, Wanyin, et al.
Pubblicazione: (2025)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
di: Yang, Siwei, et al.
Pubblicazione: (2025)
di: Yang, Siwei, et al.
Pubblicazione: (2025)
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
di: Dirauf, Richard, et al.
Pubblicazione: (2025)
di: Dirauf, Richard, et al.
Pubblicazione: (2025)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2023)
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2023)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
di: Zeng, Shuang, et al.
Pubblicazione: (2025)
di: Zeng, Shuang, et al.
Pubblicazione: (2025)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning
di: Sun, Hai-Long, et al.
Pubblicazione: (2025)
di: Sun, Hai-Long, et al.
Pubblicazione: (2025)
MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration
di: Wei, Lai, et al.
Pubblicazione: (2024)
di: Wei, Lai, et al.
Pubblicazione: (2024)
Empowering Lightweight MLLMs with Reasoning via Long CoT SFT
di: Ou, Linyu, et al.
Pubblicazione: (2025)
di: Ou, Linyu, et al.
Pubblicazione: (2025)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
di: Abdelrahman, Eslam, et al.
Pubblicazione: (2023)
di: Abdelrahman, Eslam, et al.
Pubblicazione: (2023)
CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
di: Qi, Yu, et al.
Pubblicazione: (2025)
di: Qi, Yu, et al.
Pubblicazione: (2025)
CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection
di: Choi, Hojun, et al.
Pubblicazione: (2025)
di: Choi, Hojun, et al.
Pubblicazione: (2025)
A Survey of Defenses Against AI-Generated Visual Media: Detection,Disruption, and Authentication
di: Deng, Jingyi, et al.
Pubblicazione: (2024)
di: Deng, Jingyi, et al.
Pubblicazione: (2024)
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
di: Narayan, Kartik, et al.
Pubblicazione: (2025)
di: Narayan, Kartik, et al.
Pubblicazione: (2025)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
di: Fang, I-Sheng, et al.
Pubblicazione: (2025)
di: Fang, I-Sheng, et al.
Pubblicazione: (2025)
Saliency-Bench: A Comprehensive Benchmark for Evaluating Visual Explanations
di: Zhang, Yifei, et al.
Pubblicazione: (2023)
di: Zhang, Yifei, et al.
Pubblicazione: (2023)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
di: Wang, Jiayu, et al.
Pubblicazione: (2025)
di: Wang, Jiayu, et al.
Pubblicazione: (2025)
MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs
di: Chen, Huiyi, et al.
Pubblicazione: (2025)
di: Chen, Huiyi, et al.
Pubblicazione: (2025)
FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
di: Zhuang, Cailin, et al.
Pubblicazione: (2025)
di: Zhuang, Cailin, et al.
Pubblicazione: (2025)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
di: Tian, Rui, et al.
Pubblicazione: (2025)
di: Tian, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
di: Qian, Yusu, et al.
Pubblicazione: (2024) -
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
di: Qian, Yusu, et al.
Pubblicazione: (2024) -
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
di: Qian, Yusu, et al.
Pubblicazione: (2025) -
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2025) -
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
di: Gao, Minghe, et al.
Pubblicazione: (2025)