ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Xuecheng, Liu, Jiaxing, Huang, Danlei, Wang, Yifan, Shi, Yunyun, Chen, Kedi, Xue, Junxiao, Liu, Yang, Chen, Chunlin, Dong, Hairong, Yang, Dingkang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing
di: Xue, Fengjian, et al.
Pubblicazione: (2026)
di: Xue, Fengjian, et al.
Pubblicazione: (2026)
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
di: Chen, Shi, et al.
Pubblicazione: (2026)
di: Chen, Shi, et al.
Pubblicazione: (2026)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
di: Dai, Yang, et al.
Pubblicazione: (2026)
di: Dai, Yang, et al.
Pubblicazione: (2026)
3A-YOLO: New Real-Time Object Detectors with Triple Discriminative Awareness and Coordinated Representations
di: Wu, Xuecheng, et al.
Pubblicazione: (2024)
di: Wu, Xuecheng, et al.
Pubblicazione: (2024)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
di: Wu, Xuecheng, et al.
Pubblicazione: (2025)
di: Wu, Xuecheng, et al.
Pubblicazione: (2025)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders
di: Hernandez, Jefferson, et al.
Pubblicazione: (2023)
di: Hernandez, Jefferson, et al.
Pubblicazione: (2023)
Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis
di: Wu, Xuecheng, et al.
Pubblicazione: (2025)
di: Wu, Xuecheng, et al.
Pubblicazione: (2025)
ViC: Virtual Compiler Is All You Need For Assembly Code Search
di: Gao, Zeyu, et al.
Pubblicazione: (2024)
di: Gao, Zeyu, et al.
Pubblicazione: (2024)
Interleaved-Modal Chain-of-Thought
di: Gao, Jun, et al.
Pubblicazione: (2024)
di: Gao, Jun, et al.
Pubblicazione: (2024)
DARTs: A Dual-Path Robust Framework for Anomaly Detection in High-Dimensional Multivariate Time Series
di: Liu, Xuechun, et al.
Pubblicazione: (2025)
di: Liu, Xuechun, et al.
Pubblicazione: (2025)
M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
di: Jiang, Juntao, et al.
Pubblicazione: (2026)
di: Jiang, Juntao, et al.
Pubblicazione: (2026)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
di: Xu, Pengju, et al.
Pubblicazione: (2025)
di: Xu, Pengju, et al.
Pubblicazione: (2025)
MileBench: Benchmarking MLLMs in Long Context
di: Song, Dingjie, et al.
Pubblicazione: (2024)
di: Song, Dingjie, et al.
Pubblicazione: (2024)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
di: Liu, Xu, et al.
Pubblicazione: (2026)
di: Liu, Xu, et al.
Pubblicazione: (2026)
V2X-RECT: An Efficient V2X Trajectory Prediction Framework via Redundant Interaction Filtering and Tracking Error Correction
di: Kong, Xiangyan, et al.
Pubblicazione: (2025)
di: Kong, Xiangyan, et al.
Pubblicazione: (2025)
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
di: Li, Sijing, et al.
Pubblicazione: (2026)
di: Li, Sijing, et al.
Pubblicazione: (2026)
CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
di: Ouyang, Kun, et al.
Pubblicazione: (2024)
di: Ouyang, Kun, et al.
Pubblicazione: (2024)
TACR-YOLO: A Real-time Detection Framework for Abnormal Human Behaviors Enhanced with Coordinate and Task-Aware Representations
di: Yin, Xinyi, et al.
Pubblicazione: (2025)
di: Yin, Xinyi, et al.
Pubblicazione: (2025)
Capabilities and Fundamental Limits of Latent Chain-of-Thought
di: Zou, Jiaxuan, et al.
Pubblicazione: (2026)
di: Zou, Jiaxuan, et al.
Pubblicazione: (2026)
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
di: Xu, Qiang, et al.
Pubblicazione: (2026)
di: Xu, Qiang, et al.
Pubblicazione: (2026)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
di: Fang, I-Sheng, et al.
Pubblicazione: (2025)
di: Fang, I-Sheng, et al.
Pubblicazione: (2025)
FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning
di: Shen, Xu, et al.
Pubblicazione: (2025)
di: Shen, Xu, et al.
Pubblicazione: (2025)
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
di: Zhang, Zixin, et al.
Pubblicazione: (2025)
di: Zhang, Zixin, et al.
Pubblicazione: (2025)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
di: Chen, Xinyan, et al.
Pubblicazione: (2025)
Towards Comprehensive Interactive Change Understanding in Remote Sensing: A Large-scale Dataset and Dual-granularity Enhanced VLM
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
CoMT: Chain-of-Medical-Thought Reduces Hallucination in Medical Report Generation
di: Jiang, Yue, et al.
Pubblicazione: (2024)
di: Jiang, Yue, et al.
Pubblicazione: (2024)
FAMNet: Integrating 2D and 3D Features for Micro-expression Recognition via Multi-task Learning and Hierarchical Attention
di: Fu, Liangyu, et al.
Pubblicazione: (2025)
di: Fu, Liangyu, et al.
Pubblicazione: (2025)
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
di: Liu, Shaoyu, et al.
Pubblicazione: (2025)
di: Liu, Shaoyu, et al.
Pubblicazione: (2025)
Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth
di: Chen, Mingrui, et al.
Pubblicazione: (2026)
di: Chen, Mingrui, et al.
Pubblicazione: (2026)
OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
di: Lin, Jingli, et al.
Pubblicazione: (2025)
di: Lin, Jingli, et al.
Pubblicazione: (2025)
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
di: Liu, Jiyao, et al.
Pubblicazione: (2025)
di: Liu, Jiyao, et al.
Pubblicazione: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
di: Ma, Qihang, et al.
Pubblicazione: (2025)
di: Ma, Qihang, et al.
Pubblicazione: (2025)
Rigidity of Generalized Furstenberg Boundaries and Applications to Intermediate Crossed Products
di: Amrutam, Tattwamasi, et al.
Pubblicazione: (2026)
di: Amrutam, Tattwamasi, et al.
Pubblicazione: (2026)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
di: Xu, Yunqiu, et al.
Pubblicazione: (2024)
di: Xu, Yunqiu, et al.
Pubblicazione: (2024)
Disentangling Hardness from Noise: An Uncertainty-Driven Model-Agnostic Framework for Long-Tailed Remote Sensing Classification
di: Ding, Chi, et al.
Pubblicazione: (2026)
di: Ding, Chi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing
di: Xue, Fengjian, et al.
Pubblicazione: (2026) -
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
di: Chen, Shi, et al.
Pubblicazione: (2026) -
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
di: Dai, Yang, et al.
Pubblicazione: (2026) -
3A-YOLO: New Real-Time Object Detectors with Triple Discriminative Awareness and Coordinated Representations
di: Wu, Xuecheng, et al.
Pubblicazione: (2024) -
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)