ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Xuecheng, Liu, Jiaxing, Huang, Danlei, Wang, Yifan, Shi, Yunyun, Chen, Kedi, Xue, Junxiao, Liu, Yang, Chen, Chunlin, Dong, Hairong, Yang, Dingkang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing
por: Xue, Fengjian, et al.
Publicado: (2026)
por: Xue, Fengjian, et al.
Publicado: (2026)
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
por: Chen, Shi, et al.
Publicado: (2026)
por: Chen, Shi, et al.
Publicado: (2026)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
por: Dai, Yang, et al.
Publicado: (2026)
por: Dai, Yang, et al.
Publicado: (2026)
3A-YOLO: New Real-Time Object Detectors with Triple Discriminative Awareness and Coordinated Representations
por: Wu, Xuecheng, et al.
Publicado: (2024)
por: Wu, Xuecheng, et al.
Publicado: (2024)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025)
por: Zhang, Yongheng, et al.
Publicado: (2025)
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
por: Wu, Xuecheng, et al.
Publicado: (2025)
por: Wu, Xuecheng, et al.
Publicado: (2025)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
por: Xue, Junxiao, et al.
Publicado: (2025)
por: Xue, Junxiao, et al.
Publicado: (2025)
ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders
por: Hernandez, Jefferson, et al.
Publicado: (2023)
por: Hernandez, Jefferson, et al.
Publicado: (2023)
Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis
por: Wu, Xuecheng, et al.
Publicado: (2025)
por: Wu, Xuecheng, et al.
Publicado: (2025)
ViC: Virtual Compiler Is All You Need For Assembly Code Search
por: Gao, Zeyu, et al.
Publicado: (2024)
por: Gao, Zeyu, et al.
Publicado: (2024)
Interleaved-Modal Chain-of-Thought
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
DARTs: A Dual-Path Robust Framework for Anomaly Detection in High-Dimensional Multivariate Time Series
por: Liu, Xuechun, et al.
Publicado: (2025)
por: Liu, Xuechun, et al.
Publicado: (2025)
M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
por: Jiang, Juntao, et al.
Publicado: (2026)
por: Jiang, Juntao, et al.
Publicado: (2026)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
por: Xu, Pengju, et al.
Publicado: (2025)
por: Xu, Pengju, et al.
Publicado: (2025)
MileBench: Benchmarking MLLMs in Long Context
por: Song, Dingjie, et al.
Publicado: (2024)
por: Song, Dingjie, et al.
Publicado: (2024)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
V2X-RECT: An Efficient V2X Trajectory Prediction Framework via Redundant Interaction Filtering and Tracking Error Correction
por: Kong, Xiangyan, et al.
Publicado: (2025)
por: Kong, Xiangyan, et al.
Publicado: (2025)
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
por: Li, Sijing, et al.
Publicado: (2026)
por: Li, Sijing, et al.
Publicado: (2026)
CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs
por: Liu, Yuxuan, et al.
Publicado: (2026)
por: Liu, Yuxuan, et al.
Publicado: (2026)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
por: Ouyang, Kun, et al.
Publicado: (2024)
por: Ouyang, Kun, et al.
Publicado: (2024)
TACR-YOLO: A Real-time Detection Framework for Abnormal Human Behaviors Enhanced with Coordinate and Task-Aware Representations
por: Yin, Xinyi, et al.
Publicado: (2025)
por: Yin, Xinyi, et al.
Publicado: (2025)
Capabilities and Fundamental Limits of Latent Chain-of-Thought
por: Zou, Jiaxuan, et al.
Publicado: (2026)
por: Zou, Jiaxuan, et al.
Publicado: (2026)
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
por: Xu, Qiang, et al.
Publicado: (2026)
por: Xu, Qiang, et al.
Publicado: (2026)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
por: Fang, I-Sheng, et al.
Publicado: (2025)
por: Fang, I-Sheng, et al.
Publicado: (2025)
FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning
por: Shen, Xu, et al.
Publicado: (2025)
por: Shen, Xu, et al.
Publicado: (2025)
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
por: Zhang, Zixin, et al.
Publicado: (2025)
por: Zhang, Zixin, et al.
Publicado: (2025)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
por: Chen, Xinyan, et al.
Publicado: (2025)
por: Chen, Xinyan, et al.
Publicado: (2025)
Towards Comprehensive Interactive Change Understanding in Remote Sensing: A Large-scale Dataset and Dual-granularity Enhanced VLM
por: Xue, Junxiao, et al.
Publicado: (2025)
por: Xue, Junxiao, et al.
Publicado: (2025)
CoMT: Chain-of-Medical-Thought Reduces Hallucination in Medical Report Generation
por: Jiang, Yue, et al.
Publicado: (2024)
por: Jiang, Yue, et al.
Publicado: (2024)
FAMNet: Integrating 2D and 3D Features for Micro-expression Recognition via Multi-task Learning and Hierarchical Attention
por: Fu, Liangyu, et al.
Publicado: (2025)
por: Fu, Liangyu, et al.
Publicado: (2025)
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
por: Liu, Shaoyu, et al.
Publicado: (2025)
por: Liu, Shaoyu, et al.
Publicado: (2025)
Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth
por: Chen, Mingrui, et al.
Publicado: (2026)
por: Chen, Mingrui, et al.
Publicado: (2026)
OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
por: Lin, Jingli, et al.
Publicado: (2025)
por: Lin, Jingli, et al.
Publicado: (2025)
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
por: Liu, Jiyao, et al.
Publicado: (2025)
por: Liu, Jiyao, et al.
Publicado: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
por: Chen, Harold Haodong, et al.
Publicado: (2025)
por: Chen, Harold Haodong, et al.
Publicado: (2025)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
por: Ma, Qihang, et al.
Publicado: (2025)
por: Ma, Qihang, et al.
Publicado: (2025)
Rigidity of Generalized Furstenberg Boundaries and Applications to Intermediate Crossed Products
por: Amrutam, Tattwamasi, et al.
Publicado: (2026)
por: Amrutam, Tattwamasi, et al.
Publicado: (2026)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
por: Xu, Yunqiu, et al.
Publicado: (2024)
por: Xu, Yunqiu, et al.
Publicado: (2024)
Disentangling Hardness from Noise: An Uncertainty-Driven Model-Agnostic Framework for Long-Tailed Remote Sensing Classification
por: Ding, Chi, et al.
Publicado: (2026)
por: Ding, Chi, et al.
Publicado: (2026)
Ejemplares similares
-
FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing
por: Xue, Fengjian, et al.
Publicado: (2026) -
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
por: Chen, Shi, et al.
Publicado: (2026) -
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
por: Dai, Yang, et al.
Publicado: (2026) -
3A-YOLO: New Real-Time Object Detectors with Triple Discriminative Awareness and Coordinated Representations
por: Wu, Xuecheng, et al.
Publicado: (2024) -
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025)