InsightVision: A Comprehensive, Multi-Level Chinese-based Benchmark for Evaluating Implicit Visual Semantics in Large Vision Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yin, Xiaofei, Hong, Yijie, Guo, Ya, Tu, Yi, Wang, Weiqiang, Liu, Gongshen, zhu, Huijia |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Up to 36x Speedup: Mask-based Parallel Inference Paradigm for Key Information Extraction in MLLMs
von: Wang, Xinzhong, et al.
Veröffentlicht: (2026)
von: Wang, Xinzhong, et al.
Veröffentlicht: (2026)
Keep the General, Inject the Specific: Structured Dialogue Fine-Tuning for Knowledge Injection without Catastrophic Forgetting
von: Hong, Yijie, et al.
Veröffentlicht: (2025)
von: Hong, Yijie, et al.
Veröffentlicht: (2025)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
von: Chen, Qian, et al.
Veröffentlicht: (2026)
von: Chen, Qian, et al.
Veröffentlicht: (2026)
Chinese essentials : what and how, how, designing teaching
von: Fu Haiyan zhu
von: Fu Haiyan zhu
UNER: A Unified Prediction Head for Named Entity Recognition in Visually-rich Documents
von: Tu, Yi, et al.
Veröffentlicht: (2024)
von: Tu, Yi, et al.
Veröffentlicht: (2024)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
von: Yu, Hong-Tao, et al.
Veröffentlicht: (2025)
von: Yu, Hong-Tao, et al.
Veröffentlicht: (2025)
Chinese essentials : what and how, what, a functional and grammatical walkthrough / Fu Haiyan zhu
von: Fu Haiyan zhu
von: Fu Haiyan zhu
Stochastic Layer-Wise Shuffle for Improving Vision Mamba Training
von: Huang, Zizheng, et al.
Veröffentlicht: (2024)
von: Huang, Zizheng, et al.
Veröffentlicht: (2024)
Resampling Benchmark for Efficient Comprehensive Evaluation of Large Vision-Language Models
von: Suzuki, Teppei, et al.
Veröffentlicht: (2025)
von: Suzuki, Teppei, et al.
Veröffentlicht: (2025)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
von: Zhou, Yue, et al.
Veröffentlicht: (2026)
von: Zhou, Yue, et al.
Veröffentlicht: (2026)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
AquaticVision: Benchmarking Visual SLAM in Underwater Environment with Events and Frames
von: Peng, Yifan, et al.
Veröffentlicht: (2025)
von: Peng, Yifan, et al.
Veröffentlicht: (2025)
VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan
von: Tam, Zhi Rui, et al.
Veröffentlicht: (2025)
von: Tam, Zhi Rui, et al.
Veröffentlicht: (2025)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
von: Wang, Sibo, et al.
Veröffentlicht: (2024)
von: Wang, Sibo, et al.
Veröffentlicht: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
von: Lu, Jiaying, et al.
Veröffentlicht: (2023)
von: Lu, Jiaying, et al.
Veröffentlicht: (2023)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
von: Zhang, Yiming, et al.
Veröffentlicht: (2025)
von: Zhang, Yiming, et al.
Veröffentlicht: (2025)
Multi-Physics: A Comprehensive Benchmark for Multimodal LLMs Reasoning on Chinese Multi-Subject Physics Problems
von: Luo, Zhongze, et al.
Veröffentlicht: (2025)
von: Luo, Zhongze, et al.
Veröffentlicht: (2025)
Causal Probing for Internal Visual Representations in Multimodal Large Language Models
von: Deng, Zehao, et al.
Veröffentlicht: (2026)
von: Deng, Zehao, et al.
Veröffentlicht: (2026)
Evaluating Attribute Comprehension in Large Vision-Language Models
von: Zhang, Haiwen, et al.
Veröffentlicht: (2024)
von: Zhang, Haiwen, et al.
Veröffentlicht: (2024)
Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
von: Ji, Yikun, et al.
Veröffentlicht: (2025)
von: Ji, Yikun, et al.
Veröffentlicht: (2025)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
von: Zhang, Huaxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Huaxiang, et al.
Veröffentlicht: (2024)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
von: Wang, Yu, et al.
Veröffentlicht: (2024)
von: Wang, Yu, et al.
Veröffentlicht: (2024)
Treasure Island: The Romantic Assassin
von: zhu, hailong
Veröffentlicht: (2026)
von: zhu, hailong
Veröffentlicht: (2026)
Data for: Seamless Microscale Air Quality Downscaling for Megacities: A Physics-Informed FNO Approach – PM2.5 Downscaling Dataset for Shanghai (March 1, 2024)
von: zhu, jiawei
Veröffentlicht: (2026)
von: zhu, jiawei
Veröffentlicht: (2026)
From Silenced Warnings to Systemic Collapse: ——— China's Predatory A-Share Market, COVID Over-Defense Scars, and the Self-Degenerative Spiral of Structural Deceleration
von: zhu, hailong
Veröffentlicht: (2025)
von: zhu, hailong
Veröffentlicht: (2025)
Replication Package for "Central Signal Premium and Purity-Amplified Reactions to Emerging Industry Initiatives: Evidence from China's Low-Altitude Economy"
von: zhu, hao
Veröffentlicht: (2026)
von: zhu, hao
Veröffentlicht: (2026)
Replication Package for "Central Signal Premium and Purity-Amplified Reactions to Emerging Industry Initiatives: Evidence from China's Low-Altitude Economy"
von: zhu, hao
Veröffentlicht: (2026)
von: zhu, hao
Veröffentlicht: (2026)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
von: Zong, Yi, et al.
Veröffentlicht: (2024)
von: Zong, Yi, et al.
Veröffentlicht: (2024)
An Electrocardiogram Multi-task Benchmark with Comprehensive Evaluations and Insightful Findings
von: Xu, Yuhao, et al.
Veröffentlicht: (2025)
von: Xu, Yuhao, et al.
Veröffentlicht: (2025)
REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models
von: Zhang, Jie, et al.
Veröffentlicht: (2025)
von: Zhang, Jie, et al.
Veröffentlicht: (2025)
Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
von: Cai, Wei, et al.
Veröffentlicht: (2025)
von: Cai, Wei, et al.
Veröffentlicht: (2025)
MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models
von: Lee, Young-Jun, et al.
Veröffentlicht: (2025)
von: Lee, Young-Jun, et al.
Veröffentlicht: (2025)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)
von: Shi, Ling, et al.
Veröffentlicht: (2024)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
von: Yang, Rui, et al.
Veröffentlicht: (2025)
von: Yang, Rui, et al.
Veröffentlicht: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
von: Zeng, Shuang, et al.
Veröffentlicht: (2025)
von: Zeng, Shuang, et al.
Veröffentlicht: (2025)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
von: Xia, Peng, et al.
Veröffentlicht: (2024)
von: Xia, Peng, et al.
Veröffentlicht: (2024)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
von: Ying, Kaining, et al.
Veröffentlicht: (2024)
von: Ying, Kaining, et al.
Veröffentlicht: (2024)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
von: Wang, Zekun, et al.
Veröffentlicht: (2025)
von: Wang, Zekun, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Up to 36x Speedup: Mask-based Parallel Inference Paradigm for Key Information Extraction in MLLMs
von: Wang, Xinzhong, et al.
Veröffentlicht: (2026) -
Keep the General, Inject the Specific: Structured Dialogue Fine-Tuning for Knowledge Injection without Catastrophic Forgetting
von: Hong, Yijie, et al.
Veröffentlicht: (2025) -
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
von: Chen, Qian, et al.
Veröffentlicht: (2026) -
Chinese essentials : what and how, how, designing teaching
von: Fu Haiyan zhu -
UNER: A Unified Prediction Head for Named Entity Recognition in Visually-rich Documents
von: Tu, Yi, et al.
Veröffentlicht: (2024)