TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Pengju, Wang, Yan, Zhang, Shuyuan, Zhou, Xuan, Li, Xin, Yuan, Yue, Li, Fengzhao, Zhou, Shunyuan, Wang, Xingyu, Zhang, Yi, Zhao, Haiying |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
por: Liu, Shuo, et al.
Publicado: (2024)
por: Liu, Shuo, et al.
Publicado: (2024)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks
por: Zhang, Lei, et al.
Publicado: (2025)
por: Zhang, Lei, et al.
Publicado: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
por: Meng, Jiahao, et al.
Publicado: (2026)
por: Meng, Jiahao, et al.
Publicado: (2026)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
por: Cao, Jiajun, et al.
Publicado: (2025)
por: Cao, Jiajun, et al.
Publicado: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)
por: Zeng, Xiangyu, et al.
Publicado: (2024)
CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning
por: He, Zheqi, et al.
Publicado: (2024)
por: He, Zheqi, et al.
Publicado: (2024)
EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment
por: Gao, Lancheng, et al.
Publicado: (2025)
por: Gao, Lancheng, et al.
Publicado: (2025)
Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding
por: Pan, Zhaoyan, et al.
Publicado: (2026)
por: Pan, Zhaoyan, et al.
Publicado: (2026)
MMPKUBase: A Comprehensive and High-quality Chinese Multi-modal Knowledge Graph
por: Yi, Xuan, et al.
Publicado: (2024)
por: Yi, Xuan, et al.
Publicado: (2024)
MInD: Improving Multimodal Sentiment Analysis via Multimodal Information Disentanglement
por: Dai, Weichen, et al.
Publicado: (2024)
por: Dai, Weichen, et al.
Publicado: (2024)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
por: Han, ZhaoYang, et al.
Publicado: (2025)
por: Han, ZhaoYang, et al.
Publicado: (2025)
Facilitating Daily Practice in Intangible Cultural Heritage through Virtual Reality: A Case Study of Traditional Chinese Flower Arrangement
por: Wang, Yingna, et al.
Publicado: (2025)
por: Wang, Yingna, et al.
Publicado: (2025)
A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
por: Zhou, Dingkun, et al.
Publicado: (2025)
por: Zhou, Dingkun, et al.
Publicado: (2025)
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
por: Li, Dexiang, et al.
Publicado: (2026)
por: Li, Dexiang, et al.
Publicado: (2026)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
por: Zhou, Ziya, et al.
Publicado: (2024)
por: Zhou, Ziya, et al.
Publicado: (2024)
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides
por: Zhao, Jinghua, et al.
Publicado: (2025)
por: Zhao, Jinghua, et al.
Publicado: (2025)
SpeechEE: A Novel Benchmark for Speech Event Extraction
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
por: Chen, Zixuan, et al.
Publicado: (2026)
por: Chen, Zixuan, et al.
Publicado: (2026)
MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations
por: Zhang, Hanlei, et al.
Publicado: (2024)
por: Zhang, Hanlei, et al.
Publicado: (2024)
EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations
por: Sun, Haoqin, et al.
Publicado: (2025)
por: Sun, Haoqin, et al.
Publicado: (2025)
ConCLVD: Controllable Chinese Landscape Video Generation via Diffusion Model
por: Liu, Dingming, et al.
Publicado: (2024)
por: Liu, Dingming, et al.
Publicado: (2024)
VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents
por: Yi, Hongzhu, et al.
Publicado: (2026)
por: Yi, Hongzhu, et al.
Publicado: (2026)
Multimodal Classification and Out-of-distribution Detection for Multimodal Intent Understanding
por: Zhang, Hanlei, et al.
Publicado: (2024)
por: Zhang, Hanlei, et al.
Publicado: (2024)
RiverEcho: Real-Time Interactive Digital System for Ancient Yellow River Culture
por: Wang, Haofeng, et al.
Publicado: (2025)
por: Wang, Haofeng, et al.
Publicado: (2025)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
por: Song, Shezheng, et al.
Publicado: (2026)
por: Song, Shezheng, et al.
Publicado: (2026)
DRISHTIKON: A Multimodal Multilingual Benchmark for Testing Language Models' Understanding on Indian Culture
por: Maji, Arijit, et al.
Publicado: (2025)
por: Maji, Arijit, et al.
Publicado: (2025)
Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness
por: Zhao, Yusheng, et al.
Publicado: (2025)
por: Zhao, Yusheng, et al.
Publicado: (2025)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
por: Zhou, Qianrui, et al.
Publicado: (2026)
por: Zhou, Qianrui, et al.
Publicado: (2026)
Modeling Layout Reading Order as Ordering Relations for Visually-rich Document Understanding
por: Zhang, Chong, et al.
Publicado: (2024)
por: Zhang, Chong, et al.
Publicado: (2024)
Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
por: Pan, Mianzhi, et al.
Publicado: (2023)
por: Pan, Mianzhi, et al.
Publicado: (2023)
TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering
por: Xu, Zhaoyang, et al.
Publicado: (2026)
por: Xu, Zhaoyang, et al.
Publicado: (2026)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
por: Li, Haoxuan, et al.
Publicado: (2025)
por: Li, Haoxuan, et al.
Publicado: (2025)
CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration
por: Xie, Tianyidan, et al.
Publicado: (2026)
por: Xie, Tianyidan, et al.
Publicado: (2026)
CLIPRerank: An Extremely Simple Method for Improving Ad-hoc Video Search
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
por: Yin, Zhiyu, et al.
Publicado: (2026)
por: Yin, Zhiyu, et al.
Publicado: (2026)
Deep Bi-directional Attention Network for Image Super-Resolution Quality Assessment
por: Li, Yixiao, et al.
Publicado: (2024)
por: Li, Yixiao, et al.
Publicado: (2024)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
por: Wang, Xinran, et al.
Publicado: (2026)
por: Wang, Xinran, et al.
Publicado: (2026)
Ejemplares similares
-
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
por: Liu, Shuo, et al.
Publicado: (2024) -
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025) -
MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks
por: Zhang, Lei, et al.
Publicado: (2025) -
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
por: Zhou, Yang-Hao, et al.
Publicado: (2026) -
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
por: Meng, Jiahao, et al.
Publicado: (2026)