Can MLLMs Understand the Deep Implication Behind Chinese Images?
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Chenhao, Feng, Xi, Bai, Yuelin, Du, Xinrun, Hou, Jinchang, Deng, Kaixin, Han, Guangzeng, Li, Qinrui, Wang, Bingli, Liu, Jiaheng, Qu, Xingwei, Zhang, Yifei, Zhao, Qixuan, Liang, Yiming, Liu, Ziqiang, Fang, Feiteng, Yang, Min, Huang, Wenhao, Lin, Chenghua, Zhang, Ge, Ni, Shiwen |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DeliLaw: A Chinese Legal Counselling System Based on a Large Language Model
by: Xie, Nan, et al.
Published: (2024)
by: Xie, Nan, et al.
Published: (2024)
COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning
by: Bai, Yuelin, et al.
Published: (2024)
by: Bai, Yuelin, et al.
Published: (2024)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
by: Liu, Ziqiang, et al.
Published: (2024)
by: Liu, Ziqiang, et al.
Published: (2024)
I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm
by: Liang, Yiming, et al.
Published: (2024)
by: Liang, Yiming, et al.
Published: (2024)
Kun: Answer Polishment for Chinese Self-Alignment with Instruction Back-Translation
by: Zheng, Tianyu, et al.
Published: (2024)
by: Zheng, Tianyu, et al.
Published: (2024)
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
by: Qu, Xingwei, et al.
Published: (2024)
by: Qu, Xingwei, et al.
Published: (2024)
ING-VP: MLLMs cannot Play Easy Vision-based Games Yet
by: Zhang, Haoran, et al.
Published: (2024)
by: Zhang, Haoran, et al.
Published: (2024)
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
by: Zhang, Ge, et al.
Published: (2024)
by: Zhang, Ge, et al.
Published: (2024)
Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation
by: Chen, Dingwei, et al.
Published: (2025)
by: Chen, Dingwei, et al.
Published: (2025)
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
by: Du, Xinrun, et al.
Published: (2024)
by: Du, Xinrun, et al.
Published: (2024)
COIG-P: A High-Quality and Large-Scale Chinese Preference Dataset for Alignment with Human Values
by: P Team, et al.
Published: (2025)
by: P Team, et al.
Published: (2025)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
by: Wu, Siwei, et al.
Published: (2024)
by: Wu, Siwei, et al.
Published: (2024)
DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment
by: Zhu, Liang, et al.
Published: (2026)
by: Zhu, Liang, et al.
Published: (2026)
Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions
by: Kang, Caixin, et al.
Published: (2025)
by: Kang, Caixin, et al.
Published: (2025)
CMDAG: A Chinese Metaphor Dataset with Annotated Grounds as CoT for Boosting Metaphor Generation
by: Shao, Yujie, et al.
Published: (2024)
by: Shao, Yujie, et al.
Published: (2024)
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
by: Hou, Jinchang, et al.
Published: (2024)
by: Hou, Jinchang, et al.
Published: (2024)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
by: Yang, Enneng, et al.
Published: (2024)
by: Yang, Enneng, et al.
Published: (2024)
LIME: Less Is More for MLLM Evaluation
by: Zhu, King, et al.
Published: (2024)
by: Zhu, King, et al.
Published: (2024)
DressCode: Autoregressively Sewing and Generating Garments from Text Guidance
by: He, Kai, et al.
Published: (2024)
by: He, Kai, et al.
Published: (2024)
Attributes as Textual Genes: Leveraging LLMs as Genetic Algorithm Simulators for Conditional Synthetic Data Generation
by: Han, Guangzeng, et al.
Published: (2025)
by: Han, Guangzeng, et al.
Published: (2025)
Knowledge-driven Augmentation and Retrieval for Integrative Temporal Adaptation
by: Liu, Weisi, et al.
Published: (2026)
by: Liu, Weisi, et al.
Published: (2026)
Examining and Adapting Time for Multilingual Classification via Mixture of Temporal Experts
by: Liu, Weisi, et al.
Published: (2025)
by: Liu, Weisi, et al.
Published: (2025)
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
by: Kang, Caixin, et al.
Published: (2026)
by: Kang, Caixin, et al.
Published: (2026)
Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning
by: Yang, Jingchun, et al.
Published: (2026)
by: Yang, Jingchun, et al.
Published: (2026)
Underground Mapping and Localization Based on Ground-Penetrating Radar
by: Zhang, Jinchang, et al.
Published: (2024)
by: Zhang, Jinchang, et al.
Published: (2024)
Vision-Language Embodiment for Monocular Depth Estimation
by: Zhang, Jinchang, et al.
Published: (2025)
by: Zhang, Jinchang, et al.
Published: (2025)
STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?
by: Li, Yun, et al.
Published: (2025)
by: Li, Yun, et al.
Published: (2025)
OmniBench: Towards The Future of Universal Omni-Language Models
by: Li, Yizhi, et al.
Published: (2024)
by: Li, Yizhi, et al.
Published: (2024)
What Makes Good Instruction-Tuning Data? An In-Context Learning Perspective
by: Han, Guangzeng, et al.
Published: (2026)
by: Han, Guangzeng, et al.
Published: (2026)
The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis
by: Yang, Chen, et al.
Published: (2024)
by: Yang, Chen, et al.
Published: (2024)
Hyper-parameter tuning for text guided image editing
by: Zhang, Shiwen
Published: (2024)
by: Zhang, Shiwen
Published: (2024)
Quantification of Large Language Model Distillation
by: Lee, Sunbowen, et al.
Published: (2025)
by: Lee, Sunbowen, et al.
Published: (2025)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
Educational-Psychological Dialogue Robot Based on Multi-Agent Collaboration
by: Ni, Shiwen, et al.
Published: (2024)
by: Ni, Shiwen, et al.
Published: (2024)
TAPESTRY: From Geometry to Appearance via Consistent Turntable Videos
by: Zeng, Yan, et al.
Published: (2026)
by: Zeng, Yan, et al.
Published: (2026)
PLOT: Enhancing Preference Learning via Optimal Transport
by: Zhu, Liang, et al.
Published: (2026)
by: Zhu, Liang, et al.
Published: (2026)
Linking Perception, Confidence and Accuracy in MLLMs
by: Du, Yuetian, et al.
Published: (2026)
by: Du, Yuetian, et al.
Published: (2026)
Chain-of-Interaction: Enhancing Large Language Models for Psychiatric Behavior Understanding by Dyadic Contexts
by: Han, Guangzeng, et al.
Published: (2024)
by: Han, Guangzeng, et al.
Published: (2024)
CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
by: Li, Siyi, et al.
Published: (2026)
by: Li, Siyi, et al.
Published: (2026)
Automated Multi-level Preference for MLLMs
by: Zhang, Mengxi, et al.
Published: (2024)
by: Zhang, Mengxi, et al.
Published: (2024)
Similar Items
-
DeliLaw: A Chinese Legal Counselling System Based on a Large Language Model
by: Xie, Nan, et al.
Published: (2024) -
COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning
by: Bai, Yuelin, et al.
Published: (2024) -
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
by: Liu, Ziqiang, et al.
Published: (2024) -
I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm
by: Liang, Yiming, et al.
Published: (2024) -
Kun: Answer Polishment for Chinese Self-Alignment with Instruction Back-Translation
by: Zheng, Tianyu, et al.
Published: (2024)