M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Hongyu, Xu, Jiayu, Xie, Senwei, Wang, Ruiping, Li, Jialin, Xie, Zhaojie, Zhang, Bin, Xiong, Chuyan, Chen, Xilin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation
di: Xie, Senwei, et al.
Pubblicazione: (2025)
di: Xie, Senwei, et al.
Pubblicazione: (2025)
Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models
di: Fu, Bin, et al.
Pubblicazione: (2024)
di: Fu, Bin, et al.
Pubblicazione: (2024)
MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting
di: Li, Jialin, et al.
Pubblicazione: (2026)
di: Li, Jialin, et al.
Pubblicazione: (2026)
GS-LTS: 3D Gaussian Splatting-Based Adaptive Modeling for Long-Term Service Robots
di: Fu, Bin, et al.
Pubblicazione: (2025)
di: Fu, Bin, et al.
Pubblicazione: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models
di: Xia, Haotian, et al.
Pubblicazione: (2024)
di: Xia, Haotian, et al.
Pubblicazione: (2024)
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
di: Hu, Jinyi, et al.
Pubblicazione: (2023)
di: Hu, Jinyi, et al.
Pubblicazione: (2023)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
di: Xu, Qinwu, et al.
Pubblicazione: (2026)
di: Xu, Qinwu, et al.
Pubblicazione: (2026)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
di: Qi, Ji, et al.
Pubblicazione: (2023)
di: Qi, Ji, et al.
Pubblicazione: (2023)
VisKnow: Constructing Visual Knowledge Base for Object Understanding
di: Yao, Ziwei, et al.
Pubblicazione: (2025)
di: Yao, Ziwei, et al.
Pubblicazione: (2025)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
Redefining <Creative> in Dictionary: Towards an Enhanced Semantic Understanding of Creative Generation
di: Feng, Fu, et al.
Pubblicazione: (2024)
di: Feng, Fu, et al.
Pubblicazione: (2024)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
Maya: An Instruction Finetuned Multilingual Multimodal Model
di: Alam, Nahid, et al.
Pubblicazione: (2024)
di: Alam, Nahid, et al.
Pubblicazione: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
di: Gao, Junyuan, et al.
Pubblicazione: (2025)
di: Gao, Junyuan, et al.
Pubblicazione: (2025)
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
di: Anugraha, David, et al.
Pubblicazione: (2025)
di: Anugraha, David, et al.
Pubblicazione: (2025)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
di: Wang, Xintong, et al.
Pubblicazione: (2025)
di: Wang, Xintong, et al.
Pubblicazione: (2025)
Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation
di: Zhou, Li, et al.
Pubblicazione: (2025)
di: Zhou, Li, et al.
Pubblicazione: (2025)
mOSCAR: A Large-scale Multilingual and Multimodal Document-level Corpus
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
di: LASA Team, et al.
Pubblicazione: (2025)
di: LASA Team, et al.
Pubblicazione: (2025)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
di: Bai, Ziyi, et al.
Pubblicazione: (2024)
di: Bai, Ziyi, et al.
Pubblicazione: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
di: Peng, Yi, et al.
Pubblicazione: (2025)
di: Peng, Yi, et al.
Pubblicazione: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation
di: You, Ling, et al.
Pubblicazione: (2025)
di: You, Ling, et al.
Pubblicazione: (2025)
Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
di: Khan, Shaharukh, et al.
Pubblicazione: (2026)
di: Khan, Shaharukh, et al.
Pubblicazione: (2026)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
Do Multimodal Large Language Models Understand Welding?
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025)
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
di: Xu, Jiacong, et al.
Pubblicazione: (2025)
di: Xu, Jiacong, et al.
Pubblicazione: (2025)
RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation
di: Xiao, Zhanqi, et al.
Pubblicazione: (2026)
di: Xiao, Zhanqi, et al.
Pubblicazione: (2026)
LLaVA-Critic: Learning to Evaluate Multimodal Models
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
di: Xiong, Tianyi, et al.
Pubblicazione: (2024)
Large Multimodal Agents: A Survey
di: Xie, Junlin, et al.
Pubblicazione: (2024)
di: Xie, Junlin, et al.
Pubblicazione: (2024)
Q-Sparse: All Large Language Models can be Fully Sparsely-Activated
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
di: Wang, Hongyu, et al.
Pubblicazione: (2025) -
Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation
di: Xie, Senwei, et al.
Pubblicazione: (2025) -
Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models
di: Fu, Bin, et al.
Pubblicazione: (2024) -
MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models
di: Wang, Hongyu, et al.
Pubblicazione: (2025) -
GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting
di: Li, Jialin, et al.
Pubblicazione: (2026)