Guardado en:
| Autores principales: | Paik, Gio, Kim, Geewook, Im, Jinbae |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2506.04688 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
por: Lee, Sua, et al.
Publicado: (2026)
por: Lee, Sua, et al.
Publicado: (2026)
Evaluating Multimodal Generative AI with Korean Educational Standards
por: Park, Sanghee, et al.
Publicado: (2025)
por: Park, Sanghee, et al.
Publicado: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
por: Zhou, Qiji, et al.
Publicado: (2024)
por: Zhou, Qiji, et al.
Publicado: (2024)
Robust Multimodal Large Language Models Against Modality Conflict
por: Zhang, Zongmeng, et al.
Publicado: (2025)
por: Zhang, Zongmeng, et al.
Publicado: (2025)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
por: Kim, Geewook, et al.
Publicado: (2024)
por: Kim, Geewook, et al.
Publicado: (2024)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
por: Kang, Choongwon, et al.
Publicado: (2026)
por: Kang, Choongwon, et al.
Publicado: (2026)
Model Composition for Multimodal Large Language Models
por: Chen, Chi, et al.
Publicado: (2024)
por: Chen, Chi, et al.
Publicado: (2024)
Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models
por: Chen, Zijun, et al.
Publicado: (2024)
por: Chen, Zijun, et al.
Publicado: (2024)
LLM-Optic: Unveiling the Capabilities of Large Language Models for Universal Visual Grounding
por: Zhao, Haoyu, et al.
Publicado: (2024)
por: Zhao, Haoyu, et al.
Publicado: (2024)
Benchmarking Multimodal Large Language Models for Face Recognition
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2025)
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2025)
A Survey on Agentic Multimodal Large Language Models
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
A Survey on Benchmarks of Multimodal Large Language Models
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
A Survey on Evaluation of Multimodal Large Language Models
por: Huang, Jiaxing, et al.
Publicado: (2024)
por: Huang, Jiaxing, et al.
Publicado: (2024)
MLLM-CL: Continual Learning for Multimodal Large Language Models
por: Zhao, Hongbo, et al.
Publicado: (2025)
por: Zhao, Hongbo, et al.
Publicado: (2025)
Forgotten Polygons: Multimodal Large Language Models are Shape-Blind
por: Rudman, William, et al.
Publicado: (2025)
por: Rudman, William, et al.
Publicado: (2025)
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
por: Cui, Yiming, et al.
Publicado: (2025)
por: Cui, Yiming, et al.
Publicado: (2025)
Cross-modal Information Flow in Multimodal Large Language Models
por: Zhang, Zhi, et al.
Publicado: (2024)
por: Zhang, Zhi, et al.
Publicado: (2024)
BLINK: Multimodal Large Language Models Can See but Not Perceive
por: Fu, Xingyu, et al.
Publicado: (2024)
por: Fu, Xingyu, et al.
Publicado: (2024)
Toward Robust Multimodal Learning using Multimodal Foundational Models
por: Zhao, Xianbing, et al.
Publicado: (2024)
por: Zhao, Xianbing, et al.
Publicado: (2024)
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
por: Karim, A H M Rezaul, et al.
Publicado: (2025)
por: Karim, A H M Rezaul, et al.
Publicado: (2025)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
por: Zhao, Zihui, et al.
Publicado: (2025)
por: Zhao, Zihui, et al.
Publicado: (2025)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
por: You, Liangliang, et al.
Publicado: (2025)
por: You, Liangliang, et al.
Publicado: (2025)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
FaceLLM: A Multimodal Large Language Model for Face Understanding
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2025)
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2025)
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
por: Fan, Yue, et al.
Publicado: (2024)
por: Fan, Yue, et al.
Publicado: (2024)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
por: Zhong, Weihong, et al.
Publicado: (2024)
por: Zhong, Weihong, et al.
Publicado: (2024)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
por: Kim, Youngmin, et al.
Publicado: (2025)
por: Kim, Youngmin, et al.
Publicado: (2025)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
por: Lu, Liming, et al.
Publicado: (2025)
por: Lu, Liming, et al.
Publicado: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
por: Jiang, Dongzhi, et al.
Publicado: (2025)
por: Jiang, Dongzhi, et al.
Publicado: (2025)
ARB-LLM: Alternating Refined Binarizations for Large Language Models
por: Li, Zhiteng, et al.
Publicado: (2024)
por: Li, Zhiteng, et al.
Publicado: (2024)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
por: Zhang, Wenqiao, et al.
Publicado: (2024)
por: Zhang, Wenqiao, et al.
Publicado: (2024)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
por: Lee, Kang-il, et al.
Publicado: (2024)
por: Lee, Kang-il, et al.
Publicado: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
por: Sun, Haoyuan, et al.
Publicado: (2025)
por: Sun, Haoyuan, et al.
Publicado: (2025)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
por: Kang, Zhaolu, et al.
Publicado: (2025)
por: Kang, Zhaolu, et al.
Publicado: (2025)
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
por: Niu, Tianyi, et al.
Publicado: (2025)
por: Niu, Tianyi, et al.
Publicado: (2025)
Look Twice: Training-Free Evidence Highlighting in Multimodal Large Language Models
por: Morini, Marco, et al.
Publicado: (2026)
por: Morini, Marco, et al.
Publicado: (2026)
MLLMReID: Multimodal Large Language Model-based Person Re-identification
por: Yang, Shan, et al.
Publicado: (2024)
por: Yang, Shan, et al.
Publicado: (2024)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
por: Zheng, Sipeng, et al.
Publicado: (2024)
por: Zheng, Sipeng, et al.
Publicado: (2024)
Ejemplares similares
-
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
por: Lee, Sua, et al.
Publicado: (2026) -
Evaluating Multimodal Generative AI with Korean Educational Standards
por: Park, Sanghee, et al.
Publicado: (2025) -
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023) -
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
por: Zhou, Qiji, et al.
Publicado: (2024) -
Robust Multimodal Large Language Models Against Modality Conflict
por: Zhang, Zongmeng, et al.
Publicado: (2025)