Can MLLMs "Read" What is Missing?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Jindi, Huang, Chaozheng, Fang, Xi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?
par: Hu, Yijie, et autres
Publié: (2025)
par: Hu, Yijie, et autres
Publié: (2025)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
par: Tang, Yolo Y., et autres
Publié: (2024)
par: Tang, Yolo Y., et autres
Publié: (2024)
Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs
par: Xi, Suyang, et autres
Publié: (2025)
par: Xi, Suyang, et autres
Publié: (2025)
Can the Recovery Mechanism Survive AI? Skill Formation, Labor, and What Current Measurement Misses
par: Fan, Aysa Xuemo
Publié: (2026)
par: Fan, Aysa Xuemo
Publié: (2026)
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
par: Tao, Haoyi, et autres
Publié: (2026)
par: Tao, Haoyi, et autres
Publié: (2026)
Can MLLMs Understand the Deep Implication Behind Chinese Images?
par: Zhang, Chenhao, et autres
Publié: (2024)
par: Zhang, Chenhao, et autres
Publié: (2024)
Can MLLMs generate human-like feedback in grading multimodal short answers?
par: Sil, Pritam, et autres
Publié: (2024)
par: Sil, Pritam, et autres
Publié: (2024)
Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math
par: Song, Dingjie, et autres
Publié: (2026)
par: Song, Dingjie, et autres
Publié: (2026)
Affordance Benchmark for MLLMs
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
Redundancy Principles for MLLMs Benchmarks
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
UMoE: Unifying Attention and FFN with Shared Experts
par: Yang, Yuanhang, et autres
Publié: (2025)
par: Yang, Yuanhang, et autres
Publié: (2025)
GeoGS-CE: Learning Delay--Beam Channel Priors with 3D Gaussians for High-Mobility Scenarios
par: Zhang, Yumeng, et autres
Publié: (2026)
par: Zhang, Yumeng, et autres
Publié: (2026)
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
par: Kang, Caixin, et autres
Publié: (2026)
par: Kang, Caixin, et autres
Publié: (2026)
MLLMs are Deeply Affected by Modality Bias
par: Zheng, Xu, et autres
Publié: (2025)
par: Zheng, Xu, et autres
Publié: (2025)
VAP-Diffusion: Enriching Descriptions with MLLMs for Enhanced Medical Image Generation
par: Huang, Peng, et autres
Publié: (2025)
par: Huang, Peng, et autres
Publié: (2025)
ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
par: Xu, Zhengzhuo, et autres
Publié: (2025)
par: Xu, Zhengzhuo, et autres
Publié: (2025)
What Is Missing: Interpretable Ratings for Large Language Model Outputs
par: Stranges, Nicholas, et autres
Publié: (2026)
par: Stranges, Nicholas, et autres
Publié: (2026)
Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing
par: Ulmer, Dennis, et autres
Publié: (2025)
par: Ulmer, Dennis, et autres
Publié: (2025)
MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror
par: Guo, Shengyu, et autres
Publié: (2026)
par: Guo, Shengyu, et autres
Publié: (2026)
CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
par: Lam, Man Ho, et autres
Publié: (2025)
par: Lam, Man Ho, et autres
Publié: (2025)
From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities
par: Jiang, Shixin, et autres
Publié: (2024)
par: Jiang, Shixin, et autres
Publié: (2024)
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
par: Skorobogat, Ronald, et autres
Publié: (2026)
par: Skorobogat, Ronald, et autres
Publié: (2026)
COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs
par: Guo, Peizheng, et autres
Publié: (2025)
par: Guo, Peizheng, et autres
Publié: (2025)
Multi-Path Collaborative Reasoning via Reinforcement Learning
par: Lv, Jindi, et autres
Publié: (2025)
par: Lv, Jindi, et autres
Publié: (2025)
Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
par: Helu, Zhi, et autres
Publié: (2025)
par: Helu, Zhi, et autres
Publié: (2025)
RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
par: Li, Hanzheng, et autres
Publié: (2025)
par: Li, Hanzheng, et autres
Publié: (2025)
MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues
par: Du, Dazhao, et autres
Publié: (2026)
par: Du, Dazhao, et autres
Publié: (2026)
Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning
par: Li, Rongjin, et autres
Publié: (2026)
par: Li, Rongjin, et autres
Publié: (2026)
Towards Faithful Reasoning in Comics for Small MLLMs
par: Feng, Chengcheng, et autres
Publié: (2026)
par: Feng, Chengcheng, et autres
Publié: (2026)
How Clinicians Think and What AI Can Learn From It
par: Sengupta, Dipayan, et autres
Publié: (2026)
par: Sengupta, Dipayan, et autres
Publié: (2026)
Diffusion-CAM: Faithful Visual Explanations for dMLLMs
par: Zuo, Haomin, et autres
Publié: (2026)
par: Zuo, Haomin, et autres
Publié: (2026)
FairReason: Balancing Reasoning and Social Bias in MLLMs
par: Pan, Zhenyu, et autres
Publié: (2025)
par: Pan, Zhenyu, et autres
Publié: (2025)
Can MLLMs Detect Phishing? A Comprehensive Security Benchmark Suite Focusing on Dynamic Threats and Multimodal Evaluation in Academic Environments
par: Zhou, Jingzhuo
Publié: (2025)
par: Zhou, Jingzhuo
Publié: (2025)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
par: Huang, Jincai, et autres
Publié: (2026)
par: Huang, Jincai, et autres
Publié: (2026)
Thinking Ahead: Foresight Intelligence in MLLMs and World Models
par: Gong, Zhantao, et autres
Publié: (2025)
par: Gong, Zhantao, et autres
Publié: (2025)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
par: Li, Zongjie, et autres
Publié: (2026)
par: Li, Zongjie, et autres
Publié: (2026)
Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs
par: Reza, Md Farhamdur, et autres
Publié: (2026)
par: Reza, Md Farhamdur, et autres
Publié: (2026)
Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs
par: van Sprang, Angela, et autres
Publié: (2025)
par: van Sprang, Angela, et autres
Publié: (2025)
Dense Connector for MLLMs
par: Yao, Huanjin, et autres
Publié: (2024)
par: Yao, Huanjin, et autres
Publié: (2024)
What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models
par: Karmakar, Ranit, et autres
Publié: (2026)
par: Karmakar, Ranit, et autres
Publié: (2026)
Documents similaires
-
Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?
par: Hu, Yijie, et autres
Publié: (2025) -
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
par: Tang, Yolo Y., et autres
Publié: (2024) -
Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs
par: Xi, Suyang, et autres
Publié: (2025) -
Can the Recovery Mechanism Survive AI? Skill Formation, Labor, and What Current Measurement Misses
par: Fan, Aysa Xuemo
Publié: (2026) -
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
par: Tao, Haoyi, et autres
Publié: (2026)