MM-THEBench: Do Reasoning MLLMs Think Reasonably?
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Zhidian, Yao, Zijun, Qi, Ji, Tu, Shangqing, Ma, Junxian, Liu, Jinxin, Liu, Weichuan, Che, Xiaoyin, Hou, Lei, Li, Juanzi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
por: Lee, Zhicheng, et al.
Publicado: (2025)
por: Lee, Zhicheng, et al.
Publicado: (2025)
How do Transformers Learn Implicit Reasoning?
por: Ye, Jiaran, et al.
Publicado: (2025)
por: Ye, Jiaran, et al.
Publicado: (2025)
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
por: Xin, Amy, et al.
Publicado: (2024)
por: Xin, Amy, et al.
Publicado: (2024)
SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented Generation
por: Yao, Zijun, et al.
Publicado: (2024)
por: Yao, Zijun, et al.
Publicado: (2024)
AdaptThink: Reasoning Models Can Learn When to Think
por: Zhang, Jiajie, et al.
Publicado: (2025)
por: Zhang, Jiajie, et al.
Publicado: (2025)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
por: Sun, Kai, et al.
Publicado: (2024)
por: Sun, Kai, et al.
Publicado: (2024)
Are Reasoning Models More Prone to Hallucination?
por: Yao, Zijun, et al.
Publicado: (2025)
por: Yao, Zijun, et al.
Publicado: (2025)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
por: Tu, Shangqing, et al.
Publicado: (2025)
por: Tu, Shangqing, et al.
Publicado: (2025)
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
por: Zhu, Kejian, et al.
Publicado: (2025)
por: Zhu, Kejian, et al.
Publicado: (2025)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament
por: Liu, Yantao, et al.
Publicado: (2025)
por: Liu, Yantao, et al.
Publicado: (2025)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
por: Fan, Yuchen, et al.
Publicado: (2024)
por: Fan, Yuchen, et al.
Publicado: (2024)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
por: Zhao, Yixiu, et al.
Publicado: (2025)
por: Zhao, Yixiu, et al.
Publicado: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026)
por: Peng, Hao, et al.
Publicado: (2026)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
por: He, Guanzhong, et al.
Publicado: (2025)
por: He, Guanzhong, et al.
Publicado: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
por: Hou, Zhenyu, et al.
Publicado: (2025)
por: Hou, Zhenyu, et al.
Publicado: (2025)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking
por: Xin, Amy, et al.
Publicado: (2024)
por: Xin, Amy, et al.
Publicado: (2024)
InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
por: Liu, Zeyu, et al.
Publicado: (2025)
por: Liu, Zeyu, et al.
Publicado: (2025)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder
por: Jing, Yi, et al.
Publicado: (2025)
por: Jing, Yi, et al.
Publicado: (2025)
M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
por: AI, Inclusion, et al.
Publicado: (2025)
por: AI, Inclusion, et al.
Publicado: (2025)
Could Thinking Multilingually Empower LLM Reasoning?
por: Gao, Changjiang, et al.
Publicado: (2025)
por: Gao, Changjiang, et al.
Publicado: (2025)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
por: He, Wei, et al.
Publicado: (2024)
por: He, Wei, et al.
Publicado: (2024)
MixReasoning: Switching Modes to Think
por: Lu, Haiquan, et al.
Publicado: (2025)
por: Lu, Haiquan, et al.
Publicado: (2025)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
por: Chen, Yanxu, et al.
Publicado: (2025)
por: Chen, Yanxu, et al.
Publicado: (2025)
Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains
por: Wu, Juncheng, et al.
Publicado: (2025)
por: Wu, Juncheng, et al.
Publicado: (2025)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
How Proficient Are Large Language Models in Formal Languages? An In-Depth Insight for Knowledge Base Question Answering
por: Liu, Jinxin, et al.
Publicado: (2024)
por: Liu, Jinxin, et al.
Publicado: (2024)
How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning
por: Chen, Haoyang, et al.
Publicado: (2026)
por: Chen, Haoyang, et al.
Publicado: (2026)
When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
por: Liu, Hongcheng, et al.
Publicado: (2025)
por: Liu, Hongcheng, et al.
Publicado: (2025)
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
por: Bai, Yushi, et al.
Publicado: (2023)
por: Bai, Yushi, et al.
Publicado: (2023)
Ejemplares similares
-
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
por: Lee, Zhicheng, et al.
Publicado: (2025) -
How do Transformers Learn Implicit Reasoning?
por: Ye, Jiaran, et al.
Publicado: (2025) -
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
por: Tu, Shangqing, et al.
Publicado: (2024) -
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
por: Xin, Amy, et al.
Publicado: (2024) -
SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented Generation
por: Yao, Zijun, et al.
Publicado: (2024)