What MLLMs Learn about When they Learn about Multimodal Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Chung, Jiwan, Joshi, Neel, Sharma, Pratyusha, Yu, Youngjae, Vineet, Vibhav |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
por: Chung, Jiwan, et al.
Publicado: (2025)
por: Chung, Jiwan, et al.
Publicado: (2025)
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
por: Joshi, Siddharth, et al.
Publicado: (2025)
por: Joshi, Siddharth, et al.
Publicado: (2025)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
por: Kim, Youngmin, et al.
Publicado: (2025)
por: Kim, Youngmin, et al.
Publicado: (2025)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
por: Singh, Joykirat, et al.
Publicado: (2024)
por: Singh, Joykirat, et al.
Publicado: (2024)
VAGUE: Visual Contexts Clarify Ambiguous Expressions
por: Nam, Heejeong, et al.
Publicado: (2024)
por: Nam, Heejeong, et al.
Publicado: (2024)
StreamReady: Learning What to Answer and When in Long Streaming Videos
por: Azad, Shehreen, et al.
Publicado: (2026)
por: Azad, Shehreen, et al.
Publicado: (2026)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
por: Chung, Jiwan, et al.
Publicado: (2024)
por: Chung, Jiwan, et al.
Publicado: (2024)
Dialect prejudice predicts AI decisions about people's character, employability, and criminality
por: Hofmann, Valentin, et al.
Publicado: (2024)
por: Hofmann, Valentin, et al.
Publicado: (2024)
Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation
por: Park, Jaewoo, et al.
Publicado: (2025)
por: Park, Jaewoo, et al.
Publicado: (2025)
Are Any-to-Any Models More Consistent Across Modality Transfers Than Specialists?
por: Chung, Jiwan, et al.
Publicado: (2025)
por: Chung, Jiwan, et al.
Publicado: (2025)
When are We Worried? Temporal Trends of Anxiety and What They Reveal about Us
por: Mohammad, Saif M.
Publicado: (2026)
por: Mohammad, Saif M.
Publicado: (2026)
When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
por: Liu, Hongcheng, et al.
Publicado: (2025)
por: Liu, Hongcheng, et al.
Publicado: (2025)
Inference-Time Scaling for Complex Tasks: Where We Stand and What Lies Ahead
por: Balachandran, Vidhisha, et al.
Publicado: (2025)
por: Balachandran, Vidhisha, et al.
Publicado: (2025)
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
por: Mei, Zhiting, et al.
Publicado: (2025)
por: Mei, Zhiting, et al.
Publicado: (2025)
Reasoning is about giving reasons
por: Shah, Krunal, et al.
Publicado: (2025)
por: Shah, Krunal, et al.
Publicado: (2025)
Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language Models
por: Chae, Hyungjoo, et al.
Publicado: (2024)
por: Chae, Hyungjoo, et al.
Publicado: (2024)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
por: Jiang, Ruixiang, et al.
Publicado: (2025)
por: Jiang, Ruixiang, et al.
Publicado: (2025)
UNcommonsense Reasoning: Abductive Reasoning about Uncommon Situations
por: Zhao, Wenting, et al.
Publicado: (2023)
por: Zhao, Wenting, et al.
Publicado: (2023)
What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models
por: Yun, Tian, et al.
Publicado: (2025)
por: Yun, Tian, et al.
Publicado: (2025)
Eureka: Evaluating and Understanding Large Foundation Models
por: Balachandran, Vidhisha, et al.
Publicado: (2024)
por: Balachandran, Vidhisha, et al.
Publicado: (2024)
PizzaCommonSense: Learning to Model Commonsense Reasoning about Intermediate Steps in Cooking Recipes
por: Diallo, Aissatou, et al.
Publicado: (2024)
por: Diallo, Aissatou, et al.
Publicado: (2024)
R2Vul: Learning to Reason about Software Vulnerabilities with Reinforcement Learning and Structured Reasoning Distillation
por: Weyssow, Martin, et al.
Publicado: (2025)
por: Weyssow, Martin, et al.
Publicado: (2025)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
por: Wang, Jiayu, et al.
Publicado: (2024)
por: Wang, Jiayu, et al.
Publicado: (2024)
Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations
por: Park, Eunkyu, et al.
Publicado: (2025)
por: Park, Eunkyu, et al.
Publicado: (2025)
Reasoning about Intent for Ambiguous Requests
por: Saparina, Irina, et al.
Publicado: (2025)
por: Saparina, Irina, et al.
Publicado: (2025)
What do Transformers Know about Government?
por: Hou, Jue, et al.
Publicado: (2024)
por: Hou, Jue, et al.
Publicado: (2024)
LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code
por: Jararweh, Ala, et al.
Publicado: (2025)
por: Jararweh, Ala, et al.
Publicado: (2025)
Reasoning about Affordances: Causal and Compositional Reasoning in LLMs
por: Gjerde, Magnus F., et al.
Publicado: (2025)
por: Gjerde, Magnus F., et al.
Publicado: (2025)
Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
por: Jeon, Jaehyun, et al.
Publicado: (2025)
por: Jeon, Jaehyun, et al.
Publicado: (2025)
What has LeBenchmark Learnt about French Syntax?
por: Dugonjić, Zdravko, et al.
Publicado: (2024)
por: Dugonjić, Zdravko, et al.
Publicado: (2024)
When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning
por: Wei, Jiaqi, et al.
Publicado: (2026)
por: Wei, Jiaqi, et al.
Publicado: (2026)
See, Think, Learn: A Self-Taught Multimodal Reasoner
por: Sharma, Sourabh, et al.
Publicado: (2025)
por: Sharma, Sourabh, et al.
Publicado: (2025)
ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction
por: Abaskohi, Amirhossein, et al.
Publicado: (2026)
por: Abaskohi, Amirhossein, et al.
Publicado: (2026)
BAT: Learning to Reason about Spatial Sounds with Large Language Models
por: Zheng, Zhisheng, et al.
Publicado: (2024)
por: Zheng, Zhisheng, et al.
Publicado: (2024)
Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time
por: Hu, Michael Y., et al.
Publicado: (2026)
por: Hu, Michael Y., et al.
Publicado: (2026)
Reasoning about concepts with LLMs: Inconsistencies abound
por: Uceda-Sosa, Rosario, et al.
Publicado: (2024)
por: Uceda-Sosa, Rosario, et al.
Publicado: (2024)
EgoSpeak: Learning When to Speak for Egocentric Conversational Agents in the Wild
por: Kim, Junhyeok, et al.
Publicado: (2025)
por: Kim, Junhyeok, et al.
Publicado: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)
por: Zhang, Huanyu, et al.
Publicado: (2025)
WeatherQA: Can Multimodal Language Models Reason about Severe Weather?
por: Ma, Chengqian, et al.
Publicado: (2024)
por: Ma, Chengqian, et al.
Publicado: (2024)
LoRA vs Full Fine-tuning: An Illusion of Equivalence
por: Shuttleworth, Reece, et al.
Publicado: (2024)
por: Shuttleworth, Reece, et al.
Publicado: (2024)
Ejemplares similares
-
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
por: Chung, Jiwan, et al.
Publicado: (2025) -
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
por: Joshi, Siddharth, et al.
Publicado: (2025) -
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
por: Kim, Youngmin, et al.
Publicado: (2025) -
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
por: Singh, Joykirat, et al.
Publicado: (2024) -
VAGUE: Visual Contexts Clarify Ambiguous Expressions
por: Nam, Heejeong, et al.
Publicado: (2024)