Thinking with Visual Abstract: Enhancing Multimodal Reasoning via Visual Abstraction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Dairu, Wang, Ziyue, Ruan, Minyuan, Luo, Fuwen, Chen, Chi, Li, Peng, Liu, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability
par: Wang, Ziyue, et autres
Publié: (2025)
par: Wang, Ziyue, et autres
Publié: (2025)
Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind
par: Ruan, Minyuan, et autres
Publié: (2026)
par: Ruan, Minyuan, et autres
Publié: (2026)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion
par: Wang, Ziyue, et autres
Publié: (2024)
par: Wang, Ziyue, et autres
Publié: (2024)
Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task
par: Dong, Yurui, et autres
Publié: (2026)
par: Dong, Yurui, et autres
Publié: (2026)
Model Composition for Multimodal Large Language Models
par: Chen, Chi, et autres
Publié: (2024)
par: Chen, Chi, et autres
Publié: (2024)
Filling the Image Information Gap for VQA: Prompting Large Language Models to Proactively Ask Questions
par: Wang, Ziyue, et autres
Publié: (2023)
par: Wang, Ziyue, et autres
Publié: (2023)
On Data Synthesis and Post-training for Visual Abstract Reasoning
par: Zhu, Ke, et autres
Publié: (2025)
par: Zhu, Ke, et autres
Publié: (2025)
Reasoning in Conversation: Solving Subjective Tasks through Dialogue Simulation for Large Language Models
par: Wang, Xiaolong, et autres
Publié: (2024)
par: Wang, Xiaolong, et autres
Publié: (2024)
Perspective Transition of Large Language Models for Solving Subjective Tasks
par: Wang, Xiaolong, et autres
Publié: (2025)
par: Wang, Xiaolong, et autres
Publié: (2025)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
par: Luo, Fuwen, et autres
Publié: (2025)
par: Luo, Fuwen, et autres
Publié: (2025)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
par: Ruan, Zhiwen, et autres
Publié: (2025)
par: Ruan, Zhiwen, et autres
Publié: (2025)
Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains
par: Xie, Hui, et autres
Publié: (2026)
par: Xie, Hui, et autres
Publié: (2026)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
Reinforcing Multimodal Reasoning Against Visual Degradation
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
Latent Visual Reasoning
par: Li, Bangzheng, et autres
Publié: (2025)
par: Li, Bangzheng, et autres
Publié: (2025)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
par: Tian, Changyuan, et autres
Publié: (2026)
par: Tian, Changyuan, et autres
Publié: (2026)
Exploring Large Language Models for Communication Games: An Empirical Study on Werewolf
par: Xu, Yuzhuang, et autres
Publié: (2023)
par: Xu, Yuzhuang, et autres
Publié: (2023)
Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors
par: Luo, Fuwen, et autres
Publié: (2026)
par: Luo, Fuwen, et autres
Publié: (2026)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
par: Tian, Xiaoyu, et autres
Publié: (2025)
par: Tian, Xiaoyu, et autres
Publié: (2025)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
par: Lou, Xinyue, et autres
Publié: (2025)
par: Lou, Xinyue, et autres
Publié: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
Imagination Helps Visual Reasoning, But Not Yet in Latent Space
par: Li, You, et autres
Publié: (2026)
par: Li, You, et autres
Publié: (2026)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
par: Shi, Weikang, et autres
Publié: (2025)
par: Shi, Weikang, et autres
Publié: (2025)
G2: Guided Generation for Enhanced Output Diversity in LLMs
par: Ruan, Zhiwen, et autres
Publié: (2025)
par: Ruan, Zhiwen, et autres
Publié: (2025)
Unbiased Visual Reasoning with Controlled Visual Inputs
par: Li, Zhaonan, et autres
Publié: (2025)
par: Li, Zhaonan, et autres
Publié: (2025)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
par: Sun, Yubo, et autres
Publié: (2025)
par: Sun, Yubo, et autres
Publié: (2025)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Unveiling Over-Memorization in Finetuning LLMs for Reasoning Tasks
par: Ruan, Zhiwen, et autres
Publié: (2025)
par: Ruan, Zhiwen, et autres
Publié: (2025)
Chatting with Images for Introspective Visual Thinking
par: Wu, Junfei, et autres
Publié: (2026)
par: Wu, Junfei, et autres
Publié: (2026)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
par: Zheng, Yuanlei, et autres
Publié: (2026)
par: Zheng, Yuanlei, et autres
Publié: (2026)
Meaningful Learning: Enhancing Abstract Reasoning in Large Language Models via Generic Fact Guidance
par: Xiong, Kai, et autres
Publié: (2024)
par: Xiong, Kai, et autres
Publié: (2024)
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
par: Vaishnav, Mohit, et autres
Publié: (2026)
par: Vaishnav, Mohit, et autres
Publié: (2026)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
Think Socially via Cognitive Reasoning
par: Zhou, Jinfeng, et autres
Publié: (2025)
par: Zhou, Jinfeng, et autres
Publié: (2025)
Documents similaires
-
EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability
par: Wang, Ziyue, et autres
Publié: (2025) -
Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind
par: Ruan, Minyuan, et autres
Publié: (2026) -
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024) -
Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion
par: Wang, Ziyue, et autres
Publié: (2024) -
Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task
par: Dong, Yurui, et autres
Publié: (2026)