Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Miao, Ziqi, Jia, Haonan, Li, Lijun, Qian, Chen, Xiong, Yuan, Yan, Wenting, Shao, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction
di: Wang, Yongyao, et al.
Pubblicazione: (2026)
di: Wang, Yongyao, et al.
Pubblicazione: (2026)
STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models
di: Guo, Shaoxiong, et al.
Pubblicazione: (2025)
di: Guo, Shaoxiong, et al.
Pubblicazione: (2025)
Beyond Seeing: Evaluating Multimodal LLMs on Tool-Enabled Image Perception, Transformation, and Reasoning
di: Guo, Xingang, et al.
Pubblicazione: (2025)
di: Guo, Xingang, et al.
Pubblicazione: (2025)
A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
di: Yang, Tianyu, et al.
Pubblicazione: (2026)
di: Yang, Tianyu, et al.
Pubblicazione: (2026)
Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning
di: Wang, Haoyu, et al.
Pubblicazione: (2026)
di: Wang, Haoyu, et al.
Pubblicazione: (2026)
Seeing and Reasoning with Confidence: Supercharging Multimodal LLMs with an Uncertainty-Aware Agentic Framework
di: Zhi, Zhuo, et al.
Pubblicazione: (2025)
di: Zhi, Zhuo, et al.
Pubblicazione: (2025)
Improving LLMs' Generalized Reasoning Abilities by Graph Problems
di: Zhang, Qifan, et al.
Pubblicazione: (2025)
di: Zhang, Qifan, et al.
Pubblicazione: (2025)
To See or To Read: User Behavior Reasoning in Multimodal LLMs
di: Dong, Tianning, et al.
Pubblicazione: (2025)
di: Dong, Tianning, et al.
Pubblicazione: (2025)
Info-Coevolution: An Efficient Framework for Data Model Coevolution
di: Qin, Ziheng, et al.
Pubblicazione: (2025)
di: Qin, Ziheng, et al.
Pubblicazione: (2025)
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation
di: Yuan, Yifu, et al.
Pubblicazione: (2025)
di: Yuan, Yifu, et al.
Pubblicazione: (2025)
Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
di: Wei, Jingxuan, et al.
Pubblicazione: (2025)
di: Wei, Jingxuan, et al.
Pubblicazione: (2025)
Multimodal Reasoning with Multimodal Knowledge Graph
di: Lee, Junlin, et al.
Pubblicazione: (2024)
di: Lee, Junlin, et al.
Pubblicazione: (2024)
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
di: Zhou, Chenyue, et al.
Pubblicazione: (2025)
di: Zhou, Chenyue, et al.
Pubblicazione: (2025)
GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
di: Wei, Jingxuan, et al.
Pubblicazione: (2025)
di: Wei, Jingxuan, et al.
Pubblicazione: (2025)
Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
di: Qian, Chen, et al.
Pubblicazione: (2025)
di: Qian, Chen, et al.
Pubblicazione: (2025)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
di: Li, Yizhen, et al.
Pubblicazione: (2025)
di: Li, Yizhen, et al.
Pubblicazione: (2025)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
di: Peng, Miao, et al.
Pubblicazione: (2025)
di: Peng, Miao, et al.
Pubblicazione: (2025)
ReasonBridge: Efficient Reasoning Transfer from Closed to Open-Source Language Models
di: Zhong, Ziqi, et al.
Pubblicazione: (2025)
di: Zhong, Ziqi, et al.
Pubblicazione: (2025)
ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging
di: Yang, Junyao, et al.
Pubblicazione: (2026)
di: Yang, Junyao, et al.
Pubblicazione: (2026)
Vision Language Models See What You Want but not What You See
di: Gao, Qingying, et al.
Pubblicazione: (2024)
di: Gao, Qingying, et al.
Pubblicazione: (2024)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
di: Xiong, Wei, et al.
Pubblicazione: (2025)
di: Xiong, Wei, et al.
Pubblicazione: (2025)
L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic Search
di: Wang, Ziqi, et al.
Pubblicazione: (2025)
di: Wang, Ziqi, et al.
Pubblicazione: (2025)
MediSee: Reasoning-based Pixel-level Perception in Medical Images
di: Tong, Qinyue, et al.
Pubblicazione: (2025)
di: Tong, Qinyue, et al.
Pubblicazione: (2025)
Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models
di: Yan, Qianqi, et al.
Pubblicazione: (2025)
di: Yan, Qianqi, et al.
Pubblicazione: (2025)
Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation
di: Tang, Weiliang, et al.
Pubblicazione: (2025)
di: Tang, Weiliang, et al.
Pubblicazione: (2025)
Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
di: Peng, Miao, et al.
Pubblicazione: (2026)
di: Peng, Miao, et al.
Pubblicazione: (2026)
SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning
di: Xiang, Kun, et al.
Pubblicazione: (2026)
di: Xiang, Kun, et al.
Pubblicazione: (2026)
Human-AI Coevolution
di: Pedreschi, Dino, et al.
Pubblicazione: (2023)
di: Pedreschi, Dino, et al.
Pubblicazione: (2023)
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
di: Xiang, Kun, et al.
Pubblicazione: (2025)
di: Xiang, Kun, et al.
Pubblicazione: (2025)
The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm
di: Goyal, Karan
Pubblicazione: (2026)
di: Goyal, Karan
Pubblicazione: (2026)
Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning
di: Tang, Jing, et al.
Pubblicazione: (2026)
di: Tang, Jing, et al.
Pubblicazione: (2026)
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
di: Xiong, Yuan, et al.
Pubblicazione: (2025)
di: Xiong, Yuan, et al.
Pubblicazione: (2025)
A Smart Multimodal Healthcare Copilot with Powerful LLM Reasoning
di: Zhao, Xuejiao, et al.
Pubblicazione: (2025)
di: Zhao, Xuejiao, et al.
Pubblicazione: (2025)
Stable Adaptive Thinking via Advantage Shaping and Length-Aware Gradient Regulation
di: Xu, Zihang, et al.
Pubblicazione: (2026)
di: Xu, Zihang, et al.
Pubblicazione: (2026)
To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
di: Lazić, Nevena, et al.
Pubblicazione: (2026)
di: Lazić, Nevena, et al.
Pubblicazione: (2026)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
di: Chen, Yan, et al.
Pubblicazione: (2025)
di: Chen, Yan, et al.
Pubblicazione: (2025)
Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization
di: Kong, Jiawei, et al.
Pubblicazione: (2026)
di: Kong, Jiawei, et al.
Pubblicazione: (2026)
Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning
di: Zhao, Qiannian, et al.
Pubblicazione: (2026)
di: Zhao, Qiannian, et al.
Pubblicazione: (2026)
A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
di: Wang, Ziqi, et al.
Pubblicazione: (2025)
di: Wang, Ziqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction
di: Wang, Yongyao, et al.
Pubblicazione: (2026) -
STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models
di: Guo, Shaoxiong, et al.
Pubblicazione: (2025) -
Beyond Seeing: Evaluating Multimodal LLMs on Tool-Enabled Image Perception, Transformation, and Reasoning
di: Guo, Xingang, et al.
Pubblicazione: (2025) -
A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
di: Yang, Tianyu, et al.
Pubblicazione: (2026) -
Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning
di: Wang, Haoyu, et al.
Pubblicazione: (2026)