Socratic Questioning: Learn to Self-guide Multimodal Reasoning in the Wild
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Wanpeng, Liu, Haodi, Chen, Lin, Zhou, Feng, Xiao, Changming, Yang, Qi, Zhang, Changshui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
par: Xiao, Changming, et autres
Publié: (2023)
par: Xiao, Changming, et autres
Publié: (2023)
Instruction-tuned Self-Questioning Framework for Multimodal Reasoning
par: Jang, You-Won, et autres
Publié: (2025)
par: Jang, You-Won, et autres
Publié: (2025)
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions
par: Acuna, David, et autres
Publié: (2025)
par: Acuna, David, et autres
Publié: (2025)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
par: Ma, Haodi, et autres
Publié: (2025)
par: Ma, Haodi, et autres
Publié: (2025)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025)
par: Zhang, Wanpeng, et autres
Publié: (2025)
Socratic-Geo: Synthetic Data Generation and Geometric Reasoning via Multi-Agent Interaction
par: Jiao, Zhengbo, et autres
Publié: (2026)
par: Jiao, Zhengbo, et autres
Publié: (2026)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
par: Zhang, Jesen, et autres
Publié: (2025)
par: Zhang, Jesen, et autres
Publié: (2025)
V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning
par: Wang, Haoyu, et autres
Publié: (2026)
par: Wang, Haoyu, et autres
Publié: (2026)
CogStream: Context-guided Streaming Video Question Answering
par: Zhao, Zicheng, et autres
Publié: (2025)
par: Zhao, Zicheng, et autres
Publié: (2025)
Asking like Socrates: Socrates helps VLMs understand remote sensing images
par: Shao, Run, et autres
Publié: (2025)
par: Shao, Run, et autres
Publié: (2025)
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
par: Xie, Tianchi, et autres
Publié: (2025)
par: Xie, Tianchi, et autres
Publié: (2025)
A Theoretical View of Linear Backpropagation and Its Convergence
par: Li, Ziang, et autres
Publié: (2021)
par: Li, Ziang, et autres
Publié: (2021)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
par: Choi, Changin, et autres
Publié: (2025)
par: Choi, Changin, et autres
Publié: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
par: Xi, Suyang, et autres
Publié: (2026)
par: Xi, Suyang, et autres
Publié: (2026)
When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning
par: Wu, Zhengxian, et autres
Publié: (2026)
par: Wu, Zhengxian, et autres
Publié: (2026)
Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification
par: Lv, Shuai, et autres
Publié: (2026)
par: Lv, Shuai, et autres
Publié: (2026)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
par: Tian, Shi-Yu, et autres
Publié: (2026)
par: Tian, Shi-Yu, et autres
Publié: (2026)
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
par: Guo, Yifu, et autres
Publié: (2025)
par: Guo, Yifu, et autres
Publié: (2025)
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
par: Hong, Yuyang, et autres
Publié: (2025)
par: Hong, Yuyang, et autres
Publié: (2025)
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
par: Guo, Xiaojun, et autres
Publié: (2025)
par: Guo, Xiaojun, et autres
Publié: (2025)
Mutual Information guided Visual Contrastive Learning
par: Chen, Hanyang, et autres
Publié: (2025)
par: Chen, Hanyang, et autres
Publié: (2025)
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
par: Cai, Huanqia, et autres
Publié: (2025)
par: Cai, Huanqia, et autres
Publié: (2025)
Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild
par: Feng, Yigui, et autres
Publié: (2025)
par: Feng, Yigui, et autres
Publié: (2025)
Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
par: Lan, Xiaohan, et autres
Publié: (2025)
par: Lan, Xiaohan, et autres
Publié: (2025)
Integrating Object Interaction Self-Attention and GAN-Based Debiasing for Visual Question Answering
par: Li, Zhifei, et autres
Publié: (2025)
par: Li, Zhifei, et autres
Publié: (2025)
Hand3R: Online 4D Hand-Scene Reconstruction in the Wild
par: Hu, Wendi, et autres
Publié: (2026)
par: Hu, Wendi, et autres
Publié: (2026)
VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding
par: Ding, Yizhuo, et autres
Publié: (2025)
par: Ding, Yizhuo, et autres
Publié: (2025)
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
par: Liu, Yufang, et autres
Publié: (2025)
par: Liu, Yufang, et autres
Publié: (2025)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
par: Xi, Gongli, et autres
Publié: (2026)
par: Xi, Gongli, et autres
Publié: (2026)
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
par: Zhou, Yue, et autres
Publié: (2025)
par: Zhou, Yue, et autres
Publié: (2025)
Learning to See the Elephant in the Room: Self-Supervised Context Reasoning in Humans and AI
par: Liu, Xiao, et autres
Publié: (2022)
par: Liu, Xiao, et autres
Publié: (2022)
Diving into Self-Evolving Training for Multimodal Reasoning
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
par: Xiao, Tong, et autres
Publié: (2025)
par: Xiao, Tong, et autres
Publié: (2025)
STELAR-VISION: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection
par: Zhou, Weilin, et autres
Publié: (2026)
par: Zhou, Weilin, et autres
Publié: (2026)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
par: Wang, Zhepeng, et autres
Publié: (2025)
par: Wang, Zhepeng, et autres
Publié: (2025)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
par: Ma, Jiatong, et autres
Publié: (2026)
par: Ma, Jiatong, et autres
Publié: (2026)
Documents similaires
-
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
par: Xiao, Changming, et autres
Publié: (2023) -
Instruction-tuned Self-Questioning Framework for Multimodal Reasoning
par: Jang, You-Won, et autres
Publié: (2025) -
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions
par: Acuna, David, et autres
Publié: (2025) -
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
par: Ma, Haodi, et autres
Publié: (2025) -
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025)