Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yang, Sun, Xiaoshuai, Zhao, Rui, Sun, Wujin, Chen, Yidong, Ji, Jiayi, Chen, Qian, Ji, Rongrong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis
di: Wu, Hang, et al.
Pubblicazione: (2025)
di: Wu, Hang, et al.
Pubblicazione: (2025)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026)
di: Chen, Tao, et al.
Pubblicazione: (2026)
ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation
di: Huang, Oucheng, et al.
Pubblicazione: (2025)
di: Huang, Oucheng, et al.
Pubblicazione: (2025)
StealthDiffusion: Towards Evading Diffusion Forensic Detection through Diffusion Model
di: Zhou, Ziyin, et al.
Pubblicazione: (2024)
di: Zhou, Ziyin, et al.
Pubblicazione: (2024)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
di: Ma, Jie, et al.
Pubblicazione: (2026)
di: Ma, Jie, et al.
Pubblicazione: (2026)
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
di: Zheng, Haojie, et al.
Pubblicazione: (2024)
di: Zheng, Haojie, et al.
Pubblicazione: (2024)
IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation
di: Chen, Qi, et al.
Pubblicazione: (2025)
di: Chen, Qi, et al.
Pubblicazione: (2025)
RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning
di: Wu, Mingrui, et al.
Pubblicazione: (2025)
di: Wu, Mingrui, et al.
Pubblicazione: (2025)
I2EBench: A Comprehensive Benchmark for Instruction-based Image Editing
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
AnyTrans: Translate AnyText in the Image with Large Scale Models
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning
di: Liu, Shuochen, et al.
Pubblicazione: (2025)
di: Liu, Shuochen, et al.
Pubblicazione: (2025)
Plan Before Search: Search Agents Need Plan
di: Qian, Zhipeng, et al.
Pubblicazione: (2026)
di: Qian, Zhipeng, et al.
Pubblicazione: (2026)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic
di: Xu, Chuou, et al.
Pubblicazione: (2026)
di: Xu, Chuou, et al.
Pubblicazione: (2026)
WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning
di: Yang, Haojin, et al.
Pubblicazione: (2025)
di: Yang, Haojin, et al.
Pubblicazione: (2025)
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
di: Zhou, Chenyue, et al.
Pubblicazione: (2025)
di: Zhou, Chenyue, et al.
Pubblicazione: (2025)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
di: Lin, Zhihang, et al.
Pubblicazione: (2025)
di: Lin, Zhihang, et al.
Pubblicazione: (2025)
Decoupling Knowledge and Reasoning in LLMs: An Exploration Using Cognitive Dual-System Theory
di: Yang, Mutian, et al.
Pubblicazione: (2025)
di: Yang, Mutian, et al.
Pubblicazione: (2025)
An LLM-based Framework for Human-Swarm Teaming Cognition in Disaster Search and Rescue
di: Ji, Kailun, et al.
Pubblicazione: (2025)
di: Ji, Kailun, et al.
Pubblicazione: (2025)
Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models
di: Qian, Zhe, et al.
Pubblicazione: (2026)
di: Qian, Zhe, et al.
Pubblicazione: (2026)
HRSAM: Efficient Interactive Segmentation in High-Resolution Images
di: Huang, You, et al.
Pubblicazione: (2024)
di: Huang, You, et al.
Pubblicazione: (2024)
Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling
di: Chen, Andong, et al.
Pubblicazione: (2026)
di: Chen, Andong, et al.
Pubblicazione: (2026)
CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval
di: Qian, Zhipeng, et al.
Pubblicazione: (2026)
di: Qian, Zhipeng, et al.
Pubblicazione: (2026)
Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
di: Zhang, Jesen, et al.
Pubblicazione: (2025)
di: Zhang, Jesen, et al.
Pubblicazione: (2025)
DeepVision-103K: A Visually Diverse, Broad-Coverage, and Verifiable Mathematical Dataset for Multimodal Reasoning
di: Sun, Haoxiang, et al.
Pubblicazione: (2026)
di: Sun, Haoxiang, et al.
Pubblicazione: (2026)
ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning
di: Gao, Jingyue, et al.
Pubblicazione: (2026)
di: Gao, Jingyue, et al.
Pubblicazione: (2026)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
di: Shen, Yuxiang, et al.
Pubblicazione: (2026)
di: Shen, Yuxiang, et al.
Pubblicazione: (2026)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
di: Wang, Fengxiang, et al.
Pubblicazione: (2026)
di: Wang, Fengxiang, et al.
Pubblicazione: (2026)
Speculative Decoding Reimagined for Multimodal Large Language Models
di: Lin, Luxi, et al.
Pubblicazione: (2025)
di: Lin, Luxi, et al.
Pubblicazione: (2025)
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
di: Liu, Yufang, et al.
Pubblicazione: (2025)
di: Liu, Yufang, et al.
Pubblicazione: (2025)
MedAlign: A Synergistic Framework of Multimodal Preference Optimization and Federated Meta-Cognitive Reasoning
di: Chen, Siyong, et al.
Pubblicazione: (2025)
di: Chen, Siyong, et al.
Pubblicazione: (2025)
ROI-Reasoning: Rational Optimization for Inference via Pre-Computation Meta-Cognition
di: Zhao, Muyang, et al.
Pubblicazione: (2026)
di: Zhao, Muyang, et al.
Pubblicazione: (2026)
TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis
di: Wu, Hang, et al.
Pubblicazione: (2025) -
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
di: Ma, Yiwei, et al.
Pubblicazione: (2024) -
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026) -
ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation
di: Huang, Oucheng, et al.
Pubblicazione: (2025) -
StealthDiffusion: Towards Evading Diffusion Forensic Detection through Diffusion Model
di: Zhou, Ziyin, et al.
Pubblicazione: (2024)