UnAC: Adaptive Visual Prompting with Abstraction and Stepwise Checking for Complex Multimodal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yifan, Fu, Yun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
di: Gao, Minghe, et al.
Pubblicazione: (2025)
di: Gao, Minghe, et al.
Pubblicazione: (2025)
MARVEL: Multidimensional Abstraction and Reasoning through Visual Evaluation and Learning
di: Jiang, Yifan, et al.
Pubblicazione: (2024)
di: Jiang, Yifan, et al.
Pubblicazione: (2024)
Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners
di: Liu, Qingyang, et al.
Pubblicazione: (2026)
di: Liu, Qingyang, et al.
Pubblicazione: (2026)
Visual Superordinate Abstraction for Robust Concept Learning
di: Zheng, Qi, et al.
Pubblicazione: (2022)
di: Zheng, Qi, et al.
Pubblicazione: (2022)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
A Stepwise Distillation Learning Strategy for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks
di: Wan, Wentao, et al.
Pubblicazione: (2023)
di: Wan, Wentao, et al.
Pubblicazione: (2023)
Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs
di: Nasser, Abdelmoamen, et al.
Pubblicazione: (2026)
di: Nasser, Abdelmoamen, et al.
Pubblicazione: (2026)
FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models
di: Yuan, Shengming, et al.
Pubblicazione: (2025)
di: Yuan, Shengming, et al.
Pubblicazione: (2025)
Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts
di: Gao, Yifan, et al.
Pubblicazione: (2026)
di: Gao, Yifan, et al.
Pubblicazione: (2026)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
di: Du, Yifan, et al.
Pubblicazione: (2023)
di: Du, Yifan, et al.
Pubblicazione: (2023)
Temporal Adaptive RGBT Tracking with Modality Prompt
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
di: Cai, Huanqia, et al.
Pubblicazione: (2025)
di: Cai, Huanqia, et al.
Pubblicazione: (2025)
Defending Multimodal Backdoored Models by Repulsive Visual Prompt Tuning
di: Zhang, Zhifang, et al.
Pubblicazione: (2024)
di: Zhang, Zhifang, et al.
Pubblicazione: (2024)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
di: Lu, Taiting, et al.
Pubblicazione: (2026)
di: Lu, Taiting, et al.
Pubblicazione: (2026)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward
di: Ning, Zhiwei, et al.
Pubblicazione: (2026)
di: Ning, Zhiwei, et al.
Pubblicazione: (2026)
Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation
di: Li, Yifan, et al.
Pubblicazione: (2026)
di: Li, Yifan, et al.
Pubblicazione: (2026)
Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity
di: Jung, Jaeyoon, et al.
Pubblicazione: (2026)
di: Jung, Jaeyoon, et al.
Pubblicazione: (2026)
Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
di: Sinha, Rohit, et al.
Pubblicazione: (2026)
di: Sinha, Rohit, et al.
Pubblicazione: (2026)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution
di: Tian, Baoliang, et al.
Pubblicazione: (2025)
di: Tian, Baoliang, et al.
Pubblicazione: (2025)
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
CVBench: Benchmarking Cross-Video Synergies for Complex Multimodal Reasoning
di: Zhu, Nannan, et al.
Pubblicazione: (2025)
di: Zhu, Nannan, et al.
Pubblicazione: (2025)
The Abstraction Gap in Vision-Language Causal Reasoning
di: Hoang, Chinh, et al.
Pubblicazione: (2026)
di: Hoang, Chinh, et al.
Pubblicazione: (2026)
WIR3D: Visually-Informed and Geometry-Aware 3D Shape Abstraction
di: Liu, Richard, et al.
Pubblicazione: (2025)
di: Liu, Richard, et al.
Pubblicazione: (2025)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
VP-MEL: Visual Prompts Guided Multimodal Entity Linking
di: Mi, Hongze, et al.
Pubblicazione: (2024)
di: Mi, Hongze, et al.
Pubblicazione: (2024)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
di: Kim, Hyeonyu, et al.
Pubblicazione: (2025)
Exploring Sparse Visual Prompt for Domain Adaptive Dense Prediction
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
Abstraction in Style
di: Lu, Min, et al.
Pubblicazione: (2026)
di: Lu, Min, et al.
Pubblicazione: (2026)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
di: Wang, Chuhan, et al.
Pubblicazione: (2026)
di: Wang, Chuhan, et al.
Pubblicazione: (2026)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
di: Wang, Haicheng, et al.
Pubblicazione: (2026)
di: Wang, Haicheng, et al.
Pubblicazione: (2026)
Multimodal Prompt Perceiver: Empower Adaptiveness, Generalizability and Fidelity for All-in-One Image Restoration
di: Ai, Yuang, et al.
Pubblicazione: (2023)
di: Ai, Yuang, et al.
Pubblicazione: (2023)
Towards Global Optimal Visual In-Context Learning Prompt Selection
di: Xu, Chengming, et al.
Pubblicazione: (2024)
di: Xu, Chengming, et al.
Pubblicazione: (2024)
Multimodal 3D Reasoning Segmentation with Complex Scenes
di: Jiang, Xueying, et al.
Pubblicazione: (2024)
di: Jiang, Xueying, et al.
Pubblicazione: (2024)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
di: Xu, Qinwu, et al.
Pubblicazione: (2026)
di: Xu, Qinwu, et al.
Pubblicazione: (2026)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
di: Gao, Minghe, et al.
Pubblicazione: (2025) -
MARVEL: Multidimensional Abstraction and Reasoning through Visual Evaluation and Learning
di: Jiang, Yifan, et al.
Pubblicazione: (2024) -
Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners
di: Liu, Qingyang, et al.
Pubblicazione: (2026) -
Visual Superordinate Abstraction for Robust Concept Learning
di: Zheng, Qi, et al.
Pubblicazione: (2022) -
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
di: Peng, Jingwei, et al.
Pubblicazione: (2025)