Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction
Fuente:
arXiv
Salvato in:
| Autori principali: | Jian, Yichang, Xiao, Boyuan, Huang, Zhenyuan, Peng, Yifei, Ding, Yao-Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models
di: Liu, Jingming, et al.
Pubblicazione: (2024)
di: Liu, Jingming, et al.
Pubblicazione: (2024)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
di: Dong, Shuai, et al.
Pubblicazione: (2025)
di: Dong, Shuai, et al.
Pubblicazione: (2025)
GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models
di: Wu, Zixuan, et al.
Pubblicazione: (2024)
di: Wu, Zixuan, et al.
Pubblicazione: (2024)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
di: Jian, Pu, et al.
Pubblicazione: (2025)
di: Jian, Pu, et al.
Pubblicazione: (2025)
Chatting with Images for Introspective Visual Thinking
di: Wu, Junfei, et al.
Pubblicazione: (2026)
di: Wu, Junfei, et al.
Pubblicazione: (2026)
Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts
di: Nooralahzadeh, Farhad, et al.
Pubblicazione: (2026)
di: Nooralahzadeh, Farhad, et al.
Pubblicazione: (2026)
Evaluating Vision-Language Models as Evaluators in Path Planning
di: Aghzal, Mohamed, et al.
Pubblicazione: (2024)
di: Aghzal, Mohamed, et al.
Pubblicazione: (2024)
Visual Planning: Let's Think Only with Images
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
di: Li, Sifan, et al.
Pubblicazione: (2025)
di: Li, Sifan, et al.
Pubblicazione: (2025)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
Interpretable Multimodal Framework for Human-Centered Street Assessment: Integrating Visual-Language Models for Perceptual Urban Diagnostics
di: Lan, HaoTian
Pubblicazione: (2025)
di: Lan, HaoTian
Pubblicazione: (2025)
Dual-View Visual Contextualization for Web Navigation
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
di: Tang, Raphael, et al.
Pubblicazione: (2024)
di: Tang, Raphael, et al.
Pubblicazione: (2024)
Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
di: Lai, Xin, et al.
Pubblicazione: (2025)
di: Lai, Xin, et al.
Pubblicazione: (2025)
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
di: Cheng, Sijie, et al.
Pubblicazione: (2023)
di: Cheng, Sijie, et al.
Pubblicazione: (2023)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
di: Tartaglini, Alexa R., et al.
Pubblicazione: (2025)
di: Tartaglini, Alexa R., et al.
Pubblicazione: (2025)
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
di: Vaishnav, Mohit, et al.
Pubblicazione: (2026)
di: Vaishnav, Mohit, et al.
Pubblicazione: (2026)
On the Perception Bottleneck of VLMs for Chart Understanding
di: Liu, Junteng, et al.
Pubblicazione: (2025)
di: Liu, Junteng, et al.
Pubblicazione: (2025)
RSCC: A Large-Scale Remote Sensing Change Caption Dataset for Disaster Events
di: Chen, Zhenyuan, et al.
Pubblicazione: (2025)
di: Chen, Zhenyuan, et al.
Pubblicazione: (2025)
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
di: Yang, Jianjiang, et al.
Pubblicazione: (2025)
di: Yang, Jianjiang, et al.
Pubblicazione: (2025)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
di: Fu, Xingyu, et al.
Pubblicazione: (2023)
di: Fu, Xingyu, et al.
Pubblicazione: (2023)
SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
di: Shu, Fangxun, et al.
Pubblicazione: (2025)
di: Shu, Fangxun, et al.
Pubblicazione: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
VIXEN: Visual Text Comparison Network for Image Difference Captioning
di: Black, Alexander, et al.
Pubblicazione: (2024)
di: Black, Alexander, et al.
Pubblicazione: (2024)
Pixels, Patterns, but No Poetry: To See The World like Humans
di: Gao, Hongcheng, et al.
Pubblicazione: (2025)
di: Gao, Hongcheng, et al.
Pubblicazione: (2025)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation
di: Dahal, Ashim, et al.
Pubblicazione: (2025)
di: Dahal, Ashim, et al.
Pubblicazione: (2025)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
di: Shi, Yi, et al.
Pubblicazione: (2025)
di: Shi, Yi, et al.
Pubblicazione: (2025)
Adaptive Data Augmentation with Multi-armed Bandit: Sample-Efficient Embedding Calibration for Implicit Pattern Recognition
di: Tang, Minxue, et al.
Pubblicazione: (2026)
di: Tang, Minxue, et al.
Pubblicazione: (2026)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing
di: Cao, Yong, et al.
Pubblicazione: (2024)
di: Cao, Yong, et al.
Pubblicazione: (2024)
Seeking and Updating with Live Visual Knowledge
di: Fu, Mingyang, et al.
Pubblicazione: (2025)
di: Fu, Mingyang, et al.
Pubblicazione: (2025)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners
di: Liu, Qingyang, et al.
Pubblicazione: (2026)
di: Liu, Qingyang, et al.
Pubblicazione: (2026)
VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph
di: Wang, Qiuchen, et al.
Pubblicazione: (2026)
di: Wang, Qiuchen, et al.
Pubblicazione: (2026)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
di: Ding, Yihao, et al.
Pubblicazione: (2024)
di: Ding, Yihao, et al.
Pubblicazione: (2024)
AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning
di: Lang, Jian, et al.
Pubblicazione: (2026)
di: Lang, Jian, et al.
Pubblicazione: (2026)
When to Think and When to Look: Uncertainty-Guided Lookback
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models
di: Liu, Jingming, et al.
Pubblicazione: (2024) -
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
di: Dong, Shuai, et al.
Pubblicazione: (2025) -
GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models
di: Wu, Zixuan, et al.
Pubblicazione: (2024) -
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
di: Jian, Pu, et al.
Pubblicazione: (2025) -
Chatting with Images for Introspective Visual Thinking
di: Wu, Junfei, et al.
Pubblicazione: (2026)