SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Avogaro, Niccolo, Debnath, Nayanika, Mi, Li, Frick, Thomas, Wang, Junling, He, Zexue, Hua, Hang, Schindler, Konrad, Rigotti, Mattia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation
di: Avogaro, Niccolo, et al.
Pubblicazione: (2025)
di: Avogaro, Niccolo, et al.
Pubblicazione: (2025)
Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models
di: Farronato, Nicola, et al.
Pubblicazione: (2026)
di: Farronato, Nicola, et al.
Pubblicazione: (2026)
GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
di: Ebouky, Brown, et al.
Pubblicazione: (2026)
di: Ebouky, Brown, et al.
Pubblicazione: (2026)
VP Lab: a PEFT-Enabled Visual Prompting Laboratory for Semantic Segmentation
di: Avogaro, Niccolo, et al.
Pubblicazione: (2025)
di: Avogaro, Niccolo, et al.
Pubblicazione: (2025)
Eliciting Reasoning in Language Models with Cognitive Tools
di: Ebouky, Brown, et al.
Pubblicazione: (2025)
di: Ebouky, Brown, et al.
Pubblicazione: (2025)
On the Perception Bottleneck of VLMs for Chart Understanding
di: Liu, Junteng, et al.
Pubblicazione: (2025)
di: Liu, Junteng, et al.
Pubblicazione: (2025)
GIST: Gauge-Invariant Spectral Transformers for Scalable Graph Neural Operators
di: Rigotti, Mattia, et al.
Pubblicazione: (2026)
di: Rigotti, Mattia, et al.
Pubblicazione: (2026)
Large Scale Knowledge Washing
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
di: Lu, Meng, et al.
Pubblicazione: (2025)
di: Lu, Meng, et al.
Pubblicazione: (2025)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
di: Liu, Peng, et al.
Pubblicazione: (2025)
di: Liu, Peng, et al.
Pubblicazione: (2025)
A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs
di: Vaishnav, Mohit, et al.
Pubblicazione: (2025)
di: Vaishnav, Mohit, et al.
Pubblicazione: (2025)
Modeling Subjective Urban Perception with Human Gaze
di: Che, Lin, et al.
Pubblicazione: (2026)
di: Che, Lin, et al.
Pubblicazione: (2026)
Gauss' Separation Algorithm for the Magnetic Field Decomposition of the SPARC PRD simulation
di: Trevisan, Gregorio L, et al.
Pubblicazione: (2025)
di: Trevisan, Gregorio L, et al.
Pubblicazione: (2025)
Understanding and Rectifying Safety Perception Distortion in VLMs
di: Zou, Xiaohan, et al.
Pubblicazione: (2025)
di: Zou, Xiaohan, et al.
Pubblicazione: (2025)
Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning
di: He, Jixuan, et al.
Pubblicazione: (2026)
di: He, Jixuan, et al.
Pubblicazione: (2026)
Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images
di: Jiang, Zheng, et al.
Pubblicazione: (2026)
di: Jiang, Zheng, et al.
Pubblicazione: (2026)
Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs
di: Pan, Zhiyu, et al.
Pubblicazione: (2026)
di: Pan, Zhiyu, et al.
Pubblicazione: (2026)
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
di: Shen, Yifan, et al.
Pubblicazione: (2025)
di: Shen, Yifan, et al.
Pubblicazione: (2025)
Outline-Guided Object Inpainting with Diffusion Models
di: Pobitzer, Markus, et al.
Pubblicazione: (2024)
di: Pobitzer, Markus, et al.
Pubblicazione: (2024)
Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs
di: Oh, Gyutaek, et al.
Pubblicazione: (2025)
di: Oh, Gyutaek, et al.
Pubblicazione: (2025)
ComiCap: A VLMs pipeline for dense captioning of Comic Panels
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
di: Vivoli, Emanuele, et al.
Pubblicazione: (2024)
LVCHAT: Facilitating Long Video Comprehension
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
di: Wu, Hang, et al.
Pubblicazione: (2025)
di: Wu, Hang, et al.
Pubblicazione: (2025)
[De|Re]constructing VLMs' Reasoning in Counting
di: Alghisi, Simone, et al.
Pubblicazione: (2025)
di: Alghisi, Simone, et al.
Pubblicazione: (2025)
VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization
di: Cheng, Junhao, et al.
Pubblicazione: (2026)
di: Cheng, Junhao, et al.
Pubblicazione: (2026)
Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs
di: Zhu, Mengdan, et al.
Pubblicazione: (2026)
di: Zhu, Mengdan, et al.
Pubblicazione: (2026)
Composition-Grounded Data Synthesis for Visual Reasoning
di: Gu, Xinyi, et al.
Pubblicazione: (2025)
di: Gu, Xinyi, et al.
Pubblicazione: (2025)
Beyond the Linear Separability Ceiling: Aligning Representations in VLMs
di: Vompa, Enrico, et al.
Pubblicazione: (2025)
di: Vompa, Enrico, et al.
Pubblicazione: (2025)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
di: Zhou, Guanyu, et al.
Pubblicazione: (2026)
di: Zhou, Guanyu, et al.
Pubblicazione: (2026)
Test-Time Reasoning Through Visual Human Preferences with VLMs and Soft Rewards
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
di: Yan, Ziang, et al.
Pubblicazione: (2025)
di: Yan, Ziang, et al.
Pubblicazione: (2025)
ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness
di: Liang, Yijun, et al.
Pubblicazione: (2025)
di: Liang, Yijun, et al.
Pubblicazione: (2025)
Can VLMs Unlock Semantic Anomaly Detection? A Framework for Structured Reasoning
di: Brusnicki, Roberto, et al.
Pubblicazione: (2025)
di: Brusnicki, Roberto, et al.
Pubblicazione: (2025)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
di: Chen, Jierun, et al.
Pubblicazione: (2025)
di: Chen, Jierun, et al.
Pubblicazione: (2025)
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
di: Xiao, Yang, et al.
Pubblicazione: (2025)
di: Xiao, Yang, et al.
Pubblicazione: (2025)
ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs
di: Li, Jiangyang, et al.
Pubblicazione: (2026)
di: Li, Jiangyang, et al.
Pubblicazione: (2026)
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits
di: Li, Kai, et al.
Pubblicazione: (2022)
di: Li, Kai, et al.
Pubblicazione: (2022)
Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas
di: Chen, Shiqi, et al.
Pubblicazione: (2025)
di: Chen, Shiqi, et al.
Pubblicazione: (2025)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
di: Berman, Shmuel, et al.
Pubblicazione: (2025)
di: Berman, Shmuel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation
di: Avogaro, Niccolo, et al.
Pubblicazione: (2025) -
Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models
di: Farronato, Nicola, et al.
Pubblicazione: (2026) -
GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
di: Ebouky, Brown, et al.
Pubblicazione: (2026) -
VP Lab: a PEFT-Enabled Visual Prompting Laboratory for Semantic Segmentation
di: Avogaro, Niccolo, et al.
Pubblicazione: (2025) -
Eliciting Reasoning in Language Models with Cognitive Tools
di: Ebouky, Brown, et al.
Pubblicazione: (2025)