From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Juncheng, Chen, Hardy, Tu, Haoqin, Tang, Xianfeng, Shi, Freda, Liu, Hui, Lu, Hanqing, Xie, Cihang, Zhou, Yuyin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
di: Chen, Hardy, et al.
Pubblicazione: (2025)
di: Chen, Hardy, et al.
Pubblicazione: (2025)
ViLBench: A Suite for Vision-Language Process Reward Modeling
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains
di: Wu, Juncheng, et al.
Pubblicazione: (2025)
di: Wu, Juncheng, et al.
Pubblicazione: (2025)
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
di: Qian, Zhaofang, et al.
Pubblicazione: (2025)
di: Qian, Zhaofang, et al.
Pubblicazione: (2025)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
di: Batra, Hunar, et al.
Pubblicazione: (2025)
di: Batra, Hunar, et al.
Pubblicazione: (2025)
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
A Preliminary Study of o1 in Medicine: Are We Closer to an AI Doctor?
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
di: Li, Xianhang, et al.
Pubblicazione: (2025)
di: Li, Xianhang, et al.
Pubblicazione: (2025)
Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
di: Chen, Hardy, et al.
Pubblicazione: (2026)
di: Chen, Hardy, et al.
Pubblicazione: (2026)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation
di: Mao, Jiawei, et al.
Pubblicazione: (2026)
di: Mao, Jiawei, et al.
Pubblicazione: (2026)
STAR-1: Safer Alignment of Reasoning LLMs with 1K Data
di: Wang, Zijun, et al.
Pubblicazione: (2025)
di: Wang, Zijun, et al.
Pubblicazione: (2025)
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
di: Wang, Zijun, et al.
Pubblicazione: (2026)
di: Wang, Zijun, et al.
Pubblicazione: (2026)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
di: Wang, Zijun, et al.
Pubblicazione: (2024)
di: Wang, Zijun, et al.
Pubblicazione: (2024)
AHELM: A Holistic Evaluation of Audio-Language Models
di: Lee, Tony, et al.
Pubblicazione: (2025)
di: Lee, Tony, et al.
Pubblicazione: (2025)
SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data
di: Ogezi, Michael, et al.
Pubblicazione: (2025)
di: Ogezi, Michael, et al.
Pubblicazione: (2025)
What If We Recaption Billions of Web Images with LLaMA-3?
di: Li, Xianhang, et al.
Pubblicazione: (2024)
di: Li, Xianhang, et al.
Pubblicazione: (2024)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
di: Pang, Yuqi, et al.
Pubblicazione: (2025)
di: Pang, Yuqi, et al.
Pubblicazione: (2025)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
di: Gao, Yipeng, et al.
Pubblicazione: (2023)
di: Gao, Yipeng, et al.
Pubblicazione: (2023)
Scaling White-Box Transformers for Vision
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
di: Yu, Suhao, et al.
Pubblicazione: (2025)
di: Yu, Suhao, et al.
Pubblicazione: (2025)
How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them
di: Liao, Disen, et al.
Pubblicazione: (2026)
di: Liao, Disen, et al.
Pubblicazione: (2026)
Blessing of Multilinguality: A Systematic Analysis of Multilingual In-Context Learning
di: Tu, Yilei, et al.
Pubblicazione: (2025)
di: Tu, Yilei, et al.
Pubblicazione: (2025)
Learning Language Structures through Grounding
di: Shi, Freda
Pubblicazione: (2024)
di: Shi, Freda
Pubblicazione: (2024)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
di: Yang, Siwei, et al.
Pubblicazione: (2025)
di: Yang, Siwei, et al.
Pubblicazione: (2025)
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
di: Li, Xinpeng, et al.
Pubblicazione: (2026)
di: Li, Xinpeng, et al.
Pubblicazione: (2026)
Story-Iter: A Training-free Iterative Paradigm for Long Story Visualization
di: Mao, Jiawei, et al.
Pubblicazione: (2024)
di: Mao, Jiawei, et al.
Pubblicazione: (2024)
LingGym: How Far Are LLMs from Thinking Like Field Linguists?
di: Yang, Changbing, et al.
Pubblicazione: (2025)
di: Yang, Changbing, et al.
Pubblicazione: (2025)
Autoregressive Pretraining with Mamba in Vision
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models
di: Singla, Pratham, et al.
Pubblicazione: (2025)
di: Singla, Pratham, et al.
Pubblicazione: (2025)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
Logical forms complement probability in understanding language model (and human) performance
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
di: Hui, Mude, et al.
Pubblicazione: (2024)
di: Hui, Mude, et al.
Pubblicazione: (2024)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
Mamba-R: Vision Mamba ALSO Needs Registers
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
di: Chen, Hardy, et al.
Pubblicazione: (2025) -
ViLBench: A Suite for Vision-Language Process Reward Modeling
di: Tu, Haoqin, et al.
Pubblicazione: (2025) -
Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains
di: Wu, Juncheng, et al.
Pubblicazione: (2025) -
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
di: Wu, Juncheng, et al.
Pubblicazione: (2026) -
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
di: Qian, Zhaofang, et al.
Pubblicazione: (2025)