Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Yana, Zhao, Liang, Sun, Jianjian, Lin, Kangheng, Yin, Jisheng, Hu, Jingcheng, Zhang, Yinmin, Yu, En, Lv, Haoran, Weng, Zejia, Wang, Jia, Han, Chunrui, Peng, Yuang, Han, Qi, Ge, Zheng, Zhang, Xiangyu, Jiang, Daxin, Patel, Vishal M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
di: Yu, En, et al.
Pubblicazione: (2025)
di: Yu, En, et al.
Pubblicazione: (2025)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
di: Shu, Bao, et al.
Pubblicazione: (2025)
di: Shu, Bao, et al.
Pubblicazione: (2025)
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
di: Hu, Jingcheng, et al.
Pubblicazione: (2025)
di: Hu, Jingcheng, et al.
Pubblicazione: (2025)
Perception in Reflection
di: Wei, Yana, et al.
Pubblicazione: (2025)
di: Wei, Yana, et al.
Pubblicazione: (2025)
Unhackable Temporal Rewarding for Scalable Video MLLMs
di: Yu, En, et al.
Pubblicazione: (2025)
di: Yu, En, et al.
Pubblicazione: (2025)
Small Language Model Meets with Reinforced Vision Vocabulary
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
di: Han, Chunrui, et al.
Pubblicazione: (2023)
di: Han, Chunrui, et al.
Pubblicazione: (2023)
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
di: Chen, Jinyue, et al.
Pubblicazione: (2024)
di: Chen, Jinyue, et al.
Pubblicazione: (2024)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
di: Zhu, Zining, et al.
Pubblicazione: (2025)
di: Zhu, Zining, et al.
Pubblicazione: (2025)
PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
di: Wang, Xiangfeng, et al.
Pubblicazione: (2026)
di: Wang, Xiangfeng, et al.
Pubblicazione: (2026)
Multi-matrix Factorization Attention
di: Hu, Jingcheng, et al.
Pubblicazione: (2024)
di: Hu, Jingcheng, et al.
Pubblicazione: (2024)
Focus Anywhere for Fine-grained Multi-page Document Understanding
di: Liu, Chenglong, et al.
Pubblicazione: (2024)
di: Liu, Chenglong, et al.
Pubblicazione: (2024)
DreamLLM: Synergistic Multimodal Comprehension and Creation
di: Dong, Runpei, et al.
Pubblicazione: (2023)
di: Dong, Runpei, et al.
Pubblicazione: (2023)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
di: Zhang, Zili, et al.
Pubblicazione: (2024)
di: Zhang, Zili, et al.
Pubblicazione: (2024)
DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning
di: Liu, Dongxu, et al.
Pubblicazione: (2025)
di: Liu, Dongxu, et al.
Pubblicazione: (2025)
Slow Perception: Let's Perceive Geometric Figures Step-by-step
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
di: Peng, Yuang, et al.
Pubblicazione: (2024)
di: Peng, Yuang, et al.
Pubblicazione: (2024)
ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
LLM Agents Already Know When to Call Tools -- Even Without Reasoning
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
di: Yin, Fukun, et al.
Pubblicazione: (2025)
di: Yin, Fukun, et al.
Pubblicazione: (2025)
R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging
di: Lai, Yanlin, et al.
Pubblicazione: (2026)
di: Lai, Yanlin, et al.
Pubblicazione: (2026)
Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
di: Wu, Donghang, et al.
Pubblicazione: (2025)
di: Wu, Donghang, et al.
Pubblicazione: (2025)
ShapeLLM: Universal 3D Object Understanding for Embodied Interaction
di: Qi, Zekun, et al.
Pubblicazione: (2024)
di: Qi, Zekun, et al.
Pubblicazione: (2024)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
Towards Understanding the Cognitive Habits of Large Reasoning Models
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
di: Chen, Zhenghao, et al.
Pubblicazione: (2026)
di: Chen, Zhenghao, et al.
Pubblicazione: (2026)
CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection
di: Pan, Zhihong, et al.
Pubblicazione: (2025)
di: Pan, Zhihong, et al.
Pubblicazione: (2025)
Physics Reasoner: Knowledge-Augmented Reasoning for Solving Physics Problems with Large Language Models
di: Pang, Xinyu, et al.
Pubblicazione: (2024)
di: Pang, Xinyu, et al.
Pubblicazione: (2024)
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
di: Wu, Chengfei, et al.
Pubblicazione: (2025)
di: Wu, Chengfei, et al.
Pubblicazione: (2025)
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
di: Li, Kailing, et al.
Pubblicazione: (2025)
di: Li, Kailing, et al.
Pubblicazione: (2025)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
di: Hao, Haoran, et al.
Pubblicazione: (2025)
di: Hao, Haoran, et al.
Pubblicazione: (2025)
From Imitation to Intuition: Intrinsic Reasoning for Open-Instance Video Classification
di: Zhang, Ke, et al.
Pubblicazione: (2026)
di: Zhang, Ke, et al.
Pubblicazione: (2026)
NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
di: NextStep Team, et al.
Pubblicazione: (2025)
di: NextStep Team, et al.
Pubblicazione: (2025)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
di: Xu, Jiacong, et al.
Pubblicazione: (2025)
di: Xu, Jiacong, et al.
Pubblicazione: (2025)
ALTER: Augmentation for Large-Table-Based Reasoning
di: Zhang, Han, et al.
Pubblicazione: (2024)
di: Zhang, Han, et al.
Pubblicazione: (2024)
Merlin:Empowering Multimodal LLMs with Foresight Minds
di: Yu, En, et al.
Pubblicazione: (2023)
di: Yu, En, et al.
Pubblicazione: (2023)
Provably Secure Disambiguating Neural Linguistic Steganography
di: Qi, Yuang, et al.
Pubblicazione: (2024)
di: Qi, Yuang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
di: Yu, En, et al.
Pubblicazione: (2025) -
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
di: Shu, Bao, et al.
Pubblicazione: (2025) -
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
di: Hu, Jingcheng, et al.
Pubblicazione: (2025) -
Perception in Reflection
di: Wei, Yana, et al.
Pubblicazione: (2025) -
Unhackable Temporal Rewarding for Scalable Video MLLMs
di: Yu, En, et al.
Pubblicazione: (2025)