Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gou, Yunhao, Chen, Kai, Liu, Zhili, Hong, Lanqing, Jin, Xin, Li, Zhenguo, Kwok, James T., Zhang, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation
par: Gou, Yunhao, et autres
Publié: (2024)
par: Gou, Yunhao, et autres
Publié: (2024)
Corrupted but Not Broken: Understanding and Mitigating the Negative Impacts of Corrupted Data in Visual Instruction Tuning
par: Gou, Yunhao, et autres
Publié: (2025)
par: Gou, Yunhao, et autres
Publié: (2025)
Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning
par: Gou, Yunhao, et autres
Publié: (2023)
par: Gou, Yunhao, et autres
Publié: (2023)
Task-customized Masked AutoEncoder via Mixture of Cluster-conditional Experts
par: Liu, Zhili, et autres
Publié: (2024)
par: Liu, Zhili, et autres
Publié: (2024)
Implicit Concept Removal of Diffusion Models
par: Liu, Zhili, et autres
Publié: (2023)
par: Liu, Zhili, et autres
Publié: (2023)
Mixed Autoencoder for Self-supervised Visual Representation Learning
par: Chen, Kai, et autres
Publié: (2023)
par: Chen, Kai, et autres
Publié: (2023)
MIRAGE: A Multi-modal Benchmark for Spatial Perception, Reasoning, and Intelligence
par: Liu, Chonghan, et autres
Publié: (2025)
par: Liu, Chonghan, et autres
Publié: (2025)
DetDiffusion: Synergizing Generative and Perceptive Models for Enhanced Data Generation and Perception
par: Wang, Yibo, et autres
Publié: (2024)
par: Wang, Yibo, et autres
Publié: (2024)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
par: Wu, Linquan, et autres
Publié: (2026)
par: Wu, Linquan, et autres
Publié: (2026)
MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control
par: Gao, Ruiyuan, et autres
Publié: (2024)
par: Gao, Ruiyuan, et autres
Publié: (2024)
CVT-xRF: Contrastive In-Voxel Transformer for 3D Consistent Radiance Fields from Sparse Inputs
par: Zhong, Yingji, et autres
Publié: (2024)
par: Zhong, Yingji, et autres
Publié: (2024)
ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom
par: Zhou, Jingqi, et autres
Publié: (2024)
par: Zhou, Jingqi, et autres
Publié: (2024)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
par: Li, Yizhen, et autres
Publié: (2025)
par: Li, Yizhen, et autres
Publié: (2025)
MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes
par: Gao, Ruiyuan, et autres
Publié: (2024)
par: Gao, Ruiyuan, et autres
Publié: (2024)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval
par: Ge, Xuri, et autres
Publié: (2026)
par: Ge, Xuri, et autres
Publié: (2026)
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
par: Zhang, Jiarui, et autres
Publié: (2026)
par: Zhang, Jiarui, et autres
Publié: (2026)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding
par: Pu, Bowei, et autres
Publié: (2025)
par: Pu, Bowei, et autres
Publié: (2025)
AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis
par: Chen, Qiuhui, et autres
Publié: (2024)
par: Chen, Qiuhui, et autres
Publié: (2024)
Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training
par: Xing, Jinbo, et autres
Publié: (2026)
par: Xing, Jinbo, et autres
Publié: (2026)
Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
Efficient Multi-modal Large Language Models via Visual Token Grouping
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation
par: Huang, Qing, et autres
Publié: (2026)
par: Huang, Qing, et autres
Publié: (2026)
Hybrid Latent Reasoning with Decoupled Policy Optimization
par: Cheng, Tao, et autres
Publié: (2026)
par: Cheng, Tao, et autres
Publié: (2026)
Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts
par: Zhao, Yuyang, et autres
Publié: (2023)
par: Zhao, Yuyang, et autres
Publié: (2023)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
par: Zhang, Zijian, et autres
Publié: (2024)
par: Zhang, Zijian, et autres
Publié: (2024)
DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
par: Jin, Song, et autres
Publié: (2026)
par: Jin, Song, et autres
Publié: (2026)
QTrack: Query-Driven Reasoning for Multi-modal MOT
par: Ashraf, Tajamul, et autres
Publié: (2026)
par: Ashraf, Tajamul, et autres
Publié: (2026)
RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs
par: Guo, Meng-Hao, et autres
Publié: (2025)
par: Guo, Meng-Hao, et autres
Publié: (2025)
From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning
par: Ni, Hang, et autres
Publié: (2026)
par: Ni, Hang, et autres
Publié: (2026)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
par: Liu, Yuqi, et autres
Publié: (2025)
par: Liu, Yuqi, et autres
Publié: (2025)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
par: Xiang, Kun, et autres
Publié: (2024)
par: Xiang, Kun, et autres
Publié: (2024)
GeoDiffusion: Text-Prompted Geometric Control for Object Detection Data Generation
par: Chen, Kai, et autres
Publié: (2023)
par: Chen, Kai, et autres
Publié: (2023)
Empowering Sparse-Input Neural Radiance Fields with Dual-Level Semantic Guidance from Dense Novel Views
par: Zhong, Yingji, et autres
Publié: (2025)
par: Zhong, Yingji, et autres
Publié: (2025)
Reasoning in Space via Grounding in the World
par: Chen, Yiming, et autres
Publié: (2025)
par: Chen, Yiming, et autres
Publié: (2025)
GeoSense: Internalizing Geometric Necessity Perception for Multimodal Reasoning
par: Liu, Ruiheng, et autres
Publié: (2026)
par: Liu, Ruiheng, et autres
Publié: (2026)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
MagicDrive: Street View Generation with Diverse 3D Geometry Control
par: Gao, Ruiyuan, et autres
Publié: (2023)
par: Gao, Ruiyuan, et autres
Publié: (2023)
Documents similaires
-
Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation
par: Gou, Yunhao, et autres
Publié: (2024) -
Corrupted but Not Broken: Understanding and Mitigating the Negative Impacts of Corrupted Data in Visual Instruction Tuning
par: Gou, Yunhao, et autres
Publié: (2025) -
Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning
par: Gou, Yunhao, et autres
Publié: (2023) -
Task-customized Masked AutoEncoder via Mixture of Cluster-conditional Experts
par: Liu, Zhili, et autres
Publié: (2024) -
Implicit Concept Removal of Diffusion Models
par: Liu, Zhili, et autres
Publié: (2023)