ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Tao, Xingjian, Wang, Yiwei, Cai, Yujun, Song, Yifan, Tang, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ViewFusion: Towards Multi-View Consistency via Interpolated Denoising
por: Yang, Xianghui, et al.
Publicado: (2024)
por: Yang, Xianghui, et al.
Publicado: (2024)
ViewFusion: Learning Composable Diffusion Models for Novel View Synthesis
por: Spiegl, Bernard, et al.
Publicado: (2024)
por: Spiegl, Bernard, et al.
Publicado: (2024)
Mitigating Coordinate Prediction Bias from Positional Encoding Failures
por: Tao, Xingjian, et al.
Publicado: (2025)
por: Tao, Xingjian, et al.
Publicado: (2025)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
por: Li, Sifan, et al.
Publicado: (2025)
por: Li, Sifan, et al.
Publicado: (2025)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
por: Zhan, Shaoxiong, et al.
Publicado: (2026)
por: Zhan, Shaoxiong, et al.
Publicado: (2026)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
por: Guo, Zirun, et al.
Publicado: (2025)
por: Guo, Zirun, et al.
Publicado: (2025)
$A^2R^2$: Advancing Img2LaTeX Conversion via Visual Reasoning with Attention-Guided Refinement
por: Li, Zhecheng, et al.
Publicado: (2025)
por: Li, Zhecheng, et al.
Publicado: (2025)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
por: Li, Chengzu, et al.
Publicado: (2024)
por: Li, Chengzu, et al.
Publicado: (2024)
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
por: Wu, Yike, et al.
Publicado: (2025)
por: Wu, Yike, et al.
Publicado: (2025)
Texture or Semantics? Vision-Language Models Get Lost in Font Recognition
por: Li, Zhecheng, et al.
Publicado: (2025)
por: Li, Zhecheng, et al.
Publicado: (2025)
Generalist Scanner Meets Specialist Locator: A Synergistic Coarse-to-Fine Framework for Robust GUI Grounding
por: Li, Zhecheng, et al.
Publicado: (2025)
por: Li, Zhecheng, et al.
Publicado: (2025)
Learning Multi-View Spatial Reasoning from Cross-View Relations
por: Jeong, Suchae, et al.
Publicado: (2026)
por: Jeong, Suchae, et al.
Publicado: (2026)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
por: Li, Dingming, et al.
Publicado: (2025)
por: Li, Dingming, et al.
Publicado: (2025)
Multi-View Industrial Anomaly Detection with Epipolar Constrained Cross-View Fusion
por: Liu, Yifan, et al.
Publicado: (2025)
por: Liu, Yifan, et al.
Publicado: (2025)
Energy-Calibrated VAE with Test Time Free Lunch
por: Luo, Yihong, et al.
Publicado: (2023)
por: Luo, Yihong, et al.
Publicado: (2023)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
CoV: Chain-of-View Prompting for Spatial Reasoning
por: Zhao, Haoyu, et al.
Publicado: (2026)
por: Zhao, Haoyu, et al.
Publicado: (2026)
brat: Aligned Multi-View Embeddings for Brain MRI Analysis
por: Kayser, Maxime, et al.
Publicado: (2025)
por: Kayser, Maxime, et al.
Publicado: (2025)
CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning
por: Wu, Hang, et al.
Publicado: (2026)
por: Wu, Hang, et al.
Publicado: (2026)
Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs
por: Yeh, Chun-Hsiao, et al.
Publicado: (2025)
por: Yeh, Chun-Hsiao, et al.
Publicado: (2025)
MindCube: Spatial Mental Modeling from Limited Views
por: Wang, Qineng, et al.
Publicado: (2025)
por: Wang, Qineng, et al.
Publicado: (2025)
MUFASA: Multi-View Fusion and Adaptation Network with Spatial Awareness for Radar Object Detection
por: Peng, Xiangyuan, et al.
Publicado: (2024)
por: Peng, Xiangyuan, et al.
Publicado: (2024)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
por: Li, Sifan, et al.
Publicado: (2025)
por: Li, Sifan, et al.
Publicado: (2025)
Adaptive Fusion of Single-View and Multi-View Depth for Autonomous Driving
por: Cheng, JunDa, et al.
Publicado: (2024)
por: Cheng, JunDa, et al.
Publicado: (2024)
The NGT200 Dataset: Geometric Multi-View Isolated Sign Recognition
por: Ranum, Oline, et al.
Publicado: (2024)
por: Ranum, Oline, et al.
Publicado: (2024)
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
por: Yang, Qian, et al.
Publicado: (2026)
por: Yang, Qian, et al.
Publicado: (2026)
Thinking with Novel Views: A Systematic Analysis of Generative-Augmented Spatial Intelligence
por: Zhang, Yanbing, et al.
Publicado: (2026)
por: Zhang, Yanbing, et al.
Publicado: (2026)
Semi-Supervised Multi-View Crowd Counting by Ranking Multi-View Fusion Models
por: Zhang, Qi, et al.
Publicado: (2025)
por: Zhang, Qi, et al.
Publicado: (2025)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
por: Wang, Shenzhi, et al.
Publicado: (2026)
por: Wang, Shenzhi, et al.
Publicado: (2026)
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
por: Ge, Haonan, et al.
Publicado: (2025)
por: Ge, Haonan, et al.
Publicado: (2025)
MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching
por: Cui, Wanqing, et al.
Publicado: (2024)
por: Cui, Wanqing, et al.
Publicado: (2024)
Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models
por: Jin, Yudong, et al.
Publicado: (2025)
por: Jin, Yudong, et al.
Publicado: (2025)
BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation
por: Liu, Zhijian, et al.
Publicado: (2022)
por: Liu, Zhijian, et al.
Publicado: (2022)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
por: Xu, Runsen, et al.
Publicado: (2025)
por: Xu, Runsen, et al.
Publicado: (2025)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
por: Ma, Chuang, et al.
Publicado: (2026)
por: Ma, Chuang, et al.
Publicado: (2026)
Generating Storytelling Images with Rich Chains-of-Reasoning
por: Song, Xiujie, et al.
Publicado: (2025)
por: Song, Xiujie, et al.
Publicado: (2025)
ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition
por: Huang, Ronggang, et al.
Publicado: (2025)
por: Huang, Ronggang, et al.
Publicado: (2025)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
por: Li, Yunxin, et al.
Publicado: (2025)
por: Li, Yunxin, et al.
Publicado: (2025)
RoboUniView: Visual-Language Model with Unified View Representation for Robotic Manipulation
por: Liu, Fanfan, et al.
Publicado: (2024)
por: Liu, Fanfan, et al.
Publicado: (2024)
Ejemplares similares
-
ViewFusion: Towards Multi-View Consistency via Interpolated Denoising
por: Yang, Xianghui, et al.
Publicado: (2024) -
ViewFusion: Learning Composable Diffusion Models for Novel View Synthesis
por: Spiegl, Bernard, et al.
Publicado: (2024) -
Mitigating Coordinate Prediction Bias from Positional Encoding Failures
por: Tao, Xingjian, et al.
Publicado: (2025) -
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
por: Li, Sifan, et al.
Publicado: (2025) -
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
por: Zhan, Shaoxiong, et al.
Publicado: (2026)