Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yubo, Zhang, Juntian, Wu, Yichen, Lin, Yankai, Lukas, Nils, Liu, Yuhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Latent Visual Reasoning
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
di: Dong, Shuai, et al.
Pubblicazione: (2025)
di: Dong, Shuai, et al.
Pubblicazione: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
di: Dai, Yifan, et al.
Pubblicazione: (2026)
di: Dai, Yifan, et al.
Pubblicazione: (2026)
Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
di: Sun, Yubo, et al.
Pubblicazione: (2025)
di: Sun, Yubo, et al.
Pubblicazione: (2025)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
di: Huang, Yixu, et al.
Pubblicazione: (2026)
di: Huang, Yixu, et al.
Pubblicazione: (2026)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
di: Guo, Ziyu, et al.
Pubblicazione: (2026)
di: Guo, Ziyu, et al.
Pubblicazione: (2026)
LaRe: Latent Refocusing for Multimodal Reasoning
di: Ma, Jizheng, et al.
Pubblicazione: (2025)
di: Ma, Jizheng, et al.
Pubblicazione: (2025)
Learning GUI Grounding with Spatial Reasoning from Visual Feedback
di: Zhao, Yu, et al.
Pubblicazione: (2025)
di: Zhao, Yu, et al.
Pubblicazione: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
di: Wei, Yana, et al.
Pubblicazione: (2025)
di: Wei, Yana, et al.
Pubblicazione: (2025)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization
di: Ding, Ziyang, et al.
Pubblicazione: (2026)
di: Ding, Ziyang, et al.
Pubblicazione: (2026)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
Reinforcing Multimodal Reasoning Against Visual Degradation
di: Liu, Rui, et al.
Pubblicazione: (2026)
di: Liu, Rui, et al.
Pubblicazione: (2026)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
di: Tian, Changyuan, et al.
Pubblicazione: (2026)
di: Tian, Changyuan, et al.
Pubblicazione: (2026)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
RadFabric: Agentic AI System with Reasoning Capability for Radiology
di: Chen, Wenting, et al.
Pubblicazione: (2025)
di: Chen, Wenting, et al.
Pubblicazione: (2025)
Think Before You Move: Latent Motion Reasoning for Text-to-Motion Generation
di: Qian, Yijie, et al.
Pubblicazione: (2025)
di: Qian, Yijie, et al.
Pubblicazione: (2025)
Watch Before You Answer: Learning from Visually Grounded Post-Training
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
di: Xu, Xiaoxu, et al.
Pubblicazione: (2023)
di: Xu, Xiaoxu, et al.
Pubblicazione: (2023)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
di: Lu, Jinghui, et al.
Pubblicazione: (2026)
di: Lu, Jinghui, et al.
Pubblicazione: (2026)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
di: Du, Yifan, et al.
Pubblicazione: (2023)
di: Du, Yifan, et al.
Pubblicazione: (2023)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
What's Holding Back Latent Visual Reasoning?
di: Viveiros, André G., et al.
Pubblicazione: (2026)
di: Viveiros, André G., et al.
Pubblicazione: (2026)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
Chiron-o1: Igniting Multimodal Large Language Models towards Generalizable Medical Reasoning via Mentor-Intern Collaborative Search
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking
di: Uppaal, Rheeya, et al.
Pubblicazione: (2025)
di: Uppaal, Rheeya, et al.
Pubblicazione: (2025)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
di: Zhu, Yichen, et al.
Pubblicazione: (2024)
di: Zhu, Yichen, et al.
Pubblicazione: (2024)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
Vero: An Open RL Recipe for General Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2026)
di: Sarch, Gabriel, et al.
Pubblicazione: (2026)
VAEER: Visual Attention-Inspired Emotion Elicitation Reasoning
di: Man, Fanhang, et al.
Pubblicazione: (2025)
di: Man, Fanhang, et al.
Pubblicazione: (2025)
On Data Synthesis and Post-training for Visual Abstract Reasoning
di: Zhu, Ke, et al.
Pubblicazione: (2025)
di: Zhu, Ke, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Latent Visual Reasoning
di: Li, Bangzheng, et al.
Pubblicazione: (2025) -
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
di: Zhang, Juntian, et al.
Pubblicazione: (2025) -
Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
di: Zhang, Juntian, et al.
Pubblicazione: (2025) -
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
di: Dong, Shuai, et al.
Pubblicazione: (2025) -
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)