What's Holding Back Latent Visual Reasoning?
Fuente:
arXiv
Salvato in:
| Autori principali: | Viveiros, André G., Gonçalves, Nuno, Martins, André F. T., Lindemann, Matthias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LanteRn: Latent Visual Structured Reasoning
di: Viveiros, André G., et al.
Pubblicazione: (2026)
di: Viveiros, André G., et al.
Pubblicazione: (2026)
VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
di: Ma, Jingkun, et al.
Pubblicazione: (2024)
di: Ma, Jingkun, et al.
Pubblicazione: (2024)
Point Cloud Geometry Scalable Coding with a Quality-Conditioned Latents Probability Estimator
di: Mari, Daniele, et al.
Pubblicazione: (2024)
di: Mari, Daniele, et al.
Pubblicazione: (2024)
Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs
di: Pan, Zhiyu, et al.
Pubblicazione: (2026)
di: Pan, Zhiyu, et al.
Pubblicazione: (2026)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
di: Lu, Pan, et al.
Pubblicazione: (2023)
di: Lu, Pan, et al.
Pubblicazione: (2023)
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
di: Kumar, Somnath, et al.
Pubblicazione: (2024)
di: Kumar, Somnath, et al.
Pubblicazione: (2024)
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
di: Li, Chengzu, et al.
Pubblicazione: (2026)
di: Li, Chengzu, et al.
Pubblicazione: (2026)
Back Home: A Computer Vision Solution to Seashell Identification for Ecological Restoration
di: Valverde, Alexander, et al.
Pubblicazione: (2025)
di: Valverde, Alexander, et al.
Pubblicazione: (2025)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
di: Ji, Haonian, et al.
Pubblicazione: (2025)
di: Ji, Haonian, et al.
Pubblicazione: (2025)
LatentLLM: Attention-Aware Joint Tensor Compression
di: Koike-Akino, Toshiaki, et al.
Pubblicazione: (2025)
di: Koike-Akino, Toshiaki, et al.
Pubblicazione: (2025)
What to align in multimodal contrastive learning?
di: Dufumier, Benoit, et al.
Pubblicazione: (2024)
di: Dufumier, Benoit, et al.
Pubblicazione: (2024)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing
di: Radouane, Karim, et al.
Pubblicazione: (2025)
di: Radouane, Karim, et al.
Pubblicazione: (2025)
M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
di: AI, Inclusion, et al.
Pubblicazione: (2025)
di: AI, Inclusion, et al.
Pubblicazione: (2025)
Beyond Adapter Retrieval: Latent Geometry-Preserving Composition via Sparse Task Projection
di: Jin, Pengfei, et al.
Pubblicazione: (2024)
di: Jin, Pengfei, et al.
Pubblicazione: (2024)
Efficient Architectures for High Resolution Vision-Language Models
di: Carvalho, Miguel, et al.
Pubblicazione: (2025)
di: Carvalho, Miguel, et al.
Pubblicazione: (2025)
Advancing Conversational Diagnostic AI with Multimodal Reasoning
di: Saab, Khaled, et al.
Pubblicazione: (2025)
di: Saab, Khaled, et al.
Pubblicazione: (2025)
What explains the success of cross-modal fine-tuning with ORCA?
di: García-de-Herreros, Paloma, et al.
Pubblicazione: (2024)
di: García-de-Herreros, Paloma, et al.
Pubblicazione: (2024)
What Makes a Maze Look Like a Maze?
di: Hsu, Joy, et al.
Pubblicazione: (2024)
di: Hsu, Joy, et al.
Pubblicazione: (2024)
Analyzing The Language of Visual Tokens
di: Chan, David M., et al.
Pubblicazione: (2024)
di: Chan, David M., et al.
Pubblicazione: (2024)
Reconstructive Visual Instruction Tuning
di: Wang, Haochen, et al.
Pubblicazione: (2024)
di: Wang, Haochen, et al.
Pubblicazione: (2024)
A Survey of Reasoning with Foundation Models
di: Sun, Jiankai, et al.
Pubblicazione: (2023)
di: Sun, Jiankai, et al.
Pubblicazione: (2023)
Rethinking Chain-of-Thought Reasoning for Videos
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
Improved Baselines with Visual Instruction Tuning
di: Liu, Haotian, et al.
Pubblicazione: (2023)
di: Liu, Haotian, et al.
Pubblicazione: (2023)
Learning to Instruct for Visual Instruction Tuning
di: Zhou, Zhihan, et al.
Pubblicazione: (2025)
di: Zhou, Zhihan, et al.
Pubblicazione: (2025)
Universal Approximation of Visual Autoregressive Transformers
di: Chen, Yifang, et al.
Pubblicazione: (2025)
di: Chen, Yifang, et al.
Pubblicazione: (2025)
Self-Supervised Visual Preference Alignment
di: Zhu, Ke, et al.
Pubblicazione: (2024)
di: Zhu, Ke, et al.
Pubblicazione: (2024)
Parrot: Multilingual Visual Instruction Tuning
di: Sun, Hai-Long, et al.
Pubblicazione: (2024)
di: Sun, Hai-Long, et al.
Pubblicazione: (2024)
Lightweight Operations for Visual Speech Recognition
di: Panagos, Iason Ioannis, et al.
Pubblicazione: (2025)
di: Panagos, Iason Ioannis, et al.
Pubblicazione: (2025)
Visual Text Matters: Improving Text-KVQA with Visual Text Entity Knowledge-aware Large Multimodal Assistant
di: Penamakuri, Abhirama Subramanyam, et al.
Pubblicazione: (2024)
di: Penamakuri, Abhirama Subramanyam, et al.
Pubblicazione: (2024)
Diving into Self-Evolving Training for Multimodal Reasoning
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
Interleaving Reasoning for Better Text-to-Image Generation
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
Multimodal Tabular Reasoning with Privileged Structured Information
di: Jiang, Jun-Peng, et al.
Pubblicazione: (2025)
di: Jiang, Jun-Peng, et al.
Pubblicazione: (2025)
Scratching Visual Transformer's Back with Uniform Attention
di: Hyeon-Woo, Nam, et al.
Pubblicazione: (2022)
di: Hyeon-Woo, Nam, et al.
Pubblicazione: (2022)
Decoding Diffusion: A Scalable Framework for Unsupervised Analysis of Latent Space Biases and Representations Using Natural Language Prompts
di: Zeng, E. Zhixuan, et al.
Pubblicazione: (2024)
di: Zeng, E. Zhixuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LanteRn: Latent Visual Structured Reasoning
di: Viveiros, André G., et al.
Pubblicazione: (2026) -
VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
di: Ma, Jingkun, et al.
Pubblicazione: (2024) -
Point Cloud Geometry Scalable Coding with a Quality-Conditioned Latents Probability Estimator
di: Mari, Daniele, et al.
Pubblicazione: (2024) -
Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs
di: Pan, Zhiyu, et al.
Pubblicazione: (2026) -
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)