LanteRn: Latent Visual Structured Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Viveiros, André G., Gonçalves, Nuno, Lindemann, Matthias, Martins, André |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What's Holding Back Latent Visual Reasoning?
par: Viveiros, André G., et autres
Publié: (2026)
par: Viveiros, André G., et autres
Publié: (2026)
V-MORALS: Visual Morse Graph-Aided Estimation of Regions of Attraction in a Learned Latent Space
par: Aladin, Faiz, et autres
Publié: (2026)
par: Aladin, Faiz, et autres
Publié: (2026)
DeepLatent: Think with Images via Parallel Latent Visual Reasoning
par: Lu, Dongchen, et autres
Publié: (2026)
par: Lu, Dongchen, et autres
Publié: (2026)
Point Cloud Geometry Scalable Coding with a Quality-Conditioned Latents Probability Estimator
par: Mari, Daniele, et autres
Publié: (2024)
par: Mari, Daniele, et autres
Publié: (2024)
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
par: Neuhaus, Yannic, et autres
Publié: (2026)
par: Neuhaus, Yannic, et autres
Publié: (2026)
ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
par: Zhang, Shimin, et autres
Publié: (2025)
par: Zhang, Shimin, et autres
Publié: (2025)
Interpreting the Residual Stream of ResNet18
par: Longon, André
Publié: (2024)
par: Longon, André
Publié: (2024)
Naturally Computed Scale Invariance in the Residual Stream of ResNet18
par: Longon, André
Publié: (2025)
par: Longon, André
Publié: (2025)
LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model
par: Jin, Jiachun, et autres
Publié: (2026)
par: Jin, Jiachun, et autres
Publié: (2026)
Vision-Based Runtime Monitoring under Varying Specifications using Semantic Latent Representations
par: Hoxha, Bardh, et autres
Publié: (2026)
par: Hoxha, Bardh, et autres
Publié: (2026)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
par: Izadi, Amirmohammad, et autres
Publié: (2025)
par: Izadi, Amirmohammad, et autres
Publié: (2025)
$\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation
par: Santos, Saul, et autres
Publié: (2025)
par: Santos, Saul, et autres
Publié: (2025)
BrepGen: A B-rep Generative Diffusion Model with Structured Latent Geometry
par: Xu, Xiang, et autres
Publié: (2024)
par: Xu, Xiang, et autres
Publié: (2024)
Control-oriented Clustering of Visual Latent Representation
par: Qi, Han, et autres
Publié: (2024)
par: Qi, Han, et autres
Publié: (2024)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
par: Li, Lingxiao, et autres
Publié: (2025)
par: Li, Lingxiao, et autres
Publié: (2025)
Chain-of-Sketch: Enabling Global Visual Reasoning
par: Lotfi, Aryo, et autres
Publié: (2024)
par: Lotfi, Aryo, et autres
Publié: (2024)
Visual Memory Injection Attacks for Multi-Turn Conversations
par: Schlarmann, Christian, et autres
Publié: (2026)
par: Schlarmann, Christian, et autres
Publié: (2026)
VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
par: Khezresmaeilzadeh, Tina, et autres
Publié: (2026)
par: Khezresmaeilzadeh, Tina, et autres
Publié: (2026)
Slot Abstractors: Toward Scalable Abstract Visual Reasoning
par: Mondal, Shanka Subhra, et autres
Publié: (2024)
par: Mondal, Shanka Subhra, et autres
Publié: (2024)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
par: Tekin, Selim Furkan, et autres
Publié: (2026)
par: Tekin, Selim Furkan, et autres
Publié: (2026)
Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
MARVEL: Multidimensional Abstraction and Reasoning through Visual Evaluation and Learning
par: Jiang, Yifan, et autres
Publié: (2024)
par: Jiang, Yifan, et autres
Publié: (2024)
Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA
par: Safwan, Itbaan, et autres
Publié: (2025)
par: Safwan, Itbaan, et autres
Publié: (2025)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
par: Huang, Chi-Pin, et autres
Publié: (2025)
par: Huang, Chi-Pin, et autres
Publié: (2025)
S-Chain: Structured Visual Chain-of-Thought For Medicine
par: Le-Duc, Khai, et autres
Publié: (2025)
par: Le-Duc, Khai, et autres
Publié: (2025)
Logo-VGR: Visual Grounded Reasoning for Open-world Logo Recognition
par: Liang, Zichen, et autres
Publié: (2025)
par: Liang, Zichen, et autres
Publié: (2025)
EasyARC: Evaluating Vision Language Models on True Visual Reasoning
par: Unsal, Mert, et autres
Publié: (2025)
par: Unsal, Mert, et autres
Publié: (2025)
JLT: Clean-Latent Prediction in Latent Diffusion Transformers
par: Fu, Funing, et autres
Publié: (2026)
par: Fu, Funing, et autres
Publié: (2026)
Building Deep Graph Predictors with Graph Imitation Learning
par: Eberhard, André, et autres
Publié: (2026)
par: Eberhard, André, et autres
Publié: (2026)
Além do Desempenho: Um Estudo da Confiabilidade de Detectores de Deepfakes
par: Lopes, Lucas, et autres
Publié: (2026)
par: Lopes, Lucas, et autres
Publié: (2026)
Latent Diffusion Inversion Requires Understanding the Latent Space
par: Rao, Mingxing, et autres
Publié: (2025)
par: Rao, Mingxing, et autres
Publié: (2025)
LatentGAN Autoencoder: Learning Disentangled Latent Distribution
par: Kalwar, Sanket, et autres
Publié: (2022)
par: Kalwar, Sanket, et autres
Publié: (2022)
Using Images from a Video Game to Improve the Detection of Truck Axles
par: Marcomini, Leandro Arab, et autres
Publié: (2025)
par: Marcomini, Leandro Arab, et autres
Publié: (2025)
Using Backbone Foundation Model for Evaluating Fairness in Chest Radiography Without Demographic Data
par: Queiroz, Dilermando, et autres
Publié: (2024)
par: Queiroz, Dilermando, et autres
Publié: (2024)
COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark
par: Chintapatla, Ishant, et autres
Publié: (2025)
par: Chintapatla, Ishant, et autres
Publié: (2025)
Composition-Grounded Data Synthesis for Visual Reasoning
par: Gu, Xinyi, et autres
Publié: (2025)
par: Gu, Xinyi, et autres
Publié: (2025)
What's in a Latent? Leveraging Diffusion Latent Space for Domain Generalization
par: Thomas, Xavier, et autres
Publié: (2025)
par: Thomas, Xavier, et autres
Publié: (2025)
Video Reasoning without Training
par: Sridhar, Deepak, et autres
Publié: (2025)
par: Sridhar, Deepak, et autres
Publié: (2025)
Revisiting Disentanglement in Downstream Tasks: A Study on Its Necessity for Abstract Visual Reasoning
par: Nai, Ruiqian, et autres
Publié: (2024)
par: Nai, Ruiqian, et autres
Publié: (2024)
Probing the Latent World: Emergent Discrete Symbols and Physical Structure in Latent Representations
par: ming, Liu hung
Publié: (2026)
par: ming, Liu hung
Publié: (2026)
Documents similaires
-
What's Holding Back Latent Visual Reasoning?
par: Viveiros, André G., et autres
Publié: (2026) -
V-MORALS: Visual Morse Graph-Aided Estimation of Regions of Attraction in a Learned Latent Space
par: Aladin, Faiz, et autres
Publié: (2026) -
DeepLatent: Think with Images via Parallel Latent Visual Reasoning
par: Lu, Dongchen, et autres
Publié: (2026) -
Point Cloud Geometry Scalable Coding with a Quality-Conditioned Latents Probability Estimator
par: Mari, Daniele, et autres
Publié: (2024) -
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
par: Neuhaus, Yannic, et autres
Publié: (2026)