See the past: Time-Reversed Scene Reconstruction from Thermal Traces Using Visual Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Contreras, Kebin, Toscano-Palomino, Luis, Mura, Mauro Dalla, Bacca, Jorge |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Autoregressive High-Order Finite Difference Modulo Imaging: High-Dynamic Range for Computer Vision Applications
por: Monroy, Brayan, et al.
Publicado: (2025)
por: Monroy, Brayan, et al.
Publicado: (2025)
High Dynamic Range Modulo Imaging for Robust Object Detection in Autonomous Driving
por: Contreras, Kebin, et al.
Publicado: (2025)
por: Contreras, Kebin, et al.
Publicado: (2025)
Leveraging pretrained RGB denoisers for hyperspectral image restoration
por: Picone, Daniele, et al.
Publicado: (2026)
por: Picone, Daniele, et al.
Publicado: (2026)
PMPNet: Pixel Movement Prediction Network for Monocular Depth Estimation in Dynamic Scenes
por: Peng, Kebin, et al.
Publicado: (2024)
por: Peng, Kebin, et al.
Publicado: (2024)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
por: Liang, Dayong, et al.
Publicado: (2025)
por: Liang, Dayong, et al.
Publicado: (2025)
SceneScript: Reconstructing Scenes With An Autoregressive Structured Language Model
por: Avetisyan, Armen, et al.
Publicado: (2024)
por: Avetisyan, Armen, et al.
Publicado: (2024)
TraceFlow: Dynamic 3D Reconstruction of Specular Scenes Driven by Ray Tracing
por: Tao, Jiachen, et al.
Publicado: (2025)
por: Tao, Jiachen, et al.
Publicado: (2025)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
por: Feng, Zhiyuan, et al.
Publicado: (2025)
por: Feng, Zhiyuan, et al.
Publicado: (2025)
Positional Bias in Multimodal Embedding Models: Do They Favor the Beginning, the Middle, or the End?
por: Wu, Kebin, et al.
Publicado: (2025)
por: Wu, Kebin, et al.
Publicado: (2025)
Seeing Through Clutter: Structured 3D Scene Reconstruction via Iterative Object Removal
por: Aguina-Kang, Rio, et al.
Publicado: (2026)
por: Aguina-Kang, Rio, et al.
Publicado: (2026)
Seeing Through Words: Controlling Visual Retrieval Quality with Language Models
por: Lu, Jianglin, et al.
Publicado: (2026)
por: Lu, Jianglin, et al.
Publicado: (2026)
SLARM: Streaming and Language-Aligned Reconstruction Model for Dynamic Scenes
por: Qiu, Zhicheng, et al.
Publicado: (2026)
por: Qiu, Zhicheng, et al.
Publicado: (2026)
Seeing Through Reflections: Advancing 3D Scene Reconstruction in Mirror-Containing Environments with Gaussian Splatting
por: Guo, Zijing, et al.
Publicado: (2025)
por: Guo, Zijing, et al.
Publicado: (2025)
Unified Scene Representation and Reconstruction for 3D Large Language Models
por: Chu, Tao, et al.
Publicado: (2024)
por: Chu, Tao, et al.
Publicado: (2024)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
por: Hou, Wenjin, et al.
Publicado: (2026)
por: Hou, Wenjin, et al.
Publicado: (2026)
Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions
por: Wang, Xuesong, et al.
Publicado: (2026)
por: Wang, Xuesong, et al.
Publicado: (2026)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
por: Chen, Seng Nam, et al.
Publicado: (2026)
por: Chen, Seng Nam, et al.
Publicado: (2026)
Projection-Based Correction for Enhancing Deep Inverse Networks
por: Bacca, Jorge
Publicado: (2025)
por: Bacca, Jorge
Publicado: (2025)
SplitGaussian: Reconstructing Dynamic Scenes via Visual Geometry Decomposition
por: Li, Jiahui, et al.
Publicado: (2025)
por: Li, Jiahui, et al.
Publicado: (2025)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
Scenario Understanding of Traffic Scenes Through Large Visual Language Models
por: Rivera, Esteban, et al.
Publicado: (2025)
por: Rivera, Esteban, et al.
Publicado: (2025)
WaterHE-NeRF: Water-ray Tracing Neural Radiance Fields for Underwater Scene Reconstruction
por: Zhou, Jingchun, et al.
Publicado: (2023)
por: Zhou, Jingchun, et al.
Publicado: (2023)
VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models
por: Kumar, Gokul Karthik, et al.
Publicado: (2025)
por: Kumar, Gokul Karthik, et al.
Publicado: (2025)
Seeing the Arrow of Time in Large Multimodal Models
por: Xue, Zihui, et al.
Publicado: (2025)
por: Xue, Zihui, et al.
Publicado: (2025)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
por: Zhang, Xuesong, et al.
Publicado: (2024)
por: Zhang, Xuesong, et al.
Publicado: (2024)
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
por: Cao, Meng, et al.
Publicado: (2025)
por: Cao, Meng, et al.
Publicado: (2025)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
por: Mushkani, Rashid
Publicado: (2025)
por: Mushkani, Rashid
Publicado: (2025)
DepthFocus: Controllable Depth Estimation for See-Through Scenes
por: Min, Junhong, et al.
Publicado: (2025)
por: Min, Junhong, et al.
Publicado: (2025)
EAG-PT: Emission-Aware Gaussians and Path Tracing for Diffuse Indoor Scene Reconstruction and Editing
por: Yang, Xijie, et al.
Publicado: (2026)
por: Yang, Xijie, et al.
Publicado: (2026)
Eye-See-You: Reverse Pass-Through VR and Head Avatars
por: Dash, Ankan, et al.
Publicado: (2025)
por: Dash, Ankan, et al.
Publicado: (2025)
Vision-Language Models Can't See the Obvious
por: Dahou, Yasser, et al.
Publicado: (2025)
por: Dahou, Yasser, et al.
Publicado: (2025)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
por: Zhang, Weichen, et al.
Publicado: (2025)
por: Zhang, Weichen, et al.
Publicado: (2025)
Robust Scene Change Detection Using Visual Foundation Models and Cross-Attention Mechanisms
por: Lin, Chun-Jung, et al.
Publicado: (2024)
por: Lin, Chun-Jung, et al.
Publicado: (2024)
Inferring Compositional 4D Scenes without Ever Seeing One
por: Gokmen, Ahmet Berke, et al.
Publicado: (2025)
por: Gokmen, Ahmet Berke, et al.
Publicado: (2025)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
por: Luo, Gen, et al.
Publicado: (2025)
por: Luo, Gen, et al.
Publicado: (2025)
Real-Time Scene Reconstruction using Light Field Probes
por: Liu, Yaru, et al.
Publicado: (2025)
por: Liu, Yaru, et al.
Publicado: (2025)
VENUS: Visual Editing with Noise Inversion Using Scene Graphs
por: Vo, Thanh-Nhan, et al.
Publicado: (2026)
por: Vo, Thanh-Nhan, et al.
Publicado: (2026)
Superpoint Gaussian Splatting for Real-Time High-Fidelity Dynamic Scene Reconstruction
por: Wan, Diwen, et al.
Publicado: (2024)
por: Wan, Diwen, et al.
Publicado: (2024)
Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
por: Zhang, Chuhan, et al.
Publicado: (2025)
por: Zhang, Chuhan, et al.
Publicado: (2025)
Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound
por: Zhang, Dengming, et al.
Publicado: (2025)
por: Zhang, Dengming, et al.
Publicado: (2025)
Ejemplares similares
-
Autoregressive High-Order Finite Difference Modulo Imaging: High-Dynamic Range for Computer Vision Applications
por: Monroy, Brayan, et al.
Publicado: (2025) -
High Dynamic Range Modulo Imaging for Robust Object Detection in Autonomous Driving
por: Contreras, Kebin, et al.
Publicado: (2025) -
Leveraging pretrained RGB denoisers for hyperspectral image restoration
por: Picone, Daniele, et al.
Publicado: (2026) -
PMPNet: Pixel Movement Prediction Network for Monocular Depth Estimation in Dynamic Scenes
por: Peng, Kebin, et al.
Publicado: (2024) -
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
por: Liang, Dayong, et al.
Publicado: (2025)