3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Xinye, Wang, Fei, Nie, Yiqi, Li, Kun, Chen, Junjie, Zhao, Jiaqi, Wei, Yanyan, Wu, Zhiliang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploiting Ensemble Learning for Cross-View Isolated Sign Language Recognition
by: Wang, Fei, et al.
Published: (2025)
by: Wang, Fei, et al.
Published: (2025)
Training-Free Multimodal Deepfake Detection via Graph Reasoning
by: Liu, Yuxin, et al.
Published: (2025)
by: Liu, Yuxin, et al.
Published: (2025)
Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation
by: Wang, Fei, et al.
Published: (2026)
by: Wang, Fei, et al.
Published: (2026)
MM-Gesture: Towards Precise Micro-Gesture Recognition through Multimodal Fusion
by: Gu, Jihao, et al.
Published: (2025)
by: Gu, Jihao, et al.
Published: (2025)
SmokeSeer: 3D Gaussian Splatting for Smoke Removal and Scene Reconstruction
by: Jain, Neham, et al.
Published: (2025)
by: Jain, Neham, et al.
Published: (2025)
Unified Scene Representation and Reconstruction for 3D Large Language Models
by: Chu, Tao, et al.
Published: (2024)
by: Chu, Tao, et al.
Published: (2024)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
by: Qi, Zhangyang, et al.
Published: (2025)
by: Qi, Zhangyang, et al.
Published: (2025)
Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction
by: Yang, Yiru, et al.
Published: (2026)
by: Yang, Yiru, et al.
Published: (2026)
Scene Reconstruction as Mapping Priors for 3D Detection
by: Fu, Yang, et al.
Published: (2026)
by: Fu, Yang, et al.
Published: (2026)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
by: Guo, Hao, et al.
Published: (2026)
by: Guo, Hao, et al.
Published: (2026)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
by: Nie, Yiqi, et al.
Published: (2026)
by: Nie, Yiqi, et al.
Published: (2026)
VastGaussian: Vast 3D Gaussians for Large Scene Reconstruction
by: Lin, Jiaqi, et al.
Published: (2024)
by: Lin, Jiaqi, et al.
Published: (2024)
SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection
by: Qi, Tianye, et al.
Published: (2025)
by: Qi, Tianye, et al.
Published: (2025)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
by: Li, Chen, et al.
Published: (2025)
by: Li, Chen, et al.
Published: (2025)
FreeInsert: Disentangled Text-Guided Object Insertion in 3D Gaussian Scene without Spatial Priors
by: Li, Chenxi, et al.
Published: (2025)
by: Li, Chenxi, et al.
Published: (2025)
LanP: Rethinking the Impact of Language Priors in Large Vision-Language Models
by: Wu, Zongyu, et al.
Published: (2025)
by: Wu, Zongyu, et al.
Published: (2025)
Motion Matters: Motion-guided Modulation Network for Skeleton-based Micro-Action Recognition
by: Gu, Jihao, et al.
Published: (2025)
by: Gu, Jihao, et al.
Published: (2025)
Semantic Alignment for Multimodal Large Language Models
by: Wu, Tao, et al.
Published: (2024)
by: Wu, Tao, et al.
Published: (2024)
3D Scene Graph Guided Vision-Language Pre-training
by: Liu, Hao, et al.
Published: (2024)
by: Liu, Hao, et al.
Published: (2024)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
by: Dong, Xinpeng, et al.
Published: (2026)
by: Dong, Xinpeng, et al.
Published: (2026)
SceneCraft: Layout-Guided 3D Scene Generation
by: Yang, Xiuyu, et al.
Published: (2024)
by: Yang, Xiuyu, et al.
Published: (2024)
Online 3D Scene Reconstruction Using Neural Object Priors
by: Chabal, Thomas, et al.
Published: (2025)
by: Chabal, Thomas, et al.
Published: (2025)
Scene Coordinate Reconstruction Priors
by: Bian, Wenjing, et al.
Published: (2025)
by: Bian, Wenjing, et al.
Published: (2025)
PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding
by: Wen, Junjie, et al.
Published: (2026)
by: Wen, Junjie, et al.
Published: (2026)
MGP-KAD: Multimodal Geometric Priors and Kolmogorov-Arnold Decoder for Single-View 3D Reconstruction in Complex Scenes
by: Zhang, Luoxi, et al.
Published: (2026)
by: Zhang, Luoxi, et al.
Published: (2026)
Evidence Packing for Cross-Domain Image Deepfake Detection with LVLMs
by: Liu, Yuxin, et al.
Published: (2026)
by: Liu, Yuxin, et al.
Published: (2026)
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
by: Min, Chen, et al.
Published: (2023)
by: Min, Chen, et al.
Published: (2023)
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
by: Suzuki, Naru, et al.
Published: (2025)
by: Suzuki, Naru, et al.
Published: (2025)
Pow3R: Empowering Unconstrained 3D Reconstruction with Camera and Scene Priors
by: Jang, Wonbong, et al.
Published: (2025)
by: Jang, Wonbong, et al.
Published: (2025)
Generative Face Parsing Map Guided 3D Face Reconstruction Under Occluded Scenes
by: Zhao, Dapeng, et al.
Published: (2024)
by: Zhao, Dapeng, et al.
Published: (2024)
Micro-gesture Online Recognition using Learnable Query Points
by: Liu, Pengyu, et al.
Published: (2024)
by: Liu, Pengyu, et al.
Published: (2024)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
by: Lu, Fan, et al.
Published: (2024)
by: Lu, Fan, et al.
Published: (2024)
MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios
by: Fan, Jiaqi, et al.
Published: (2024)
by: Fan, Jiaqi, et al.
Published: (2024)
GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction
by: Schmid, Katharina, et al.
Published: (2026)
by: Schmid, Katharina, et al.
Published: (2026)
RGE-GS: Reward-Guided Expansive Driving Scene Reconstruction via Diffusion Priors
by: Du, Sicong, et al.
Published: (2025)
by: Du, Sicong, et al.
Published: (2025)
Feature-Optimized Vision for Adaptive 3D Scene Reconstruction
by: Liang, Eric
Published: (2026)
by: Liang, Eric
Published: (2026)
LaMP: Learning Vision-Language-Action Policies with 3D Scene Flow as Latent Motion Prior
by: Wang, Xinkai, et al.
Published: (2026)
by: Wang, Xinkai, et al.
Published: (2026)
ExploreGS: Explorable 3D Scene Reconstruction with Virtual Camera Samplings and Diffusion Priors
by: Kim, Minsu, et al.
Published: (2025)
by: Kim, Minsu, et al.
Published: (2025)
Unleashing Semantic and Geometric Priors for 3D Scene Completion
by: Chen, Shiyuan, et al.
Published: (2025)
by: Chen, Shiyuan, et al.
Published: (2025)
AquaGS: Fast Underwater Scene Reconstruction with SfM-Free Gaussian Splatting
by: Shi, Junhao, et al.
Published: (2025)
by: Shi, Junhao, et al.
Published: (2025)
Similar Items
-
Exploiting Ensemble Learning for Cross-View Isolated Sign Language Recognition
by: Wang, Fei, et al.
Published: (2025) -
Training-Free Multimodal Deepfake Detection via Graph Reasoning
by: Liu, Yuxin, et al.
Published: (2025) -
Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation
by: Wang, Fei, et al.
Published: (2026) -
MM-Gesture: Towards Precise Micro-Gesture Recognition through Multimodal Fusion
by: Gu, Jihao, et al.
Published: (2025) -
SmokeSeer: 3D Gaussian Splatting for Smoke Removal and Scene Reconstruction
by: Jain, Neham, et al.
Published: (2025)