Saved in:
| Main Authors: | Esparza, Miguel, Gupta, Archit, Yin, Kai, Xiao, Yiming, Mostafavi, Ali |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2509.01895 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Recov-Vision: Linking Street View Imagery and Vision-Language Models for Post-Disaster Recovery
by: Xiao, Yiming, et al.
Published: (2025)
by: Xiao, Yiming, et al.
Published: (2025)
DamageCAT: A Deep Learning Transformer Framework for Typology-Based Post-Disaster Building Damage Categorization
by: Xiao, Yiming, et al.
Published: (2025)
by: Xiao, Yiming, et al.
Published: (2025)
CrisiSense-RAG: Crisis Sensing Multimodal Retrieval-Augmented Generation for Rapid Disaster Impact Assessment
by: Xiao, Yiming, et al.
Published: (2026)
by: Xiao, Yiming, et al.
Published: (2026)
Flood-DamageSense: Multimodal Mamba with Multitask Learning for Building Flood Damage Assessment using SAR Remote Sensing Imagery
by: Ho, Yu-Hsuan, et al.
Published: (2025)
by: Ho, Yu-Hsuan, et al.
Published: (2025)
ELEV-VISION-SAM: Integrated Vision Language and Foundation Model for Automated Estimation of Building Lowest Floor Elevation
by: Ho, Yu-Hsuan, et al.
Published: (2024)
by: Ho, Yu-Hsuan, et al.
Published: (2024)
Wildfire Detection Using Vision Transformer with the Wildfire Dataset
by: Vuppari, Gowtham Raj, et al.
Published: (2025)
by: Vuppari, Gowtham Raj, et al.
Published: (2025)
Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models
by: Wei, Jie, et al.
Published: (2025)
by: Wei, Jie, et al.
Published: (2025)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
by: Li, Ke, et al.
Published: (2026)
by: Li, Ke, et al.
Published: (2026)
ViM-UNet: Vision Mamba for Biomedical Segmentation
by: Archit, Anwai, et al.
Published: (2024)
by: Archit, Anwai, et al.
Published: (2024)
Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
GraphFire-X: Physics-Informed Graph Attention Networks and Structural Gradient Boosting for Building-Scale Wildfire Preparedness at the Wildland-Urban Interface
by: Esparza, Miguel, et al.
Published: (2025)
by: Esparza, Miguel, et al.
Published: (2025)
DamageArbiter: A CLIP-Enhanced Multimodal Arbitration Framework for Hurricane Damage Assessment from Street-View Imagery
by: Yang, Yifan, et al.
Published: (2026)
by: Yang, Yifan, et al.
Published: (2026)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
by: Zhou, Yue, et al.
Published: (2026)
by: Zhou, Yue, et al.
Published: (2026)
Automated Building Heritage Assessment Using Street-Level Imagery
by: Dabrock, Kristina, et al.
Published: (2025)
by: Dabrock, Kristina, et al.
Published: (2025)
Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment
by: Kyem, Blessing Agyei, et al.
Published: (2026)
by: Kyem, Blessing Agyei, et al.
Published: (2026)
Learning Visual Grounding from Generative Vision and Language Model
by: Wang, Shijie, et al.
Published: (2024)
by: Wang, Shijie, et al.
Published: (2024)
Deploying Rapid Damage Assessments from sUAS Imagery for Disaster Response
by: Manzini, Thomas, et al.
Published: (2025)
by: Manzini, Thomas, et al.
Published: (2025)
MCANet: A Multi-Scale Class-Specific Attention Network for Multi-Label Post-Hurricane Damage Assessment using UAV Imagery
by: Liu, Zhangding, et al.
Published: (2025)
by: Liu, Zhangding, et al.
Published: (2025)
Edge Attention Module for Object Classification
by: Roy, Santanu, et al.
Published: (2025)
by: Roy, Santanu, et al.
Published: (2025)
WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery
by: Ayanzadeh, Aydin, et al.
Published: (2026)
by: Ayanzadeh, Aydin, et al.
Published: (2026)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
by: Cheng, An-Chieh, et al.
Published: (2024)
by: Cheng, An-Chieh, et al.
Published: (2024)
Generalizable Disaster Damage Assessment via Change Detection with Vision Foundation Model
by: Ahn, Kyeongjin, et al.
Published: (2024)
by: Ahn, Kyeongjin, et al.
Published: (2024)
Multi-class Seismic Building Damage Assessment from InSAR Imagery using Quadratic Variational Causal Bayesian Inference
by: Li, Xuechun, et al.
Published: (2025)
by: Li, Xuechun, et al.
Published: (2025)
Enhancing Targeted Adversarial Attacks on Large Vision-Language Models via Intermediate Projector
by: Cao, Yiming, et al.
Published: (2025)
by: Cao, Yiming, et al.
Published: (2025)
AD-Lite Net: A Lightweight and Concatenated CNN Model for Alzheimer's Detection from MRI Images
by: Roy, Santanu, et al.
Published: (2024)
by: Roy, Santanu, et al.
Published: (2024)
Generating Satellite Imagery Data for Wildfire Detection through Mask-Conditioned Generative AI
by: Martin, Valeria, et al.
Published: (2026)
by: Martin, Valeria, et al.
Published: (2026)
FLAME 3 Dataset: Unleashing the Power of Radiometric Thermal UAV Imagery for Wildfire Management
by: Hopkins, Bryce, et al.
Published: (2024)
by: Hopkins, Bryce, et al.
Published: (2024)
Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation
by: Lee, Phillip Y., et al.
Published: (2025)
by: Lee, Phillip Y., et al.
Published: (2025)
BiomedCoOp: Learning to Prompt for Biomedical Vision-Language Models
by: Koleilat, Taha, et al.
Published: (2024)
by: Koleilat, Taha, et al.
Published: (2024)
MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging
by: Chen, Siyi, et al.
Published: (2025)
by: Chen, Siyi, et al.
Published: (2025)
Grounded 3D-Aware Spatial Vision-Language Modeling
by: Cheng, An-Chieh, et al.
Published: (2026)
by: Cheng, An-Chieh, et al.
Published: (2026)
Evaluating Vision Foundation Models for Pixel and Object Classification in Microscopy
by: Teuber, Carolin, et al.
Published: (2026)
by: Teuber, Carolin, et al.
Published: (2026)
Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning
by: Koleilat, Taha, et al.
Published: (2026)
by: Koleilat, Taha, et al.
Published: (2026)
From Pixels to Semantics: A Multi-Stage AI Framework for Structural Damage Detection in Satellite Imagery
by: Shakya, Bijay, et al.
Published: (2026)
by: Shakya, Bijay, et al.
Published: (2026)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
by: Fan, Rong, et al.
Published: (2026)
by: Fan, Rong, et al.
Published: (2026)
Popeye: A Unified Visual-Language Model for Multi-Source Ship Detection from Remote Sensing Imagery
by: Zhang, Wei, et al.
Published: (2024)
by: Zhang, Wei, et al.
Published: (2024)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
by: Chen, Zheng, et al.
Published: (2024)
by: Chen, Zheng, et al.
Published: (2024)
ELEV-VISION: Automated Lowest Floor Elevation Estimation from Segmenting Street View Images
by: Ho, Yu-Hsuan, et al.
Published: (2023)
by: Ho, Yu-Hsuan, et al.
Published: (2023)
A Benchmark Dataset for Spatially Aligned Road Damage Assessment in Small Uncrewed Aerial Systems Disaster Imagery
by: Manzini, Thomas, et al.
Published: (2025)
by: Manzini, Thomas, et al.
Published: (2025)
Physically Grounded Vision-Language Models for Robotic Manipulation
by: Gao, Jensen, et al.
Published: (2023)
by: Gao, Jensen, et al.
Published: (2023)
Similar Items
-
Recov-Vision: Linking Street View Imagery and Vision-Language Models for Post-Disaster Recovery
by: Xiao, Yiming, et al.
Published: (2025) -
DamageCAT: A Deep Learning Transformer Framework for Typology-Based Post-Disaster Building Damage Categorization
by: Xiao, Yiming, et al.
Published: (2025) -
CrisiSense-RAG: Crisis Sensing Multimodal Retrieval-Augmented Generation for Rapid Disaster Impact Assessment
by: Xiao, Yiming, et al.
Published: (2026) -
Flood-DamageSense: Multimodal Mamba with Multitask Learning for Building Flood Damage Assessment using SAR Remote Sensing Imagery
by: Ho, Yu-Hsuan, et al.
Published: (2025) -
ELEV-VISION-SAM: Integrated Vision Language and Foundation Model for Automated Estimation of Building Lowest Floor Elevation
by: Ho, Yu-Hsuan, et al.
Published: (2024)