Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception
Fuente:
arXiv
Saved in:
| Main Authors: | Thushara, Rusiru, Ranasinghe, Yasiru, Paranjape, Jay, Patel, Vishal M. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
by: Ranasinghe, Yasiru, et al.
Published: (2025)
by: Ranasinghe, Yasiru, et al.
Published: (2025)
Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection
by: Ranasinghe, Yasiru, et al.
Published: (2026)
by: Ranasinghe, Yasiru, et al.
Published: (2026)
F-ViTA: Foundation Model Guided Visible to Thermal Translation
by: Paranjape, Jay N., et al.
Published: (2025)
by: Paranjape, Jay N., et al.
Published: (2025)
$CrowdDiff$: Multi-hypothesis Crowd Density Estimation using Diffusion Models
by: Ranasinghe, Yasiru, et al.
Published: (2023)
by: Ranasinghe, Yasiru, et al.
Published: (2023)
SINR: Sparsity Driven Compressed Implicit Neural Representations
by: Jayasundara, Dhananjaya, et al.
Published: (2025)
by: Jayasundara, Dhananjaya, et al.
Published: (2025)
S-SAM: SVD-based Fine-Tuning of Segment Anything Model for Medical Image Segmentation
by: Paranjape, Jay N., et al.
Published: (2024)
by: Paranjape, Jay N., et al.
Published: (2024)
A Mamba-based Siamese Network for Remote Sensing Change Detection
by: Paranjape, Jay N., et al.
Published: (2024)
by: Paranjape, Jay N., et al.
Published: (2024)
Blackbox Adaptation for Medical Image Segmentation
by: Paranjape, Jay N., et al.
Published: (2024)
by: Paranjape, Jay N., et al.
Published: (2024)
Federated Black-Box Adaptation for Semantic Segmentation
by: Paranjape, Jay N., et al.
Published: (2024)
by: Paranjape, Jay N., et al.
Published: (2024)
Active Learning for Vision-Language Models
by: Safaei, Bardia, et al.
Published: (2024)
by: Safaei, Bardia, et al.
Published: (2024)
GenDeg: Diffusion-based Degradation Synthesis for Generalizable All-In-One Image Restoration
by: Rajagopalan, Sudarshan, et al.
Published: (2024)
by: Rajagopalan, Sudarshan, et al.
Published: (2024)
Referring Change Detection in Remote Sensing Imagery
by: Korkmaz, Yilmaz, et al.
Published: (2025)
by: Korkmaz, Yilmaz, et al.
Published: (2025)
UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation
by: Chen, Dengbo, et al.
Published: (2025)
by: Chen, Dengbo, et al.
Published: (2025)
VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping
by: Baliah, Sanoojan, et al.
Published: (2026)
by: Baliah, Sanoojan, et al.
Published: (2026)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
by: Wang, Peng, et al.
Published: (2024)
by: Wang, Peng, et al.
Published: (2024)
3VL: Using Trees to Improve Vision-Language Models' Interpretability
by: Yellinek, Nir, et al.
Published: (2023)
by: Yellinek, Nir, et al.
Published: (2023)
VL4Gaze: Unleashing Vision-Language Models for Gaze Following
by: Wang, Shijing, et al.
Published: (2025)
by: Wang, Shijing, et al.
Published: (2025)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
by: Zeng, Lunbin, et al.
Published: (2025)
by: Zeng, Lunbin, et al.
Published: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
by: Ye, Jiacheng, et al.
Published: (2025)
by: Ye, Jiacheng, et al.
Published: (2025)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
by: Zhang, Ruiyang, et al.
Published: (2024)
by: Zhang, Ruiyang, et al.
Published: (2024)
VL4AD: Vision-Language Models Improve Pixel-wise Anomaly Detection
by: Zhong, Liangyu, et al.
Published: (2024)
by: Zhong, Liangyu, et al.
Published: (2024)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
by: Dong, Daxiang, et al.
Published: (2025)
by: Dong, Daxiang, et al.
Published: (2025)
A-VL: Adaptive Attention for Large Vision-Language Models
by: Zhang, Junyang, et al.
Published: (2024)
by: Zhang, Junyang, et al.
Published: (2024)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
by: Trinh, Quoc-Huy, et al.
Published: (2026)
by: Trinh, Quoc-Huy, et al.
Published: (2026)
VL-Reader: Vision and Language Reconstructor is an Effective Scene Text Recognizer
by: Zhong, Humen, et al.
Published: (2024)
by: Zhong, Humen, et al.
Published: (2024)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
by: Hao, Zhiwei, et al.
Published: (2024)
by: Hao, Zhiwei, et al.
Published: (2024)
DP^2-VL: Private Photo Dataset Protection by Data Poisoning for Vision-Language Models
by: Miao, Hongyi, et al.
Published: (2026)
by: Miao, Hongyi, et al.
Published: (2026)
GraphVL: Graph-Enhanced Semantic Modeling via Vision-Language Models for Generalized Class Discovery
by: Solanki, Bhupendra, et al.
Published: (2024)
by: Solanki, Bhupendra, et al.
Published: (2024)
GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI
by: Li, Tianbin, et al.
Published: (2024)
by: Li, Tianbin, et al.
Published: (2024)
ModelMix: A New Model-Mixup Strategy to Minimize Vicinal Risk across Tasks for Few-scribble based Cardiac Segmentation
by: Zhang, Ke, et al.
Published: (2024)
by: Zhang, Ke, et al.
Published: (2024)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
by: Deria, Ankan, et al.
Published: (2026)
by: Deria, Ankan, et al.
Published: (2026)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
by: Wei, Zhixiang, et al.
Published: (2026)
by: Wei, Zhixiang, et al.
Published: (2026)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
by: Li, Lei, et al.
Published: (2024)
by: Li, Lei, et al.
Published: (2024)
Enhancing Multi-Label Thoracic Disease Diagnosis with Deep Ensemble-Based Uncertainty Quantification
by: Laksara, Yasiru, et al.
Published: (2025)
by: Laksara, Yasiru, et al.
Published: (2025)
RemoteVAR: Autoregressive Visual Modeling for Remote Sensing Change Detection
by: Korkmaz, Yilmaz, et al.
Published: (2026)
by: Korkmaz, Yilmaz, et al.
Published: (2026)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
by: Chen, Jiuhai, et al.
Published: (2024)
by: Chen, Jiuhai, et al.
Published: (2024)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
by: He, Yefei, et al.
Published: (2024)
by: He, Yefei, et al.
Published: (2024)
ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models
by: Yi, Jingwei, et al.
Published: (2025)
by: Yi, Jingwei, et al.
Published: (2025)
GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations
by: Li, Zesheng, et al.
Published: (2026)
by: Li, Zesheng, et al.
Published: (2026)
LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning
by: Huang, Jiangyong, et al.
Published: (2025)
by: Huang, Jiangyong, et al.
Published: (2025)
Similar Items
-
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
by: Ranasinghe, Yasiru, et al.
Published: (2025) -
Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection
by: Ranasinghe, Yasiru, et al.
Published: (2026) -
F-ViTA: Foundation Model Guided Visible to Thermal Translation
by: Paranjape, Jay N., et al.
Published: (2025) -
$CrowdDiff$: Multi-hypothesis Crowd Density Estimation using Diffusion Models
by: Ranasinghe, Yasiru, et al.
Published: (2023) -
SINR: Sparsity Driven Compressed Implicit Neural Representations
by: Jayasundara, Dhananjaya, et al.
Published: (2025)