DiffV2IR: Visible-to-Infrared Diffusion Model via Vision-Language Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Ran, Lingyan, Wang, Lidong, Wang, Guangcong, Wang, Peng, Zhang, Yanning |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
di: Ma, Ji, et al.
Pubblicazione: (2025)
di: Ma, Ji, et al.
Pubblicazione: (2025)
C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
di: Ma, Ji, et al.
Pubblicazione: (2024)
di: Ma, Ji, et al.
Pubblicazione: (2024)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
di: Ma, Ji, et al.
Pubblicazione: (2026)
di: Ma, Ji, et al.
Pubblicazione: (2026)
Adaptive Spatial Augmentation for Semi-supervised Semantic Segmentation
di: Ran, Lingyan, et al.
Pubblicazione: (2025)
di: Ran, Lingyan, et al.
Pubblicazione: (2025)
SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model
di: Ding, Zongcan, et al.
Pubblicazione: (2025)
di: Ding, Zongcan, et al.
Pubblicazione: (2025)
Semi-Supervised Semantic Segmentation Based on Pseudo-Labels: A Survey
di: Ran, Lingyan, et al.
Pubblicazione: (2024)
di: Ran, Lingyan, et al.
Pubblicazione: (2024)
FreDFT: Frequency Domain Fusion Transformer for Visible-Infrared Object Detection
di: Wu, Wencong, et al.
Pubblicazione: (2025)
di: Wu, Wencong, et al.
Pubblicazione: (2025)
UniRGB-IR: A Unified Framework for Visible-Infrared Semantic Tasks via Adapter Tuning
di: Yuan, Maoxun, et al.
Pubblicazione: (2024)
di: Yuan, Maoxun, et al.
Pubblicazione: (2024)
AdaSemiCD: An Adaptive Semi-Supervised Change Detection Method Based on Pseudo-Label Evaluation
di: Lingyan, Ran, et al.
Pubblicazione: (2024)
di: Lingyan, Ran, et al.
Pubblicazione: (2024)
CamI2V: Camera-Controlled Image-to-Video Diffusion Model
di: Zheng, Guangcong, et al.
Pubblicazione: (2024)
di: Zheng, Guangcong, et al.
Pubblicazione: (2024)
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
di: Suo, Wei, et al.
Pubblicazione: (2024)
di: Suo, Wei, et al.
Pubblicazione: (2024)
CrossDiff: Exploring Self-Supervised Representation of Pansharpening via Cross-Predictive Diffusion Model
di: Xing, Yinghui, et al.
Pubblicazione: (2024)
di: Xing, Yinghui, et al.
Pubblicazione: (2024)
CapHDR2IR: Caption-Driven Transfer from Visible Light to Infrared Domain
di: Peng, Jingchao, et al.
Pubblicazione: (2024)
di: Peng, Jingchao, et al.
Pubblicazione: (2024)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
di: Pan, Yu, et al.
Pubblicazione: (2026)
di: Pan, Yu, et al.
Pubblicazione: (2026)
Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models
di: Fu, Mingyu, et al.
Pubblicazione: (2025)
di: Fu, Mingyu, et al.
Pubblicazione: (2025)
CM-Diff: A Single Generative Network for Bidirectional Cross-Modality Translation Diffusion Model Between Infrared and Visible Images
di: Hu, Bin, et al.
Pubblicazione: (2025)
di: Hu, Bin, et al.
Pubblicazione: (2025)
Frequency-Guided Spatial Adaptation for Camouflaged Object Detection
di: Zhang, Shizhou, et al.
Pubblicazione: (2024)
di: Zhang, Shizhou, et al.
Pubblicazione: (2024)
DiffIR2VR-Zero: Zero-Shot Video Restoration with Diffusion-based Image Restoration Models
di: Yeh, Chang-Han, et al.
Pubblicazione: (2024)
di: Yeh, Chang-Han, et al.
Pubblicazione: (2024)
DiffCAP: Diffusion-based Cumulative Adversarial Purification for Vision Language Models
di: Fu, Jia, et al.
Pubblicazione: (2025)
di: Fu, Jia, et al.
Pubblicazione: (2025)
AnaMoDiff: 2D Analogical Motion Diffusion via Disentangled Denoising
di: Tanveer, Maham, et al.
Pubblicazione: (2024)
di: Tanveer, Maham, et al.
Pubblicazione: (2024)
Embodied Scene Understanding for Vision Language Models via MetaVQA
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
di: Zhu, Junhan, et al.
Pubblicazione: (2025)
di: Zhu, Junhan, et al.
Pubblicazione: (2025)
Cross-Platform Video Person ReID: A New Benchmark Dataset and Adaptation Approach
di: Zhang, Shizhou, et al.
Pubblicazione: (2024)
di: Zhang, Shizhou, et al.
Pubblicazione: (2024)
Infrared and Visible Image Fusion with Language-Driven Loss in CLIP Embedding Space
di: Wang, Yuhao, et al.
Pubblicazione: (2024)
di: Wang, Yuhao, et al.
Pubblicazione: (2024)
Understanding Degradation with Vision Language Model
di: Lan, Guanzhou, et al.
Pubblicazione: (2026)
di: Lan, Guanzhou, et al.
Pubblicazione: (2026)
RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion
di: Wang, Ruofan, et al.
Pubblicazione: (2025)
di: Wang, Ruofan, et al.
Pubblicazione: (2025)
Identity Clue Refinement and Enhancement for Visible-Infrared Person Re-Identification
di: Zhang, Guoqing, et al.
Pubblicazione: (2025)
di: Zhang, Guoqing, et al.
Pubblicazione: (2025)
Diff-Oracle: Deciphering Oracle Bone Scripts with Controllable Diffusion Model
di: Li, Jing, et al.
Pubblicazione: (2023)
di: Li, Jing, et al.
Pubblicazione: (2023)
CamFreeDiff: Camera-free Image to Panorama Generation with Diffusion Model
di: Yuan, Xiaoding, et al.
Pubblicazione: (2024)
di: Yuan, Xiaoding, et al.
Pubblicazione: (2024)
ResDiff: Combining CNN and Diffusion Model for Image Super-Resolution
di: Shang, Shuyao, et al.
Pubblicazione: (2023)
di: Shang, Shuyao, et al.
Pubblicazione: (2023)
IV-tuning: Parameter-Efficient Transfer Learning for Infrared-Visible Tasks
di: Zhang, Yaming, et al.
Pubblicazione: (2024)
di: Zhang, Yaming, et al.
Pubblicazione: (2024)
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
Vision and Intention Boost Large Language Model in Long-Term Action Anticipation
di: Cao, Congqi, et al.
Pubblicazione: (2025)
di: Cao, Congqi, et al.
Pubblicazione: (2025)
Text-based Talking Video Editing with Cascaded Conditional Diffusion
di: Han, Bo, et al.
Pubblicazione: (2024)
di: Han, Bo, et al.
Pubblicazione: (2024)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
di: Zou, Heqing, et al.
Pubblicazione: (2024)
di: Zou, Heqing, et al.
Pubblicazione: (2024)
UNIV: Unified Foundation Model for Infrared and Visible Modalities
di: Mao, Fangyuan, et al.
Pubblicazione: (2025)
di: Mao, Fangyuan, et al.
Pubblicazione: (2025)
Unsupervised Visible-Infrared ReID via Pseudo-label Correction and Modality-level Alignment
di: Liu, Yexin, et al.
Pubblicazione: (2024)
di: Liu, Yexin, et al.
Pubblicazione: (2024)
LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
di: Dong, Xuanzhao, et al.
Pubblicazione: (2025)
di: Dong, Xuanzhao, et al.
Pubblicazione: (2025)
DDF: A Novel Dual-Domain Image Fusion Strategy for Remote Sensing Image Semantic Segmentation with Unsupervised Domain Adaptation
di: Ran, Lingyan, et al.
Pubblicazione: (2024)
di: Ran, Lingyan, et al.
Pubblicazione: (2024)
Masked Diffusion Vision-Language Models for Temporal Action Localization
di: Wang, Fengshun, et al.
Pubblicazione: (2026)
di: Wang, Fengshun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
di: Ma, Ji, et al.
Pubblicazione: (2025) -
C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
di: Ma, Ji, et al.
Pubblicazione: (2024) -
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
di: Ma, Ji, et al.
Pubblicazione: (2026) -
Adaptive Spatial Augmentation for Semi-supervised Semantic Segmentation
di: Ran, Lingyan, et al.
Pubblicazione: (2025) -
SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model
di: Ding, Zongcan, et al.
Pubblicazione: (2025)