Saved in:
| Main Authors: | Ran, Lingyan, Wang, Lidong, Wang, Guangcong, Wang, Peng, Zhang, Yanning |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2503.19012 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
by: Ma, Ji, et al.
Published: (2025)
by: Ma, Ji, et al.
Published: (2025)
Semi-Supervised Semantic Segmentation Based on Pseudo-Labels: A Survey
by: Ran, Lingyan, et al.
Published: (2024)
by: Ran, Lingyan, et al.
Published: (2024)
C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
by: Ma, Ji, et al.
Published: (2024)
by: Ma, Ji, et al.
Published: (2024)
Adaptive Spatial Augmentation for Semi-supervised Semantic Segmentation
by: Ran, Lingyan, et al.
Published: (2025)
by: Ran, Lingyan, et al.
Published: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
by: Ma, Ji, et al.
Published: (2026)
by: Ma, Ji, et al.
Published: (2026)
SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model
by: Ding, Zongcan, et al.
Published: (2025)
by: Ding, Zongcan, et al.
Published: (2025)
AdaSemiCD: An Adaptive Semi-Supervised Change Detection Method Based on Pseudo-Label Evaluation
by: Lingyan, Ran, et al.
Published: (2024)
by: Lingyan, Ran, et al.
Published: (2024)
FreDFT: Frequency Domain Fusion Transformer for Visible-Infrared Object Detection
by: Wu, Wencong, et al.
Published: (2025)
by: Wu, Wencong, et al.
Published: (2025)
Frequency-Guided Spatial Adaptation for Camouflaged Object Detection
by: Zhang, Shizhou, et al.
Published: (2024)
by: Zhang, Shizhou, et al.
Published: (2024)
CrossDiff: Exploring Self-Supervised Representation of Pansharpening via Cross-Predictive Diffusion Model
by: Xing, Yinghui, et al.
Published: (2024)
by: Xing, Yinghui, et al.
Published: (2024)
CamI2V: Camera-Controlled Image-to-Video Diffusion Model
by: Zheng, Guangcong, et al.
Published: (2024)
by: Zheng, Guangcong, et al.
Published: (2024)
UniRGB-IR: A Unified Framework for Visible-Infrared Semantic Tasks via Adapter Tuning
by: Yuan, Maoxun, et al.
Published: (2024)
by: Yuan, Maoxun, et al.
Published: (2024)
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
by: Suo, Wei, et al.
Published: (2024)
by: Suo, Wei, et al.
Published: (2024)
Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models
by: Fu, Mingyu, et al.
Published: (2025)
by: Fu, Mingyu, et al.
Published: (2025)
Cross-Platform Video Person ReID: A New Benchmark Dataset and Adaptation Approach
by: Zhang, Shizhou, et al.
Published: (2024)
by: Zhang, Shizhou, et al.
Published: (2024)
CapHDR2IR: Caption-Driven Transfer from Visible Light to Infrared Domain
by: Peng, Jingchao, et al.
Published: (2024)
by: Peng, Jingchao, et al.
Published: (2024)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
by: Pan, Yu, et al.
Published: (2026)
by: Pan, Yu, et al.
Published: (2026)
CM-Diff: A Single Generative Network for Bidirectional Cross-Modality Translation Diffusion Model Between Infrared and Visible Images
by: Hu, Bin, et al.
Published: (2025)
by: Hu, Bin, et al.
Published: (2025)
DiffCAP: Diffusion-based Cumulative Adversarial Purification for Vision Language Models
by: Fu, Jia, et al.
Published: (2025)
by: Fu, Jia, et al.
Published: (2025)
DiffIR2VR-Zero: Zero-Shot Video Restoration with Diffusion-based Image Restoration Models
by: Yeh, Chang-Han, et al.
Published: (2024)
by: Yeh, Chang-Han, et al.
Published: (2024)
Embodied Scene Understanding for Vision Language Models via MetaVQA
by: Wang, Weizhen, et al.
Published: (2025)
by: Wang, Weizhen, et al.
Published: (2025)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
by: Zou, Heqing, et al.
Published: (2024)
by: Zou, Heqing, et al.
Published: (2024)
Text-based Talking Video Editing with Cascaded Conditional Diffusion
by: Han, Bo, et al.
Published: (2024)
by: Han, Bo, et al.
Published: (2024)
AnaMoDiff: 2D Analogical Motion Diffusion via Disentangled Denoising
by: Tanveer, Maham, et al.
Published: (2024)
by: Tanveer, Maham, et al.
Published: (2024)
Infrared and Visible Image Fusion with Language-Driven Loss in CLIP Embedding Space
by: Wang, Yuhao, et al.
Published: (2024)
by: Wang, Yuhao, et al.
Published: (2024)
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
by: Jiang, Anqing, et al.
Published: (2025)
by: Jiang, Anqing, et al.
Published: (2025)
OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
by: Zhu, Junhan, et al.
Published: (2025)
by: Zhu, Junhan, et al.
Published: (2025)
Vision and Intention Boost Large Language Model in Long-Term Action Anticipation
by: Cao, Congqi, et al.
Published: (2025)
by: Cao, Congqi, et al.
Published: (2025)
DDF: A Novel Dual-Domain Image Fusion Strategy for Remote Sensing Image Semantic Segmentation with Unsupervised Domain Adaptation
by: Ran, Lingyan, et al.
Published: (2024)
by: Ran, Lingyan, et al.
Published: (2024)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
by: Zheng, Guangcong, et al.
Published: (2023)
by: Zheng, Guangcong, et al.
Published: (2023)
IV-tuning: Parameter-Efficient Transfer Learning for Infrared-Visible Tasks
by: Zhang, Yaming, et al.
Published: (2024)
by: Zhang, Yaming, et al.
Published: (2024)
Understanding Degradation with Vision Language Model
by: Lan, Guanzhou, et al.
Published: (2026)
by: Lan, Guanzhou, et al.
Published: (2026)
CamFreeDiff: Camera-free Image to Panorama Generation with Diffusion Model
by: Yuan, Xiaoding, et al.
Published: (2024)
by: Yuan, Xiaoding, et al.
Published: (2024)
Identity Clue Refinement and Enhancement for Visible-Infrared Person Re-Identification
by: Zhang, Guoqing, et al.
Published: (2025)
by: Zhang, Guoqing, et al.
Published: (2025)
ResDiff: Combining CNN and Diffusion Model for Image Super-Resolution
by: Shang, Shuyao, et al.
Published: (2023)
by: Shang, Shuyao, et al.
Published: (2023)
Diff-Oracle: Deciphering Oracle Bone Scripts with Controllable Diffusion Model
by: Li, Jing, et al.
Published: (2023)
by: Li, Jing, et al.
Published: (2023)
VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer
by: Hou, Yanning, et al.
Published: (2026)
by: Hou, Yanning, et al.
Published: (2026)
RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion
by: Wang, Ruofan, et al.
Published: (2025)
by: Wang, Ruofan, et al.
Published: (2025)
UNIV: Unified Foundation Model for Infrared and Visible Modalities
by: Mao, Fangyuan, et al.
Published: (2025)
by: Mao, Fangyuan, et al.
Published: (2025)
Unsupervised Visible-Infrared ReID via Pseudo-label Correction and Modality-level Alignment
by: Liu, Yexin, et al.
Published: (2024)
by: Liu, Yexin, et al.
Published: (2024)
Similar Items
-
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
by: Ma, Ji, et al.
Published: (2025) -
Semi-Supervised Semantic Segmentation Based on Pseudo-Labels: A Survey
by: Ran, Lingyan, et al.
Published: (2024) -
C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
by: Ma, Ji, et al.
Published: (2024) -
Adaptive Spatial Augmentation for Semi-supervised Semantic Segmentation
by: Ran, Lingyan, et al.
Published: (2025) -
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
by: Ma, Ji, et al.
Published: (2026)