Understanding Degradation with Vision Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lan, Guanzhou, Liao, Chenyi, Yang, Yuqi, Ma, Qianli, Wang, Zhigang, Wang, Dong, Zhao, Bin, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Night-to-Day Translation via Illumination Degradation Disentanglement
par: Lan, Guanzhou, et autres
Publié: (2024)
par: Lan, Guanzhou, et autres
Publié: (2024)
Efficient Diffusion as Low Light Enhancer
par: Lan, Guanzhou, et autres
Publié: (2024)
par: Lan, Guanzhou, et autres
Publié: (2024)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
par: Wang, Zhigang, et autres
Publié: (2024)
par: Wang, Zhigang, et autres
Publié: (2024)
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
par: Zhang, Da, et autres
Publié: (2025)
par: Zhang, Da, et autres
Publié: (2025)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
par: Zhang, Pingrui, et autres
Publié: (2025)
par: Zhang, Pingrui, et autres
Publié: (2025)
GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
par: Yan, Chi, et autres
Publié: (2023)
par: Yan, Chi, et autres
Publié: (2023)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
par: Yang, Shuai, et autres
Publié: (2025)
par: Yang, Shuai, et autres
Publié: (2025)
Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy
par: Wu, Pengyuan, et autres
Publié: (2026)
par: Wu, Pengyuan, et autres
Publié: (2026)
Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning
par: Gao, Xianqiang, et autres
Publié: (2026)
par: Gao, Xianqiang, et autres
Publié: (2026)
RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
par: Gao, Bingjie, et autres
Publié: (2025)
par: Gao, Bingjie, et autres
Publié: (2025)
Beyond Retraining: Training-Free Unknown Class Filtering for Source-Free Open Set Domain Adaptation of Vision-Language Models
par: Li, Yongguang, et autres
Publié: (2025)
par: Li, Yongguang, et autres
Publié: (2025)
SpatialBot: Precise Spatial Understanding with Vision Language Models
par: Cai, Wenxiao, et autres
Publié: (2024)
par: Cai, Wenxiao, et autres
Publié: (2024)
Masked Diffusion Vision-Language Models for Temporal Action Localization
par: Wang, Fengshun, et autres
Publié: (2026)
par: Wang, Fengshun, et autres
Publié: (2026)
Point-PEFT: Parameter-Efficient Fine-Tuning for 3D Pre-trained Models
par: Tang, Yiwen, et autres
Publié: (2023)
par: Tang, Yiwen, et autres
Publié: (2023)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
par: Yang, Fan, et autres
Publié: (2026)
par: Yang, Fan, et autres
Publié: (2026)
Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Degradation-Aware Image Enhancement via Vision-Language Classification
par: Cai, Jie, et autres
Publié: (2025)
par: Cai, Jie, et autres
Publié: (2025)
GLAD: Generalizable Tuning for Vision-Language Models
par: Peng, Yuqi, et autres
Publié: (2025)
par: Peng, Yuqi, et autres
Publié: (2025)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
Enhanced Continual Learning of Vision-Language Models with Model Fusion
par: Gao, Haoyuan, et autres
Publié: (2025)
par: Gao, Haoyuan, et autres
Publié: (2025)
LightBSR: Towards Lightweight Blind Super-Resolution via Discriminative Implicit Degradation Representation Learning
par: Yuan, Jiang, et autres
Publié: (2025)
par: Yuan, Jiang, et autres
Publié: (2025)
EVLM: An Efficient Vision-Language Model for Visual Understanding
par: Chen, Kaibing, et autres
Publié: (2024)
par: Chen, Kaibing, et autres
Publié: (2024)
HPL-ESS: Hybrid Pseudo-Labeling for Unsupervised Event-based Semantic Segmentation
par: Jing, Linglin, et autres
Publié: (2024)
par: Jing, Linglin, et autres
Publié: (2024)
Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models
par: Li, Yueyan, et autres
Publié: (2025)
par: Li, Yueyan, et autres
Publié: (2025)
LiveScene: Language Embedding Interactive Radiance Fields for Physical Scene Rendering and Control
par: Qu, Delin, et autres
Publié: (2024)
par: Qu, Delin, et autres
Publié: (2024)
Vehicle Perception from Satellite
par: Zhao, Bin, et autres
Publié: (2024)
par: Zhao, Bin, et autres
Publié: (2024)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
par: Yang, Jiabing, et autres
Publié: (2025)
par: Yang, Jiabing, et autres
Publié: (2025)
Transferable 3D Adversarial Shape Completion using Diffusion Models
par: Dai, Xuelong, et autres
Publié: (2024)
par: Dai, Xuelong, et autres
Publié: (2024)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
par: Ma, Jingtian, et autres
Publié: (2025)
par: Ma, Jingtian, et autres
Publié: (2025)
Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities
par: Xia, Shiyu, et autres
Publié: (2024)
par: Xia, Shiyu, et autres
Publié: (2024)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function
par: Zhuang, Chenyi, et autres
Publié: (2024)
par: Zhuang, Chenyi, et autres
Publié: (2024)
Improving Transferable Targeted Attacks with Feature Tuning Mixup
par: Liang, Kaisheng, et autres
Publié: (2024)
par: Liang, Kaisheng, et autres
Publié: (2024)
Enhance Vision-Language Alignment with Noise
par: Huang, Sida, et autres
Publié: (2024)
par: Huang, Sida, et autres
Publié: (2024)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
par: Hong, Wenyi, et autres
Publié: (2025)
par: Hong, Wenyi, et autres
Publié: (2025)
Class-Aware Prototype Learning with Negative Contrast for Test-Time Adaptation of Vision-Language Models
par: Qiao, Xiaozhen, et autres
Publié: (2025)
par: Qiao, Xiaozhen, et autres
Publié: (2025)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
par: Yang, Ganlin, et autres
Publié: (2025)
par: Yang, Ganlin, et autres
Publié: (2025)
One Language-Free Foundation Model Is Enough for Universal Vision Anomaly Detection
par: Gao, Bin-Bin, et autres
Publié: (2026)
par: Gao, Bin-Bin, et autres
Publié: (2026)
Documents similaires
-
Night-to-Day Translation via Illumination Degradation Disentanglement
par: Lan, Guanzhou, et autres
Publié: (2024) -
Efficient Diffusion as Low Light Enhancer
par: Lan, Guanzhou, et autres
Publié: (2024) -
Open-Vocabulary Octree-Graph for 3D Scene Understanding
par: Wang, Zhigang, et autres
Publié: (2024) -
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
par: Zhang, Da, et autres
Publié: (2025) -
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
par: Zhang, Pingrui, et autres
Publié: (2025)