Learning A Low-Level Vision Generalist via Visual Task Prompt
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Xiangyu, Liu, Yihao, Pu, Yuandong, Zhang, Wenlong, Zhou, Jiantao, Qiao, Yu, Dong, Chao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploring Scalable Unified Modeling for General Low-Level Vision
by: Chen, Xiangyu, et al.
Published: (2025)
by: Chen, Xiangyu, et al.
Published: (2025)
A Comparative Study of Image Restoration Networks for General Backbone Network Design
by: Chen, Xiangyu, et al.
Published: (2023)
by: Chen, Xiangyu, et al.
Published: (2023)
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
by: Pu, Yuandong, et al.
Published: (2025)
by: Pu, Yuandong, et al.
Published: (2025)
Unifying Image Processing as Visual Prompting Question Answering
by: Liu, Yihao, et al.
Published: (2023)
by: Liu, Yihao, et al.
Published: (2023)
HAT: Hybrid Attention Transformer for Image Restoration
by: Chen, Xiangyu, et al.
Published: (2023)
by: Chen, Xiangyu, et al.
Published: (2023)
A Preliminary Exploration Towards General Image Restoration
by: Kong, Xiangtao, et al.
Published: (2024)
by: Kong, Xiangtao, et al.
Published: (2024)
UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
by: Cao, Shuo, et al.
Published: (2025)
by: Cao, Shuo, et al.
Published: (2025)
GRIDS: Grouped Multiple-Degradation Restoration with Image Degradation Similarity
by: Cao, Shuo, et al.
Published: (2024)
by: Cao, Shuo, et al.
Published: (2024)
Towards Efficient SDRTV-to-HDRTV by Learning from Image Formation
by: Chen, Xiangyu, et al.
Published: (2023)
by: Chen, Xiangyu, et al.
Published: (2023)
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
by: Bai, Yang, et al.
Published: (2024)
by: Bai, Yang, et al.
Published: (2024)
WeatherGFM: Learning A Weather Generalist Foundation Model via In-context Learning
by: Zhao, Xiangyu, et al.
Published: (2024)
by: Zhao, Xiangyu, et al.
Published: (2024)
SynWeather: Weather Observation Data Synthesis across Multiple Regions and Variables via a General Diffusion Transformer
by: Xu, Kaiyi, et al.
Published: (2025)
by: Xu, Kaiyi, et al.
Published: (2025)
SEAL: A Framework for Systematic Evaluation of Real-World Super-Resolution
by: Zhang, Wenlong, et al.
Published: (2023)
by: Zhang, Wenlong, et al.
Published: (2023)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
by: Wu, Jiannan, et al.
Published: (2024)
by: Wu, Jiannan, et al.
Published: (2024)
DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks
by: Zhao, Canyu, et al.
Published: (2025)
by: Zhao, Canyu, et al.
Published: (2025)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
by: Ren, Sucheng, et al.
Published: (2024)
by: Ren, Sucheng, et al.
Published: (2024)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
by: Hou, Zhi, et al.
Published: (2025)
by: Hou, Zhi, et al.
Published: (2025)
OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning
by: Yang, Zhengwei, et al.
Published: (2026)
by: Yang, Zhengwei, et al.
Published: (2026)
Causality-guided Prompt Learning for Vision-language Models via Visual Granulation
by: Gao, Mengyu, et al.
Published: (2025)
by: Gao, Mengyu, et al.
Published: (2025)
Vision Foundation Models as Generalist Tokenizers for Image Generation
by: Zheng, Anlin, et al.
Published: (2026)
by: Zheng, Anlin, et al.
Published: (2026)
Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios
by: Gao, Yuanting, et al.
Published: (2026)
by: Gao, Yuanting, et al.
Published: (2026)
Vision Graph Prompting via Semantic Low-Rank Decomposition
by: Ai, Zixiang, et al.
Published: (2025)
by: Ai, Zixiang, et al.
Published: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
by: Lei, Zhenxin, et al.
Published: (2025)
by: Lei, Zhenxin, et al.
Published: (2025)
Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
by: Zhu, Kaiwen, et al.
Published: (2026)
by: Zhu, Kaiwen, et al.
Published: (2026)
PECTP: Parameter-Efficient Cross-Task Prompts for Incremental Vision Transformer
by: Feng, Qian, et al.
Published: (2024)
by: Feng, Qian, et al.
Published: (2024)
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
by: Cao, Shuo, et al.
Published: (2025)
by: Cao, Shuo, et al.
Published: (2025)
Masked AutoDecoder is Effective Multi-Task Vision Generalist
by: Qiu, Han, et al.
Published: (2024)
by: Qiu, Han, et al.
Published: (2024)
Toward a Diffusion-Based Generalist for Dense Vision Tasks
by: Fan, Yue, et al.
Published: (2024)
by: Fan, Yue, et al.
Published: (2024)
Factuality Matters: When Image Generation and Editing Meet Structured Visuals
by: Zhuo, Le, et al.
Published: (2025)
by: Zhuo, Le, et al.
Published: (2025)
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
by: Zhu, Yan, et al.
Published: (2025)
by: Zhu, Yan, et al.
Published: (2025)
PICABench: How Far Are We from Physically Realistic Image Editing?
by: Pu, Yuandong, et al.
Published: (2025)
by: Pu, Yuandong, et al.
Published: (2025)
Vision Generalist Model: A Survey
by: Wang, Ziyi, et al.
Published: (2025)
by: Wang, Ziyi, et al.
Published: (2025)
Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation
by: Zhou, Zhiwang, et al.
Published: (2025)
by: Zhou, Zhiwang, et al.
Published: (2025)
Evolution-based Region Adversarial Prompt Learning for Robustness Enhancement in Vision-Language Models
by: Jia, Xiaojun, et al.
Published: (2025)
by: Jia, Xiaojun, et al.
Published: (2025)
IAP: Improving Continual Learning of Vision-Language Models via Instance-Aware Prompting
by: Fu, Hao, et al.
Published: (2025)
by: Fu, Hao, et al.
Published: (2025)
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
by: Liu, Jihao, et al.
Published: (2024)
by: Liu, Jihao, et al.
Published: (2024)
VPTracker: Global Vision-Language Tracking via Visual Prompt
by: Wang, Jingchao, et al.
Published: (2025)
by: Wang, Jingchao, et al.
Published: (2025)
Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization
by: Zhao, Zidong, et al.
Published: (2026)
by: Zhao, Zidong, et al.
Published: (2026)
LM4LV: A Frozen Large Language Model for Low-level Vision Tasks
by: Zheng, Boyang, et al.
Published: (2024)
by: Zheng, Boyang, et al.
Published: (2024)
MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models
by: Xu, Wenbo, et al.
Published: (2026)
by: Xu, Wenbo, et al.
Published: (2026)
Similar Items
-
Exploring Scalable Unified Modeling for General Low-Level Vision
by: Chen, Xiangyu, et al.
Published: (2025) -
A Comparative Study of Image Restoration Networks for General Backbone Network Design
by: Chen, Xiangyu, et al.
Published: (2023) -
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
by: Pu, Yuandong, et al.
Published: (2025) -
Unifying Image Processing as Visual Prompting Question Answering
by: Liu, Yihao, et al.
Published: (2023) -
HAT: Hybrid Attention Transformer for Image Restoration
by: Chen, Xiangyu, et al.
Published: (2023)