Learning A Low-Level Vision Generalist via Visual Task Prompt
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Xiangyu, Liu, Yihao, Pu, Yuandong, Zhang, Wenlong, Zhou, Jiantao, Qiao, Yu, Dong, Chao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Exploring Scalable Unified Modeling for General Low-Level Vision
von: Chen, Xiangyu, et al.
Veröffentlicht: (2025)
von: Chen, Xiangyu, et al.
Veröffentlicht: (2025)
A Comparative Study of Image Restoration Networks for General Backbone Network Design
von: Chen, Xiangyu, et al.
Veröffentlicht: (2023)
von: Chen, Xiangyu, et al.
Veröffentlicht: (2023)
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
von: Pu, Yuandong, et al.
Veröffentlicht: (2025)
von: Pu, Yuandong, et al.
Veröffentlicht: (2025)
Unifying Image Processing as Visual Prompting Question Answering
von: Liu, Yihao, et al.
Veröffentlicht: (2023)
von: Liu, Yihao, et al.
Veröffentlicht: (2023)
HAT: Hybrid Attention Transformer for Image Restoration
von: Chen, Xiangyu, et al.
Veröffentlicht: (2023)
von: Chen, Xiangyu, et al.
Veröffentlicht: (2023)
A Preliminary Exploration Towards General Image Restoration
von: Kong, Xiangtao, et al.
Veröffentlicht: (2024)
von: Kong, Xiangtao, et al.
Veröffentlicht: (2024)
UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
von: Cao, Shuo, et al.
Veröffentlicht: (2025)
von: Cao, Shuo, et al.
Veröffentlicht: (2025)
GRIDS: Grouped Multiple-Degradation Restoration with Image Degradation Similarity
von: Cao, Shuo, et al.
Veröffentlicht: (2024)
von: Cao, Shuo, et al.
Veröffentlicht: (2024)
Towards Efficient SDRTV-to-HDRTV by Learning from Image Formation
von: Chen, Xiangyu, et al.
Veröffentlicht: (2023)
von: Chen, Xiangyu, et al.
Veröffentlicht: (2023)
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
von: Bai, Yang, et al.
Veröffentlicht: (2024)
von: Bai, Yang, et al.
Veröffentlicht: (2024)
WeatherGFM: Learning A Weather Generalist Foundation Model via In-context Learning
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2024)
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2024)
SynWeather: Weather Observation Data Synthesis across Multiple Regions and Variables via a General Diffusion Transformer
von: Xu, Kaiyi, et al.
Veröffentlicht: (2025)
von: Xu, Kaiyi, et al.
Veröffentlicht: (2025)
SEAL: A Framework for Systematic Evaluation of Real-World Super-Resolution
von: Zhang, Wenlong, et al.
Veröffentlicht: (2023)
von: Zhang, Wenlong, et al.
Veröffentlicht: (2023)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
von: Wu, Jiannan, et al.
Veröffentlicht: (2024)
von: Wu, Jiannan, et al.
Veröffentlicht: (2024)
DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks
von: Zhao, Canyu, et al.
Veröffentlicht: (2025)
von: Zhao, Canyu, et al.
Veröffentlicht: (2025)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
von: Hou, Zhi, et al.
Veröffentlicht: (2025)
von: Hou, Zhi, et al.
Veröffentlicht: (2025)
OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning
von: Yang, Zhengwei, et al.
Veröffentlicht: (2026)
von: Yang, Zhengwei, et al.
Veröffentlicht: (2026)
Causality-guided Prompt Learning for Vision-language Models via Visual Granulation
von: Gao, Mengyu, et al.
Veröffentlicht: (2025)
von: Gao, Mengyu, et al.
Veröffentlicht: (2025)
Vision Foundation Models as Generalist Tokenizers for Image Generation
von: Zheng, Anlin, et al.
Veröffentlicht: (2026)
von: Zheng, Anlin, et al.
Veröffentlicht: (2026)
Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios
von: Gao, Yuanting, et al.
Veröffentlicht: (2026)
von: Gao, Yuanting, et al.
Veröffentlicht: (2026)
Vision Graph Prompting via Semantic Low-Rank Decomposition
von: Ai, Zixiang, et al.
Veröffentlicht: (2025)
von: Ai, Zixiang, et al.
Veröffentlicht: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
von: Lei, Zhenxin, et al.
Veröffentlicht: (2025)
von: Lei, Zhenxin, et al.
Veröffentlicht: (2025)
Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
von: Zhu, Kaiwen, et al.
Veröffentlicht: (2026)
von: Zhu, Kaiwen, et al.
Veröffentlicht: (2026)
PECTP: Parameter-Efficient Cross-Task Prompts for Incremental Vision Transformer
von: Feng, Qian, et al.
Veröffentlicht: (2024)
von: Feng, Qian, et al.
Veröffentlicht: (2024)
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
von: Cao, Shuo, et al.
Veröffentlicht: (2025)
von: Cao, Shuo, et al.
Veröffentlicht: (2025)
Masked AutoDecoder is Effective Multi-Task Vision Generalist
von: Qiu, Han, et al.
Veröffentlicht: (2024)
von: Qiu, Han, et al.
Veröffentlicht: (2024)
Toward a Diffusion-Based Generalist for Dense Vision Tasks
von: Fan, Yue, et al.
Veröffentlicht: (2024)
von: Fan, Yue, et al.
Veröffentlicht: (2024)
Factuality Matters: When Image Generation and Editing Meet Structured Visuals
von: Zhuo, Le, et al.
Veröffentlicht: (2025)
von: Zhuo, Le, et al.
Veröffentlicht: (2025)
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
von: Zhu, Yan, et al.
Veröffentlicht: (2025)
von: Zhu, Yan, et al.
Veröffentlicht: (2025)
PICABench: How Far Are We from Physically Realistic Image Editing?
von: Pu, Yuandong, et al.
Veröffentlicht: (2025)
von: Pu, Yuandong, et al.
Veröffentlicht: (2025)
Vision Generalist Model: A Survey
von: Wang, Ziyi, et al.
Veröffentlicht: (2025)
von: Wang, Ziyi, et al.
Veröffentlicht: (2025)
Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation
von: Zhou, Zhiwang, et al.
Veröffentlicht: (2025)
von: Zhou, Zhiwang, et al.
Veröffentlicht: (2025)
Evolution-based Region Adversarial Prompt Learning for Robustness Enhancement in Vision-Language Models
von: Jia, Xiaojun, et al.
Veröffentlicht: (2025)
von: Jia, Xiaojun, et al.
Veröffentlicht: (2025)
IAP: Improving Continual Learning of Vision-Language Models via Instance-Aware Prompting
von: Fu, Hao, et al.
Veröffentlicht: (2025)
von: Fu, Hao, et al.
Veröffentlicht: (2025)
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
VPTracker: Global Vision-Language Tracking via Visual Prompt
von: Wang, Jingchao, et al.
Veröffentlicht: (2025)
von: Wang, Jingchao, et al.
Veröffentlicht: (2025)
Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization
von: Zhao, Zidong, et al.
Veröffentlicht: (2026)
von: Zhao, Zidong, et al.
Veröffentlicht: (2026)
LM4LV: A Frozen Large Language Model for Low-level Vision Tasks
von: Zheng, Boyang, et al.
Veröffentlicht: (2024)
von: Zheng, Boyang, et al.
Veröffentlicht: (2024)
MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models
von: Xu, Wenbo, et al.
Veröffentlicht: (2026)
von: Xu, Wenbo, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Exploring Scalable Unified Modeling for General Low-Level Vision
von: Chen, Xiangyu, et al.
Veröffentlicht: (2025) -
A Comparative Study of Image Restoration Networks for General Backbone Network Design
von: Chen, Xiangyu, et al.
Veröffentlicht: (2023) -
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
von: Pu, Yuandong, et al.
Veröffentlicht: (2025) -
Unifying Image Processing as Visual Prompting Question Answering
von: Liu, Yihao, et al.
Veröffentlicht: (2023) -
HAT: Hybrid Attention Transformer for Image Restoration
von: Chen, Xiangyu, et al.
Veröffentlicht: (2023)