Exploring Scalable Unified Modeling for General Low-Level Vision
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Xiangyu, Zhu, Kaiwen, Pu, Yuandong, Cao, Shuo, Li, Xiaohui, Zhang, Wenlong, Liu, Yihao, Qiao, Yu, Zhou, Jiantao, Dong, Chao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning A Low-Level Vision Generalist via Visual Task Prompt
por: Chen, Xiangyu, et al.
Publicado: (2024)
por: Chen, Xiangyu, et al.
Publicado: (2024)
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
por: Pu, Yuandong, et al.
Publicado: (2025)
por: Pu, Yuandong, et al.
Publicado: (2025)
A Comparative Study of Image Restoration Networks for General Backbone Network Design
por: Chen, Xiangyu, et al.
Publicado: (2023)
por: Chen, Xiangyu, et al.
Publicado: (2023)
UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
por: Cao, Shuo, et al.
Publicado: (2025)
por: Cao, Shuo, et al.
Publicado: (2025)
Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
por: Zhu, Kaiwen, et al.
Publicado: (2026)
por: Zhu, Kaiwen, et al.
Publicado: (2026)
GRIDS: Grouped Multiple-Degradation Restoration with Image Degradation Similarity
por: Cao, Shuo, et al.
Publicado: (2024)
por: Cao, Shuo, et al.
Publicado: (2024)
Unifying Image Processing as Visual Prompting Question Answering
por: Liu, Yihao, et al.
Publicado: (2023)
por: Liu, Yihao, et al.
Publicado: (2023)
Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios
por: Gao, Yuanting, et al.
Publicado: (2026)
por: Gao, Yuanting, et al.
Publicado: (2026)
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
por: Cao, Shuo, et al.
Publicado: (2025)
por: Cao, Shuo, et al.
Publicado: (2025)
HAT: Hybrid Attention Transformer for Image Restoration
por: Chen, Xiangyu, et al.
Publicado: (2023)
por: Chen, Xiangyu, et al.
Publicado: (2023)
A Preliminary Exploration Towards General Image Restoration
por: Kong, Xiangtao, et al.
Publicado: (2024)
por: Kong, Xiangtao, et al.
Publicado: (2024)
PICABench: How Far Are We from Physically Realistic Image Editing?
por: Pu, Yuandong, et al.
Publicado: (2025)
por: Pu, Yuandong, et al.
Publicado: (2025)
DualX-VSR: Dual Axial Spatial$\times$Temporal Transformer for Real-World Video Super-Resolution without Motion Compensation
por: Cao, Shuo, et al.
Publicado: (2025)
por: Cao, Shuo, et al.
Publicado: (2025)
Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation
por: Zhou, Zhiwang, et al.
Publicado: (2025)
por: Zhou, Zhiwang, et al.
Publicado: (2025)
SEAL: A Framework for Systematic Evaluation of Real-World Super-Resolution
por: Zhang, Wenlong, et al.
Publicado: (2023)
por: Zhang, Wenlong, et al.
Publicado: (2023)
LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution
por: Li, Xiaohui, et al.
Publicado: (2025)
por: Li, Xiaohui, et al.
Publicado: (2025)
StableI2I: Spotting Unintended Changes in Image-to-Image Transition
por: Li, Jiayang, et al.
Publicado: (2026)
por: Li, Jiayang, et al.
Publicado: (2026)
Revisiting the Generalization Problem of Low-level Vision Models Through the Lens of Image Deraining
por: Hu, Jinfan, et al.
Publicado: (2025)
por: Hu, Jinfan, et al.
Publicado: (2025)
DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations
por: Li, Xiaohui, et al.
Publicado: (2025)
por: Li, Xiaohui, et al.
Publicado: (2025)
Towards Efficient SDRTV-to-HDRTV by Learning from Image Formation
por: Chen, Xiangyu, et al.
Publicado: (2023)
por: Chen, Xiangyu, et al.
Publicado: (2023)
SynWeather: Weather Observation Data Synthesis across Multiple Regions and Variables via a General Diffusion Transformer
por: Xu, Kaiyi, et al.
Publicado: (2025)
por: Xu, Kaiyi, et al.
Publicado: (2025)
UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
An Intelligent Agentic System for Complex Image Restoration Problems
por: Zhu, Kaiwen, et al.
Publicado: (2024)
por: Zhu, Kaiwen, et al.
Publicado: (2024)
MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
por: Wang, Yuandong, et al.
Publicado: (2025)
por: Wang, Yuandong, et al.
Publicado: (2025)
A Unified Perspective on Adversarial Membership Manipulation in Vision Models
por: Gao, Ruize, et al.
Publicado: (2026)
por: Gao, Ruize, et al.
Publicado: (2026)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
por: Chen, Jieneng, et al.
Publicado: (2024)
por: Chen, Jieneng, et al.
Publicado: (2024)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
por: Li, Teng, et al.
Publicado: (2025)
por: Li, Teng, et al.
Publicado: (2025)
GRN+: A Simplified Generative Reinforcement Network for Tissue Layer Analysis in 3D Ultrasound Images for Chronic Low-back Pain
por: Zeng, Zixue, et al.
Publicado: (2025)
por: Zeng, Zixue, et al.
Publicado: (2025)
Rethinking Low-Rank Adaptation in Vision: Exploring Head-Level Responsiveness across Diverse Tasks
por: Zhong, Yibo, et al.
Publicado: (2024)
por: Zhong, Yibo, et al.
Publicado: (2024)
L4P: Towards Unified Low-Level 4D Vision Perception
por: Badki, Abhishek, et al.
Publicado: (2025)
por: Badki, Abhishek, et al.
Publicado: (2025)
Exploring Position Encoding in Diffusion U-Net for Training-free High-resolution Image Generation
por: Zhou, Feng, et al.
Publicado: (2025)
por: Zhou, Feng, et al.
Publicado: (2025)
Factuality Matters: When Image Generation and Editing Meet Structured Visuals
por: Zhuo, Le, et al.
Publicado: (2025)
por: Zhuo, Le, et al.
Publicado: (2025)
Dissecting Bit-Level Scaling Laws in Quantizing Vision Generative Models
por: Ding, Xin, et al.
Publicado: (2025)
por: Ding, Xin, et al.
Publicado: (2025)
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
por: Zhao, Min, et al.
Publicado: (2026)
por: Zhao, Min, et al.
Publicado: (2026)
MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models
por: Xu, Wenbo, et al.
Publicado: (2026)
por: Xu, Wenbo, et al.
Publicado: (2026)
Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models
por: Yang, Fan, et al.
Publicado: (2025)
por: Yang, Fan, et al.
Publicado: (2025)
FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder
por: Dong, Zeyu, et al.
Publicado: (2026)
por: Dong, Zeyu, et al.
Publicado: (2026)
UNIT: Unifying Image and Text Recognition in One Vision Encoder
por: Zhu, Yi, et al.
Publicado: (2024)
por: Zhu, Yi, et al.
Publicado: (2024)
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
por: Liu, Lu, et al.
Publicado: (2026)
por: Liu, Lu, et al.
Publicado: (2026)
Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation
por: Ye, Chongjie, et al.
Publicado: (2026)
por: Ye, Chongjie, et al.
Publicado: (2026)
Ejemplares similares
-
Learning A Low-Level Vision Generalist via Visual Task Prompt
por: Chen, Xiangyu, et al.
Publicado: (2024) -
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
por: Pu, Yuandong, et al.
Publicado: (2025) -
A Comparative Study of Image Restoration Networks for General Backbone Network Design
por: Chen, Xiangyu, et al.
Publicado: (2023) -
UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
por: Cao, Shuo, et al.
Publicado: (2025) -
Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
por: Zhu, Kaiwen, et al.
Publicado: (2026)