Enregistré dans:
| Auteurs principaux: | Tai, Yan, Zhu, Luhao, Ding, Yunan, Dong, Yiying, Zhai, Guangtao, Liu, Xiaohong, Guo, Guodong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2503.07413 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Face2QR: A Unified Framework for Aesthetic, Face-Preserving, and Scannable QR Code Generation
par: Cui, Xuehao, et autres
Publié: (2024)
par: Cui, Xuehao, et autres
Publié: (2024)
CMC-Bench: Towards a New Paradigm of Visual Signal Compression
par: Li, Chunyi, et autres
Publié: (2024)
par: Li, Chunyi, et autres
Publié: (2024)
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
par: Liu, Xiaohong, et autres
Publié: (2025)
par: Liu, Xiaohong, et autres
Publié: (2025)
Samba+: General and Accurate Salient Object Detection via A More Unified Mamba-based Framework
par: Zhao, Wenzhuo, et autres
Publié: (2026)
par: Zhao, Wenzhuo, et autres
Publié: (2026)
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024)
par: Tian, Yuan, et autres
Publié: (2024)
FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal
par: Xu, Telang, et autres
Publié: (2026)
par: Xu, Telang, et autres
Publié: (2026)
A$^2$-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks
par: Zheng, Huayu, et autres
Publié: (2026)
par: Zheng, Huayu, et autres
Publié: (2026)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
par: Zhang, Yiming, et autres
Publié: (2025)
par: Zhang, Yiming, et autres
Publié: (2025)
Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
par: Zhang, Kaiwei, et autres
Publié: (2025)
par: Zhang, Kaiwei, et autres
Publié: (2025)
Low-Light Image Enhancement via Generative Perceptual Priors
par: Zhou, Han, et autres
Publié: (2024)
par: Zhou, Han, et autres
Publié: (2024)
DehazeDCT: Towards Effective Non-Homogeneous Dehazing via Deformable Convolutional Transformer
par: Dong, Wei, et autres
Publié: (2024)
par: Dong, Wei, et autres
Publié: (2024)
Text2QR: Harmonizing Aesthetic Customization and Scanning Robustness for Text-Guided QR Code Generation
par: Wu, Guangyang, et autres
Publié: (2024)
par: Wu, Guangyang, et autres
Publié: (2024)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
MoGen: A Unified Collaborative Framework for Controllable Multi-Object Image Generation
par: Li, Yanfeng, et autres
Publié: (2026)
par: Li, Yanfeng, et autres
Publié: (2026)
GLARE: Low Light Image Enhancement via Generative Latent Feature based Codebook Retrieval
par: Zhou, Han, et autres
Publié: (2024)
par: Zhou, Han, et autres
Publié: (2024)
ShadowRefiner: Towards Mask-free Shadow Removal via Fast Fourier Transformer
par: Dong, Wei, et autres
Publié: (2024)
par: Dong, Wei, et autres
Publié: (2024)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
par: Xu, Runsen, et autres
Publié: (2024)
par: Xu, Runsen, et autres
Publié: (2024)
When No-Reference Image Quality Models Meet MAP Estimation in Diffusion Latents
par: Zhang, Weixia, et autres
Publié: (2024)
par: Zhang, Weixia, et autres
Publié: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
par: Sun, Yinan, et autres
Publié: (2024)
par: Sun, Yinan, et autres
Publié: (2024)
Enhancing Test Time Adaptation with Few-shot Guidance
par: Luo, Siqi, et autres
Publié: (2024)
par: Luo, Siqi, et autres
Publié: (2024)
Towards Open-ended Visual Quality Comparison
par: Wu, Haoning, et autres
Publié: (2024)
par: Wu, Haoning, et autres
Publié: (2024)
Zero-Reference Joint Low-Light Enhancement and Deblurring via Visual Autoregressive Modeling with VLM-Derived Modulation
par: Dong, Wei, et autres
Publié: (2025)
par: Dong, Wei, et autres
Publié: (2025)
UniProcessor: A Text-induced Unified Low-level Image Processor
par: Duan, Huiyu, et autres
Publié: (2024)
par: Duan, Huiyu, et autres
Publié: (2024)
Resolution-Agnostic Neural Compression for High-Fidelity Portrait Video Conferencing via Implicit Radiance Fields
par: Li, Yifei, et autres
Publié: (2024)
par: Li, Yifei, et autres
Publié: (2024)
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
par: Song, Xiufeng, et autres
Publié: (2024)
par: Song, Xiufeng, et autres
Publié: (2024)
CogVLM: Visual Expert for Pretrained Language Models
par: Wang, Weihan, et autres
Publié: (2023)
par: Wang, Weihan, et autres
Publié: (2023)
A2BFR: Attribute-Aware Blind Face Restoration
par: Zhu, Chenxin, et autres
Publié: (2026)
par: Zhu, Chenxin, et autres
Publié: (2026)
How Does Audio Influence Visual Attention in Omnidirectional Videos? Database and Model
par: Zhu, Yuxin, et autres
Publié: (2024)
par: Zhu, Yuxin, et autres
Publié: (2024)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
par: Hu, Junshan, et autres
Publié: (2025)
par: Hu, Junshan, et autres
Publié: (2025)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
par: Li, Zhang, et autres
Publié: (2025)
par: Li, Zhang, et autres
Publié: (2025)
Learning Hazing to Dehazing: Towards Realistic Haze Generation for Real-World Image Dehazing
par: Wang, Ruiyi, et autres
Publié: (2025)
par: Wang, Ruiyi, et autres
Publié: (2025)
HazeCLIP: Towards Language Guided Real-World Image Dehazing
par: Wang, Ruiyi, et autres
Publié: (2024)
par: Wang, Ruiyi, et autres
Publié: (2024)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
par: Fu, Kang, et autres
Publié: (2025)
par: Fu, Kang, et autres
Publié: (2025)
AttentionLut: Attention Fusion-based Canonical Polyadic LUT for Real-time Image Enhancement
par: Fu, Kang, et autres
Publié: (2024)
par: Fu, Kang, et autres
Publié: (2024)
TR-PTS: Task-Relevant Parameter and Token Selection for Efficient Tuning
par: Luo, Siqi, et autres
Publié: (2025)
par: Luo, Siqi, et autres
Publié: (2025)
Preference-Guided Debiasing for No-Reference Enhancement Image Quality Assessment
par: Gao, Shiqi, et autres
Publié: (2026)
par: Gao, Shiqi, et autres
Publié: (2026)
LayerT2V: A Unified Multi-Layer Video Generation Framework
par: Li, Guangzhao, et autres
Publié: (2025)
par: Li, Guangzhao, et autres
Publié: (2025)
PVRF: All-in-one Adverse Weather Removal via Prior-modulated and Velocity-constrained Rectified Flow
par: Dong, Wei, et autres
Publié: (2026)
par: Dong, Wei, et autres
Publié: (2026)
Light-VQA+: A Video Quality Assessment Model for Exposure Correction with Vision-Language Guidance
par: Zhou, Xunchu, et autres
Publié: (2024)
par: Zhou, Xunchu, et autres
Publié: (2024)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
par: Huang, Zhipeng, et autres
Publié: (2024)
par: Huang, Zhipeng, et autres
Publié: (2024)
Documents similaires
-
Face2QR: A Unified Framework for Aesthetic, Face-Preserving, and Scannable QR Code Generation
par: Cui, Xuehao, et autres
Publié: (2024) -
CMC-Bench: Towards a New Paradigm of Visual Signal Compression
par: Li, Chunyi, et autres
Publié: (2024) -
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
par: Liu, Xiaohong, et autres
Publié: (2025) -
Samba+: General and Accurate Salient Object Detection via A More Unified Mamba-based Framework
par: Zhao, Wenzhuo, et autres
Publié: (2026) -
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024)