DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Zehong, Wei, Longhui, Wang, Shuai, Zhang, Shiliang, Tian, Qi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PixelGen: Improving Pixel Diffusion with Perceptual Supervision
par: Ma, Zehong, et autres
Publié: (2026)
par: Ma, Zehong, et autres
Publié: (2026)
Efficient Multi-modal Long Context Learning for Training-free Adaptation
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
OVMR: Open-Vocabulary Recognition with Multi-Modal References
par: Ma, Zehong, et autres
Publié: (2024)
par: Ma, Zehong, et autres
Publié: (2024)
MagCache: Fast Video Generation with Magnitude-Aware Cache
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
End-to-End Optimized Image Compression with the Frequency-Oriented Transform
par: Zhang, Yuefeng, et autres
Publié: (2024)
par: Zhang, Yuefeng, et autres
Publié: (2024)
DDT: Decoupled Diffusion Transformer
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
DeCo: Decoupled Human-Centered Diffusion Video Editing with Motion Consistency
par: Zhong, Xiaojing, et autres
Publié: (2024)
par: Zhong, Xiaojing, et autres
Publié: (2024)
Fose: Fusion of One-Step Diffusion and End-to-End Network for Pansharpening
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation
par: Zhang, Mengchen, et autres
Publié: (2025)
par: Zhang, Mengchen, et autres
Publié: (2025)
AlphaVAE: Unified End-to-End RGBA Image Reconstruction and Generation with Alpha-Aware Representation Learning
par: Wang, Zile, et autres
Publié: (2025)
par: Wang, Zile, et autres
Publié: (2025)
Enhanced Safety in Autonomous Driving: Integrating Latent State Diffusion Model for End-to-End Navigation
par: Chu, Detian, et autres
Publié: (2024)
par: Chu, Detian, et autres
Publié: (2024)
PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving
par: Wozniak, Maciej K., et autres
Publié: (2025)
par: Wozniak, Maciej K., et autres
Publié: (2025)
End-to-End Multi-Modal Diffusion Mamba
par: Lu, Chunhao, et autres
Publié: (2025)
par: Lu, Chunhao, et autres
Publié: (2025)
ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts
par: Zhang, Yaping, et autres
Publié: (2026)
par: Zhang, Yaping, et autres
Publié: (2026)
End-to-End Human Instance Matting
par: Liu, Qinglin, et autres
Publié: (2024)
par: Liu, Qinglin, et autres
Publié: (2024)
EA-RAS: Towards Efficient and Accurate End-to-End Reconstruction of Anatomical Skeleton
par: Peng, Zhiheng, et autres
Publié: (2024)
par: Peng, Zhiheng, et autres
Publié: (2024)
DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection
par: Wang, Siheng, et autres
Publié: (2026)
par: Wang, Siheng, et autres
Publié: (2026)
Training Multi-Image Vision Agents via End2End Reinforcement Learning
par: Dong, Chengqi, et autres
Publié: (2025)
par: Dong, Chengqi, et autres
Publié: (2025)
An End-to-End Deep Learning Generative Framework for Refinable Shape Matching and Generation
par: Kalaie, Soodeh, et autres
Publié: (2024)
par: Kalaie, Soodeh, et autres
Publié: (2024)
DiffuseRAW: End-to-End Generative RAW Image Processing for Low-Light Images
par: Dagli, Rishit
Publié: (2023)
par: Dagli, Rishit
Publié: (2023)
USAD: End-to-End Human Activity Recognition via Diffusion Model with Spatiotemporal Attention
par: Xiao, Hang, et autres
Publié: (2025)
par: Xiao, Hang, et autres
Publié: (2025)
No Image, No Problem: End-to-End Multi-Task Cardiac Analysis from Undersampled k-Space
par: Zhang, Yundi, et autres
Publié: (2026)
par: Zhang, Yundi, et autres
Publié: (2026)
ParkingScenes: A Structured Dataset for End-to-End Autonomous Parking in Simulation Scenes
par: Chen, Haonan, et autres
Publié: (2026)
par: Chen, Haonan, et autres
Publié: (2026)
DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor
par: Zhao, Yan, et autres
Publié: (2025)
par: Zhao, Yan, et autres
Publié: (2025)
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
par: Shao, Hao, et autres
Publié: (2026)
par: Shao, Hao, et autres
Publié: (2026)
Vision without Images: End-to-End Computer Vision from Single Compressive Measurements
par: Pan, Fengpu, et autres
Publié: (2025)
par: Pan, Fengpu, et autres
Publié: (2025)
A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos
par: He, Allen, et autres
Publié: (2026)
par: He, Allen, et autres
Publié: (2026)
Spatially Visual Perception for End-to-End Robotic Learning
par: Davies, Travis, et autres
Publié: (2024)
par: Davies, Travis, et autres
Publié: (2024)
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
par: Chen, Yi, et autres
Publié: (2026)
par: Chen, Yi, et autres
Publié: (2026)
Spatial-Aware Latent Initialization for Controllable Image Generation
par: Sun, Wenqiang, et autres
Publié: (2024)
par: Sun, Wenqiang, et autres
Publié: (2024)
Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
par: Jiang, Hao, et autres
Publié: (2025)
par: Jiang, Hao, et autres
Publié: (2025)
An End-to-End Deep Learning Framework for Arsenicosis Diagnosis Using Mobile-Captured Skin Images
par: Newaz, Asif, et autres
Publié: (2025)
par: Newaz, Asif, et autres
Publié: (2025)
Beyond Adapting SAM: Towards End-to-End Ultrasound Image Segmentation via Auto Prompting
par: Lin, Xian, et autres
Publié: (2023)
par: Lin, Xian, et autres
Publié: (2023)
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
par: Yao, Linli, et autres
Publié: (2024)
par: Yao, Linli, et autres
Publié: (2024)
Multi-granularity Contrastive Cross-modal Collaborative Generation for End-to-End Long-term Video Question Answering
par: Yu, Ting, et autres
Publié: (2024)
par: Yu, Ting, et autres
Publié: (2024)
Guiding Attention in End-to-End Driving Models
par: Porres, Diego, et autres
Publié: (2024)
par: Porres, Diego, et autres
Publié: (2024)
STORM: End-to-End Referring Multi-Object Tracking in Videos
par: Lu, Zijia, et autres
Publié: (2026)
par: Lu, Zijia, et autres
Publié: (2026)
Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
Enhancing Frequency Forgery Clues for Diffusion-Generated Image Detection
par: Zhang, Daichi, et autres
Publié: (2025)
par: Zhang, Daichi, et autres
Publié: (2025)
JointRF: End-to-End Joint Optimization for Dynamic Neural Radiance Field Representation and Compression
par: Zheng, Zihan, et autres
Publié: (2024)
par: Zheng, Zihan, et autres
Publié: (2024)
Documents similaires
-
PixelGen: Improving Pixel Diffusion with Perceptual Supervision
par: Ma, Zehong, et autres
Publié: (2026) -
Efficient Multi-modal Long Context Learning for Training-free Adaptation
par: Ma, Zehong, et autres
Publié: (2025) -
OVMR: Open-Vocabulary Recognition with Multi-Modal References
par: Ma, Zehong, et autres
Publié: (2024) -
MagCache: Fast Video Generation with Magnitude-Aware Cache
par: Ma, Zehong, et autres
Publié: (2025) -
End-to-End Optimized Image Compression with the Frequency-Oriented Transform
par: Zhang, Yuefeng, et autres
Publié: (2024)