Neural Residual Diffusion Models for Deep Scalable Vision Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Zhiyuan, Zhao, Liangliang, Qi, Biqing, Zhou, Bowen |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
by: Cheng, Shuang, et al.
Published: (2025)
by: Cheng, Shuang, et al.
Published: (2025)
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
by: Ma, Zhiyuan, et al.
Published: (2024)
by: Ma, Zhiyuan, et al.
Published: (2024)
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
by: Qi, Biqing, et al.
Published: (2024)
by: Qi, Biqing, et al.
Published: (2024)
MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling
by: Zhang, Bowen, et al.
Published: (2024)
by: Zhang, Bowen, et al.
Published: (2024)
DH-VTON: Deep Text-Driven Virtual Try-On via Hybrid Attention Learning
by: Wei, Jiabao, et al.
Published: (2024)
by: Wei, Jiabao, et al.
Published: (2024)
ResNet: Enabling Deep Convolutional Neural Networks through Residual Learning
by: Liu, Xingyu, et al.
Published: (2025)
by: Liu, Xingyu, et al.
Published: (2025)
Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance
by: Chen, Xinrong, et al.
Published: (2026)
by: Chen, Xinrong, et al.
Published: (2026)
DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks
by: Zhou, Haokun, et al.
Published: (2024)
by: Zhou, Haokun, et al.
Published: (2024)
DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer
by: Ma, Zhiyuan, et al.
Published: (2024)
by: Ma, Zhiyuan, et al.
Published: (2024)
SDUM: A Scalable Deep Unrolled Model for Universal MRI Reconstruction
by: Wang, Puyang, et al.
Published: (2025)
by: Wang, Puyang, et al.
Published: (2025)
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
by: Yang, Zhiyuan, et al.
Published: (2026)
by: Yang, Zhiyuan, et al.
Published: (2026)
YOLO-pdd: A Novel Multi-scale PCB Defect Detection Method Using Deep Representations with Sequential Images
by: Liu, Bowen, et al.
Published: (2024)
by: Liu, Bowen, et al.
Published: (2024)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
by: Zheng, Anlin, et al.
Published: (2025)
by: Zheng, Anlin, et al.
Published: (2025)
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
by: Zheng, Guanghao, et al.
Published: (2025)
by: Zheng, Guanghao, et al.
Published: (2025)
Physics-Guided Motion Loss for Video Generation Model
by: Xue, Bowen, et al.
Published: (2025)
by: Xue, Bowen, et al.
Published: (2025)
Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play
by: Wang, Qinsi, et al.
Published: (2025)
by: Wang, Qinsi, et al.
Published: (2025)
Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models
by: Korkmaz, Cansu, et al.
Published: (2025)
by: Korkmaz, Cansu, et al.
Published: (2025)
Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation
by: Si, Qi, et al.
Published: (2025)
by: Si, Qi, et al.
Published: (2025)
Sat2Flow: A Structure-Aware Diffusion Framework for Human Flow Generation from Satellite Imagery
by: Wang, Xiangxu, et al.
Published: (2025)
by: Wang, Xiangxu, et al.
Published: (2025)
GVD: Guiding Video Diffusion Model for Scalable Video Distillation
by: Li, Kunyang, et al.
Published: (2025)
by: Li, Kunyang, et al.
Published: (2025)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
by: Dai, Muzhi, et al.
Published: (2025)
by: Dai, Muzhi, et al.
Published: (2025)
DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers
by: Shi, Minglei, et al.
Published: (2025)
by: Shi, Minglei, et al.
Published: (2025)
Resfusion: Denoising Diffusion Probabilistic Models for Image Restoration Based on Prior Residual Noise
by: Shi, Zhenning, et al.
Published: (2023)
by: Shi, Zhenning, et al.
Published: (2023)
Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models
by: Zou, Zhengtao, et al.
Published: (2025)
by: Zou, Zhengtao, et al.
Published: (2025)
ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models
by: Sun, Guoheng, et al.
Published: (2026)
by: Sun, Guoheng, et al.
Published: (2026)
Res-VMamba: Fine-Grained Food Category Visual Classification Using Selective State Space Models with Deep Residual Learning
by: Chen, Chi-Sheng, et al.
Published: (2024)
by: Chen, Chi-Sheng, et al.
Published: (2024)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
by: Mao, Jiawei, et al.
Published: (2025)
by: Mao, Jiawei, et al.
Published: (2025)
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
by: Ma, Zehong, et al.
Published: (2025)
by: Ma, Zehong, et al.
Published: (2025)
Detecting AI-Generated Video via Frame Consistency
by: Ma, Long, et al.
Published: (2024)
by: Ma, Long, et al.
Published: (2024)
Efficient Diffusion Models for Vision: A Survey
by: Ulhaq, Anwaar, et al.
Published: (2022)
by: Ulhaq, Anwaar, et al.
Published: (2022)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
by: Li, Zhiyuan, et al.
Published: (2024)
by: Li, Zhiyuan, et al.
Published: (2024)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
by: Huang, Wenxuan, et al.
Published: (2026)
by: Huang, Wenxuan, et al.
Published: (2026)
FADE: Frequency-Aware Diffusion Model Factorization for Video Editing
by: Zhu, Yixuan, et al.
Published: (2025)
by: Zhu, Yixuan, et al.
Published: (2025)
What's in the Image? A Deep-Dive into the Vision of Vision Language Models
by: Kaduri, Omri, et al.
Published: (2024)
by: Kaduri, Omri, et al.
Published: (2024)
DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention
by: Zhu, Lianghui, et al.
Published: (2024)
by: Zhu, Lianghui, et al.
Published: (2024)
ChangeDiff: A Multi-Temporal Change Detection Data Generator with Flexible Text Prompts via Diffusion Model
by: Zang, Qi, et al.
Published: (2024)
by: Zang, Qi, et al.
Published: (2024)
DMin: Scalable Training Data Influence Estimation for Diffusion Models
by: Lin, Huawei, et al.
Published: (2024)
by: Lin, Huawei, et al.
Published: (2024)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
by: Zhang, Jiaming, et al.
Published: (2025)
by: Zhang, Jiaming, et al.
Published: (2025)
Scalable Analytic Classifiers with Associative Drift Compensation for Class-Incremental Learning of Vision Transformers
by: Rao, Xuan, et al.
Published: (2026)
by: Rao, Xuan, et al.
Published: (2026)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
by: Zhao, Yunhan, et al.
Published: (2025)
by: Zhao, Yunhan, et al.
Published: (2025)
Similar Items
-
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
by: Cheng, Shuang, et al.
Published: (2025) -
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
by: Ma, Zhiyuan, et al.
Published: (2024) -
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
by: Qi, Biqing, et al.
Published: (2024) -
MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling
by: Zhang, Bowen, et al.
Published: (2024) -
DH-VTON: Deep Text-Driven Virtual Try-On via Hybrid Attention Learning
by: Wei, Jiabao, et al.
Published: (2024)