Visual Generation Without Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Huayu, Jiang, Kai, Zheng, Kaiwen, Chen, Jianfei, Su, Hang, Zhu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiffusionNFT: Online Diffusion Reinforcement with Forward Process
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
Toward Guidance-Free AR Visual Generation via Condition Contrastive Alignment
di: Chen, Huayu, et al.
Pubblicazione: (2024)
di: Chen, Huayu, et al.
Pubblicazione: (2024)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
SLA2: Sparse-Linear Attention with Learnable Routing and QAT
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
FrameBridge: Improving Image-to-Video Generation with Bridge Models
di: Wang, Yuji, et al.
Pubblicazione: (2024)
di: Wang, Yuji, et al.
Pubblicazione: (2024)
Oscillation-Reduced MXFP4 Training for Vision Transformers
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
RCR-AF: Enhancing Model Generalization via Rademacher Complexity Reduction Activation Function
di: Yu, Yunrui, et al.
Pubblicazione: (2025)
di: Yu, Yunrui, et al.
Pubblicazione: (2025)
Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
di: Liu, Songming, et al.
Pubblicazione: (2024)
di: Liu, Songming, et al.
Pubblicazione: (2024)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
REG: Rectified Gradient Guidance for Conditional Diffusion Models
di: Gao, Zhengqi, et al.
Pubblicazione: (2025)
di: Gao, Zhengqi, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Continual Learning: Theory, Method and Application
di: Wang, Liyuan, et al.
Pubblicazione: (2023)
di: Wang, Liyuan, et al.
Pubblicazione: (2023)
Theoretical Analysis of Relative Errors in Gradient Computations for Adversarial Attacks with CE Loss
di: Yu, Yunrui, et al.
Pubblicazione: (2025)
di: Yu, Yunrui, et al.
Pubblicazione: (2025)
RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization
di: Liu, Songming, et al.
Pubblicazione: (2026)
di: Liu, Songming, et al.
Pubblicazione: (2026)
Elucidating the Preconditioning in Consistency Distillation
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
Consistency Diffusion Bridge Models
di: He, Guande, et al.
Pubblicazione: (2024)
di: He, Guande, et al.
Pubblicazione: (2024)
Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding
di: Du, Zilin, et al.
Pubblicazione: (2024)
di: Du, Zilin, et al.
Pubblicazione: (2024)
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
SpectralAR: Spectral Autoregressive Visual Generation
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
HiFA: High-fidelity Text-to-3D Generation with Advanced Diffusion Guidance
di: Zhu, Junzhe, et al.
Pubblicazione: (2023)
di: Zhu, Junzhe, et al.
Pubblicazione: (2023)
Focus On What Matters: Separated Models For Visual-Based RL Generalization
di: Zhang, Di, et al.
Pubblicazione: (2024)
di: Zhang, Di, et al.
Pubblicazione: (2024)
EP-CFG: Energy-Preserving Classifier-Free Guidance
di: Zhang, Kai, et al.
Pubblicazione: (2024)
di: Zhang, Kai, et al.
Pubblicazione: (2024)
Diffusion Models without Classifier-free Guidance
di: Tang, Zhicong, et al.
Pubblicazione: (2025)
di: Tang, Zhicong, et al.
Pubblicazione: (2025)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
CGFformer: Cluster-Guidance Frequency Transformer for Pansharpening
di: Zhou, Zijian, et al.
Pubblicazione: (2026)
di: Zhou, Zijian, et al.
Pubblicazione: (2026)
Statistically Significant Concept-based Explanation of Image Classifiers via Model Knockoffs
di: Xu, Kaiwen, et al.
Pubblicazione: (2023)
di: Xu, Kaiwen, et al.
Pubblicazione: (2023)
Next Visual Granularity Generation
di: Wang, Yikai, et al.
Pubblicazione: (2025)
di: Wang, Yikai, et al.
Pubblicazione: (2025)
ChangeAnywhere: Sample Generation for Remote Sensing Change Detection via Semantic Latent Diffusion Model
di: Tang, Kai, et al.
Pubblicazione: (2024)
di: Tang, Kai, et al.
Pubblicazione: (2024)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
di: Tang, Haotian, et al.
Pubblicazione: (2024)
di: Tang, Haotian, et al.
Pubblicazione: (2024)
UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
di: Kang, Wonjun, et al.
Pubblicazione: (2025)
di: Kang, Wonjun, et al.
Pubblicazione: (2025)
ReGuidance: A Simple Diffusion Wrapper for Boosting Sample Quality on Hard Inverse Problems
di: Karan, Aayush, et al.
Pubblicazione: (2025)
di: Karan, Aayush, et al.
Pubblicazione: (2025)
SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
Jodi: Unification of Visual Generation and Understanding via Joint Modeling
di: Xu, Yifeng, et al.
Pubblicazione: (2025)
di: Xu, Yifeng, et al.
Pubblicazione: (2025)
Boost-and-Skip: A Simple Guidance-Free Diffusion for Minority Generation
di: Um, Soobin, et al.
Pubblicazione: (2025)
di: Um, Soobin, et al.
Pubblicazione: (2025)
Improving Geo-diversity of Generated Images with Contextualized Vendi Score Guidance
di: Hemmat, Reyhane Askari, et al.
Pubblicazione: (2024)
di: Hemmat, Reyhane Askari, et al.
Pubblicazione: (2024)
DiG-IN: Diffusion Guidance for Investigating Networks -- Uncovering Classifier Differences Neuron Visualisations and Visual Counterfactual Explanations
di: Augustin, Maximilian, et al.
Pubblicazione: (2023)
di: Augustin, Maximilian, et al.
Pubblicazione: (2023)
Integrating Frequency Guidance into Multi-source Domain Generalization for Bearing Fault Diagnosis
di: Tu, Xiaotong, et al.
Pubblicazione: (2025)
di: Tu, Xiaotong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DiffusionNFT: Online Diffusion Reinforcement with Forward Process
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025) -
Toward Guidance-Free AR Visual Generation via Condition Contrastive Alignment
di: Chen, Huayu, et al.
Pubblicazione: (2024) -
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
di: Zhang, Jintao, et al.
Pubblicazione: (2025) -
SLA2: Sparse-Linear Attention with Learnable Routing and QAT
di: Zhang, Jintao, et al.
Pubblicazione: (2026) -
FrameBridge: Improving Image-to-Video Generation with Bridge Models
di: Wang, Yuji, et al.
Pubblicazione: (2024)