Mining Your Own Secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jha, Saurav, Yang, Shiqi, Ishii, Masato, Zhao, Mengjie, Simon, Christian, Mirza, Muhammad Jehanzeb, Gong, Dong, Yao, Lina, Takahashi, Shusuke, Mitsufuji, Yuki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
por: Yang, Shiqi, et al.
Publicado: (2024)
por: Yang, Shiqi, et al.
Publicado: (2024)
TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
por: Simon, Christian, et al.
Publicado: (2025)
por: Simon, Christian, et al.
Publicado: (2025)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
por: Hirano, Masato, et al.
Publicado: (2023)
por: Hirano, Masato, et al.
Publicado: (2023)
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
por: Takahashi, Akira, et al.
Publicado: (2025)
por: Takahashi, Akira, et al.
Publicado: (2025)
Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling
por: Jha, Saurav, et al.
Publicado: (2025)
por: Jha, Saurav, et al.
Publicado: (2025)
OpenMU: Your Swiss Army Knife for Music Understanding
por: Zhao, Mengjie, et al.
Publicado: (2024)
por: Zhao, Mengjie, et al.
Publicado: (2024)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
por: Hayakawa, Akio, et al.
Publicado: (2024)
por: Hayakawa, Akio, et al.
Publicado: (2024)
A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation
por: Ishii, Masato, et al.
Publicado: (2024)
por: Ishii, Masato, et al.
Publicado: (2024)
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
por: Takahashi, Akira, et al.
Publicado: (2026)
por: Takahashi, Akira, et al.
Publicado: (2026)
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders
por: Shi, Hao, et al.
Publicado: (2023)
por: Shi, Hao, et al.
Publicado: (2023)
VIRTUE: Visual-Interactive Text-Image Universal Embedder
por: Wang, Wei-Yao, et al.
Publicado: (2025)
por: Wang, Wei-Yao, et al.
Publicado: (2025)
Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models
por: Jha, Saurav, et al.
Publicado: (2024)
por: Jha, Saurav, et al.
Publicado: (2024)
MoLA: Motion Generation and Editing with Latent Diffusion Enhanced by Adversarial Training
por: Uchida, Kengo, et al.
Publicado: (2024)
por: Uchida, Kengo, et al.
Publicado: (2024)
GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
por: Mirza, M. Jehanzeb, et al.
Publicado: (2024)
por: Mirza, M. Jehanzeb, et al.
Publicado: (2024)
Do Foundational Audio Encoders Understand Music Structure?
por: Toyama, Keisuke, et al.
Publicado: (2025)
por: Toyama, Keisuke, et al.
Publicado: (2025)
'Studies for': A Human-AI Co-Creative Sound Artwork Using a Real-time Multi-channel Sound Generation Model
por: Nagashima, Chihiro, et al.
Publicado: (2025)
por: Nagashima, Chihiro, et al.
Publicado: (2025)
The Whole Is Greater than the Sum of Its Parts: Improving Music Source Separation by Bridging Network
por: Sawata, Ryosuke, et al.
Publicado: (2023)
por: Sawata, Ryosuke, et al.
Publicado: (2023)
Your Diffusion Model is Secretly a Certifiably Robust Classifier
por: Chen, Huanran, et al.
Publicado: (2024)
por: Chen, Huanran, et al.
Publicado: (2024)
DiffRoll: Diffusion-based Generative Music Transcription with Unsupervised Pretraining Capability
por: Cheuk, Kin Wai, et al.
Publicado: (2022)
por: Cheuk, Kin Wai, et al.
Publicado: (2022)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
por: Comunità, Marco, et al.
Publicado: (2024)
por: Comunità, Marco, et al.
Publicado: (2024)
Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
por: Hayakawa, Akio, et al.
Publicado: (2025)
por: Hayakawa, Akio, et al.
Publicado: (2025)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
por: Ishii, Masato, et al.
Publicado: (2025)
por: Ishii, Masato, et al.
Publicado: (2025)
AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path
por: Yu, Zhengyang, et al.
Publicado: (2025)
por: Yu, Zhengyang, et al.
Publicado: (2025)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
por: Shimada, Kazuki, et al.
Publicado: (2024)
por: Shimada, Kazuki, et al.
Publicado: (2024)
Distill, Forget, Repeat: A Framework for Continual Unlearning in Text-to-Image Diffusion Models
por: George, Naveen, et al.
Publicado: (2025)
por: George, Naveen, et al.
Publicado: (2025)
DiffuCOMET: Contextual Commonsense Knowledge Diffusion
por: Gao, Silin, et al.
Publicado: (2024)
por: Gao, Silin, et al.
Publicado: (2024)
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
por: Zhong, Zhi, et al.
Publicado: (2025)
por: Zhong, Zhi, et al.
Publicado: (2025)
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
por: Tateishi, Kazuya, et al.
Publicado: (2026)
por: Tateishi, Kazuya, et al.
Publicado: (2026)
Can Diffusion Models Disentangle? A Theoretical Perspective
por: Wang, Liming, et al.
Publicado: (2025)
por: Wang, Liming, et al.
Publicado: (2025)
Your Diffusion Model is Secretly a Noise Classifier and Benefits from Contrastive Training
por: Wu, Yunshu, et al.
Publicado: (2024)
por: Wu, Yunshu, et al.
Publicado: (2024)
Your Extreme Multi-label Classifier is Secretly a Hierarchical Text Classifier for Free
por: Bertalis, Nerijus, et al.
Publicado: (2024)
por: Bertalis, Nerijus, et al.
Publicado: (2024)
$\textit{Jump Your Steps}$: Optimizing Sampling Schedule of Discrete Diffusion Models
por: Park, Yong-Hyun, et al.
Publicado: (2024)
por: Park, Yong-Hyun, et al.
Publicado: (2024)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
por: Xu, Weihan, et al.
Publicado: (2025)
por: Xu, Weihan, et al.
Publicado: (2025)
Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models
por: Simon, Christian, et al.
Publicado: (2026)
por: Simon, Christian, et al.
Publicado: (2026)
Improving Classifier-Free Guidance in Masked Diffusion: Low-Dim Theoretical Insights with High-Dim Impact
por: Rojas, Kevin, et al.
Publicado: (2025)
por: Rojas, Kevin, et al.
Publicado: (2025)
Feeding LLM Annotations to BERT Classifiers at Your Own Risk
por: Lu, Yucheng, et al.
Publicado: (2025)
por: Lu, Yucheng, et al.
Publicado: (2025)
Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion
por: Dontas, Michail, et al.
Publicado: (2024)
por: Dontas, Michail, et al.
Publicado: (2024)
Zero- and Few-shot Sound Event Localization and Detection
por: Shimada, Kazuki, et al.
Publicado: (2023)
por: Shimada, Kazuki, et al.
Publicado: (2023)
EMMA: Your Text-to-Image Diffusion Model Can Secretly Accept Multi-Modal Prompts
por: Han, Yucheng, et al.
Publicado: (2024)
por: Han, Yucheng, et al.
Publicado: (2024)
Ejemplares similares
-
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
por: Yang, Shiqi, et al.
Publicado: (2024) -
TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
por: Simon, Christian, et al.
Publicado: (2025) -
Diffusion-based Signal Refiner for Speech Enhancement and Separation
por: Hirano, Masato, et al.
Publicado: (2023) -
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
por: Takahashi, Akira, et al.
Publicado: (2025) -
Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling
por: Jha, Saurav, et al.
Publicado: (2025)