Diffusion Classifiers Understand Compositionality, but Conditions Apply
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jeong, Yujin, Uselis, Arnas, Oh, Seong Joon, Rohrbach, Anna |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Do Diffusion Models learn to Generate Multiple Objects?
par: Jeong, Yujin, et autres
Publié: (2026)
par: Jeong, Yujin, et autres
Publié: (2026)
Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models
par: Uselis, Arnas, et autres
Publié: (2026)
par: Uselis, Arnas, et autres
Publié: (2026)
On the rankability of visual embeddings
par: Sonthalia, Ankit, et autres
Publié: (2025)
par: Sonthalia, Ankit, et autres
Publié: (2025)
Half-Truths Break Similarity-Based Retrieval
par: Kargi, Bora, et autres
Publié: (2026)
par: Kargi, Bora, et autres
Publié: (2026)
CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally
par: Koishigarina, Darina, et autres
Publié: (2025)
par: Koishigarina, Darina, et autres
Publié: (2025)
How can embedding models bind concepts?
par: Uselis, Arnas, et autres
Publié: (2026)
par: Uselis, Arnas, et autres
Publié: (2026)
Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models
par: Morelli, Fabian, et autres
Publié: (2026)
par: Morelli, Fabian, et autres
Publié: (2026)
Intermediate Layer Classifiers for OOD generalization
par: Uselis, Arnas, et autres
Publié: (2025)
par: Uselis, Arnas, et autres
Publié: (2025)
Tuning Just Enough: Lightweight Backdoor Attacks on Multi-Encoder Diffusion Models
par: Chen, Ziyuan, et autres
Publié: (2026)
par: Chen, Ziyuan, et autres
Publié: (2026)
V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts
par: Abdessaied, Adnen, et autres
Publié: (2025)
par: Abdessaied, Adnen, et autres
Publié: (2025)
Does Data Scaling Lead to Visual Compositional Generalization?
par: Uselis, Arnas, et autres
Publié: (2025)
par: Uselis, Arnas, et autres
Publié: (2025)
DEFAME: Dynamic Evidence-based FAct-checking with Multimodal Experts
par: Braun, Tobias, et autres
Publié: (2024)
par: Braun, Tobias, et autres
Publié: (2024)
Chrono: A Simple Blueprint for Representing Time in MLLMs
par: Rodriguez, Hector, et autres
Publié: (2024)
par: Rodriguez, Hector, et autres
Publié: (2024)
Enhancing Multi-Image Understanding through Delimiter Token Scaling
par: Lee, Minyoung, et autres
Publié: (2026)
par: Lee, Minyoung, et autres
Publié: (2026)
Controllable and Efficient Multi-Class Pathology Nuclei Data Augmentation using Text-Conditioned Diffusion Models
par: Oh, Hyun-Jic, et autres
Publié: (2024)
par: Oh, Hyun-Jic, et autres
Publié: (2024)
Co-synthesis of Histopathology Nuclei Image-Label Pairs using a Context-Conditioned Joint Diffusion Model
par: Min, Seonghui, et autres
Publié: (2024)
par: Min, Seonghui, et autres
Publié: (2024)
GroupCoOp: Group-robust Fine-tuning via Group Prompt Learning
par: Kim, Nayeong, et autres
Publié: (2025)
par: Kim, Nayeong, et autres
Publié: (2025)
VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking
par: Rothermel, Mark, et autres
Publié: (2026)
par: Rothermel, Mark, et autres
Publié: (2026)
ECCV Caption: Correcting False Negatives by Collecting Machine-and-Human-verified Image-Caption Associations for MS-COCO
par: Chun, Sanghyuk, et autres
Publié: (2022)
par: Chun, Sanghyuk, et autres
Publié: (2022)
OVS Meets Continual Learning: Towards Sustainable Open-Vocabulary Segmentation
par: Hwang, Dongjun, et autres
Publié: (2024)
par: Hwang, Dongjun, et autres
Publié: (2024)
Mitigating Shortcut Learning with Diffusion Counterfactuals and Diverse Ensembles
par: Scimeca, Luca, et autres
Publié: (2023)
par: Scimeca, Luca, et autres
Publié: (2023)
HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models
par: Zohrabi, Reihaneh, et autres
Publié: (2026)
par: Zohrabi, Reihaneh, et autres
Publié: (2026)
Pretrained Visual Uncertainties
par: Kirchhof, Michael, et autres
Publié: (2024)
par: Kirchhof, Michael, et autres
Publié: (2024)
Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection
par: Zohrabi, Reihaneh, et autres
Publié: (2025)
par: Zohrabi, Reihaneh, et autres
Publié: (2025)
SIR-DIFF: Sparse Image Sets Restoration with Multi-View Diffusion Model
par: Mao, Yucheng, et autres
Publié: (2025)
par: Mao, Yucheng, et autres
Publié: (2025)
Guided Conditional Diffusion Classifier (ConDiff) for Enhanced Prediction of Infection in Diabetic Foot Ulcers
par: Busaranuvong, Palawat, et autres
Publié: (2024)
par: Busaranuvong, Palawat, et autres
Publié: (2024)
Universal Algorithm-Implicit Learning
par: Woerner, Stefano, et autres
Publié: (2026)
par: Woerner, Stefano, et autres
Publié: (2026)
Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier
par: Zhou, Yujie, et autres
Publié: (2026)
par: Zhou, Yujie, et autres
Publié: (2026)
MonoWAD: Weather-Adaptive Diffusion Model for Robust Monocular 3D Object Detection
par: Oh, Youngmin, et autres
Publié: (2024)
par: Oh, Youngmin, et autres
Publié: (2024)
TestDG: Test-time Domain Generalization for Continual Test-time Adaptation
par: Lee, Sohyun, et autres
Publié: (2025)
par: Lee, Sohyun, et autres
Publié: (2025)
AVOID: The Adverse Visual Conditions Dataset with Obstacles for Driving Scene Understanding
par: Jeong, Jongoh, et autres
Publié: (2025)
par: Jeong, Jongoh, et autres
Publié: (2025)
VSC: Visual Search Compositional Text-to-Image Diffusion Model
par: Dat, Do Huu, et autres
Publié: (2025)
par: Dat, Do Huu, et autres
Publié: (2025)
Towards Understanding the Mechanisms of Classifier-Free Guidance
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
Task-oriented Learnable Diffusion Timesteps for Universal Few-shot Learning of Dense Tasks
par: Oh, Changgyoon, et autres
Publié: (2025)
par: Oh, Changgyoon, et autres
Publié: (2025)
SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring
par: Rodriguez, Hector G., et autres
Publié: (2026)
par: Rodriguez, Hector G., et autres
Publié: (2026)
ReCap: Lightweight Referential Grounding for Coherent Story Visualization
par: Arora, Aditya, et autres
Publié: (2026)
par: Arora, Aditya, et autres
Publié: (2026)
Are We Done with Object-Centric Learning?
par: Rubinstein, Alexander, et autres
Publié: (2025)
par: Rubinstein, Alexander, et autres
Publié: (2025)
Scalable Ensemble Diversification for OOD Generalization and Detection
par: Rubinstein, Alexander, et autres
Publié: (2024)
par: Rubinstein, Alexander, et autres
Publié: (2024)
Conditional Diffusion Models are Medical Image Classifiers that Provide Explainability and Uncertainty for Free
par: Favero, Gian Mario, et autres
Publié: (2025)
par: Favero, Gian Mario, et autres
Publié: (2025)
TLDR: Text Based Last-layer Retraining for Debiasing Image Classifiers
par: Park, Juhyeon, et autres
Publié: (2023)
par: Park, Juhyeon, et autres
Publié: (2023)
Documents similaires
-
When Do Diffusion Models learn to Generate Multiple Objects?
par: Jeong, Yujin, et autres
Publié: (2026) -
Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models
par: Uselis, Arnas, et autres
Publié: (2026) -
On the rankability of visual embeddings
par: Sonthalia, Ankit, et autres
Publié: (2025) -
Half-Truths Break Similarity-Based Retrieval
par: Kargi, Bora, et autres
Publié: (2026) -
CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally
par: Koishigarina, Darina, et autres
Publié: (2025)