Multimodal ELBO with Diffusion Decoders
Fuente:
arXiv
Salvato in:
| Autori principali: | Wesego, Daniel, Rooshenas, Pedram |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Score-Based Multimodal Autoencoder
di: Wesego, Daniel, et al.
Pubblicazione: (2023)
di: Wesego, Daniel, et al.
Pubblicazione: (2023)
TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers
di: Wesego, Daniel, et al.
Pubblicazione: (2026)
di: Wesego, Daniel, et al.
Pubblicazione: (2026)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
di: Wang, Yuduo, et al.
Pubblicazione: (2023)
di: Wang, Yuduo, et al.
Pubblicazione: (2023)
Gradient-free Decoder Inversion in Latent Diffusion Models
di: Hong, Seongmin, et al.
Pubblicazione: (2024)
di: Hong, Seongmin, et al.
Pubblicazione: (2024)
ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models
di: Zhou, Qin, et al.
Pubblicazione: (2025)
di: Zhou, Qin, et al.
Pubblicazione: (2025)
LatentHDR: Decoupling Exposure from Diffusion via Conditional Latent-to-Latent Mapping for Text/Image-to-Panoramic HDR
di: Fekri, Pedram, et al.
Pubblicazione: (2026)
di: Fekri, Pedram, et al.
Pubblicazione: (2026)
Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor
di: Agarwal, Vatsal, et al.
Pubblicazione: (2025)
di: Agarwal, Vatsal, et al.
Pubblicazione: (2025)
ACDC: Autoregressive Coherent Multimodal Generation using Diffusion Correction
di: Chung, Hyungjin, et al.
Pubblicazione: (2024)
di: Chung, Hyungjin, et al.
Pubblicazione: (2024)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
di: Liang, Zhixuan, et al.
Pubblicazione: (2025)
di: Liang, Zhixuan, et al.
Pubblicazione: (2025)
RefDecoder: Enhancing Visual Generation with Conditional Video Decoding
di: Fan, Xiang, et al.
Pubblicazione: (2026)
di: Fan, Xiang, et al.
Pubblicazione: (2026)
LILAC: Long-sequence Incremental Low-latency Arbitrary Motion Stylization via Streaming VAE-Diffusion with Causal Decoding
di: Ren, Peng, et al.
Pubblicazione: (2025)
di: Ren, Peng, et al.
Pubblicazione: (2025)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
di: Ganesan, Mugilan, et al.
Pubblicazione: (2025)
di: Ganesan, Mugilan, et al.
Pubblicazione: (2025)
NPNet: A Non-Parametric Network with Adaptive Gaussian-Fourier Positional Encoding for 3D Classification and Segmentation
di: Saeid, Mohammad, et al.
Pubblicazione: (2026)
di: Saeid, Mohammad, et al.
Pubblicazione: (2026)
Causal Decoding for Hallucination-Resistant Multimodal Large Language Models
di: Tan, Shiwei, et al.
Pubblicazione: (2026)
di: Tan, Shiwei, et al.
Pubblicazione: (2026)
High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding
di: Hong, Ji Woo, et al.
Pubblicazione: (2026)
di: Hong, Ji Woo, et al.
Pubblicazione: (2026)
DepMicroDiff: Diffusion-Based Dependency-Aware Multimodal Imputation for Microbiome Data
di: Sadia, Rabeya Tus, et al.
Pubblicazione: (2025)
di: Sadia, Rabeya Tus, et al.
Pubblicazione: (2025)
Mask Approximation Net: A Novel Diffusion Model Approach for Remote Sensing Change Captioning
di: Sun, Dongwei, et al.
Pubblicazione: (2024)
di: Sun, Dongwei, et al.
Pubblicazione: (2024)
REED-VAE: RE-Encode Decode Training for Iterative Image Editing with Diffusion Models
di: Almog, Gal, et al.
Pubblicazione: (2025)
di: Almog, Gal, et al.
Pubblicazione: (2025)
VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs
di: Kolli, Govinda, et al.
Pubblicazione: (2026)
di: Kolli, Govinda, et al.
Pubblicazione: (2026)
Multimodal Latent Language Modeling with Next-Token Diffusion
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
Flows and Diffusions on the Neural Manifold
di: Saragih, Daniel, et al.
Pubblicazione: (2025)
di: Saragih, Daniel, et al.
Pubblicazione: (2025)
Invariant Representation Guided Multimodal Sentiment Decoding with Sequential Variation Regularization
di: Xu, Guoyang, et al.
Pubblicazione: (2024)
di: Xu, Guoyang, et al.
Pubblicazione: (2024)
MDiFF: Exploiting Multimodal Score-based Diffusion Models for New Fashion Product Performance Forecasting
di: Avogaro, Andrea, et al.
Pubblicazione: (2024)
di: Avogaro, Andrea, et al.
Pubblicazione: (2024)
Spatial Gated Multi-Layer Perceptron for Land Use and Land Cover Mapping
di: Jamali, Ali, et al.
Pubblicazione: (2023)
di: Jamali, Ali, et al.
Pubblicazione: (2023)
Multimodal Latent Diffusion Model for Complex Sewing Pattern Generation
di: Liu, Shengqi, et al.
Pubblicazione: (2024)
di: Liu, Shengqi, et al.
Pubblicazione: (2024)
Controlling Multimodal LLMs via Reward-guided Decoding
di: Mañas, Oscar, et al.
Pubblicazione: (2025)
di: Mañas, Oscar, et al.
Pubblicazione: (2025)
Score-based Membership Inference on Diffusion Models
di: Rao, Mingxing, et al.
Pubblicazione: (2025)
di: Rao, Mingxing, et al.
Pubblicazione: (2025)
Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces
di: Rojas, Kevin, et al.
Pubblicazione: (2025)
di: Rojas, Kevin, et al.
Pubblicazione: (2025)
CLIPTime: Time-Aware Multimodal Representation Learning from Images and Text
di: Rani, Anju, et al.
Pubblicazione: (2025)
di: Rani, Anju, et al.
Pubblicazione: (2025)
Memory-Efficient Vision Transformers: An Activation-Aware Mixed-Rank Compression Strategy
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2024)
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2024)
DMODE: Differential Monocular Object Distance Estimation Module without Class Specific Information
di: Agand, Pedram, et al.
Pubblicazione: (2022)
di: Agand, Pedram, et al.
Pubblicazione: (2022)
Latent Diffusion Inversion Requires Understanding the Latent Space
di: Rao, Mingxing, et al.
Pubblicazione: (2025)
di: Rao, Mingxing, et al.
Pubblicazione: (2025)
DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders
di: Hong, Susung, et al.
Pubblicazione: (2025)
di: Hong, Susung, et al.
Pubblicazione: (2025)
Finding Shared Decodable Concepts and their Negations in the Brain
di: Efird, Cory, et al.
Pubblicazione: (2024)
di: Efird, Cory, et al.
Pubblicazione: (2024)
VMDT: Decoding the Trustworthiness of Video Foundation Models
di: Potter, Yujin, et al.
Pubblicazione: (2025)
di: Potter, Yujin, et al.
Pubblicazione: (2025)
Visual Diffusion Models are Geometric Solvers
di: Goren, Nir, et al.
Pubblicazione: (2025)
di: Goren, Nir, et al.
Pubblicazione: (2025)
Dif4FF: Leveraging Multimodal Diffusion Models and Graph Neural Networks for Accurate New Fashion Product Performance Forecasting
di: Avogaro, Andrea, et al.
Pubblicazione: (2024)
di: Avogaro, Andrea, et al.
Pubblicazione: (2024)
DeCLIP: Decoding CLIP representations for deepfake localization
di: Smeu, Stefan, et al.
Pubblicazione: (2024)
di: Smeu, Stefan, et al.
Pubblicazione: (2024)
Decoding Federated Learning: The FedNAM+ Conformal Revolution
di: Balija, Sree Bhargavi, et al.
Pubblicazione: (2025)
di: Balija, Sree Bhargavi, et al.
Pubblicazione: (2025)
Domain Independent SVM for Transfer Learning in Brain Decoding
di: Zhou, Shuo, et al.
Pubblicazione: (2019)
di: Zhou, Shuo, et al.
Pubblicazione: (2019)
Documenti analoghi
-
Score-Based Multimodal Autoencoder
di: Wesego, Daniel, et al.
Pubblicazione: (2023) -
TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers
di: Wesego, Daniel, et al.
Pubblicazione: (2026) -
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
di: Wang, Yuduo, et al.
Pubblicazione: (2023) -
Gradient-free Decoder Inversion in Latent Diffusion Models
di: Hong, Seongmin, et al.
Pubblicazione: (2024) -
ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models
di: Zhou, Qin, et al.
Pubblicazione: (2025)