Preference Alignment for Diffusion Model via Explicit Denoised Distribution Estimation
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Dingyuan, Wang, Yong, Li, Hangyu, Chu, Xiangxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
di: Huang, Hailang, et al.
Pubblicazione: (2024)
di: Huang, Hailang, et al.
Pubblicazione: (2024)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
di: Li, Shengzhi, et al.
Pubblicazione: (2024)
di: Li, Shengzhi, et al.
Pubblicazione: (2024)
Self-Supervised Visual Preference Alignment
di: Zhu, Ke, et al.
Pubblicazione: (2024)
di: Zhu, Ke, et al.
Pubblicazione: (2024)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
Think While You Generate: Discrete Diffusion with Planned Denoising
di: Liu, Sulin, et al.
Pubblicazione: (2024)
di: Liu, Sulin, et al.
Pubblicazione: (2024)
Improving Denoising Diffusion Models via Simultaneous Estimation of Image and Noise
di: Zhang, Zhenkai, et al.
Pubblicazione: (2023)
di: Zhang, Zhenkai, et al.
Pubblicazione: (2023)
Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo
di: Wang, Weixin, et al.
Pubblicazione: (2026)
di: Wang, Weixin, et al.
Pubblicazione: (2026)
Reducing Hallucination in Vision-Language Models via Stage-wise Preference Optimization under Distribution Shift
di: Xu, Qinwu
Pubblicazione: (2026)
di: Xu, Qinwu
Pubblicazione: (2026)
Unified Vision-Language Modeling via Concept Space Alignment
di: Qiu, Yifu, et al.
Pubblicazione: (2026)
di: Qiu, Yifu, et al.
Pubblicazione: (2026)
Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
di: Chen, Kun, et al.
Pubblicazione: (2025)
di: Chen, Kun, et al.
Pubblicazione: (2025)
Step-level Denoising-time Diffusion Alignment with Multiple Objectives
di: Zhang, Qi, et al.
Pubblicazione: (2026)
di: Zhang, Qi, et al.
Pubblicazione: (2026)
FlowDreamer: Exploring High Fidelity Text-to-3D Generation via Rectified Flow
di: Li, Hangyu, et al.
Pubblicazione: (2024)
di: Li, Hangyu, et al.
Pubblicazione: (2024)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
di: Li, Chen-An, et al.
Pubblicazione: (2025)
di: Li, Chen-An, et al.
Pubblicazione: (2025)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
Rethinking Genomic Modeling Through Optical Character Recognition
di: Xiang, Hongxin, et al.
Pubblicazione: (2026)
di: Xiang, Hongxin, et al.
Pubblicazione: (2026)
Set-CLIP: Exploring Aligned Semantic From Low-Alignment Multimodal Data Through A Distribution View
di: Song, Zijia, et al.
Pubblicazione: (2024)
di: Song, Zijia, et al.
Pubblicazione: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding
di: Xiao, Zhongyu, et al.
Pubblicazione: (2026)
di: Xiao, Zhongyu, et al.
Pubblicazione: (2026)
$\textit{Jump Your Steps}$: Optimizing Sampling Schedule of Discrete Diffusion Models
di: Park, Yong-Hyun, et al.
Pubblicazione: (2024)
di: Park, Yong-Hyun, et al.
Pubblicazione: (2024)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
GeneOH Diffusion: Towards Generalizable Hand-Object Interaction Denoising via Denoising Diffusion
di: Liu, Xueyi, et al.
Pubblicazione: (2024)
di: Liu, Xueyi, et al.
Pubblicazione: (2024)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
di: Liu, Runtao, et al.
Pubblicazione: (2024)
di: Liu, Runtao, et al.
Pubblicazione: (2024)
Do Vision and Language Models Share Concepts? A Vector Space Alignment Study
di: Li, Jiaang, et al.
Pubblicazione: (2023)
di: Li, Jiaang, et al.
Pubblicazione: (2023)
In-Situ Tweedie Discrete Diffusion Models
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
di: Li, Zongxia, et al.
Pubblicazione: (2025)
di: Li, Zongxia, et al.
Pubblicazione: (2025)
Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
MAGIC: Achieving Superior Model Merging via Magnitude Calibration
di: Li, Yayuan, et al.
Pubblicazione: (2025)
di: Li, Yayuan, et al.
Pubblicazione: (2025)
RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
di: Li, YuQian, et al.
Pubblicazione: (2025)
di: Li, YuQian, et al.
Pubblicazione: (2025)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
di: Chang, Kai-Po, et al.
Pubblicazione: (2025)
di: Chang, Kai-Po, et al.
Pubblicazione: (2025)
The Best of Both Worlds: Integrating Language Models and Diffusion Models for Video Generation
di: Yin, Aoxiong, et al.
Pubblicazione: (2025)
di: Yin, Aoxiong, et al.
Pubblicazione: (2025)
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
di: Li, Jianxiong, et al.
Pubblicazione: (2024)
ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusion
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025)
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
di: Jiang, Jiachen, et al.
Pubblicazione: (2025)
di: Jiang, Jiachen, et al.
Pubblicazione: (2025)
Unified Lexical Representation for Interpretable Visual-Language Alignment
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models
di: Kim, Soo Yong, et al.
Pubblicazione: (2025)
di: Kim, Soo Yong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
di: Huang, Hailang, et al.
Pubblicazione: (2024) -
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
di: Li, Shengzhi, et al.
Pubblicazione: (2024) -
Self-Supervised Visual Preference Alignment
di: Zhu, Ke, et al.
Pubblicazione: (2024) -
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
di: Khaki, Saeed, et al.
Pubblicazione: (2024) -
Think While You Generate: Discrete Diffusion with Planned Denoising
di: Liu, Sulin, et al.
Pubblicazione: (2024)