Gespeichert in:
| Hauptverfasser: | Ahn, Daechul, Choi, Yura, Kim, San, Yu, Youngjae, Kang, Dongyeop, Choi, Jonghyun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2406.11280 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback
von: Ahn, Daechul, et al.
Veröffentlicht: (2024)
von: Ahn, Daechul, et al.
Veröffentlicht: (2024)
What Happens When: Learning Temporal Orders of Events in Videos
von: Ahn, Daechul, et al.
Veröffentlicht: (2025)
von: Ahn, Daechul, et al.
Veröffentlicht: (2025)
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
von: Tang, Jiyang, et al.
Veröffentlicht: (2025)
von: Tang, Jiyang, et al.
Veröffentlicht: (2025)
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
von: Huang, Qihan, et al.
Veröffentlicht: (2024)
von: Huang, Qihan, et al.
Veröffentlicht: (2024)
VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving
von: Xu, Zhefan, et al.
Veröffentlicht: (2026)
von: Xu, Zhefan, et al.
Veröffentlicht: (2026)
Becoming Experienced Judges: Selective Test-Time Learning for Evaluators
von: Jwa, Seungyeon, et al.
Veröffentlicht: (2025)
von: Jwa, Seungyeon, et al.
Veröffentlicht: (2025)
DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving
von: Shang, Shuyao, et al.
Veröffentlicht: (2025)
von: Shang, Shuyao, et al.
Veröffentlicht: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
von: Wang, Fei, et al.
Veröffentlicht: (2024)
von: Wang, Fei, et al.
Veröffentlicht: (2024)
Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment
von: Park, Jonghyun, et al.
Veröffentlicht: (2025)
von: Park, Jonghyun, et al.
Veröffentlicht: (2025)
When Preferences Diverge: Aligning Diffusion Models with Minority-Aware Adaptive DPO
von: Zhang, Lingfan, et al.
Veröffentlicht: (2025)
von: Zhang, Lingfan, et al.
Veröffentlicht: (2025)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
von: Huang, Haojian, et al.
Veröffentlicht: (2025)
von: Huang, Haojian, et al.
Veröffentlicht: (2025)
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
von: Jia, Hongrui, et al.
Veröffentlicht: (2024)
von: Jia, Hongrui, et al.
Veröffentlicht: (2024)
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
von: Wu, Ziyi, et al.
Veröffentlicht: (2025)
von: Wu, Ziyi, et al.
Veröffentlicht: (2025)
$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models
von: Truong, Thanh-Dat, et al.
Veröffentlicht: (2026)
von: Truong, Thanh-Dat, et al.
Veröffentlicht: (2026)
SEE-DPO: Self Entropy Enhanced Direct Preference Optimization
von: Shekhar, Shivanshu, et al.
Veröffentlicht: (2024)
von: Shekhar, Shivanshu, et al.
Veröffentlicht: (2024)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
von: Liu, Runtao, et al.
Veröffentlicht: (2024)
von: Liu, Runtao, et al.
Veröffentlicht: (2024)
DeDPO: Debiased Direct Preference Optimization for Diffusion Models
von: Pham, Khiem, et al.
Veröffentlicht: (2026)
von: Pham, Khiem, et al.
Veröffentlicht: (2026)
Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
von: Ahn, Daechul, et al.
Veröffentlicht: (2025)
von: Ahn, Daechul, et al.
Veröffentlicht: (2025)
RealDPO: Real or Not Real, that is the Preference
von: Cheng, Guo, et al.
Veröffentlicht: (2025)
von: Cheng, Guo, et al.
Veröffentlicht: (2025)
Multi-Level Knowledge Distillation and Dynamic Self-Supervised Learning for Continual Learning
von: Kim, Taeheon, et al.
Veröffentlicht: (2025)
von: Kim, Taeheon, et al.
Veröffentlicht: (2025)
Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key
von: Yang, Zhihe, et al.
Veröffentlicht: (2025)
von: Yang, Zhihe, et al.
Veröffentlicht: (2025)
BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment
von: Zhou, Dewei, et al.
Veröffentlicht: (2025)
von: Zhou, Dewei, et al.
Veröffentlicht: (2025)
BalancedDPO: Adaptive Multi-Metric Alignment
von: Tamboli, Dipesh, et al.
Veröffentlicht: (2025)
von: Tamboli, Dipesh, et al.
Veröffentlicht: (2025)
SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning
von: Cheng, Xin, et al.
Veröffentlicht: (2026)
von: Cheng, Xin, et al.
Veröffentlicht: (2026)
Inversion-DPO: Precise and Efficient Post-Training for Diffusion Models
von: Li, Zejian, et al.
Veröffentlicht: (2025)
von: Li, Zejian, et al.
Veröffentlicht: (2025)
S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models
von: Shukla, Nitish, et al.
Veröffentlicht: (2026)
von: Shukla, Nitish, et al.
Veröffentlicht: (2026)
Do Understanding and Generation Fight? A Diagnostic Study of DPO for Unified Multimodal Models
von: Rao, Abinav, et al.
Veröffentlicht: (2026)
von: Rao, Abinav, et al.
Veröffentlicht: (2026)
V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models
von: Kim, Jisoo, et al.
Veröffentlicht: (2025)
von: Kim, Jisoo, et al.
Veröffentlicht: (2025)
PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection
von: Wang, Peiyao, et al.
Veröffentlicht: (2025)
von: Wang, Peiyao, et al.
Veröffentlicht: (2025)
HuViDPO:Enhancing Video Generation through Direct Preference Optimization for Human-Centric Alignment
von: Jiang, Lifan, et al.
Veröffentlicht: (2025)
von: Jiang, Lifan, et al.
Veröffentlicht: (2025)
Region-Normalized DPO for Medical Image Segmentation under Noisy Judges
von: Kalisch, Hamza, et al.
Veröffentlicht: (2026)
von: Kalisch, Hamza, et al.
Veröffentlicht: (2026)
CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs
von: Ouali, Yassine, et al.
Veröffentlicht: (2024)
von: Ouali, Yassine, et al.
Veröffentlicht: (2024)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
von: Liu, Ziyu, et al.
Veröffentlicht: (2024)
von: Liu, Ziyu, et al.
Veröffentlicht: (2024)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
von: Du, Jie, et al.
Veröffentlicht: (2025)
von: Du, Jie, et al.
Veröffentlicht: (2025)
DPO Learning with LLMs-Judge Signal for Computer Use Agents
von: Luo, Man, et al.
Veröffentlicht: (2025)
von: Luo, Man, et al.
Veröffentlicht: (2025)
HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images
von: Yang, Yilin, et al.
Veröffentlicht: (2026)
von: Yang, Yilin, et al.
Veröffentlicht: (2026)
DreamBoothDPO: Improving Personalized Generation using Direct Preference Optimization
von: Ayupov, Shamil, et al.
Veröffentlicht: (2025)
von: Ayupov, Shamil, et al.
Veröffentlicht: (2025)
SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization
von: Ahn, Young Jin, et al.
Veröffentlicht: (2024)
von: Ahn, Young Jin, et al.
Veröffentlicht: (2024)
DEVIAS: Learning Disentangled Video Representations of Action and Scene
von: Bae, Kyungho, et al.
Veröffentlicht: (2023)
von: Bae, Kyungho, et al.
Veröffentlicht: (2023)
HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting
von: Lee, Jeongeun, et al.
Veröffentlicht: (2025)
von: Lee, Jeongeun, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback
von: Ahn, Daechul, et al.
Veröffentlicht: (2024) -
What Happens When: Learning Temporal Orders of Events in Videos
von: Ahn, Daechul, et al.
Veröffentlicht: (2025) -
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
von: Tang, Jiyang, et al.
Veröffentlicht: (2025) -
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
von: Huang, Qihan, et al.
Veröffentlicht: (2024) -
VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving
von: Xu, Zhefan, et al.
Veröffentlicht: (2026)