V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Jisoo, Seo, Wooseok, Kim, Junwan, Park, Seungho, Park, Sooyeon, Yu, Youngjae |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
di: Kim, Joowon, et al.
Pubblicazione: (2026)
di: Kim, Joowon, et al.
Pubblicazione: (2026)
DEEPTalk: Dynamic Emotion Embedding for Probabilistic Speech-Driven 3D Face Animation
di: Kim, Jisoo, et al.
Pubblicazione: (2024)
di: Kim, Jisoo, et al.
Pubblicazione: (2024)
DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding
di: Cho, Jungbin, et al.
Pubblicazione: (2024)
di: Cho, Jungbin, et al.
Pubblicazione: (2024)
Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models
di: Jeon, Wooseok, et al.
Pubblicazione: (2026)
di: Jeon, Wooseok, et al.
Pubblicazione: (2026)
V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping
di: Lee, Hyunkoo, et al.
Pubblicazione: (2025)
di: Lee, Hyunkoo, et al.
Pubblicazione: (2025)
CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
di: Kim, Jiwan, et al.
Pubblicazione: (2025)
di: Kim, Jiwan, et al.
Pubblicazione: (2025)
ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO
di: Ahn, Daechul, et al.
Pubblicazione: (2024)
di: Ahn, Daechul, et al.
Pubblicazione: (2024)
Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines
di: Kim, Junwan, et al.
Pubblicazione: (2026)
di: Kim, Junwan, et al.
Pubblicazione: (2026)
TWLV-I: Analysis and Insights from Holistic Evaluation on Video Foundation Models
di: Lee, Hyeongmin, et al.
Pubblicazione: (2024)
di: Lee, Hyeongmin, et al.
Pubblicazione: (2024)
Identity-preserving Distillation Sampling by Fixed-Point Iterator
di: Kim, SeonHwa, et al.
Pubblicazione: (2025)
di: Kim, SeonHwa, et al.
Pubblicazione: (2025)
Generalist Multi-Class Anomaly Detection via Distillation to Two Heterogeneous Student Networks
di: Park, Hangil, et al.
Pubblicazione: (2025)
di: Park, Hangil, et al.
Pubblicazione: (2025)
Layout-and-Retouch: A Dual-stage Framework for Improving Diversity in Personalized Image Generation
di: Kim, Kangyeol, et al.
Pubblicazione: (2024)
di: Kim, Kangyeol, et al.
Pubblicazione: (2024)
SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion
di: Cho, Jungbin, et al.
Pubblicazione: (2025)
di: Cho, Jungbin, et al.
Pubblicazione: (2025)
Improving Cone-Beam CT Image Quality with Knowledge Distillation-Enhanced Diffusion Model in Imbalanced Data Settings
di: Hwang, Joonil, et al.
Pubblicazione: (2024)
di: Hwang, Joonil, et al.
Pubblicazione: (2024)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
di: Kim, Youngmin, et al.
Pubblicazione: (2025)
di: Kim, Youngmin, et al.
Pubblicazione: (2025)
Image Diffusion Models Exhibit Emergent Temporal Propagation in Videos
di: Kim, Youngseo, et al.
Pubblicazione: (2025)
di: Kim, Youngseo, et al.
Pubblicazione: (2025)
Lightweight Wasserstein Audio-Visual Model for Unified Speech Enhancement and Separation
di: Park, Jisoo, et al.
Pubblicazione: (2025)
di: Park, Jisoo, et al.
Pubblicazione: (2025)
OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
Let 2D Diffusion Model Know 3D-Consistency for Robust Text-to-3D Generation
di: Seo, Junyoung, et al.
Pubblicazione: (2023)
di: Seo, Junyoung, et al.
Pubblicazione: (2023)
Retrieval-Augmented Score Distillation for Text-to-3D Generation
di: Seo, Junyoung, et al.
Pubblicazione: (2024)
di: Seo, Junyoung, et al.
Pubblicazione: (2024)
Hybrid Video Diffusion Models with 2D Triplane and 3D Wavelet Representation
di: Kim, Kihong, et al.
Pubblicazione: (2024)
di: Kim, Kihong, et al.
Pubblicazione: (2024)
Preserve and Personalize: Personalized Text-to-Image Diffusion Models without Distributional Drift
di: Kim, Gihoon, et al.
Pubblicazione: (2025)
di: Kim, Gihoon, et al.
Pubblicazione: (2025)
Multispectral Pedestrian Detection with Sparsely Annotated Label
di: Lee, Chan, et al.
Pubblicazione: (2025)
di: Lee, Chan, et al.
Pubblicazione: (2025)
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
di: Lee, Ji Soo, et al.
Pubblicazione: (2025)
di: Lee, Ji Soo, et al.
Pubblicazione: (2025)
GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance
di: Kim, Junhyeok, et al.
Pubblicazione: (2025)
di: Kim, Junhyeok, et al.
Pubblicazione: (2025)
SRVP: Strong Recollection Video Prediction Model Using Attention-Based Spatiotemporal Correlation Fusion
di: Kim, Yuseon, et al.
Pubblicazione: (2025)
di: Kim, Yuseon, et al.
Pubblicazione: (2025)
EgoSpeak: Learning When to Speak for Egocentric Conversational Agents in the Wild
di: Kim, Junhyeok, et al.
Pubblicazione: (2025)
di: Kim, Junhyeok, et al.
Pubblicazione: (2025)
Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models
di: Hwang, Sungwon, et al.
Pubblicazione: (2025)
di: Hwang, Sungwon, et al.
Pubblicazione: (2025)
Diffusion Model Compression for Image-to-Image Translation
di: Kim, Geonung, et al.
Pubblicazione: (2024)
di: Kim, Geonung, et al.
Pubblicazione: (2024)
Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
di: Kim, Dohyun, et al.
Pubblicazione: (2025)
di: Kim, Dohyun, et al.
Pubblicazione: (2025)
Simulating Post-Neoadjuvant Chemotherapy Breast Cancer MRI via Diffusion Model with Prompt Tuning
di: Kim, Jonghun, et al.
Pubblicazione: (2025)
di: Kim, Jonghun, et al.
Pubblicazione: (2025)
SlumpGuard: An AI-Powered Real-Time System for Automated Concrete Slump Prediction via Video Analysis
di: Kim, Youngmin, et al.
Pubblicazione: (2025)
di: Kim, Youngmin, et al.
Pubblicazione: (2025)
StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback
di: Park, Jiho, et al.
Pubblicazione: (2025)
di: Park, Jiho, et al.
Pubblicazione: (2025)
Distilling ODE Solvers of Diffusion Models into Smaller Steps
di: Kim, Sanghwan, et al.
Pubblicazione: (2023)
di: Kim, Sanghwan, et al.
Pubblicazione: (2023)
APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping
di: Kang, Jiwon, et al.
Pubblicazione: (2026)
di: Kang, Jiwon, et al.
Pubblicazione: (2026)
Memory-Efficient Personalization of Text-to-Image Diffusion Models via Selective Optimization Strategies
di: Choi, Seokeon, et al.
Pubblicazione: (2025)
di: Choi, Seokeon, et al.
Pubblicazione: (2025)
FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution
di: Choi, Seungho, et al.
Pubblicazione: (2025)
di: Choi, Seungho, et al.
Pubblicazione: (2025)
Teaching Metric Distance to Discrete Autoregressive Language Models
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
Distribution Matching Distillation without Fake Score Network
di: Kim, Youngjoong, et al.
Pubblicazione: (2026)
di: Kim, Youngjoong, et al.
Pubblicazione: (2026)
VideoMamba: Spatio-Temporal Selective State Space Model
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
di: Kim, Joowon, et al.
Pubblicazione: (2026) -
DEEPTalk: Dynamic Emotion Embedding for Probabilistic Speech-Driven 3D Face Animation
di: Kim, Jisoo, et al.
Pubblicazione: (2024) -
DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding
di: Cho, Jungbin, et al.
Pubblicazione: (2024) -
Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models
di: Jeon, Wooseok, et al.
Pubblicazione: (2026) -
V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping
di: Lee, Hyunkoo, et al.
Pubblicazione: (2025)