SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lian, Jiesong, Zhou, Zixiang, Zhong, Ruizhe, Zhou, Yuan, Lu, Qinglin, Wang, Rui, Hu, Long, Hao, Yixue, Huang, Baoru |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
di: Lian, Jiesong, et al.
Pubblicazione: (2025)
di: Lian, Jiesong, et al.
Pubblicazione: (2025)
Video Generation Models Are Good Latent Reward Models
di: Mi, Xiaoyue, et al.
Pubblicazione: (2025)
di: Mi, Xiaoyue, et al.
Pubblicazione: (2025)
Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics
di: Zhong, Ruizhe, et al.
Pubblicazione: (2026)
di: Zhong, Ruizhe, et al.
Pubblicazione: (2026)
SARA: Controllable Makeup Transfer with Spatial Alignment and Region-Adaptive Normalization
di: Zhong, Xiaojing, et al.
Pubblicazione: (2023)
di: Zhong, Xiaojing, et al.
Pubblicazione: (2023)
USV: Unified Sparsification for Accelerating Video Diffusion Models
di: Wu, Xinjian, et al.
Pubblicazione: (2025)
di: Wu, Xinjian, et al.
Pubblicazione: (2025)
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
di: Chen, Hesen, et al.
Pubblicazione: (2025)
di: Chen, Hesen, et al.
Pubblicazione: (2025)
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation
di: Hong, Fa-Ting, et al.
Pubblicazione: (2025)
di: Hong, Fa-Ting, et al.
Pubblicazione: (2025)
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
MASRA: MLLM-Assisted Semantic-Relational Consistent Alignment for Video Temporal Grounding
di: Ran, Ran, et al.
Pubblicazione: (2026)
di: Ran, Ran, et al.
Pubblicazione: (2026)
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
di: Hu, Teng, et al.
Pubblicazione: (2025)
di: Hu, Teng, et al.
Pubblicazione: (2025)
PDF: A Probability-Driven Framework for Open World 3D Point Cloud Semantic Segmentation
di: Xu, Jinfeng, et al.
Pubblicazione: (2024)
di: Xu, Jinfeng, et al.
Pubblicazione: (2024)
HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation
di: Huang, Ziyao, et al.
Pubblicazione: (2025)
di: Huang, Ziyao, et al.
Pubblicazione: (2025)
Arbitrary Generative Video Interpolation
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement
di: Hu, Teng, et al.
Pubblicazione: (2025)
di: Hu, Teng, et al.
Pubblicazione: (2025)
Vision Graph Prompting via Semantic Low-Rank Decomposition
di: Ai, Zixiang, et al.
Pubblicazione: (2025)
di: Ai, Zixiang, et al.
Pubblicazione: (2025)
Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
di: Hu, Teng, et al.
Pubblicazione: (2025)
di: Hu, Teng, et al.
Pubblicazione: (2025)
Phased One-Step Adversarial Equilibrium for Video Diffusion Models
di: Cheng, Jiaxiang, et al.
Pubblicazione: (2025)
di: Cheng, Jiaxiang, et al.
Pubblicazione: (2025)
ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
di: Hu, Xiwei, et al.
Pubblicazione: (2024)
di: Hu, Xiwei, et al.
Pubblicazione: (2024)
Modality-Fair Preference Optimization for Trustworthy MLLM Alignment
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
Laparoscopic Scene Analysis for Intraoperative Visualisation of Gamma Probe Signals in Minimally Invasive Cancer Surgery
di: Huang, Baoru
Pubblicazione: (2025)
di: Huang, Baoru
Pubblicazione: (2025)
Adaptive Score Alignment Learning for Continual Perceptual Quality Assessment of 360-Degree Videos in Virtual Reality
di: Zhou, Kanglei, et al.
Pubblicazione: (2025)
di: Zhou, Kanglei, et al.
Pubblicazione: (2025)
HarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal Synchronization
di: Zhou, Zitang, et al.
Pubblicazione: (2025)
di: Zhou, Zitang, et al.
Pubblicazione: (2025)
KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration
di: Zhang, Ruicheng, et al.
Pubblicazione: (2026)
di: Zhang, Ruicheng, et al.
Pubblicazione: (2026)
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
di: Sun, Zhiyao, et al.
Pubblicazione: (2025)
di: Sun, Zhiyao, et al.
Pubblicazione: (2025)
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
di: Zhang, Xinyao, et al.
Pubblicazione: (2026)
di: Zhang, Xinyao, et al.
Pubblicazione: (2026)
DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation
di: Hu, Jie, et al.
Pubblicazione: (2026)
di: Hu, Jie, et al.
Pubblicazione: (2026)
Pack and Force Your Memory: Long-form and Consistent Video Generation
di: Wu, Xiaofei, et al.
Pubblicazione: (2025)
di: Wu, Xiaofei, et al.
Pubblicazione: (2025)
Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
di: He, Xiaoxuan, et al.
Pubblicazione: (2026)
di: He, Xiaoxuan, et al.
Pubblicazione: (2026)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)
OrbitNVS: Harnessing Video Diffusion Priors for Novel View Synthesis
di: Liang, Jinglin, et al.
Pubblicazione: (2026)
di: Liang, Jinglin, et al.
Pubblicazione: (2026)
Fancy123: One Image to High-Quality 3D Mesh Generation via Plug-and-Play Deformation
di: Yu, Qiao, et al.
Pubblicazione: (2024)
di: Yu, Qiao, et al.
Pubblicazione: (2024)
Dual Semantic-Aware Network for Noise Suppressed Ultrasound Video Segmentation
di: Zhou, Ling, et al.
Pubblicazione: (2025)
di: Zhou, Ling, et al.
Pubblicazione: (2025)
OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation
di: Liang, Sen, et al.
Pubblicazione: (2025)
di: Liang, Sen, et al.
Pubblicazione: (2025)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2025)
di: Xiao, Jian, et al.
Pubblicazione: (2025)
Adaptive 3D Gaussian Splatting Video Streaming
di: Gong, Han, et al.
Pubblicazione: (2025)
di: Gong, Han, et al.
Pubblicazione: (2025)
Semantic Image Synthesis via Diffusion Models
di: Zhou, Wengang, et al.
Pubblicazione: (2022)
di: Zhou, Wengang, et al.
Pubblicazione: (2022)
SegCol Challenge: Semantic Segmentation for Tools and Fold Edges in Colonoscopy data
di: Ju, Xinwei, et al.
Pubblicazione: (2024)
di: Ju, Xinwei, et al.
Pubblicazione: (2024)
Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
di: Xue, Naifu, et al.
Pubblicazione: (2025)
di: Xue, Naifu, et al.
Pubblicazione: (2025)
SmoothVideo: Smooth Video Synthesis with Noise Constraints on Diffusion Models for One-shot Video Tuning
di: Peng, Liang, et al.
Pubblicazione: (2023)
di: Peng, Liang, et al.
Pubblicazione: (2023)
Documenti analoghi
-
SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
di: Lian, Jiesong, et al.
Pubblicazione: (2025) -
Video Generation Models Are Good Latent Reward Models
di: Mi, Xiaoyue, et al.
Pubblicazione: (2025) -
Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics
di: Zhong, Ruizhe, et al.
Pubblicazione: (2026) -
SARA: Controllable Makeup Transfer with Spatial Alignment and Region-Adaptive Normalization
di: Zhong, Xiaojing, et al.
Pubblicazione: (2023) -
USV: Unified Sparsification for Accelerating Video Diffusion Models
di: Wu, Xinjian, et al.
Pubblicazione: (2025)