Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search
Fuente:
arXiv
Salvato in:
| Autori principali: | Oshima, Yuta, Suzuki, Masahiro, Matsuo, Yutaka, Furuta, Hiroki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WorldPack: Compressed Memory Improves Spatial Consistency in Video World Modeling
di: Oshima, Yuta, et al.
Pubblicazione: (2025)
di: Oshima, Yuta, et al.
Pubblicazione: (2025)
SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces
di: Oshima, Yuta, et al.
Pubblicazione: (2024)
di: Oshima, Yuta, et al.
Pubblicazione: (2024)
MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
di: Oshima, Yuta, et al.
Pubblicazione: (2025)
di: Oshima, Yuta, et al.
Pubblicazione: (2025)
Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
di: Zhao, Zengqun, et al.
Pubblicazione: (2026)
di: Zhao, Zengqun, et al.
Pubblicazione: (2026)
Enhancing Unimodal Latent Representations in Multimodal VAEs through Iterative Amortized Inference
di: Oshima, Yuta, et al.
Pubblicazione: (2024)
di: Oshima, Yuta, et al.
Pubblicazione: (2024)
Inference-time Trajectory Optimization for Manga Image Editing
di: Furuta, Ryosuke
Pubblicazione: (2026)
di: Furuta, Ryosuke
Pubblicazione: (2026)
Realtime Data-Efficient Portrait Stylization Based On Geometric Alignment
di: Wang, Xinrui, et al.
Pubblicazione: (2022)
di: Wang, Xinrui, et al.
Pubblicazione: (2022)
Inference-time Physics Alignment of Video Generative Models with Latent World Models
di: Yuan, Jianhao, et al.
Pubblicazione: (2026)
di: Yuan, Jianhao, et al.
Pubblicazione: (2026)
CLIP-like Model as a Foundational Density Ratio Estimator
di: Uchiyama, Fumiya, et al.
Pubblicazione: (2025)
di: Uchiyama, Fumiya, et al.
Pubblicazione: (2025)
InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models
di: Rastegar, Sarah, et al.
Pubblicazione: (2025)
di: Rastegar, Sarah, et al.
Pubblicazione: (2025)
TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
di: Simon, Christian, et al.
Pubblicazione: (2025)
di: Simon, Christian, et al.
Pubblicazione: (2025)
Latent Beam Diffusion Models for Generating Visual Sequences
di: Fernandes, Guilherme, et al.
Pubblicazione: (2025)
di: Fernandes, Guilherme, et al.
Pubblicazione: (2025)
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
di: Zhang, David Junhao, et al.
Pubblicazione: (2023)
di: Zhang, David Junhao, et al.
Pubblicazione: (2023)
LTX-Video: Realtime Video Latent Diffusion
di: HaCohen, Yoav, et al.
Pubblicazione: (2024)
di: HaCohen, Yoav, et al.
Pubblicazione: (2024)
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
di: Suzuki, Naru, et al.
Pubblicazione: (2025)
di: Suzuki, Naru, et al.
Pubblicazione: (2025)
Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation
di: Hassan, Mariam, et al.
Pubblicazione: (2026)
di: Hassan, Mariam, et al.
Pubblicazione: (2026)
6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models
di: Su, Rundong, et al.
Pubblicazione: (2026)
di: Su, Rundong, et al.
Pubblicazione: (2026)
Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
di: Cheng, Min, et al.
Pubblicazione: (2025)
di: Cheng, Min, et al.
Pubblicazione: (2025)
LatentColorization: Latent Diffusion-Based Speaker Video Colorization
di: Ward, Rory, et al.
Pubblicazione: (2024)
di: Ward, Rory, et al.
Pubblicazione: (2024)
ColorizeDiffusion v2: Enhancing Reference-based Sketch Colorization Through Separating Utilities
di: Yan, Dingkun, et al.
Pubblicazione: (2025)
di: Yan, Dingkun, et al.
Pubblicazione: (2025)
Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation
di: Maduabuchi, Chika, et al.
Pubblicazione: (2025)
di: Maduabuchi, Chika, et al.
Pubblicazione: (2025)
Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models
di: Xie, Yiwei, et al.
Pubblicazione: (2026)
di: Xie, Yiwei, et al.
Pubblicazione: (2026)
Can Text-to-Video Generation help Video-Language Alignment?
di: Zanella, Luca, et al.
Pubblicazione: (2025)
di: Zanella, Luca, et al.
Pubblicazione: (2025)
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
di: Tsuchiya, Fumihiko, et al.
Pubblicazione: (2026)
di: Tsuchiya, Fumihiko, et al.
Pubblicazione: (2026)
HDR Video Generation via Latent Alignment with Logarithmic Encoding
di: Korem, Naomi Ken, et al.
Pubblicazione: (2026)
di: Korem, Naomi Ken, et al.
Pubblicazione: (2026)
Latte: Latent Diffusion Transformer for Video Generation
di: Ma, Xin, et al.
Pubblicazione: (2024)
di: Ma, Xin, et al.
Pubblicazione: (2024)
Boosting Latent Diffusion Models via Disentangled Representation Alignment
di: Page, John, et al.
Pubblicazione: (2026)
di: Page, John, et al.
Pubblicazione: (2026)
Text-image Alignment for Diffusion-based Perception
di: Kondapaneni, Neehar, et al.
Pubblicazione: (2023)
di: Kondapaneni, Neehar, et al.
Pubblicazione: (2023)
Progressive Text-to-Image Diffusion with Soft Latent Direction
di: Ye, YuTeng, et al.
Pubblicazione: (2023)
di: Ye, YuTeng, et al.
Pubblicazione: (2023)
Dynamic Reflections: Probing Video Representations with Text Alignment
di: Zhu, Tyler, et al.
Pubblicazione: (2025)
di: Zhu, Tyler, et al.
Pubblicazione: (2025)
Escaping Plato's Cave: Towards the Alignment of 3D and Text Latent Spaces
di: Hadgi, Souhail, et al.
Pubblicazione: (2025)
di: Hadgi, Souhail, et al.
Pubblicazione: (2025)
DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment
di: Cai, Xin, et al.
Pubblicazione: (2026)
di: Cai, Xin, et al.
Pubblicazione: (2026)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
LVMark: Robust Watermark for Latent Video Diffusion Models
di: Jang, MinHyuk, et al.
Pubblicazione: (2024)
di: Jang, MinHyuk, et al.
Pubblicazione: (2024)
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
di: Masui, Kento, et al.
Pubblicazione: (2024)
di: Masui, Kento, et al.
Pubblicazione: (2024)
FlashVideo: A Framework for Swift Inference in Text-to-Video Generation
di: Lei, Bin, et al.
Pubblicazione: (2023)
di: Lei, Bin, et al.
Pubblicazione: (2023)
ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
Searching Priors Makes Text-to-Video Synthesis Better
di: Cheng, Haoran, et al.
Pubblicazione: (2024)
di: Cheng, Haoran, et al.
Pubblicazione: (2024)
Documenti analoghi
-
WorldPack: Compressed Memory Improves Spatial Consistency in Video World Modeling
di: Oshima, Yuta, et al.
Pubblicazione: (2025) -
SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces
di: Oshima, Yuta, et al.
Pubblicazione: (2024) -
MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
di: Oshima, Yuta, et al.
Pubblicazione: (2025) -
Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback
di: Furuta, Hiroki, et al.
Pubblicazione: (2024) -
LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
di: Zhao, Zengqun, et al.
Pubblicazione: (2026)