Latent Beam Diffusion Models for Generating Visual Sequences
Fuente:
arXiv
Salvato in:
| Autori principali: | Fernandes, Guilherme, Ramos, Vasco, Cohen, Regev, Szpektor, Idan, Magalhães, João |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
di: Ramos, Vasco, et al.
Pubblicazione: (2025)
di: Ramos, Vasco, et al.
Pubblicazione: (2025)
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
di: Ramos, Vasco, et al.
Pubblicazione: (2024)
di: Ramos, Vasco, et al.
Pubblicazione: (2024)
Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks
di: Bordalo, João, et al.
Pubblicazione: (2024)
di: Bordalo, João, et al.
Pubblicazione: (2024)
Anchored Diffusion for Video Face Reenactment
di: Kligvasser, Idan, et al.
Pubblicazione: (2024)
di: Kligvasser, Idan, et al.
Pubblicazione: (2024)
Looks Too Good To Be True: An Information-Theoretic Analysis of Hallucinations in Generative Restoration Models
di: Cohen, Regev, et al.
Pubblicazione: (2024)
di: Cohen, Regev, et al.
Pubblicazione: (2024)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
di: Gordon, Brian, et al.
Pubblicazione: (2023)
di: Gordon, Brian, et al.
Pubblicazione: (2023)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
di: Gordon, Brian, et al.
Pubblicazione: (2025)
di: Gordon, Brian, et al.
Pubblicazione: (2025)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
di: Bitton-Guetta, Nitzan, et al.
Pubblicazione: (2024)
di: Bitton-Guetta, Nitzan, et al.
Pubblicazione: (2024)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
Face inpainting with Identity Preserving Latent Diffusion Models
di: Santos, João, et al.
Pubblicazione: (2026)
di: Santos, João, et al.
Pubblicazione: (2026)
Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search
di: Oshima, Yuta, et al.
Pubblicazione: (2025)
di: Oshima, Yuta, et al.
Pubblicazione: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding
di: Pereira, Joao, et al.
Pubblicazione: (2025)
di: Pereira, Joao, et al.
Pubblicazione: (2025)
RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generation
di: Slobodkin, Aviv, et al.
Pubblicazione: (2025)
di: Slobodkin, Aviv, et al.
Pubblicazione: (2025)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
di: Zhang, Yue, et al.
Pubblicazione: (2026)
di: Zhang, Yue, et al.
Pubblicazione: (2026)
Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis
di: Ventura, Mor, et al.
Pubblicazione: (2026)
di: Ventura, Mor, et al.
Pubblicazione: (2026)
Detection-Driven Object Count Optimization for Text-to-Image Diffusion Models
di: Zafar, Oz, et al.
Pubblicazione: (2024)
di: Zafar, Oz, et al.
Pubblicazione: (2024)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
di: Liu, Chang, et al.
Pubblicazione: (2023)
di: Liu, Chang, et al.
Pubblicazione: (2023)
From Visual Explanations to Counterfactual Explanations with Latent Diffusion
di: Luu, Tung, et al.
Pubblicazione: (2025)
di: Luu, Tung, et al.
Pubblicazione: (2025)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
di: Pereira, João, et al.
Pubblicazione: (2026)
di: Pereira, João, et al.
Pubblicazione: (2026)
Latent Feature-Guided Diffusion Models for Shadow Removal
di: Mei, Kangfu, et al.
Pubblicazione: (2023)
di: Mei, Kangfu, et al.
Pubblicazione: (2023)
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
di: Wang, Chenfeng, et al.
Pubblicazione: (2026)
di: Wang, Chenfeng, et al.
Pubblicazione: (2026)
StrokeFusion: Vector Sketch Generation via Joint Stroke-UDF Encoding and Latent Sequence Diffusion
di: Zhou, Jin, et al.
Pubblicazione: (2025)
di: Zhou, Jin, et al.
Pubblicazione: (2025)
Generalized Visual Relation Detection with Diffusion Models
di: Gao, Kaifeng, et al.
Pubblicazione: (2025)
di: Gao, Kaifeng, et al.
Pubblicazione: (2025)
Visual Diffusion Models are Geometric Solvers
di: Goren, Nir, et al.
Pubblicazione: (2025)
di: Goren, Nir, et al.
Pubblicazione: (2025)
Controlling the Latent Diffusion Model for Generative Image Shadow Removal via Residual Generation
di: Li, Xinjie, et al.
Pubblicazione: (2024)
di: Li, Xinjie, et al.
Pubblicazione: (2024)
Latent Diffusion for Guided Document Table Generation
di: Hamdani, Syed Jawwad Haider, et al.
Pubblicazione: (2024)
di: Hamdani, Syed Jawwad Haider, et al.
Pubblicazione: (2024)
Latte: Latent Diffusion Transformer for Video Generation
di: Ma, Xin, et al.
Pubblicazione: (2024)
di: Ma, Xin, et al.
Pubblicazione: (2024)
Utilizing Image Transforms and Diffusion Models for Generative Modeling of Short and Long Time Series
di: Naiman, Ilan, et al.
Pubblicazione: (2024)
di: Naiman, Ilan, et al.
Pubblicazione: (2024)
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
Latent Space Super-Resolution for Higher-Resolution Image Generation with Diffusion Models
di: Jeong, Jinho, et al.
Pubblicazione: (2025)
di: Jeong, Jinho, et al.
Pubblicazione: (2025)
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
di: Zhang, David Junhao, et al.
Pubblicazione: (2023)
di: Zhang, David Junhao, et al.
Pubblicazione: (2023)
LaMoD: Latent Motion Diffusion Model For Myocardial Strain Generation
di: Xing, Jiarui, et al.
Pubblicazione: (2024)
di: Xing, Jiarui, et al.
Pubblicazione: (2024)
JADE: Joint-aware Latent Diffusion for 3D Human Generative Modeling
di: Ji, Haorui, et al.
Pubblicazione: (2024)
di: Ji, Haorui, et al.
Pubblicazione: (2024)
MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation
di: Sun, Mingzhen, et al.
Pubblicazione: (2024)
di: Sun, Mingzhen, et al.
Pubblicazione: (2024)
Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
Diffusion Models Need Visual Priors for Image Generation
di: Yue, Xiaoyu, et al.
Pubblicazione: (2024)
di: Yue, Xiaoyu, et al.
Pubblicazione: (2024)
Zero-Shot Action Recognition in Surveillance Videos
di: Pereira, Joao, et al.
Pubblicazione: (2024)
di: Pereira, Joao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
di: Ramos, Vasco, et al.
Pubblicazione: (2025) -
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
di: Ramos, Vasco, et al.
Pubblicazione: (2024) -
Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks
di: Bordalo, João, et al.
Pubblicazione: (2024) -
Anchored Diffusion for Video Face Reenactment
di: Kligvasser, Idan, et al.
Pubblicazione: (2024) -
Looks Too Good To Be True: An Information-Theoretic Analysis of Hallucinations in Generative Restoration Models
di: Cohen, Regev, et al.
Pubblicazione: (2024)