Inference-time Physics Alignment of Video Generative Models with Latent World Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Jianhao, Zhang, Xiaofeng, Friedrich, Felix, Beltran-Velez, Nicolas, Hall, Melissa, Askari-Hemmat, Reyhane, Han, Xiaochuang, Ballas, Nicolas, Drozdzal, Michal, Romero-Soriano, Adriana |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving the Physics of Video Generation with VJEPA-2 Reward Signal
par: Yuan, Jianhao, et autres
Publié: (2025)
par: Yuan, Jianhao, et autres
Publié: (2025)
Multi-Modal Language Models as Text-to-Image Model Evaluators
par: Chen, Jiahui, et autres
Publié: (2025)
par: Chen, Jiahui, et autres
Publié: (2025)
Improving Geo-diversity of Generated Images with Contextualized Vendi Score Guidance
par: Hemmat, Reyhane Askari, et autres
Publié: (2024)
par: Hemmat, Reyhane Askari, et autres
Publié: (2024)
Increasing the Utility of Synthetic Images through Chamfer Guidance
par: Dall'Asen, Nicola, et autres
Publié: (2025)
par: Dall'Asen, Nicola, et autres
Publié: (2025)
Feedback-guided Data Synthesis for Imbalanced Classification
par: Hemmat, Reyhane Askari, et autres
Publié: (2023)
par: Hemmat, Reyhane Askari, et autres
Publié: (2023)
Improving the Scaling Laws of Synthetic Data with Deliberate Practice
par: Askari-Hemmat, Reyhane, et autres
Publié: (2025)
par: Askari-Hemmat, Reyhane, et autres
Publié: (2025)
On Improved Conditioning Mechanisms and Pre-training Strategies for Diffusion Models
par: Ifriqi, Tariq Berrada, et autres
Publié: (2024)
par: Ifriqi, Tariq Berrada, et autres
Publié: (2024)
The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models
par: Xiaofeng, Zhang, et autres
Publié: (2025)
par: Xiaofeng, Zhang, et autres
Publié: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
par: Hu, Yushi, et autres
Publié: (2025)
par: Hu, Yushi, et autres
Publié: (2025)
DIG In: Evaluating Disparities in Image Generations with Indicators for Geographic Diversity
par: Hall, Melissa, et autres
Publié: (2023)
par: Hall, Melissa, et autres
Publié: (2023)
Unified Text-Image Generation with Weakness-Targeted Post-Training
par: Chen, Jiahui, et autres
Publié: (2026)
par: Chen, Jiahui, et autres
Publié: (2026)
Why Less is More (Sometimes): A Theory of Data Curation
par: Dohmatob, Elvis, et autres
Publié: (2025)
par: Dohmatob, Elvis, et autres
Publié: (2025)
Towards Geographic Inclusion in the Evaluation of Text-to-Image Models
par: Hall, Melissa, et autres
Publié: (2024)
par: Hall, Melissa, et autres
Publié: (2024)
EvalGIM: A Library for Evaluating Generative Image Models
par: Hall, Melissa, et autres
Publié: (2024)
par: Hall, Melissa, et autres
Publié: (2024)
Boosting Latent Diffusion with Perceptual Objectives
par: Berrada, Tariq, et autres
Publié: (2024)
par: Berrada, Tariq, et autres
Publié: (2024)
PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs
par: Assouel, Rim, et autres
Publié: (2026)
par: Assouel, Rim, et autres
Publié: (2026)
Entropy Rectifying Guidance for Diffusion and Flow Models
par: Ifriqi, Tariq Berrada, et autres
Publié: (2025)
par: Ifriqi, Tariq Berrada, et autres
Publié: (2025)
Learning Latent Action World Models In The Wild
par: Garrido, Quentin, et autres
Publié: (2026)
par: Garrido, Quentin, et autres
Publié: (2026)
Consistency-diversity-realism Pareto fronts of conditional image generative models
par: Astolfi, Pietro, et autres
Publié: (2024)
par: Astolfi, Pietro, et autres
Publié: (2024)
QGen: On the Ability to Generalize in Quantization Aware Training
par: AskariHemmat, MohammadHossein, et autres
Publié: (2024)
par: AskariHemmat, MohammadHossein, et autres
Publié: (2024)
Object-centric Binding in Contrastive Language-Image Pretraining
par: Assouel, Rim, et autres
Publié: (2025)
par: Assouel, Rim, et autres
Publié: (2025)
Improving Text-to-Image Consistency via Automatic Prompt Optimization
par: Mañas, Oscar, et autres
Publié: (2024)
par: Mañas, Oscar, et autres
Publié: (2024)
Hierarchical Planning with Latent World Models
par: Zhang, Wancong, et autres
Publié: (2026)
par: Zhang, Wancong, et autres
Publié: (2026)
Controlling Multimodal LLMs via Reward-guided Decoding
par: Mañas, Oscar, et autres
Publié: (2025)
par: Mañas, Oscar, et autres
Publié: (2025)
VEDIT: Latent Prediction Architecture For Procedural Video Representation Learning
par: Lin, Han, et autres
Publié: (2024)
par: Lin, Han, et autres
Publié: (2024)
Learning and Leveraging World Models in Visual Representation Learning
par: Garrido, Quentin, et autres
Publié: (2024)
par: Garrido, Quentin, et autres
Publié: (2024)
What makes a good metric? Evaluating automatic metrics for text-to-image consistency
par: Ross, Candace, et autres
Publié: (2024)
par: Ross, Candace, et autres
Publié: (2024)
Flatness and Gradient Alignment Are Both Necessary: Spectral-Aware Gradient-Aligned Exploration for Multi-Distribution Learning
par: Ballas, Aristotelis, et autres
Publié: (2026)
par: Ballas, Aristotelis, et autres
Publié: (2026)
Delta-Audit: Explaining What Changes When Models Change
par: Hemmat, Arshia, et autres
Publié: (2025)
par: Hemmat, Arshia, et autres
Publié: (2025)
DIMCIM: A Quantitative Evaluation Framework for Default-mode Diversity and Generalization in Text-to-Image Generative Models
par: Teotia, Revant, et autres
Publié: (2025)
par: Teotia, Revant, et autres
Publié: (2025)
Metacognitive Reuse: Turning Recurring LLM Reasoning Into Concise Behaviors
par: Didolkar, Aniket, et autres
Publié: (2025)
par: Didolkar, Aniket, et autres
Publié: (2025)
A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs
par: Krojer, Benno, et autres
Publié: (2025)
par: Krojer, Benno, et autres
Publié: (2025)
Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal Control
par: Domingo-Enrich, Carles, et autres
Publié: (2024)
par: Domingo-Enrich, Carles, et autres
Publié: (2024)
TV2TV: A Unified Framework for Interleaved Language and Video Generation
par: Han, Xiaochuang, et autres
Publié: (2025)
par: Han, Xiaochuang, et autres
Publié: (2025)
CONTEMPORARY HERMENEUTICS AND THE ROLE OF THE SELF IN TRANSLATION
par: Amrollah Hemmat
Publié: (2009)
par: Amrollah Hemmat
Publié: (2009)
Hidden in Plain Sight: Evaluating Abstract Shape Recognition in Vision-Language Models
par: Hemmat, Arshia, et autres
Publié: (2024)
par: Hemmat, Arshia, et autres
Publié: (2024)
Olaf-World: Orienting Latent Actions for Video World Modeling
par: Jiang, Yuxin, et autres
Publié: (2026)
par: Jiang, Yuxin, et autres
Publié: (2026)
Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search
par: Oshima, Yuta, et autres
Publié: (2025)
par: Oshima, Yuta, et autres
Publié: (2025)
Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density
par: Balestriero, Randall, et autres
Publié: (2025)
par: Balestriero, Randall, et autres
Publié: (2025)
Can Generative AI Solve Your In-Context Learning Problem? A Martingale Perspective
par: Jesson, Andrew, et autres
Publié: (2024)
par: Jesson, Andrew, et autres
Publié: (2024)
Documents similaires
-
Improving the Physics of Video Generation with VJEPA-2 Reward Signal
par: Yuan, Jianhao, et autres
Publié: (2025) -
Multi-Modal Language Models as Text-to-Image Model Evaluators
par: Chen, Jiahui, et autres
Publié: (2025) -
Improving Geo-diversity of Generated Images with Contextualized Vendi Score Guidance
par: Hemmat, Reyhane Askari, et autres
Publié: (2024) -
Increasing the Utility of Synthetic Images through Chamfer Guidance
par: Dall'Asen, Nicola, et autres
Publié: (2025) -
Feedback-guided Data Synthesis for Imbalanced Classification
par: Hemmat, Reyhane Askari, et autres
Publié: (2023)