PISA Experiments: Exploring Physics Post-Training for Video Diffusion Models by Watching Stuff Drop
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Chenyu, Michel, Oscar, Pan, Xichen, Liu, Sainan, Roberts, Mike, Xie, Saining |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Image Sculpting: Precise Object Editing with 3D Geometry Control
par: Yenphraphai, Jiraphon, et autres
Publié: (2024)
par: Yenphraphai, Jiraphon, et autres
Publié: (2024)
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
par: Tang, Bingda, et autres
Publié: (2025)
par: Tang, Bingda, et autres
Publié: (2025)
Cambrian-P: Pose-Grounded Video Understanding
par: Yang, Jihan, et autres
Publié: (2026)
par: Yang, Jihan, et autres
Publié: (2026)
Repurposing Geometric Foundation Models for Multi-view Diffusion
par: Jang, Wooseok, et autres
Publié: (2026)
par: Jang, Wooseok, et autres
Publié: (2026)
Solaris: Building a Multiplayer Video World Model in Minecraft
par: Savva, Georgy, et autres
Publié: (2026)
par: Savva, Georgy, et autres
Publié: (2026)
Deconstructing Denoising Diffusion Models for Self-Supervised Learning
par: Chen, Xinlei, et autres
Publié: (2024)
par: Chen, Xinlei, et autres
Publié: (2024)
SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers
par: Ma, Nanye, et autres
Publié: (2024)
par: Ma, Nanye, et autres
Publié: (2024)
Fast Encoding and Decoding for Implicit Video Representation
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset
par: Chen, Jiuhai, et autres
Publié: (2025)
par: Chen, Jiuhai, et autres
Publié: (2025)
Diffusion Transformers with Representation Autoencoders
par: Zheng, Boyang, et autres
Publié: (2025)
par: Zheng, Boyang, et autres
Publié: (2025)
TPDiff: Temporal Pyramid Video Diffusion Model
par: Ran, Lingmin, et autres
Publié: (2025)
par: Ran, Lingmin, et autres
Publié: (2025)
Video Diffusion Models are Training-free Motion Interpreter and Controller
par: Xiao, Zeqi, et autres
Publié: (2024)
par: Xiao, Zeqi, et autres
Publié: (2024)
Morpheus: Benchmarking Physical Reasoning of Video Generative Models with Real Physical Experiments
par: Zhang, Chenyu, et autres
Publié: (2025)
par: Zhang, Chenyu, et autres
Publié: (2025)
SARD: Segmentation-Aware Anomaly Synthesis via Region-Constrained Diffusion with Discriminative Mask Guidance
par: Wang, Yanshu, et autres
Publié: (2025)
par: Wang, Yanshu, et autres
Publié: (2025)
Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
par: Brown, Ellis, et autres
Publié: (2025)
par: Brown, Ellis, et autres
Publié: (2025)
LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
par: Yang, Lianwei, et autres
Publié: (2025)
par: Yang, Lianwei, et autres
Publié: (2025)
Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
par: Yu, Sihyun, et autres
Publié: (2024)
par: Yu, Sihyun, et autres
Publié: (2024)
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
par: Xu, Jilan, et autres
Publié: (2025)
par: Xu, Jilan, et autres
Publié: (2025)
DiffusionGuard: A Robust Defense Against Malicious Diffusion-based Image Editing
par: Choi, June Suk, et autres
Publié: (2024)
par: Choi, June Suk, et autres
Publié: (2024)
MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers
par: Li, Haopeng, et autres
Publié: (2026)
par: Li, Haopeng, et autres
Publié: (2026)
SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
par: Brown, Ellis, et autres
Publié: (2025)
par: Brown, Ellis, et autres
Publié: (2025)
SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs
par: Tong, Shengbang, et autres
Publié: (2024)
par: Tong, Shengbang, et autres
Publié: (2024)
QVD: Post-training Quantization for Video Diffusion Models
par: Tian, Shilong, et autres
Publié: (2024)
par: Tian, Shilong, et autres
Publié: (2024)
Exploring Data-Free LoRA Transferability for Video Diffusion Models
par: Wang, Yuchen, et autres
Publié: (2026)
par: Wang, Yuchen, et autres
Publié: (2026)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
par: Guan, Yiran, et autres
Publié: (2026)
par: Guan, Yiran, et autres
Publié: (2026)
Scale Where It Matters: Training-Free Localized Scaling for Diffusion Models
par: Ren, Qin, et autres
Publié: (2025)
par: Ren, Qin, et autres
Publié: (2025)
SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training
par: Wang, Jianyi, et autres
Publié: (2025)
par: Wang, Jianyi, et autres
Publié: (2025)
Watch Before You Answer: Learning from Visually Grounded Post-Training
par: Zhang, Yuxuan, et autres
Publié: (2026)
par: Zhang, Yuxuan, et autres
Publié: (2026)
ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning
par: Duan, Zhongjie, et autres
Publié: (2024)
par: Duan, Zhongjie, et autres
Publié: (2024)
Tail-Aware Post-Training Quantization for 3D Geometry Models
par: Pan, Sicheng, et autres
Publié: (2026)
par: Pan, Sicheng, et autres
Publié: (2026)
Exploring Iterative Refinement with Diffusion Models for Video Grounding
par: Liang, Xiao, et autres
Publié: (2023)
par: Liang, Xiao, et autres
Publié: (2023)
VipDiff: Towards Coherent and Diverse Video Inpainting via Training-free Denoising Diffusion Models
par: Xie, Chaohao, et autres
Publié: (2025)
par: Xie, Chaohao, et autres
Publié: (2025)
Magic Fixup: Streamlining Photo Editing by Watching Dynamic Videos
par: Alzayer, Hadi, et autres
Publié: (2024)
par: Alzayer, Hadi, et autres
Publié: (2024)
WAT: Online Video Understanding Needs Watching Before Thinking
par: Han, Zifan, et autres
Publié: (2026)
par: Han, Zifan, et autres
Publié: (2026)
Self-Refining Video Sampling
par: Jang, Sangwon, et autres
Publié: (2026)
par: Jang, Sangwon, et autres
Publié: (2026)
Learning A Physical-aware Diffusion Model Based on Transformer for Underwater Image Enhancement
par: Zhao, Chen, et autres
Publié: (2024)
par: Zhao, Chen, et autres
Publié: (2024)
Transfer between Modalities with MetaQueries
par: Pan, Xichen, et autres
Publié: (2025)
par: Pan, Xichen, et autres
Publié: (2025)
Documents similaires
-
Image Sculpting: Precise Object Editing with 3D Geometry Control
par: Yenphraphai, Jiraphon, et autres
Publié: (2024) -
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
par: Tang, Bingda, et autres
Publié: (2025) -
Cambrian-P: Pose-Grounded Video Understanding
par: Yang, Jihan, et autres
Publié: (2026) -
Repurposing Geometric Foundation Models for Multi-view Diffusion
par: Jang, Wooseok, et autres
Publié: (2026) -
Solaris: Building a Multiplayer Video World Model in Minecraft
par: Savva, Georgy, et autres
Publié: (2026)