PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Satish, Siddarth Nilol Kundur, Jaiswal, Devesh, Chen, Hongyu, Bakshi, Abhishek |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance
di: Wang, Chaoyi, et al.
Pubblicazione: (2025)
di: Wang, Chaoyi, et al.
Pubblicazione: (2025)
A Simple Baseline for Streaming Video Understanding
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
Action Anticipation from SoccerNet Football Video Broadcasts
di: Dalal, Mohamad, et al.
Pubblicazione: (2025)
di: Dalal, Mohamad, et al.
Pubblicazione: (2025)
Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos
di: Li, Yayuan, et al.
Pubblicazione: (2025)
di: Li, Yayuan, et al.
Pubblicazione: (2025)
NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models
di: Lee, Kyuho, et al.
Pubblicazione: (2025)
di: Lee, Kyuho, et al.
Pubblicazione: (2025)
CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models
di: Foss, Aaron, et al.
Pubblicazione: (2025)
di: Foss, Aaron, et al.
Pubblicazione: (2025)
Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition
di: Wang, Yiming, et al.
Pubblicazione: (2026)
di: Wang, Yiming, et al.
Pubblicazione: (2026)
Semi supervised GAN for smart microscopy, fast and data efficient cell cycle classification
di: Manick, Rajeev, et al.
Pubblicazione: (2026)
di: Manick, Rajeev, et al.
Pubblicazione: (2026)
SimWorld: A Unified Benchmark for Simulator-Conditioned Scene Generation via World Model
di: Li, Xinqing, et al.
Pubblicazione: (2025)
di: Li, Xinqing, et al.
Pubblicazione: (2025)
OmniAcc: Personalized Accessibility Assistant Using Generative AI
di: Karki, Siddhant, et al.
Pubblicazione: (2025)
di: Karki, Siddhant, et al.
Pubblicazione: (2025)
From eye to AI: studying rodent social behavior in the era of machine Learning
di: Chindemi, Giuseppe, et al.
Pubblicazione: (2025)
di: Chindemi, Giuseppe, et al.
Pubblicazione: (2025)
GenMatter: Perceiving Physical Objects with Generative Matter Models
di: Li, Eric, et al.
Pubblicazione: (2026)
di: Li, Eric, et al.
Pubblicazione: (2026)
A Reverse Causal Framework to Mitigate Spurious Correlations for Debiasing Scene Graph Generation
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
LATTE: Latent Trajectory Embedding for Diffusion-Generated Image Detection
di: Vasilcoiu, Ana, et al.
Pubblicazione: (2025)
di: Vasilcoiu, Ana, et al.
Pubblicazione: (2025)
Combining Absolute and Semi-Generalized Relative Poses for Visual Localization
di: Panek, Vojtech, et al.
Pubblicazione: (2024)
di: Panek, Vojtech, et al.
Pubblicazione: (2024)
Foreground Focus: Enhancing Coherence and Fidelity in Camouflaged Image Generation
di: Chen, Pei-Chi, et al.
Pubblicazione: (2025)
di: Chen, Pei-Chi, et al.
Pubblicazione: (2025)
A Recipe for Geometry-Aware 3D Mesh Transformers
di: Farazi, Mohammad, et al.
Pubblicazione: (2024)
di: Farazi, Mohammad, et al.
Pubblicazione: (2024)
Deep Learning-based Depth Estimation Methods from Monocular Image and Videos: A Comprehensive Survey
di: Rajapaksha, Uchitha, et al.
Pubblicazione: (2024)
di: Rajapaksha, Uchitha, et al.
Pubblicazione: (2024)
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
di: Durrani, Hamza Ahmed, et al.
Pubblicazione: (2026)
di: Durrani, Hamza Ahmed, et al.
Pubblicazione: (2026)
DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification
di: Ho, Darryl, et al.
Pubblicazione: (2025)
di: Ho, Darryl, et al.
Pubblicazione: (2025)
Towards a Generalizable Fusion Architecture for Multimodal Object Detection
di: Berjawi, Jad, et al.
Pubblicazione: (2025)
di: Berjawi, Jad, et al.
Pubblicazione: (2025)
Detecting AI-Generated Videos with Spiking Neural Networks
di: Jang, Minsuk, et al.
Pubblicazione: (2026)
di: Jang, Minsuk, et al.
Pubblicazione: (2026)
PhysicsNeRF: Physics-Guided 3D Reconstruction from Sparse Views
di: Barhdadi, Mohamed Rayan, et al.
Pubblicazione: (2025)
di: Barhdadi, Mohamed Rayan, et al.
Pubblicazione: (2025)
VDPP: Video Depth Post-Processing for Speed and Scalability
di: Yoon, Daewon, et al.
Pubblicazione: (2026)
di: Yoon, Daewon, et al.
Pubblicazione: (2026)
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
di: Ko, Hyun-kyu, et al.
Pubblicazione: (2026)
di: Ko, Hyun-kyu, et al.
Pubblicazione: (2026)
Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens
di: Shen, Meng, et al.
Pubblicazione: (2026)
di: Shen, Meng, et al.
Pubblicazione: (2026)
Car Object Counting and Position Estimation via Extension of the CLIP-EBC Framework
di: Jung, Seoik, et al.
Pubblicazione: (2025)
di: Jung, Seoik, et al.
Pubblicazione: (2025)
Visible Iris Area as a Quality Metric for Reliable Iris Recognition Under Pupil Dilation and Eyelid Occlusion
di: Pessaud, Jack, et al.
Pubblicazione: (2025)
di: Pessaud, Jack, et al.
Pubblicazione: (2025)
Privacy-Preserving Structureless Visual Localization via Image Obfuscation
di: Panek, Vojtech, et al.
Pubblicazione: (2026)
di: Panek, Vojtech, et al.
Pubblicazione: (2026)
HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding
di: Jin, Haopeng, et al.
Pubblicazione: (2026)
di: Jin, Haopeng, et al.
Pubblicazione: (2026)
Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery
di: Wu, Kunlin, et al.
Pubblicazione: (2026)
di: Wu, Kunlin, et al.
Pubblicazione: (2026)
DeltaVLM: Interactive Remote Sensing Image Change Analysis via Instruction-guided Difference Perception
di: Deng, Pei, et al.
Pubblicazione: (2025)
di: Deng, Pei, et al.
Pubblicazione: (2025)
Hierarchical Image-Guided 3D Point Cloud Segmentation in Industrial Scenes via Multi-View Bayesian Fusion
di: Zhu, Yu, et al.
Pubblicazione: (2025)
di: Zhu, Yu, et al.
Pubblicazione: (2025)
CADE 2.5 - ZeResFDG: Frequency-Decoupled, Rescaled and Zero-Projected Guidance for SD/SDXL Latent Diffusion Models
di: Rychkovskiy, Denis
Pubblicazione: (2025)
di: Rychkovskiy, Denis
Pubblicazione: (2025)
Video-based Exercise Classification and Activated Muscle Group Prediction with Hybrid X3D-SlowFast Network
di: Pasula, Manvik, et al.
Pubblicazione: (2024)
di: Pasula, Manvik, et al.
Pubblicazione: (2024)
RayFlow: Instance-Aware Diffusion Acceleration via Adaptive Flow Trajectories
di: Shao, Huiyang, et al.
Pubblicazione: (2025)
di: Shao, Huiyang, et al.
Pubblicazione: (2025)
Context in object detection: a systematic literature review
di: Jamali, Mahtab, et al.
Pubblicazione: (2025)
di: Jamali, Mahtab, et al.
Pubblicazione: (2025)
Mask-Conditioned Voxel Diffusion for Joint Geometry and Color Inpainting
di: Sumuk, Aarya
Pubblicazione: (2026)
di: Sumuk, Aarya
Pubblicazione: (2026)
Pedestrian Detection in Low-Light Conditions: A Comprehensive Survey
di: Ghari, Bahareh, et al.
Pubblicazione: (2024)
di: Ghari, Bahareh, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025) -
OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance
di: Wang, Chaoyi, et al.
Pubblicazione: (2025) -
A Simple Baseline for Streaming Video Understanding
di: Shen, Yujiao, et al.
Pubblicazione: (2026) -
Action Anticipation from SoccerNet Football Video Broadcasts
di: Dalal, Mohamad, et al.
Pubblicazione: (2025) -
Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos
di: Li, Yayuan, et al.
Pubblicazione: (2025)