Generative Physical AI in Vision: A Survey
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Daochang, Zhang, Junyu, Dinh, Anh-Dung, Park, Eunbyung, Zhang, Shichao, Mian, Ajmal, Shah, Mubarak, Xu, Chang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Compress Guidance in Conditional Diffusion Sampling
por: Dinh, Anh-Dung, et al.
Publicado: (2024)
por: Dinh, Anh-Dung, et al.
Publicado: (2024)
Surgical Triplet Recognition via Diffusion Model
por: Liu, Daochang, et al.
Publicado: (2024)
por: Liu, Daochang, et al.
Publicado: (2024)
Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control
por: Le, Nhat, et al.
Publicado: (2026)
por: Le, Nhat, et al.
Publicado: (2026)
Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
por: Hao, Yutong, et al.
Publicado: (2025)
por: Hao, Yutong, et al.
Publicado: (2025)
Implicit Neural Representation-Based Continuous Single Image Super-Resolution: An Empirical Benchmark
por: Nasir, Tayyab, et al.
Publicado: (2026)
por: Nasir, Tayyab, et al.
Publicado: (2026)
Safety Without Semantic Disruptions: Editing-free Safe Image Generation via Context-preserving Dual Latent Reconstruction
por: Vice, Jordan, et al.
Publicado: (2024)
por: Vice, Jordan, et al.
Publicado: (2024)
Text-guided 3D Human Motion Generation with Keyframe-based Parallel Skip Transformer
por: Geng, Zichen, et al.
Publicado: (2024)
por: Geng, Zichen, et al.
Publicado: (2024)
Enhancing Privacy-Utility Trade-offs to Mitigate Memorization in Diffusion Models
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
Exploring Local Memorization in Diffusion Models via Bright Ending Attention
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Not All Tokens are Guided Equal: Improving Guidance in Visual Autoregressive Models
por: Nguyen, Ky Dan, et al.
Publicado: (2025)
por: Nguyen, Ky Dan, et al.
Publicado: (2025)
NAIMA: Semantics Aware RGB Guided Depth Super-Resolution
por: Nasir, Tayyab, et al.
Publicado: (2026)
por: Nasir, Tayyab, et al.
Publicado: (2026)
Investigating Memorization in Video Diffusion Models
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Sparse Points to Dense Clouds: Enhancing 3D Detection with Limited LiDAR Data
por: Kumar, Aakash, et al.
Publicado: (2024)
por: Kumar, Aakash, et al.
Publicado: (2024)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
por: Miao, Bo, et al.
Publicado: (2024)
por: Miao, Bo, et al.
Publicado: (2024)
Draft-and-Target Sampling for Video Generation Policy
por: Zhang, Qikang, et al.
Publicado: (2026)
por: Zhang, Qikang, et al.
Publicado: (2026)
Diffusion Models in Vision: A Survey
por: Croitoru, Florinel-Alin, et al.
Publicado: (2022)
por: Croitoru, Florinel-Alin, et al.
Publicado: (2022)
DiffuseHigh: Training-free Progressive High-Resolution Image Synthesis through Structure Guidance
por: Kim, Younghyun, et al.
Publicado: (2024)
por: Kim, Younghyun, et al.
Publicado: (2024)
FastBO: Fast HPO and NAS with Adaptive Fidelity Identification
por: Jiang, Jiantong, et al.
Publicado: (2024)
por: Jiang, Jiantong, et al.
Publicado: (2024)
UniHM: Universal Human Motion Generation with Object Interactions in Indoor Scenes
por: Geng, Zichen, et al.
Publicado: (2025)
por: Geng, Zichen, et al.
Publicado: (2025)
Manipulating and Mitigating Generative Model Biases without Retraining
por: Vice, Jordan, et al.
Publicado: (2024)
por: Vice, Jordan, et al.
Publicado: (2024)
Exploring Bias in over 100 Text-to-Image Generative Models
por: Vice, Jordan, et al.
Publicado: (2025)
por: Vice, Jordan, et al.
Publicado: (2025)
Auto-Regressive Diffusion for Generating 3D Human-Object Interactions
por: Geng, Zichen, et al.
Publicado: (2025)
por: Geng, Zichen, et al.
Publicado: (2025)
CollagePrompt: A Benchmark for Budget-Friendly Visual Recognition with GPT-4V
por: Xu, Siyu, et al.
Publicado: (2024)
por: Xu, Siyu, et al.
Publicado: (2024)
VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis
por: Park, Jinho, et al.
Publicado: (2026)
por: Park, Jinho, et al.
Publicado: (2026)
Disentangled Hierarchical VAE for 3D Human-Human Interaction Generation
por: Geng, Zichen, et al.
Publicado: (2026)
por: Geng, Zichen, et al.
Publicado: (2026)
On the Fairness, Diversity and Reliability of Text-to-Image Generative Models
por: Vice, Jordan, et al.
Publicado: (2024)
por: Vice, Jordan, et al.
Publicado: (2024)
Towards Memorization-Free Diffusion Models
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Multi-Level Heterogeneous Knowledge Transfer Network on Forward Scattering Center Model for Limited Samples SAR ATR
por: Zhao, Chenxi, et al.
Publicado: (2025)
por: Zhao, Chenxi, et al.
Publicado: (2025)
Multistream Network for LiDAR and Camera-based 3D Object Detection in Outdoor Scenes
por: Ibrahim, Muhammad, et al.
Publicado: (2025)
por: Ibrahim, Muhammad, et al.
Publicado: (2025)
Visual Attention Methods in Deep Learning: An In-Depth Survey
por: Hassanin, Mohammed, et al.
Publicado: (2022)
por: Hassanin, Mohammed, et al.
Publicado: (2022)
Weakly-Supervised Spatiotemporal Anomaly Detection
por: Gianchandani, Urvi, et al.
Publicado: (2026)
por: Gianchandani, Urvi, et al.
Publicado: (2026)
Attribution-Guided Model Rectification of Unreliable Neural Network Behaviors
por: Yang, Peiyu, et al.
Publicado: (2026)
por: Yang, Peiyu, et al.
Publicado: (2026)
Skip Mamba Diffusion for Monocular 3D Semantic Scene Completion
por: Liang, Li, et al.
Publicado: (2025)
por: Liang, Li, et al.
Publicado: (2025)
Class-Partitioned VQ-VAE and Latent Flow Matching for Point Cloud Scene Generation
por: Edirimuni, Dasith de Silva, et al.
Publicado: (2026)
por: Edirimuni, Dasith de Silva, et al.
Publicado: (2026)
Geo-Registration of Terrestrial LiDAR Point Clouds with Satellite Images without GNSS
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations
por: Vice, Jordan, et al.
Publicado: (2025)
por: Vice, Jordan, et al.
Publicado: (2025)
CompMarkGS: Robust Watermarking for Compressed 3D Gaussian Splatting
por: In, Sumin, et al.
Publicado: (2025)
por: In, Sumin, et al.
Publicado: (2025)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
por: Chen, Mengyuan, et al.
Publicado: (2024)
por: Chen, Mengyuan, et al.
Publicado: (2024)
ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation
por: Geng, Zichen, et al.
Publicado: (2025)
por: Geng, Zichen, et al.
Publicado: (2025)
Image Colorization: A Survey and Dataset
por: Anwar, Saeed, et al.
Publicado: (2020)
por: Anwar, Saeed, et al.
Publicado: (2020)
Ejemplares similares
-
Compress Guidance in Conditional Diffusion Sampling
por: Dinh, Anh-Dung, et al.
Publicado: (2024) -
Surgical Triplet Recognition via Diffusion Model
por: Liu, Daochang, et al.
Publicado: (2024) -
Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control
por: Le, Nhat, et al.
Publicado: (2026) -
Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
por: Hao, Yutong, et al.
Publicado: (2025) -
Implicit Neural Representation-Based Continuous Single Image Super-Resolution: An Empirical Benchmark
por: Nasir, Tayyab, et al.
Publicado: (2026)