Simulating the Real World: A Unified Survey of Multimodal Generative Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Yuqi, Wang, Longguang, Liu, Xian, Chen, Ling-Hao, Guo, Yuwei, Shi, Yukai, Liu, Ce, Rao, Anyi, Wang, Zeyu, Xiong, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NegVSR: Augmenting Negatives for Generalized Noise Modeling in Real-World Video Super-Resolution
di: Song, Yexing, et al.
Pubblicazione: (2023)
di: Song, Yexing, et al.
Pubblicazione: (2023)
Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
di: Yang, Songlin, et al.
Pubblicazione: (2026)
di: Yang, Songlin, et al.
Pubblicazione: (2026)
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
di: Chen, Houyuan, et al.
Pubblicazione: (2026)
di: Chen, Houyuan, et al.
Pubblicazione: (2026)
Composing Concepts from Images and Videos via Concept-prompt Binding
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
UPGS: Unified Pose-aware Gaussian Splatting for Dynamic Scene Deblurring
di: Wu, Zhijing, et al.
Pubblicazione: (2025)
di: Wu, Zhijing, et al.
Pubblicazione: (2025)
CinePreGen: Camera Controllable Video Previsualization via Engine-powered Diffusion
di: Chen, Yiran, et al.
Pubblicazione: (2024)
di: Chen, Yiran, et al.
Pubblicazione: (2024)
Extended Non-Markovian Stochastic Schrödinger Equation with Complex Frequency Modes for General Basis Functions
di: Guo, Yukai, et al.
Pubblicazione: (2025)
di: Guo, Yukai, et al.
Pubblicazione: (2025)
DroneSR: Rethinking Few-shot Thermal Image Super-Resolution from Drone-based Perspective
di: Weng, Zhipeng, et al.
Pubblicazione: (2025)
di: Weng, Zhipeng, et al.
Pubblicazione: (2025)
AURA: Multimodal Shared Autonomy for Real-World Urban Navigation
di: Ma, Yukai, et al.
Pubblicazione: (2026)
di: Ma, Yukai, et al.
Pubblicazione: (2026)
XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs
di: Xiao, Yuzhuo, et al.
Pubblicazione: (2025)
di: Xiao, Yuzhuo, et al.
Pubblicazione: (2025)
Is Sora a World Simulator? A Comprehensive Survey on General World Models and Beyond
di: Zhu, Zheng, et al.
Pubblicazione: (2024)
di: Zhu, Zheng, et al.
Pubblicazione: (2024)
Mask-ControlNet: Higher-Quality Image Generation with An Additional Mask Prompt
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
Graph-Based Uncertainty Modeling and Multimodal Fusion for Salient Object Detection
di: Xiong, Yuqi, et al.
Pubblicazione: (2025)
di: Xiong, Yuqi, et al.
Pubblicazione: (2025)
A Unified Hierarchical Framework for Fine-grained Cross-view Geo-localization over Large-scale Scenarios
di: Song, Zhuo, et al.
Pubblicazione: (2025)
di: Song, Zhuo, et al.
Pubblicazione: (2025)
SimART: A Unified and Open Real-world Multimodal Simulation Platform for 6G Integrated Sensing and Communication
di: Yan, Kang, et al.
Pubblicazione: (2026)
di: Yan, Kang, et al.
Pubblicazione: (2026)
URaG: Unified Retrieval and Generation in Multimodal LLMs for Efficient Long Document Understanding
di: Shi, Yongxin, et al.
Pubblicazione: (2025)
di: Shi, Yongxin, et al.
Pubblicazione: (2025)
Controllable Reference Guided Diffusion with Local Global Fusion for Real World Remote Sensing Image Super Resolution
di: Wang, Ce, et al.
Pubblicazione: (2025)
di: Wang, Ce, et al.
Pubblicazione: (2025)
Towards UAV Detection in the Real World: A New Multispectral Dataset UAVNet-MS and a New Method
di: Luo, Yihang, et al.
Pubblicazione: (2026)
di: Luo, Yihang, et al.
Pubblicazione: (2026)
Taming Flow-based I2V Models for Creative Video Editing
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
On Fairness of Unified Multimodal Large Language Model for Image Generation
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
Light of Normals: Unified Feature Representation for Universal Photometric Stereo
di: Chen, Houyuan, et al.
Pubblicazione: (2025)
di: Chen, Houyuan, et al.
Pubblicazione: (2025)
A Comprehensive Survey for Real-World Industrial Defect Detection: Challenges, Approaches, and Prospects
di: Cheng, Yuqi, et al.
Pubblicazione: (2025)
di: Cheng, Yuqi, et al.
Pubblicazione: (2025)
Controllable Text-to-Motion Generation via Modular Body-Part Phase Control
di: Dai, Minyue, et al.
Pubblicazione: (2026)
di: Dai, Minyue, et al.
Pubblicazione: (2026)
PanMatch: Unleashing the Potential of Large Vision Models for Unified Matching Models
di: Zhang, Yongjian, et al.
Pubblicazione: (2025)
di: Zhang, Yongjian, et al.
Pubblicazione: (2025)
Quantum Simulation of Open Quantum Dynamics via Non-Markovian Quantum State Diffusion
di: Guo, Yukai, et al.
Pubblicazione: (2024)
di: Guo, Yukai, et al.
Pubblicazione: (2024)
DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection
di: Wu, Junchao, et al.
Pubblicazione: (2026)
di: Wu, Junchao, et al.
Pubblicazione: (2026)
Code2Worlds: Empowering Coding LLMs for 4D World Generation
di: Zhang, Yi, et al.
Pubblicazione: (2026)
di: Zhang, Yi, et al.
Pubblicazione: (2026)
Improving Generalization of Speech Separation in Real-World Scenarios: Strategies in Simulation, Optimization, and Evaluation
di: Chen, Ke, et al.
Pubblicazione: (2024)
di: Chen, Ke, et al.
Pubblicazione: (2024)
On the Low-SNR Asymptotic Capacity of Two Types of Optical Wireless Channels under Average-Intensity Constraints
di: Li, Longguang
Pubblicazione: (2023)
di: Li, Longguang
Pubblicazione: (2023)
Unified Reward Model for Multimodal Understanding and Generation
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
WorldParticle: Unified World Simulation of Lagrangian Particle Dynamics via Transformer
di: Wang, Caoliwen, et al.
Pubblicazione: (2026)
di: Wang, Caoliwen, et al.
Pubblicazione: (2026)
MoRL: Reinforced Reasoning for Unified Motion Understanding and Generation
di: Wang, Hongpeng, et al.
Pubblicazione: (2026)
di: Wang, Hongpeng, et al.
Pubblicazione: (2026)
Pluggable Style Representation Learning for Multi-Style Transfer
di: Liu, Hongda, et al.
Pubblicazione: (2025)
di: Liu, Hongda, et al.
Pubblicazione: (2025)
SaMam: Style-aware State Space Model for Arbitrary Image Style Transfer
di: Liu, Hongda, et al.
Pubblicazione: (2025)
di: Liu, Hongda, et al.
Pubblicazione: (2025)
Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models
di: Guo, Jiayi, et al.
Pubblicazione: (2026)
di: Guo, Jiayi, et al.
Pubblicazione: (2026)
DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers
di: Chen, Yuntao, et al.
Pubblicazione: (2024)
di: Chen, Yuntao, et al.
Pubblicazione: (2024)
Adversarial Examples in the Physical World: A Survey
di: Wang, Jiakai, et al.
Pubblicazione: (2023)
di: Wang, Jiakai, et al.
Pubblicazione: (2023)
AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
di: Guo, Yuwei, et al.
Pubblicazione: (2023)
di: Guo, Yuwei, et al.
Pubblicazione: (2023)
Exploiting Gaussian Agnostic Representation Learning with Diffusion Priors for Enhanced Infrared Small Target Detection
di: Li, Junyao, et al.
Pubblicazione: (2025)
di: Li, Junyao, et al.
Pubblicazione: (2025)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
NegVSR: Augmenting Negatives for Generalized Noise Modeling in Real-World Video Super-Resolution
di: Song, Yexing, et al.
Pubblicazione: (2023) -
Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
di: Yang, Songlin, et al.
Pubblicazione: (2026) -
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
di: Chen, Houyuan, et al.
Pubblicazione: (2026) -
Composing Concepts from Images and Videos via Concept-prompt Binding
di: Kong, Xianghao, et al.
Pubblicazione: (2025) -
UPGS: Unified Pose-aware Gaussian Splatting for Dynamic Scene Deblurring
di: Wu, Zhijing, et al.
Pubblicazione: (2025)