FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Mu, Lingzhou, Wang, Qiang, Jiang, Fan, Wang, Mengchao, Fan, Yaqi, Xu, Mu, Zhang, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers
di: Wang, Qiang, et al.
Pubblicazione: (2025)
di: Wang, Qiang, et al.
Pubblicazione: (2025)
FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis
di: Wang, Mengchao, et al.
Pubblicazione: (2025)
di: Wang, Mengchao, et al.
Pubblicazione: (2025)
FantasyID: Face Knowledge Enhanced ID-Preserving Video Generation
di: Zhang, Yunpeng, et al.
Pubblicazione: (2025)
di: Zhang, Yunpeng, et al.
Pubblicazione: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
di: Zuo, Jing, et al.
Pubblicazione: (2026)
di: Zuo, Jing, et al.
Pubblicazione: (2026)
FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction
di: Dai, Yixiang, et al.
Pubblicazione: (2025)
di: Dai, Yixiang, et al.
Pubblicazione: (2025)
FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation
di: Wang, MengChao, et al.
Pubblicazione: (2025)
di: Wang, MengChao, et al.
Pubblicazione: (2025)
TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization
di: Pan, Liang, et al.
Pubblicazione: (2025)
di: Pan, Liang, et al.
Pubblicazione: (2025)
ZeroHSI: Zero-Shot 4D Human-Scene Interaction by Video Generation
di: Li, Hongjie, et al.
Pubblicazione: (2024)
di: Li, Hongjie, et al.
Pubblicazione: (2024)
InstructScene: Instruction-Driven 3D Indoor Scene Synthesis with Semantic Graph Prior
di: Lin, Chenguo, et al.
Pubblicazione: (2024)
di: Lin, Chenguo, et al.
Pubblicazione: (2024)
GenHSI: Controllable Generation of Human-Scene Interaction Videos
di: Li, Zekun, et al.
Pubblicazione: (2025)
di: Li, Zekun, et al.
Pubblicazione: (2025)
FLAP: Fully-controllable Audio-driven Portrait Video Generation through 3D head conditioned diffusion model
di: Mu, Lingzhou, et al.
Pubblicazione: (2025)
di: Mu, Lingzhou, et al.
Pubblicazione: (2025)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
di: Chen, Mu, et al.
Pubblicazione: (2025)
di: Chen, Mu, et al.
Pubblicazione: (2025)
Bridging the gap between training and inference in LM-based TTS models
di: Zhang, Ruonan, et al.
Pubblicazione: (2025)
di: Zhang, Ruonan, et al.
Pubblicazione: (2025)
Animate3D: Animating Any 3D Model with Multi-view Video Diffusion
di: Jiang, Yanqin, et al.
Pubblicazione: (2024)
di: Jiang, Yanqin, et al.
Pubblicazione: (2024)
63‐1: Invited Paper: Thin Film Neuromorphics: Fantasy or Reality?
di: Bowei Jiang, et al.
Pubblicazione: (2024)
di: Bowei Jiang, et al.
Pubblicazione: (2024)
MultiEgo: A Multi-View Egocentric Video Dataset for 4D Scene Reconstruction
di: Li, Bate, et al.
Pubblicazione: (2025)
di: Li, Bate, et al.
Pubblicazione: (2025)
Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale
di: Wei, Dongxu, et al.
Pubblicazione: (2026)
di: Wei, Dongxu, et al.
Pubblicazione: (2026)
Controllable Longer Image Animation with Diffusion Models
di: Wang, Qiang, et al.
Pubblicazione: (2024)
di: Wang, Qiang, et al.
Pubblicazione: (2024)
SwapAnyone: Consistent and Realistic Video Synthesis for Swapping Any Person into Any Video
di: Zhao, Chengshu, et al.
Pubblicazione: (2025)
di: Zhao, Chengshu, et al.
Pubblicazione: (2025)
Utilizing Graph Generation for Enhanced Domain Adaptive Object Detection
di: Wang, Mu
Pubblicazione: (2024)
di: Wang, Mu
Pubblicazione: (2024)
One for All: A General Framework of LLMs-based Multi-Criteria Decision Making on Human Expert Level
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Scanpath Prediction in Panoramic Videos via Expected Code Length Minimization
di: Li, Mu, et al.
Pubblicazione: (2023)
di: Li, Mu, et al.
Pubblicazione: (2023)
GenXD: Generating Any 3D and 4D Scenes
di: Zhao, Yuyang, et al.
Pubblicazione: (2024)
di: Zhao, Yuyang, et al.
Pubblicazione: (2024)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
Electrolyzers-HSI: Close-Range Multi-Scene Hyperspectral Imaging Benchmark Dataset
di: Arbash, Elias, et al.
Pubblicazione: (2025)
di: Arbash, Elias, et al.
Pubblicazione: (2025)
AnyAct: Towards Human Reenactment of Character Motion From Video
di: Chen, Liuhan, et al.
Pubblicazione: (2026)
di: Chen, Liuhan, et al.
Pubblicazione: (2026)
KG4Diagnosis: A Hierarchical Multi-Agent LLM Framework with Knowledge Graph Enhancement for Medical Diagnosis
di: Zuo, Kaiwen, et al.
Pubblicazione: (2024)
di: Zuo, Kaiwen, et al.
Pubblicazione: (2024)
Dropout Concrete Autoencoder for Band Selection on HSI Scenes
di: Xu, Lei, et al.
Pubblicazione: (2024)
di: Xu, Lei, et al.
Pubblicazione: (2024)
Multi-Agent, Human-Agent and Beyond: A Survey on Cooperation in Social Dilemmas
di: Mu, Chunjiang, et al.
Pubblicazione: (2024)
di: Mu, Chunjiang, et al.
Pubblicazione: (2024)
Anything in Any Scene: Photorealistic Video Object Insertion
di: Bai, Chen, et al.
Pubblicazione: (2024)
di: Bai, Chen, et al.
Pubblicazione: (2024)
Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes
di: Wang, Yin, et al.
Pubblicazione: (2026)
di: Wang, Yin, et al.
Pubblicazione: (2026)
MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes
di: Gao, Ruiyuan, et al.
Pubblicazione: (2024)
di: Gao, Ruiyuan, et al.
Pubblicazione: (2024)
Functional 3D Scene Synthesis through Human-Scene Optimization
di: Wei, Yao, et al.
Pubblicazione: (2025)
di: Wei, Yao, et al.
Pubblicazione: (2025)
R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint Optimization
di: Li, Yuante, et al.
Pubblicazione: (2025)
di: Li, Yuante, et al.
Pubblicazione: (2025)
Understanding Dynamic Scenes in Ego Centric 4D Point Clouds
di: Huang, Junsheng, et al.
Pubblicazione: (2025)
di: Huang, Junsheng, et al.
Pubblicazione: (2025)
RoboPaint: From Human Demonstration to Any Robot and Any View
di: Fan, Jiacheng, et al.
Pubblicazione: (2026)
di: Fan, Jiacheng, et al.
Pubblicazione: (2026)
OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation
di: Li, Hui, et al.
Pubblicazione: (2024)
di: Li, Hui, et al.
Pubblicazione: (2024)
HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
Measuring Responsibility in Multi-Agent Systems
di: Mu, Chunyan, et al.
Pubblicazione: (2024)
di: Mu, Chunyan, et al.
Pubblicazione: (2024)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers
di: Wang, Qiang, et al.
Pubblicazione: (2025) -
FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis
di: Wang, Mengchao, et al.
Pubblicazione: (2025) -
FantasyID: Face Knowledge Enhanced ID-Preserving Video Generation
di: Zhang, Yunpeng, et al.
Pubblicazione: (2025) -
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
di: Zuo, Jing, et al.
Pubblicazione: (2026) -
FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction
di: Dai, Yixiang, et al.
Pubblicazione: (2025)