PMMD: A pose-guided multi-view multi-modal diffusion for person generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Shang, Ziyu, Liu, Haoran, Zhang, Rongchao, Wei, Zhiqian, Feng, Tongtong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KAN-RCBEVDepth: A multi-modal fusion algorithm in object detection for autonomous driving
di: Lai, Zhihao, et al.
Pubblicazione: (2024)
di: Lai, Zhihao, et al.
Pubblicazione: (2024)
EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
di: Shi, Danli, et al.
Pubblicazione: (2024)
di: Shi, Danli, et al.
Pubblicazione: (2024)
Multi-person 3D pose estimation from unlabelled data
di: Rodriguez-Criado, Daniel, et al.
Pubblicazione: (2022)
di: Rodriguez-Criado, Daniel, et al.
Pubblicazione: (2022)
Multi-weather Cross-view Geo-localization Using Denoising Diffusion Models
di: Feng, Tongtong, et al.
Pubblicazione: (2024)
di: Feng, Tongtong, et al.
Pubblicazione: (2024)
UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark
di: Zhang, Yu, et al.
Pubblicazione: (2026)
di: Zhang, Yu, et al.
Pubblicazione: (2026)
TransMA: an explainable multi-modal deep learning model for predicting properties of ionizable lipid nanoparticles in mRNA delivery
di: Wu, Kun, et al.
Pubblicazione: (2024)
di: Wu, Kun, et al.
Pubblicazione: (2024)
Lightweight framework for underground pipeline recognition and spatial localization based on multi-view 2D GPR images
di: Lv, Haotian, et al.
Pubblicazione: (2025)
di: Lv, Haotian, et al.
Pubblicazione: (2025)
Msmsfnet: a multi-stream and multi-scale fusion net for edge detection
di: Liu, Chenguang, et al.
Pubblicazione: (2024)
di: Liu, Chenguang, et al.
Pubblicazione: (2024)
ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking
di: Ge, Jiawei, et al.
Pubblicazione: (2026)
di: Ge, Jiawei, et al.
Pubblicazione: (2026)
Deep Extrinsic Manifold Representation for Vision Tasks
di: Zhang, Tongtong, et al.
Pubblicazione: (2024)
di: Zhang, Tongtong, et al.
Pubblicazione: (2024)
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
di: Zheng, Mingzhe, et al.
Pubblicazione: (2024)
di: Zheng, Mingzhe, et al.
Pubblicazione: (2024)
Phantom: Subject-consistent video generation via cross-modal alignment
di: Liu, Lijie, et al.
Pubblicazione: (2025)
di: Liu, Lijie, et al.
Pubblicazione: (2025)
MIRAGE: A Multi-modal Benchmark for Spatial Perception, Reasoning, and Intelligence
di: Liu, Chonghan, et al.
Pubblicazione: (2025)
di: Liu, Chonghan, et al.
Pubblicazione: (2025)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
di: Zhang, Zijian, et al.
Pubblicazione: (2024)
di: Zhang, Zijian, et al.
Pubblicazione: (2024)
FSMDet: Vision-guided feature diffusion for fully sparse 3D detector
di: Liu, Tianran, et al.
Pubblicazione: (2024)
di: Liu, Tianran, et al.
Pubblicazione: (2024)
Focus on Focus: Focus-oriented Representation Learning and Multi-view Cross-modal Alignment for Glioma Grading
di: Pan, Li, et al.
Pubblicazione: (2024)
di: Pan, Li, et al.
Pubblicazione: (2024)
Intra-view and Inter-view Correlation Guided Multi-view Novel Class Discovery
di: Wan, Xinhang, et al.
Pubblicazione: (2025)
di: Wan, Xinhang, et al.
Pubblicazione: (2025)
DeepFAN, a transformer-based deep learning model for human-artificial intelligence collaborative assessment of incidental pulmonary nodules in CT scans: a multi-reader, multi-case trial
di: Zhu, Zhenchen, et al.
Pubblicazione: (2026)
di: Zhu, Zhenchen, et al.
Pubblicazione: (2026)
Progressive enhancement and restoration for mural images under low-light and defected conditions based on multi-receptive field strategy
di: Wei, Xiameng, et al.
Pubblicazione: (2024)
di: Wei, Xiameng, et al.
Pubblicazione: (2024)
BD-MSA: Body decouple VHR Remote Sensing Image Change Detection method guided by multi-scale feature information aggregation
di: Tan, Yonghui, et al.
Pubblicazione: (2024)
di: Tan, Yonghui, et al.
Pubblicazione: (2024)
Sketch2NeRF: Multi-view Sketch-guided Text-to-3D Generation
di: Chen, Minglin, et al.
Pubblicazione: (2024)
di: Chen, Minglin, et al.
Pubblicazione: (2024)
VGNC: Reducing the Overfitting of Sparse-view 3DGS via Validation-guided Gaussian Number Control
di: Lin, Lifeng, et al.
Pubblicazione: (2025)
di: Lin, Lifeng, et al.
Pubblicazione: (2025)
Unveiling the Power of Self-supervision for Multi-view Multi-human Association and Tracking
di: Feng, Wei, et al.
Pubblicazione: (2024)
di: Feng, Wei, et al.
Pubblicazione: (2024)
CODE: Contrasting Self-generated Description to Combat Hallucination in Large Multi-modal Models
di: Kim, Junho, et al.
Pubblicazione: (2024)
di: Kim, Junho, et al.
Pubblicazione: (2024)
Modality-Aware and Shift Mixer for Multi-modal Brain Tumor Segmentation
di: Huang, Zhongzhen, et al.
Pubblicazione: (2024)
di: Huang, Zhongzhen, et al.
Pubblicazione: (2024)
Improvement of human health lifespan with hybrid group pose estimation methods
di: Chaudhuri, Arindam
Pubblicazione: (2025)
di: Chaudhuri, Arindam
Pubblicazione: (2025)
Variational Adapter for Cross-modal Similarity Representation
di: Wei, WenZhang, et al.
Pubblicazione: (2026)
di: Wei, WenZhang, et al.
Pubblicazione: (2026)
CL-MVSNet: Unsupervised Multi-view Stereo with Dual-level Contrastive Learning
di: Xiong, Kaiqiang, et al.
Pubblicazione: (2025)
di: Xiong, Kaiqiang, et al.
Pubblicazione: (2025)
Awesome Multi-modal Object Tracking
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
Socratic Questioning: Learn to Self-guide Multimodal Reasoning in the Wild
di: Hu, Wanpeng, et al.
Pubblicazione: (2025)
di: Hu, Wanpeng, et al.
Pubblicazione: (2025)
TACFN: Transformer-based Adaptive Cross-modal Fusion Network for Multimodal Emotion Recognition
di: Liu, Feng, et al.
Pubblicazione: (2025)
di: Liu, Feng, et al.
Pubblicazione: (2025)
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2025)
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2025)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
DETRPose: Real-time end-to-end transformer model for multi-person pose estimation
di: Janampa, Sebastian, et al.
Pubblicazione: (2025)
di: Janampa, Sebastian, et al.
Pubblicazione: (2025)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
MedSAM-based lung masking for multi-label chest X-ray classification
di: Miao, Brayden, et al.
Pubblicazione: (2025)
di: Miao, Brayden, et al.
Pubblicazione: (2025)
Tera-MIND: Tera-scale mouse brain simulation via spatial mRNA-guided diffusion
di: Wu, Jiqing, et al.
Pubblicazione: (2025)
di: Wu, Jiqing, et al.
Pubblicazione: (2025)
A Fourier-enhanced multi-modal 3D small object optical mark recognition and positioning method for percutaneous abdominal puncture surgical navigation
di: Guo, Zezhao, et al.
Pubblicazione: (2024)
di: Guo, Zezhao, et al.
Pubblicazione: (2024)
CoilDrop-MRI: Self-supervised physics-guided MRI reconstruction with coil dropout
di: Song, Tongxi, et al.
Pubblicazione: (2026)
di: Song, Tongxi, et al.
Pubblicazione: (2026)
AnomalyControl: Learning Cross-modal Semantic Features for Controllable Anomaly Synthesis
di: He, Shidan, et al.
Pubblicazione: (2024)
di: He, Shidan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
KAN-RCBEVDepth: A multi-modal fusion algorithm in object detection for autonomous driving
di: Lai, Zhihao, et al.
Pubblicazione: (2024) -
EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
di: Shi, Danli, et al.
Pubblicazione: (2024) -
Multi-person 3D pose estimation from unlabelled data
di: Rodriguez-Criado, Daniel, et al.
Pubblicazione: (2022) -
Multi-weather Cross-view Geo-localization Using Denoising Diffusion Models
di: Feng, Tongtong, et al.
Pubblicazione: (2024) -
UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark
di: Zhang, Yu, et al.
Pubblicazione: (2026)