HDiffTG: A Lightweight Hybrid Diffusion-Transformer-GCN Architecture for 3D Human Pose Estimation
Fuente:
arXiv
Saved in:
| Main Authors: | Fu, Yajie, Huang, Chaorui, Li, Junwei, Kong, Hui, Tian, Yibin, Li, Huakang, Zhang, Zhiyuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SMPLer: Taming Transformers for Monocular 3D Human Shape and Pose Estimation
by: Xu, Xiangyu, et al.
Published: (2024)
by: Xu, Xiangyu, et al.
Published: (2024)
GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
by: Yang, Quanwei, et al.
Published: (2025)
by: Yang, Quanwei, et al.
Published: (2025)
Radio Frequency Signal based Human Silhouette Segmentation: A Sequential Diffusion Approach
by: Wen, Penghui, et al.
Published: (2024)
by: Wen, Penghui, et al.
Published: (2024)
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
by: Li, Dong, et al.
Published: (2025)
by: Li, Dong, et al.
Published: (2025)
Exploring Event-based Human Pose Estimation with 3D Event Representations
by: Yin, Xiaoting, et al.
Published: (2023)
by: Yin, Xiaoting, et al.
Published: (2023)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
by: Zhang, Beiyuan, et al.
Published: (2024)
by: Zhang, Beiyuan, et al.
Published: (2024)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
by: Li, Yaoru, et al.
Published: (2025)
by: Li, Yaoru, et al.
Published: (2025)
Classification of Gastrointestinal Diseases Using Hybrid Recurrent Vision Transformers With Wavelet Transform
by: Biniyam Mulugeta Abuhayi, et al.
Published: (2024)
by: Biniyam Mulugeta Abuhayi, et al.
Published: (2024)
Hybrid CNN-Mamba Enhancement Network for Robust Multimodal Sentiment Analysis
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
GenHPE: Generative Counterfactuals for 3D Human Pose Estimation with Radio Frequency Signals
by: Huang, Shuokang, et al.
Published: (2025)
by: Huang, Shuokang, et al.
Published: (2025)
SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation
by: Yin, Wanqi, et al.
Published: (2025)
by: Yin, Wanqi, et al.
Published: (2025)
Beyond Forced Modality Balance: Intrinsic Information Budgets for Multimodal Learning
by: Xiong, Zechang, et al.
Published: (2026)
by: Xiong, Zechang, et al.
Published: (2026)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
by: Guan, Jiazhi, et al.
Published: (2025)
by: Guan, Jiazhi, et al.
Published: (2025)
Research on Piano Timbre Transformation System Based on Diffusion Model
by: Hsu, Chun-Chieh, et al.
Published: (2026)
by: Hsu, Chun-Chieh, et al.
Published: (2026)
PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification
by: Luo, Qiuming, et al.
Published: (2026)
by: Luo, Qiuming, et al.
Published: (2026)
Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval
by: Jiang, Xin, et al.
Published: (2025)
by: Jiang, Xin, et al.
Published: (2025)
HDCompression: Hybrid-Diffusion Image Compression for Ultra-Low Bitrates
by: Lu, Lei, et al.
Published: (2025)
by: Lu, Lei, et al.
Published: (2025)
RoSMM: A Robust and Secure Multi-Modal Watermarking Framework for Diffusion Models
by: Fang, ZhongLi, et al.
Published: (2025)
by: Fang, ZhongLi, et al.
Published: (2025)
Voices, Faces, and Feelings: Multi-modal Emotion-Cognition Captioning for Mental Health Understanding
by: Zhou, Zhiyuan, et al.
Published: (2026)
by: Zhou, Zhiyuan, et al.
Published: (2026)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
by: Wang, Xiang, et al.
Published: (2025)
by: Wang, Xiang, et al.
Published: (2025)
Voxel-GS: Quantized Scaffold Gaussian Splatting Compression with Run-Length Coding
by: Fu, Chunyang, et al.
Published: (2025)
by: Fu, Chunyang, et al.
Published: (2025)
Diffusion Model-Based Size Variable Virtual Try-On Technology and Evaluation Method
by: Zhang, Shufang, et al.
Published: (2025)
by: Zhang, Shufang, et al.
Published: (2025)
HLC: A High-Quality Lightweight Mezzanine Codec Featuring High-Throughput Palette
by: He, Chenlong, et al.
Published: (2026)
by: He, Chenlong, et al.
Published: (2026)
ConCLVD: Controllable Chinese Landscape Video Generation via Diffusion Model
by: Liu, Dingming, et al.
Published: (2024)
by: Liu, Dingming, et al.
Published: (2024)
DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations
by: Song, Qiya, et al.
Published: (2025)
by: Song, Qiya, et al.
Published: (2025)
High-Fidelity 3D Gaussian Human Reconstruction via Region-Aware Initialization and Geometric Priors
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
TSC-PCAC: Voxel Transformer and Sparse Convolution Based Point Cloud Attribute Compression for 3D Broadcasting
by: Guo, Zixi, et al.
Published: (2024)
by: Guo, Zixi, et al.
Published: (2024)
Deep Bi-directional Attention Network for Image Super-Resolution Quality Assessment
by: Li, Yixiao, et al.
Published: (2024)
by: Li, Yixiao, et al.
Published: (2024)
Period-conscious Time-series Reconstruction under Local Differential Privacy
by: Wang, Yaxuan, et al.
Published: (2026)
by: Wang, Yaxuan, et al.
Published: (2026)
Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD
by: Xiao, Junhao, et al.
Published: (2025)
by: Xiao, Junhao, et al.
Published: (2025)
Differential Multimodal Transformers
by: Li, Jerry, et al.
Published: (2025)
by: Li, Jerry, et al.
Published: (2025)
Bi-modal Prediction and Transformation Coding for Compressing Complex Human Dynamics
by: Hoang, Huong, et al.
Published: (2025)
by: Hoang, Huong, et al.
Published: (2025)
Text2Sign Diffusion: A Generative Approach for Gloss-Free Sign Language Production
by: Feng, Liqian, et al.
Published: (2025)
by: Feng, Liqian, et al.
Published: (2025)
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
by: Zhang, Yuang, et al.
Published: (2024)
by: Zhang, Yuang, et al.
Published: (2024)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
by: Li, Fu, et al.
Published: (2025)
by: Li, Fu, et al.
Published: (2025)
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
by: Zhu, Rui, et al.
Published: (2024)
by: Zhu, Rui, et al.
Published: (2024)
Efficient Geometry Compression and Communication for 3D Gaussian Splatting Point Clouds
by: Xie, Liang, et al.
Published: (2025)
by: Xie, Liang, et al.
Published: (2025)
Perceptual Quality Assessment of Octree-RAHT Encoded 3D Point Clouds
by: Duan, Dongshuai, et al.
Published: (2024)
by: Duan, Dongshuai, et al.
Published: (2024)
HumanVLM: Foundation for Human-Scene Vision-Language Model
by: Dai, Dawei, et al.
Published: (2024)
by: Dai, Dawei, et al.
Published: (2024)
FlexCache: Flexible Approximate Cache System for Video Diffusion
by: Sun, Desen, et al.
Published: (2024)
by: Sun, Desen, et al.
Published: (2024)
Similar Items
-
SMPLer: Taming Transformers for Monocular 3D Human Shape and Pose Estimation
by: Xu, Xiangyu, et al.
Published: (2024) -
GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
by: Yang, Quanwei, et al.
Published: (2025) -
Radio Frequency Signal based Human Silhouette Segmentation: A Sequential Diffusion Approach
by: Wen, Penghui, et al.
Published: (2024) -
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
by: Li, Dong, et al.
Published: (2025) -
Exploring Event-based Human Pose Estimation with 3D Event Representations
by: Yin, Xiaoting, et al.
Published: (2023)