DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Yichen, Song, Jyun-Ting, Jung, Siyeol, Liu, Ruofan, Liu, Haiyang, Chu, Xuangeng, Liu, Ruicong, Wu, Erwin, Koike, Hideki, Kitani, Kris |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
par: Chu, Xuangeng, et autres
Publié: (2025)
par: Chu, Xuangeng, et autres
Publié: (2025)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
par: Sun, Yasheng, et autres
Publié: (2025)
par: Sun, Yasheng, et autres
Publié: (2025)
PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers
par: Zhang, Xiangyue, et autres
Publié: (2026)
par: Zhang, Xiangyue, et autres
Publié: (2026)
DiffListener: Discrete Diffusion Model for Listener Generation
par: Jung, Siyeol, et autres
Publié: (2025)
par: Jung, Siyeol, et autres
Publié: (2025)
Harmony4D: A Video Dataset for In-The-Wild Close Human Interactions
par: Khirodkar, Rawal, et autres
Publié: (2024)
par: Khirodkar, Rawal, et autres
Publié: (2024)
Joint Diffusion for Universal Hand-Object Grasp Generation
par: Cao, Jinkun, et autres
Publié: (2024)
par: Cao, Jinkun, et autres
Publié: (2024)
PixelDiT: Pixel Diffusion Transformers for Image Generation
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
Ground Reaction Inertial Poser: Physics-based Human Motion Capture from Sparse IMUs and Insole Pressure Sensors
par: Hori, Ryosuke, et autres
Publié: (2026)
par: Hori, Ryosuke, et autres
Publié: (2026)
Generalizable and Animatable Gaussian Head Avatar
par: Chu, Xuangeng, et autres
Publié: (2024)
par: Chu, Xuangeng, et autres
Publié: (2024)
Intentional Gesture: Deliver Your Intentions with Gestures for Speech
par: Liu, Pinxin, et autres
Publié: (2025)
par: Liu, Pinxin, et autres
Publié: (2025)
Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video
par: Choi, Chanhyuk, et autres
Publié: (2026)
par: Choi, Chanhyuk, et autres
Publié: (2026)
DyStream: Streaming Dyadic Talking Heads Generation via Flow Matching-based Autoregressive Model
par: Chen, Bohong, et autres
Publié: (2025)
par: Chen, Bohong, et autres
Publié: (2025)
LuxDiT: Lighting Estimation with Video Diffusion Transformer
par: Liang, Ruofan, et autres
Publié: (2025)
par: Liang, Ruofan, et autres
Publié: (2025)
Don't Look Twice: Faster Video Transformers with Run-Length Tokenization
par: Choudhury, Rohan, et autres
Publié: (2024)
par: Choudhury, Rohan, et autres
Publié: (2024)
Multi-Object Tracking by Hierarchical Visual Representations
par: Cao, Jinkun, et autres
Publié: (2024)
par: Cao, Jinkun, et autres
Publié: (2024)
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
par: Liu, Pinxin, et autres
Publié: (2025)
par: Liu, Pinxin, et autres
Publié: (2025)
Accelerating Vision Transformers with Adaptive Patch Sizes
par: Choudhury, Rohan, et autres
Publié: (2025)
par: Choudhury, Rohan, et autres
Publié: (2025)
DiTPainter: Efficient Video Inpainting with Diffusion Transformers
par: Wu, Xian, et autres
Publié: (2025)
par: Wu, Xian, et autres
Publié: (2025)
Random Channel Ablation for Robust Hand Gesture Classification with Multimodal Biosignals
par: Bimbraw, Keshav, et autres
Publié: (2024)
par: Bimbraw, Keshav, et autres
Publié: (2024)
CrystalDiT: A Diffusion Transformer for Crystal Generation
par: Yi, Xiaohan, et autres
Publié: (2025)
par: Yi, Xiaohan, et autres
Publié: (2025)
EraserDiT: Fast Video Inpainting with Diffusion Transformer Model
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
Luminance-GS: Adapting 3D Gaussian Splatting to Challenging Lighting Conditions with View-Adaptive Curve Adjustment
par: Cui, Ziteng, et autres
Publié: (2025)
par: Cui, Ziteng, et autres
Publié: (2025)
I2-NeRF: Learning Neural Radiance Fields Under Physically-Grounded Media Interactions
par: Liu, Shuhong, et autres
Publié: (2025)
par: Liu, Shuhong, et autres
Publié: (2025)
EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture Modeling
par: Liu, Haiyang, et autres
Publié: (2023)
par: Liu, Haiyang, et autres
Publié: (2023)
GPT Sonograpy: Hand Gesture Decoding from Forearm Ultrasound Images via VLM
par: Bimbraw, Keshav, et autres
Publié: (2024)
par: Bimbraw, Keshav, et autres
Publié: (2024)
Towards Interactive Intelligence for Digital Humans
par: Cai, Yiyi, et autres
Publié: (2025)
par: Cai, Yiyi, et autres
Publié: (2025)
DiTS: Multimodal Diffusion Transformers Are Time Series Forecasters
par: Zhang, Haoran, et autres
Publié: (2026)
par: Zhang, Haoran, et autres
Publié: (2026)
G-HOP: Generative Hand-Object Prior for Interaction Reconstruction and Grasp Synthesis
par: Ye, Yufei, et autres
Publié: (2024)
par: Ye, Yufei, et autres
Publié: (2024)
Evaluating a VR System for Collecting Safety-Critical Vehicle-Pedestrian Interactions
par: Weng, Erica, et autres
Publié: (2023)
par: Weng, Erica, et autres
Publié: (2023)
CacheFlow: Fast Human Motion Prediction by Cached Normalizing Flow
par: Maeda, Takahiro, et autres
Publié: (2025)
par: Maeda, Takahiro, et autres
Publié: (2025)
JaywalkerVR: A VR System for Collecting Safety-Critical Pedestrian-Vehicle Interactions
par: Mukoya, Kenta, et autres
Publié: (2024)
par: Mukoya, Kenta, et autres
Publié: (2024)
Crafting Query-Aware Selective Attention for Single Image Super-Resolution
par: Kim, Junyoung, et autres
Publié: (2025)
par: Kim, Junyoung, et autres
Publié: (2025)
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
par: Liu, Wenxuan, et autres
Publié: (2024)
par: Liu, Wenxuan, et autres
Publié: (2024)
LayoutDiT: Exploring Content-Graphic Balance in Layout Generation with Diffusion Transformer
par: Li, Yu, et autres
Publié: (2024)
par: Li, Yu, et autres
Publié: (2024)
FD-DiT: Frequency Domain-Directed Diffusion Transformer for Low-Dose CT Reconstruction
par: Liu, Qiqing, et autres
Publié: (2025)
par: Liu, Qiqing, et autres
Publié: (2025)
TaQ-DiT: Time-aware Quantization for Diffusion Transformers
par: Liu, Xinyan, et autres
Publié: (2024)
par: Liu, Xinyan, et autres
Publié: (2024)
TerDiT: Ternary Diffusion Models with Transformers
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion Interpolation
par: Liu, Haiyang, et autres
Publié: (2024)
par: Liu, Haiyang, et autres
Publié: (2024)
LaVin-DiT: Large Vision Diffusion Transformer
par: Wang, Zhaoqing, et autres
Publié: (2024)
par: Wang, Zhaoqing, et autres
Publié: (2024)
GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
par: Yang, Quanwei, et autres
Publié: (2025)
par: Yang, Quanwei, et autres
Publié: (2025)
Documents similaires
-
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
par: Chu, Xuangeng, et autres
Publié: (2025) -
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
par: Sun, Yasheng, et autres
Publié: (2025) -
PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers
par: Zhang, Xiangyue, et autres
Publié: (2026) -
DiffListener: Discrete Diffusion Model for Listener Generation
par: Jung, Siyeol, et autres
Publié: (2025) -
Harmony4D: A Video Dataset for In-The-Wild Close Human Interactions
par: Khirodkar, Rawal, et autres
Publié: (2024)