JoyStreamer-Flash: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Chaochao, Wang, Ruikui, Zhou, Liangbo, Feng, Jinheng, Luo, Huaishao, Zhang, Huan, Wu, Youzheng, He, Xiaodong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
JoyStreamer: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning
par: Wang, Ruikui, et autres
Publié: (2026)
par: Wang, Ruikui, et autres
Publié: (2026)
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
par: Huang, Yubo, et autres
Publié: (2025)
par: Huang, Yubo, et autres
Publié: (2025)
StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
par: Tu, Shuyuan, et autres
Publié: (2025)
par: Tu, Shuyuan, et autres
Publié: (2025)
SoulX-FlashTalk: Real-Time Infinite Streaming of Audio-Driven Avatars via Self-Correcting Bidirectional Distillation
par: Shen, Le, et autres
Publié: (2025)
par: Shen, Le, et autres
Publié: (2025)
MotionStreamer: Streaming Motion Generation via Diffusion-based Autoregressive Model in Causal Latent Space
par: Xiao, Lixing, et autres
Publié: (2025)
par: Xiao, Lixing, et autres
Publié: (2025)
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
par: Zhou, Junkang, et autres
Publié: (2026)
par: Zhou, Junkang, et autres
Publié: (2026)
SoulX-FlashHead: Oracle-guided Generation of Infinite Real-time Streaming Talking Heads
par: Yu, Tan, et autres
Publié: (2026)
par: Yu, Tan, et autres
Publié: (2026)
Infinite Gaze Generation for Videos with Autoregressive Diffusion
par: Kang, Jenna, et autres
Publié: (2026)
par: Kang, Jenna, et autres
Publié: (2026)
LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models
par: Yu, Haojie, et autres
Publié: (2025)
par: Yu, Haojie, et autres
Publié: (2025)
JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation
par: Cao, Xuyang, et autres
Publié: (2024)
par: Cao, Xuyang, et autres
Publié: (2024)
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
par: Gan, Qijun, et autres
Publié: (2025)
par: Gan, Qijun, et autres
Publié: (2025)
Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation
par: Xiao, Steven, et autres
Publié: (2025)
par: Xiao, Steven, et autres
Publié: (2025)
JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency
par: Cai, Aichen, et autres
Publié: (2026)
par: Cai, Aichen, et autres
Publié: (2026)
Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion Generation
par: Zhen, Dingcheng, et autres
Publié: (2025)
par: Zhen, Dingcheng, et autres
Publié: (2025)
A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation
par: Zhou, S. Z., et autres
Publié: (2025)
par: Zhou, S. Z., et autres
Publié: (2025)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
par: Liu, Xiangyu, et autres
Publié: (2026)
par: Liu, Xiangyu, et autres
Publié: (2026)
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
par: Sun, Zhiyao, et autres
Publié: (2025)
par: Sun, Zhiyao, et autres
Publié: (2025)
TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models
par: Low, Chetwin, et autres
Publié: (2025)
par: Low, Chetwin, et autres
Publié: (2025)
Audio-Driven Universal Gaussian Head Avatars
par: Teotia, Kartik, et autres
Publié: (2025)
par: Teotia, Kartik, et autres
Publié: (2025)
GaussianSpeech: Audio-Driven Gaussian Avatars
par: Aneja, Shivangi, et autres
Publié: (2024)
par: Aneja, Shivangi, et autres
Publié: (2024)
FlashAvatar: High-fidelity Head Avatar with Efficient Gaussian Embedding
par: Xiang, Jun, et autres
Publié: (2023)
par: Xiang, Jun, et autres
Publié: (2023)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
Nods of Agreement: Webcam-Driven Avatars Improve Meeting Outcomes and Avatar Satisfaction Over Audio-Driven or Static Avatars in All-Avatar Work Videoconferencing
par: Ma, Fang, et autres
Publié: (2024)
par: Ma, Fang, et autres
Publié: (2024)
XHand: Real-time Expressive Hand Avatar
par: Gan, Qijun, et autres
Publié: (2024)
par: Gan, Qijun, et autres
Publié: (2024)
EMO2: End-Effector Guided Audio-Driven Avatar Video Generation
par: Tian, Linrui, et autres
Publié: (2025)
par: Tian, Linrui, et autres
Publié: (2025)
JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing
par: Wang, Qili, et autres
Publié: (2025)
par: Wang, Qili, et autres
Publié: (2025)
InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing
par: Yang, Shaoshu, et autres
Publié: (2025)
par: Yang, Shaoshu, et autres
Publié: (2025)
Computational Model for Photoionization in Pure SF6 Streamer at 1-15 atm
par: Feng, Zihao, et autres
Publié: (2025)
par: Feng, Zihao, et autres
Publié: (2025)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
par: Wang, Haotian, et autres
Publié: (2025)
par: Wang, Haotian, et autres
Publié: (2025)
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
SceneStreamer: Continuous Scenario Generation as Next Token Group Prediction
par: Peng, Zhenghao, et autres
Publié: (2025)
par: Peng, Zhenghao, et autres
Publié: (2025)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
par: Guan, Jiazhi, et autres
Publié: (2025)
par: Guan, Jiazhi, et autres
Publié: (2025)
Differences in Text Generated by Diffusion and Autoregressive Language Models
par: Zhang, Zeyang, et autres
Publié: (2026)
par: Zhang, Zeyang, et autres
Publié: (2026)
Real-Time Motion-Controllable Autoregressive Video Diffusion
par: Zhao, Kesen, et autres
Publié: (2025)
par: Zhao, Kesen, et autres
Publié: (2025)
UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2024)
par: Fu, Li, et autres
Publié: (2024)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2025)
par: Fu, Li, et autres
Publié: (2025)
Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation
par: Xu, Boxun, et autres
Publié: (2026)
par: Xu, Boxun, et autres
Publié: (2026)
RAIN: Real-time Animation of Infinite Video Stream
par: Shu, Zhilei, et autres
Publié: (2024)
par: Shu, Zhilei, et autres
Publié: (2024)
Documents similaires
-
JoyStreamer: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning
par: Wang, Ruikui, et autres
Publié: (2026) -
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
par: Huang, Yubo, et autres
Publié: (2025) -
StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
par: Tu, Shuyuan, et autres
Publié: (2025) -
SoulX-FlashTalk: Real-Time Infinite Streaming of Audio-Driven Avatars via Self-Correcting Bidirectional Distillation
par: Shen, Le, et autres
Publié: (2025) -
MotionStreamer: Streaming Motion Generation via Diffusion-based Autoregressive Model in Causal Latent Space
par: Xiao, Lixing, et autres
Publié: (2025)