EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Weng, Yuzhe, Wang, Haotian, Yu, Yuanhong, Du, Jun, He, Shan, Wu, Xiaoyan, Xu, Haoran |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation
par: Wang, Haotian, et autres
Publié: (2025)
par: Wang, Haotian, et autres
Publié: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
par: Xu, Xinmeng, et autres
Publié: (2026)
par: Xu, Xinmeng, et autres
Publié: (2026)
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
par: Weng, Yuzhe, et autres
Publié: (2026)
par: Weng, Yuzhe, et autres
Publié: (2026)
CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
par: Wu, Kangyi, et autres
Publié: (2025)
par: Wu, Kangyi, et autres
Publié: (2025)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)
par: He, Mao-Kui, et autres
Publié: (2024)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
par: Hong, Fa-Ting, et autres
Publié: (2024)
par: Hong, Fa-Ting, et autres
Publié: (2024)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
par: Zhu, Jian, et autres
Publié: (2026)
par: Zhu, Jian, et autres
Publié: (2026)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
par: Xie, Yifan, et autres
Publié: (2024)
par: Xie, Yifan, et autres
Publié: (2024)
Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation
par: Shen, Nanhan, et autres
Publié: (2026)
par: Shen, Nanhan, et autres
Publié: (2026)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
par: Wang, Haotian, et autres
Publié: (2025)
par: Wang, Haotian, et autres
Publié: (2025)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music
par: Su, Hongju, et autres
Publié: (2025)
par: Su, Hongju, et autres
Publié: (2025)
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
par: Liu, Ke, et autres
Publié: (2026)
par: Liu, Ke, et autres
Publié: (2026)
Improved symbolic drum style classification with grammar-based hierarchical representations
par: Géré, Léo, et autres
Publié: (2024)
par: Géré, Léo, et autres
Publié: (2024)
SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations
par: Wang, Chunshi, et autres
Publié: (2025)
par: Wang, Chunshi, et autres
Publié: (2025)
Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling
par: Fan, Congyi, et autres
Publié: (2026)
par: Fan, Congyi, et autres
Publié: (2026)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
par: Chen, Zhipeng, et autres
Publié: (2026)
par: Chen, Zhipeng, et autres
Publié: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
par: Li, Hebeizi, et autres
Publié: (2026)
par: Li, Hebeizi, et autres
Publié: (2026)
Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation
par: Wen, Yadi, et autres
Publié: (2026)
par: Wen, Yadi, et autres
Publié: (2026)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
par: Liu, Xiangyu, et autres
Publié: (2026)
par: Liu, Xiangyu, et autres
Publié: (2026)
Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes
par: Feng, Zhou, et autres
Publié: (2025)
par: Feng, Zhou, et autres
Publié: (2025)
Towards Practical Real-Time Low-Latency Music Source Separation
par: Wu, Junyu, et autres
Publié: (2025)
par: Wu, Junyu, et autres
Publié: (2025)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
par: Li, Fu, et autres
Publié: (2025)
par: Li, Fu, et autres
Publié: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
par: Pan, Zihan, et autres
Publié: (2025)
par: Pan, Zihan, et autres
Publié: (2025)
TalkSketch: Multimodal Generative AI for Real-time Sketch Ideation with Speech
par: Shi, Weiyan, et autres
Publié: (2025)
par: Shi, Weiyan, et autres
Publié: (2025)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
par: Chan, Nolan, et autres
Publié: (2026)
par: Chan, Nolan, et autres
Publié: (2026)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
par: Surana, Rohan, et autres
Publié: (2025)
par: Surana, Rohan, et autres
Publié: (2025)
NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
par: Liu, Xiaoxing, et autres
Publié: (2025)
par: Liu, Xiaoxing, et autres
Publié: (2025)
Timed text extraction from Taiwanese Kua-á-hì TV series
par: Huang, Tzu-Hung, et autres
Publié: (2026)
par: Huang, Tzu-Hung, et autres
Publié: (2026)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
par: Zhou, Rui, et autres
Publié: (2024)
par: Zhou, Rui, et autres
Publié: (2024)
Research on Piano Timbre Transformation System Based on Diffusion Model
par: Hsu, Chun-Chieh, et autres
Publié: (2026)
par: Hsu, Chun-Chieh, et autres
Publié: (2026)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
par: Cui, Yang, et autres
Publié: (2025)
par: Cui, Yang, et autres
Publié: (2025)
Zero-Shot End-to-End Spoken Language Understanding via Cross-Modal Selective Self-Training
par: He, Jianfeng, et autres
Publié: (2023)
par: He, Jianfeng, et autres
Publié: (2023)
Documents similaires
-
REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation
par: Wang, Haotian, et autres
Publié: (2025) -
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
par: Xu, Xinmeng, et autres
Publié: (2026) -
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
par: Weng, Yuzhe, et autres
Publié: (2026) -
CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
par: Wu, Kangyi, et autres
Publié: (2025) -
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)