Guardado en:
| Autores principales: | Wang, Siyi, Tan, Shihong, Liu, Siyi, Jia, Hong, Huang, Gongping, Bailey, James, Dang, Ting |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.03420 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Emotion-Aware Quantization for Discrete Speech Representations: An Analysis of Emotion Preservation
por: Zhou, Haoguang, et al.
Publicado: (2026)
por: Zhou, Haoguang, et al.
Publicado: (2026)
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
por: Halim, Jule Valendo, et al.
Publicado: (2025)
por: Halim, Jule Valendo, et al.
Publicado: (2025)
Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models
por: Xue, Xiangyuan, et al.
Publicado: (2026)
por: Xue, Xiangyuan, et al.
Publicado: (2026)
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
por: Zhang, Wenda, et al.
Publicado: (2026)
por: Zhang, Wenda, et al.
Publicado: (2026)
EmoSphere-TTS: Emotional Style and Intensity Modeling via Spherical Emotion Vector for Controllable Emotional Text-to-Speech
por: Cho, Deok-Hyeon, et al.
Publicado: (2024)
por: Cho, Deok-Hyeon, et al.
Publicado: (2024)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
por: Deng, Wei, et al.
Publicado: (2025)
por: Deng, Wei, et al.
Publicado: (2025)
EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis
por: Zhou, Li, et al.
Publicado: (2026)
por: Zhou, Li, et al.
Publicado: (2026)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
por: Zhou, Siyi, et al.
Publicado: (2025)
por: Zhou, Siyi, et al.
Publicado: (2025)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
por: Xiao, Yang, et al.
Publicado: (2026)
por: Xiao, Yang, et al.
Publicado: (2026)
Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory
por: Xiao, Yang, et al.
Publicado: (2026)
por: Xiao, Yang, et al.
Publicado: (2026)
IndexTTS 2.5 Technical Report
por: Li, Yunpei, et al.
Publicado: (2026)
por: Li, Yunpei, et al.
Publicado: (2026)
EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
por: Cho, Deok-Hyeon, et al.
Publicado: (2025)
por: Cho, Deok-Hyeon, et al.
Publicado: (2025)
Test-Time Adaptation for Speech Emotion Recognition
por: Dong, Jiaheng, et al.
Publicado: (2026)
por: Dong, Jiaheng, et al.
Publicado: (2026)
Lightweight Front-end Enhancement for Robust ASR via Frame Resampling and Sub-Band Pruning
por: Zhao, Siyi, et al.
Publicado: (2025)
por: Zhao, Siyi, et al.
Publicado: (2025)
CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition
por: Chen, Yin, et al.
Publicado: (2025)
por: Chen, Yin, et al.
Publicado: (2025)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024)
por: Wang, Siyi, et al.
Publicado: (2024)
Perturbation Self-Supervised Representations for Cross-Lingual Emotion TTS: Stage-Wise Modeling of Emotion and Speaker
por: Gong, Cheng, et al.
Publicado: (2025)
por: Gong, Cheng, et al.
Publicado: (2025)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
por: Cong, Gaoxiang, et al.
Publicado: (2024)
por: Cong, Gaoxiang, et al.
Publicado: (2024)
TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis
por: Liang, Qifan, et al.
Publicado: (2026)
por: Liang, Qifan, et al.
Publicado: (2026)
EmoSphere++: Emotion-Controllable Zero-Shot Text-to-Speech via Emotion-Adaptive Spherical Vector
por: Cho, Deok-Hyeon, et al.
Publicado: (2024)
por: Cho, Deok-Hyeon, et al.
Publicado: (2024)
E-BATS: Efficient Backpropagation-Free Test-Time Adaptation for Speech Foundation Models
por: Dong, Jiaheng, et al.
Publicado: (2025)
por: Dong, Jiaheng, et al.
Publicado: (2025)
Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
por: Dang, Ting, et al.
Publicado: (2025)
por: Dang, Ting, et al.
Publicado: (2025)
EmoOmni: Bridging Emotional Understanding and Expression in Omni-Modal LLMs
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization
por: Gao, Xiaoxue, et al.
Publicado: (2024)
por: Gao, Xiaoxue, et al.
Publicado: (2024)
Genre Controlled Music Generation via Activation Steering
por: Narashiman, Swathi, et al.
Publicado: (2025)
por: Narashiman, Swathi, et al.
Publicado: (2025)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
por: Yu, Xiaofeng, et al.
Publicado: (2026)
por: Yu, Xiaofeng, et al.
Publicado: (2026)
EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions
por: Jing, Xin, et al.
Publicado: (2026)
por: Jing, Xin, et al.
Publicado: (2026)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
por: Zhao, Yan, et al.
Publicado: (2022)
por: Zhao, Yan, et al.
Publicado: (2022)
EmoTransCap: Dataset and Pipeline for Emotion Transition-Aware Speech Captioning in Discourses
por: Xu, Shuhao, et al.
Publicado: (2026)
por: Xu, Shuhao, et al.
Publicado: (2026)
DTT-BSR: GAN-based DTTNet with RoPE Transformer Enhancement for Music Source Restoration
por: Tan, Shihong, et al.
Publicado: (2026)
por: Tan, Shihong, et al.
Publicado: (2026)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
por: Zhang, Hezhao, et al.
Publicado: (2026)
por: Zhang, Hezhao, et al.
Publicado: (2026)
EmoHRNet: High-Resolution Neural Network Based Speech Emotion Recognition
por: Muppidi, Akshay, et al.
Publicado: (2025)
por: Muppidi, Akshay, et al.
Publicado: (2025)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
por: Wang, Haoyu, et al.
Publicado: (2024)
por: Wang, Haoyu, et al.
Publicado: (2024)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
por: Yang, Yiqing, et al.
Publicado: (2025)
por: Yang, Yiqing, et al.
Publicado: (2025)
EME-TTS: Unlocking the Emphasis and Emotion Link in Speech Synthesis
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
EmoKnob: Enhance Voice Cloning with Fine-Grained Emotion Control
por: Chen, Haozhe, et al.
Publicado: (2024)
por: Chen, Haozhe, et al.
Publicado: (2024)
Ejemplares similares
-
Emotion-Aware Quantization for Discrete Speech Representations: An Analysis of Emotion Preservation
por: Zhou, Haoguang, et al.
Publicado: (2026) -
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
por: Xie, Tianxin, et al.
Publicado: (2025) -
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
por: Halim, Jule Valendo, et al.
Publicado: (2025) -
Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models
por: Xue, Xiangyuan, et al.
Publicado: (2026) -
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
por: Zhang, Wenda, et al.
Publicado: (2026)