Length-Aware Rotary Position Embedding for Text-Speech Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Hyeongju, Lee, Juheon, Yang, Jinhyeok, Morton, Jacob |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving Test-Time Performance of RVQ-based Neural Codecs
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
por: Yang, Jinhyeok, et al.
Publicado: (2024)
por: Yang, Jinhyeok, et al.
Publicado: (2024)
SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
por: Yang, Jinhyeok, et al.
Publicado: (2026)
por: Yang, Jinhyeok, et al.
Publicado: (2026)
Training Flow Matching Models with Reliable Labels via Self-Purification
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
Length Aware Speech Translation for Video Dubbing
por: Chadha, Harveen Singh, et al.
Publicado: (2025)
por: Chadha, Harveen Singh, et al.
Publicado: (2025)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
por: Ye, Zongli, et al.
Publicado: (2025)
por: Ye, Zongli, et al.
Publicado: (2025)
Benchmarking Rotary Position Embeddings for Automatic Speech Recognition
por: Zhang, Shucong, et al.
Publicado: (2025)
por: Zhang, Shucong, et al.
Publicado: (2025)
USAT: A Universal Speaker-Adaptive Text-to-Speech Approach
por: Wang, Wenbin, et al.
Publicado: (2024)
por: Wang, Wenbin, et al.
Publicado: (2024)
Neural networks for Text-to-Speech evaluation
por: Trofimenko, Ilya, et al.
Publicado: (2026)
por: Trofimenko, Ilya, et al.
Publicado: (2026)
An Investigation Into Explainable Audio Hate Speech Detection
por: An, Jinmyeong, et al.
Publicado: (2024)
por: An, Jinmyeong, et al.
Publicado: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
por: Chen, Li-Wei, et al.
Publicado: (2024)
por: Chen, Li-Wei, et al.
Publicado: (2024)
Beyond Hard Sharing: Efficient Multi-Task Speech-to-Text Modeling with Supervised Mixture of Experts
por: Jin, Hojun, et al.
Publicado: (2025)
por: Jin, Hojun, et al.
Publicado: (2025)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
por: He, Xinlu, et al.
Publicado: (2025)
por: He, Xinlu, et al.
Publicado: (2025)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
por: Wang, Chien-Chun, et al.
Publicado: (2024)
por: Wang, Chien-Chun, et al.
Publicado: (2024)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
por: Peng, An-Ci, et al.
Publicado: (2026)
por: Peng, An-Ci, et al.
Publicado: (2026)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
por: Polák, Peter, et al.
Publicado: (2023)
por: Polák, Peter, et al.
Publicado: (2023)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
por: Diwan, Anuj, et al.
Publicado: (2026)
por: Diwan, Anuj, et al.
Publicado: (2026)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
por: Lee, Seo-Hyun, et al.
Publicado: (2023)
por: Lee, Seo-Hyun, et al.
Publicado: (2023)
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
por: Weise, Tobias, et al.
Publicado: (2024)
por: Weise, Tobias, et al.
Publicado: (2024)
How "Real" is Your Real-Time Simultaneous Speech-to-Text Translation System?
por: Papi, Sara, et al.
Publicado: (2024)
por: Papi, Sara, et al.
Publicado: (2024)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
por: Wu, Jinyang, et al.
Publicado: (2026)
por: Wu, Jinyang, et al.
Publicado: (2026)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
por: Zhang, Shaolei, et al.
Publicado: (2024)
por: Zhang, Shaolei, et al.
Publicado: (2024)
From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models
por: Ersoy, Asım, et al.
Publicado: (2025)
por: Ersoy, Asım, et al.
Publicado: (2025)
EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis
por: Zhou, Li, et al.
Publicado: (2026)
por: Zhou, Li, et al.
Publicado: (2026)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
por: Liu, Yutong, et al.
Publicado: (2025)
por: Liu, Yutong, et al.
Publicado: (2025)
TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment
por: Kim, Taesoo, et al.
Publicado: (2025)
por: Kim, Taesoo, et al.
Publicado: (2025)
Papez: Resource-Efficient Speech Separation with Auditory Working Memory
por: Oh, Hyunseok, et al.
Publicado: (2024)
por: Oh, Hyunseok, et al.
Publicado: (2024)
UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
por: Qiang, Chunyu, et al.
Publicado: (2026)
por: Qiang, Chunyu, et al.
Publicado: (2026)
StreamAtt: Direct Streaming Speech-to-Text Translation with Attention-based Audio History Selection
por: Papi, Sara, et al.
Publicado: (2024)
por: Papi, Sara, et al.
Publicado: (2024)
Exploring Speech Pattern Disorders in Autism using Machine Learning
por: Hu, Chuanbo, et al.
Publicado: (2024)
por: Hu, Chuanbo, et al.
Publicado: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
por: Liu, Jiaxuan, et al.
Publicado: (2024)
por: Liu, Jiaxuan, et al.
Publicado: (2024)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
por: Chen, Szu-Chi, et al.
Publicado: (2026)
por: Chen, Szu-Chi, et al.
Publicado: (2026)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
por: Lee, Keon, et al.
Publicado: (2024)
por: Lee, Keon, et al.
Publicado: (2024)
Adaptive Duration Model for Text Speech Alignment
por: Cao, Junjie
Publicado: (2025)
por: Cao, Junjie
Publicado: (2025)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025)
por: Jo, Daejin, et al.
Publicado: (2025)
Frame-Stacked Local Transformers For Efficient Multi-Codebook Speech Generation
por: Fejgin, Roy, et al.
Publicado: (2025)
por: Fejgin, Roy, et al.
Publicado: (2025)
Ejemplares similares
-
Improving Test-Time Performance of RVQ-based Neural Codecs
por: Kim, Hyeongju, et al.
Publicado: (2025) -
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
por: Yang, Jinhyeok, et al.
Publicado: (2024) -
SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System
por: Kim, Hyeongju, et al.
Publicado: (2025) -
RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
por: Yang, Jinhyeok, et al.
Publicado: (2026) -
Training Flow Matching Models with Reliable Labels via Self-Purification
por: Kim, Hyeongju, et al.
Publicado: (2025)