MathReader : Text-to-Speech for Mathematical Documents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hyeon, Sieun, Jung, Kyudan, Kim, Nam-Joon, Ryu, Hyun Gon, Do, Jaeyoung |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
par: Jung, Kyudan, et autres
Publié: (2026)
par: Jung, Kyudan, et autres
Publié: (2026)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025)
par: Kim, Nam-Gyu, et autres
Publié: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
par: Kim, Jaeyoung, et autres
Publié: (2024)
par: Kim, Jaeyoung, et autres
Publié: (2024)
EmoSphere++: Emotion-Controllable Zero-Shot Text-to-Speech via Emotion-Adaptive Spherical Vector
par: Cho, Deok-Hyeon, et autres
Publié: (2024)
par: Cho, Deok-Hyeon, et autres
Publié: (2024)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
par: Jin, Sichen, et autres
Publié: (2024)
par: Jin, Sichen, et autres
Publié: (2024)
DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
Whisfusion: Parallel ASR Decoding via a Diffusion Transformer
par: Kwon, Taeyoun, et autres
Publié: (2025)
par: Kwon, Taeyoun, et autres
Publié: (2025)
EmoSphere-TTS: Emotional Style and Intensity Modeling via Spherical Emotion Vector for Controllable Emotional Text-to-Speech
par: Cho, Deok-Hyeon, et autres
Publié: (2024)
par: Cho, Deok-Hyeon, et autres
Publié: (2024)
Towards Unified Neural Decoding of Perceived, Spoken and Imagined Speech from EEG Signals
par: Lee, Jung-Sun, et autres
Publié: (2024)
par: Lee, Jung-Sun, et autres
Publié: (2024)
Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9
par: Lee, Do Hyun, et autres
Publié: (2024)
par: Lee, Do Hyun, et autres
Publié: (2024)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
par: Lee, Seo-Hyun, et autres
Publié: (2023)
par: Lee, Seo-Hyun, et autres
Publié: (2023)
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
par: Kim, Taesoo, et autres
Publié: (2025)
par: Kim, Taesoo, et autres
Publié: (2025)
EmoSphere-SER: Enhancing Speech Emotion Recognition Through Spherical Representation with Auxiliary Classification
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
par: Hyeon, Jonghwan, et autres
Publié: (2024)
par: Hyeon, Jonghwan, et autres
Publié: (2024)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
par: Kim, Ji-Hoon, et autres
Publié: (2024)
par: Kim, Ji-Hoon, et autres
Publié: (2024)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
par: Nguyen, Tan Dat, et autres
Publié: (2024)
par: Nguyen, Tan Dat, et autres
Publié: (2024)
MathSpeech: Leveraging Small LMs for Accurate Conversion in Mathematical Speech-to-Formula
par: Hyeon, Sieun, et autres
Publié: (2024)
par: Hyeon, Sieun, et autres
Publié: (2024)
Adaptive Duration Model for Text Speech Alignment
par: Cao, Junjie
Publié: (2025)
par: Cao, Junjie
Publié: (2025)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence
par: Ryu, Yerin, et autres
Publié: (2025)
par: Ryu, Yerin, et autres
Publié: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
par: Wang, Xinsheng, et autres
Publié: (2025)
par: Wang, Xinsheng, et autres
Publié: (2025)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
par: Singh, Robin, et autres
Publié: (2026)
par: Singh, Robin, et autres
Publié: (2026)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
par: Yang, Dong, et autres
Publié: (2025)
par: Yang, Dong, et autres
Publié: (2025)
LoRP-TTS: Low-Rank Personalized Text-To-Speech
par: Bondaruk, Łukasz, et autres
Publié: (2025)
par: Bondaruk, Łukasz, et autres
Publié: (2025)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
par: Melechovsky, Jan, et autres
Publié: (2024)
par: Melechovsky, Jan, et autres
Publié: (2024)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
par: Lemerle, Théodor, et autres
Publié: (2024)
par: Lemerle, Théodor, et autres
Publié: (2024)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)
par: Kim, Ji-Hoon, et autres
Publié: (2023)
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
par: Zhang, Leying, et autres
Publié: (2026)
par: Zhang, Leying, et autres
Publié: (2026)
BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification
par: Kim, June-Woo, et autres
Publié: (2024)
par: Kim, June-Woo, et autres
Publié: (2024)
Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech
par: He, Shuwei, et autres
Publié: (2024)
par: He, Shuwei, et autres
Publié: (2024)
Incremental FastPitch: Chunk-based High Quality Text to Speech
par: Du, Muyang, et autres
Publié: (2024)
par: Du, Muyang, et autres
Publié: (2024)
DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment
par: Oh, Hyung-Seok, et autres
Publié: (2024)
par: Oh, Hyung-Seok, et autres
Publié: (2024)
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
par: Yang, Jianing, et autres
Publié: (2025)
par: Yang, Jianing, et autres
Publié: (2025)
MultiVerse: Efficient and Expressive Zero-Shot Multi-Task Text-to-Speech
par: Bak, Taejun, et autres
Publié: (2024)
par: Bak, Taejun, et autres
Publié: (2024)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
par: Ni, Qinke, et autres
Publié: (2026)
par: Ni, Qinke, et autres
Publié: (2026)
Sing-On-Your-Beat: Simple Text-Controllable Accompaniment Generations
par: Trinh, Quoc-Huy, et autres
Publié: (2024)
par: Trinh, Quoc-Huy, et autres
Publié: (2024)
LLMs-Integrated Automatic Hate Speech Recognition Using Controllable Text Generation Models
par: Oshima, Ryutaro, et autres
Publié: (2026)
par: Oshima, Ryutaro, et autres
Publié: (2026)
Documents similaires
-
Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
par: Jung, Kyudan, et autres
Publié: (2026) -
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025) -
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
par: Kim, Jaeyoung, et autres
Publié: (2024) -
EmoSphere++: Emotion-Controllable Zero-Shot Text-to-Speech via Emotion-Adaptive Spherical Vector
par: Cho, Deok-Hyeon, et autres
Publié: (2024) -
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
par: Jin, Sichen, et autres
Publié: (2024)