MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Yifan, Zhang, Ruoyi, Shi, Jiatong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
por: Jiang, Feng, et al.
Publicado: (2025)
por: Jiang, Feng, et al.
Publicado: (2025)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
por: Kang, Wonjune, et al.
Publicado: (2024)
por: Kang, Wonjune, et al.
Publicado: (2024)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
por: Kim, Heeseung, et al.
Publicado: (2024)
por: Kim, Heeseung, et al.
Publicado: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information
por: Sanders, Nicholas, et al.
Publicado: (2025)
por: Sanders, Nicholas, et al.
Publicado: (2025)
OpusLM: A Family of Open Unified Speech Language Models
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
TI-ASU: Toward Robust Automatic Speech Understanding through Text-to-speech Imputation Against Missing Speech Modality
por: Feng, Tiantian, et al.
Publicado: (2024)
por: Feng, Tiantian, et al.
Publicado: (2024)
Self-supervised Speech Representations Still Struggle with African American Vernacular English
por: Chang, Kalvin, et al.
Publicado: (2024)
por: Chang, Kalvin, et al.
Publicado: (2024)
Towards Machine Unlearning for Paralinguistic Speech Processing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Joint Beam Search Integrating CTC, Attention, and Transducer Decoders
por: Sudo, Yui, et al.
Publicado: (2024)
por: Sudo, Yui, et al.
Publicado: (2024)
Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
TOGGL: Transcribing Overlapping Speech with Staggered Labeling
por: Li, Chak-Fai, et al.
Publicado: (2024)
por: Li, Chak-Fai, et al.
Publicado: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
por: Wang, Chaoren, et al.
Publicado: (2026)
por: Wang, Chaoren, et al.
Publicado: (2026)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
por: Shakeel, Muhammad, et al.
Publicado: (2024)
por: Shakeel, Muhammad, et al.
Publicado: (2024)
Self-Powered LLM Modality Expansion for Large Speech-Text Models
por: Yu, Tengfei, et al.
Publicado: (2024)
por: Yu, Tengfei, et al.
Publicado: (2024)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
por: Shi, Jiatong, et al.
Publicado: (2023)
por: Shi, Jiatong, et al.
Publicado: (2023)
LibriheavyMix: A 20,000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization
por: Jin, Zengrui, et al.
Publicado: (2024)
por: Jin, Zengrui, et al.
Publicado: (2024)
SSR: Alignment-Aware Modality Connector for Speech Language Models
por: Tan, Weiting, et al.
Publicado: (2024)
por: Tan, Weiting, et al.
Publicado: (2024)
Towards Robust Speech Representation Learning for Thousands of Languages
por: Chen, William, et al.
Publicado: (2024)
por: Chen, William, et al.
Publicado: (2024)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025)
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Generative Expressive Conversational Speech Synthesis
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
por: Lin, Hsi-Che, et al.
Publicado: (2024)
por: Lin, Hsi-Che, et al.
Publicado: (2024)
Continuous Speech Tokenizer in Text To Speech
por: Li, Yixing, et al.
Publicado: (2024)
por: Li, Yixing, et al.
Publicado: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
por: Sudo, Yui, et al.
Publicado: (2024)
por: Sudo, Yui, et al.
Publicado: (2024)
Leveraging Parameter-Efficient Transfer Learning for Multi-Lingual Text-to-Speech Adaptation
por: Li, Yingting, et al.
Publicado: (2024)
por: Li, Yingting, et al.
Publicado: (2024)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
por: Shakeel, Muhammad, et al.
Publicado: (2024)
por: Shakeel, Muhammad, et al.
Publicado: (2024)
Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval
por: Zhou, Lifeng, et al.
Publicado: (2024)
por: Zhou, Lifeng, et al.
Publicado: (2024)
BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition
por: Jiang, Liuyuan, et al.
Publicado: (2025)
por: Jiang, Liuyuan, et al.
Publicado: (2025)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
por: Gao, Yifan, et al.
Publicado: (2025)
por: Gao, Yifan, et al.
Publicado: (2025)
Representation Purification for End-to-End Speech Translation
por: Zhang, Chengwei, et al.
Publicado: (2024)
por: Zhang, Chengwei, et al.
Publicado: (2024)
Ejemplares similares
-
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
por: Jiang, Feng, et al.
Publicado: (2025) -
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
por: Phukan, Orchid Chetia, et al.
Publicado: (2024) -
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
por: Kang, Wonjune, et al.
Publicado: (2024) -
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
por: Kim, Heeseung, et al.
Publicado: (2024) -
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
por: Lin, Yi-Cheng, et al.
Publicado: (2025)