Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Haoyu, Zhang, Guangyan, Chen, Jiale, Li, Jingyu, Wang, Yuehai, Guo, Yiwen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
por: Cheng, Zhuangfei, et al.
Publicado: (2025)
por: Cheng, Zhuangfei, et al.
Publicado: (2025)
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
Self-Improvement for Audio Large Language Model using Unlabeled Speech
por: Wang, Shaowen, et al.
Publicado: (2025)
por: Wang, Shaowen, et al.
Publicado: (2025)
Quantifying the effect of speech pathology on automatic and human speaker verification
por: Halpern, Bence Mark, et al.
Publicado: (2024)
por: Halpern, Bence Mark, et al.
Publicado: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
por: Ahn, Taekyung, et al.
Publicado: (2024)
por: Ahn, Taekyung, et al.
Publicado: (2024)
Everyday Speech in the Indian Subcontinent
por: P, Utkarsh
Publicado: (2024)
por: P, Utkarsh
Publicado: (2024)
Measuring the Accuracy of Automatic Speech Recognition Solutions
por: Kuhn, Korbinian, et al.
Publicado: (2024)
por: Kuhn, Korbinian, et al.
Publicado: (2024)
Bigger is not Always Better: The Effect of Context Size on Speech Pre-Training
por: Robertson, Sean, et al.
Publicado: (2023)
por: Robertson, Sean, et al.
Publicado: (2023)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
por: Jain, Sarthak, et al.
Publicado: (2024)
por: Jain, Sarthak, et al.
Publicado: (2024)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
por: Sharma, Manali, et al.
Publicado: (2026)
por: Sharma, Manali, et al.
Publicado: (2026)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
por: Li, Pengcheng, et al.
Publicado: (2024)
por: Li, Pengcheng, et al.
Publicado: (2024)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
por: Wang, Hsuan-Yu, et al.
Publicado: (2025)
por: Wang, Hsuan-Yu, et al.
Publicado: (2025)
Communication Access Real-Time Translation Through Collaborative Correction of Automatic Speech Recognition
por: Kuhn, Korbinian, et al.
Publicado: (2025)
por: Kuhn, Korbinian, et al.
Publicado: (2025)
Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
CTC-based Non-autoregressive Textless Speech-to-Speech Translation
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector
por: Costa-jussà, Marta R., et al.
Publicado: (2024)
por: Costa-jussà, Marta R., et al.
Publicado: (2024)
Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Beyond Levenshtein: Leveraging Multiple Algorithms for Robust Word Error Rate Computations And Granular Error Classifications
por: Kuhn, Korbinian, et al.
Publicado: (2024)
por: Kuhn, Korbinian, et al.
Publicado: (2024)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
por: Viswanathan, Janaki, et al.
Publicado: (2025)
por: Viswanathan, Janaki, et al.
Publicado: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
por: Alamr, Meshal, et al.
Publicado: (2026)
por: Alamr, Meshal, et al.
Publicado: (2026)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
por: Adelson, Trevor, et al.
Publicado: (2026)
por: Adelson, Trevor, et al.
Publicado: (2026)
Generation of Musical Timbres using a Text-Guided Diffusion Model
por: Yuan, Weixuan, et al.
Publicado: (2025)
por: Yuan, Weixuan, et al.
Publicado: (2025)
Syllable based DNN-HMM Cantonese Speech to Text System
por: Wong, Timothy, et al.
Publicado: (2024)
por: Wong, Timothy, et al.
Publicado: (2024)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
por: Hori, Takaaki, et al.
Publicado: (2025)
por: Hori, Takaaki, et al.
Publicado: (2025)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
por: Soni, Aniket Abhishek
Publicado: (2025)
por: Soni, Aniket Abhishek
Publicado: (2025)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations
por: Lee, Yoonhyung, et al.
Publicado: (2026)
por: Lee, Yoonhyung, et al.
Publicado: (2026)
A Voice-based Triage for Type 2 Diabetes using a Conversational Virtual Assistant in the Home Environment
por: Summoogum, Kelvin, et al.
Publicado: (2024)
por: Summoogum, Kelvin, et al.
Publicado: (2024)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
por: Kim, Minu, et al.
Publicado: (2025)
por: Kim, Minu, et al.
Publicado: (2025)
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
por: Villatoro-Tello, Esaú, et al.
Publicado: (2022)
por: Villatoro-Tello, Esaú, et al.
Publicado: (2022)
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
por: Tu, Zehai, et al.
Publicado: (2024)
por: Tu, Zehai, et al.
Publicado: (2024)
SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution
por: Donepudi, Dharma Teja
Publicado: (2025)
por: Donepudi, Dharma Teja
Publicado: (2025)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
por: Chen, Kuan-Yu, et al.
Publicado: (2025)
por: Chen, Kuan-Yu, et al.
Publicado: (2025)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
por: Kozak, Nazar
Publicado: (2026)
por: Kozak, Nazar
Publicado: (2026)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
por: Cheripally, Sowmya
Publicado: (2024)
por: Cheripally, Sowmya
Publicado: (2024)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
por: Marie, Ambre, et al.
Publicado: (2025)
por: Marie, Ambre, et al.
Publicado: (2025)
Ejemplares similares
-
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
por: Cheng, Zhuangfei, et al.
Publicado: (2025) -
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
por: Fang, Qingkai, et al.
Publicado: (2024) -
Self-Improvement for Audio Large Language Model using Unlabeled Speech
por: Wang, Shaowen, et al.
Publicado: (2025) -
Quantifying the effect of speech pathology on automatic and human speaker verification
por: Halpern, Bence Mark, et al.
Publicado: (2024) -
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)