ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Yu-Xiang, Lin, Yi-Cheng, Chuang, Ming-To, Chen, Jia-Hung, Tsai, I-Ning, Kiew, Pei Xing, Huang, Yueh-Hsuan, Liu, Chien-Feng, Chen, Yu-Chen, Feng, Bo-Han, Ren, Wenze, Lee, Hung-yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
por: Du, Jiawei, et al.
Publicado: (2024)
por: Du, Jiawei, et al.
Publicado: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
por: Tao, Dehua, et al.
Publicado: (2024)
por: Tao, Dehua, et al.
Publicado: (2024)
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
por: Ieong, Lok-Lam, et al.
Publicado: (2026)
por: Ieong, Lok-Lam, et al.
Publicado: (2026)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
por: Chen, Szu-Chi, et al.
Publicado: (2026)
por: Chen, Szu-Chi, et al.
Publicado: (2026)
Towards Generalizability to Tone and Content Variations in the Transcription of Amplifier Rendered Electric Guitar Audio
por: Chen, Yu-Hua, et al.
Publicado: (2025)
por: Chen, Yu-Hua, et al.
Publicado: (2025)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
por: Feng, Bo-Han, et al.
Publicado: (2025)
por: Feng, Bo-Han, et al.
Publicado: (2025)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild
por: Chang, Kai-Wei, et al.
Publicado: (2026)
por: Chang, Kai-Wei, et al.
Publicado: (2026)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
por: Yang, Chih-Kai, et al.
Publicado: (2024)
por: Yang, Chih-Kai, et al.
Publicado: (2024)
TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
DOTA-ME-CS: Daily Oriented Text Audio-Mandarin English-Code Switching Dataset
por: Li, Yupei, et al.
Publicado: (2025)
por: Li, Yupei, et al.
Publicado: (2025)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
por: Lin, Guan-Ting, et al.
Publicado: (2026)
por: Lin, Guan-Ting, et al.
Publicado: (2026)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2026)
por: Yang, Chih-Kai, et al.
Publicado: (2026)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
por: Mai, Jialong, et al.
Publicado: (2025)
por: Mai, Jialong, et al.
Publicado: (2025)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
por: Hsu, Tzu-wen, et al.
Publicado: (2025)
por: Hsu, Tzu-wen, et al.
Publicado: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
por: Ren, Wenze, et al.
Publicado: (2025)
por: Ren, Wenze, et al.
Publicado: (2025)
EMO-Debias: Benchmarking Gender Debiasing Techniques in Multi-Label Speech Emotion Recognition
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
A Preliminary Exploration with GPT-4o Voice Mode
por: Lin, Yu-Xiang, et al.
Publicado: (2025)
por: Lin, Yu-Xiang, et al.
Publicado: (2025)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
por: Lu, Ke-Han, et al.
Publicado: (2026)
por: Lu, Ke-Han, et al.
Publicado: (2026)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
por: Huang, Hsiao-Ying, et al.
Publicado: (2025)
por: Huang, Hsiao-Ying, et al.
Publicado: (2025)
Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
Enhancing Multilingual Voice Toxicity Detection with Speech-Text Alignment
por: Liu, Joseph, et al.
Publicado: (2024)
por: Liu, Joseph, et al.
Publicado: (2024)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
Ejemplares similares
-
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
por: Du, Jiawei, et al.
Publicado: (2024) -
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
por: Tao, Dehua, et al.
Publicado: (2024) -
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
por: Lin, Yi-Cheng, et al.
Publicado: (2025) -
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025) -
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
por: Ren, Wenze, et al.
Publicado: (2024)