QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Chien-Chun, Huang, Kuan-Tang, Yang, Cheng-Yeh, Lee, Hung-Shin, Wang, Hsin-Min, Chen, Berlin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2026)
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2026)
DRASP: A Dual-Resolution Attentive Statistics Pooling Framework for Automatic MOS Prediction
von: Yang, Cheng-Yeh, et al.
Veröffentlicht: (2025)
von: Yang, Cheng-Yeh, et al.
Veröffentlicht: (2025)
Revealing the Role of Audio Channels in ASR Performance Degradation
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2025)
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2025)
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic Perturbation
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2024)
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2024)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2026)
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2026)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
von: Yang, Cheng-Yeh, et al.
Veröffentlicht: (2026)
von: Yang, Cheng-Yeh, et al.
Veröffentlicht: (2026)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2024)
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2024)
SincQDR-VAD: A Noise-Robust Voice Activity Detection Framework Leveraging Learnable Filters and Ranking-Aware Optimization
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2025)
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
von: Peng, An-Ci, et al.
Veröffentlicht: (2026)
von: Peng, An-Ci, et al.
Veröffentlicht: (2026)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
von: Sung, Hung-Yang, et al.
Veröffentlicht: (2025)
von: Sung, Hung-Yang, et al.
Veröffentlicht: (2025)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
von: Yan, Bi-Cheng, et al.
Veröffentlicht: (2024)
von: Yan, Bi-Cheng, et al.
Veröffentlicht: (2024)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
ConSep: a Noise- and Reverberation-Robust Speech Separation Framework by Magnitude Conditioning
von: Ho, Kuan-Hsun, et al.
Veröffentlicht: (2024)
von: Ho, Kuan-Hsun, et al.
Veröffentlicht: (2024)
What do neural networks listen to? Exploring the crucial bands in Speech Enhancement using Sinc-convolution
von: Ho, Kuan-Hsun, et al.
Veröffentlicht: (2024)
von: Ho, Kuan-Hsun, et al.
Veröffentlicht: (2024)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
von: Wu, Chung-Wen, et al.
Veröffentlicht: (2024)
von: Wu, Chung-Wen, et al.
Veröffentlicht: (2024)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
von: Cheng, Yao-Fei, et al.
Veröffentlicht: (2024)
von: Cheng, Yao-Fei, et al.
Veröffentlicht: (2024)
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
von: Lu, Hao-Chien, et al.
Veröffentlicht: (2025)
von: Lu, Hao-Chien, et al.
Veröffentlicht: (2025)
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
von: Wang, Chung-Chun, et al.
Veröffentlicht: (2025)
von: Wang, Chung-Chun, et al.
Veröffentlicht: (2025)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
HAAQI-Net: A Non-intrusive Neural Music Audio Quality Assessment Model for Hearing Aids
von: Wisnu, Dyah A. M. G., et al.
Veröffentlicht: (2024)
von: Wisnu, Dyah A. M. G., et al.
Veröffentlicht: (2024)
Hearing the Order: Investigating Position Bias in Large Audio-Language Models
von: Lin, Yu-Xiang, et al.
Veröffentlicht: (2025)
von: Lin, Yu-Xiang, et al.
Veröffentlicht: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
von: Deshmukh, Soham, et al.
Veröffentlicht: (2024)
von: Deshmukh, Soham, et al.
Veröffentlicht: (2024)
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
von: Chen, Chih-Ning, et al.
Veröffentlicht: (2026)
von: Chen, Chih-Ning, et al.
Veröffentlicht: (2026)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
von: Ren, Wenze, et al.
Veröffentlicht: (2024)
von: Ren, Wenze, et al.
Veröffentlicht: (2024)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
von: Yang, Tzu-Ting, et al.
Veröffentlicht: (2024)
von: Yang, Tzu-Ting, et al.
Veröffentlicht: (2024)
SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models
von: Yin, Chun, et al.
Veröffentlicht: (2024)
von: Yin, Chun, et al.
Veröffentlicht: (2024)
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
von: Wisnu, Dyah A. M. G., et al.
Veröffentlicht: (2025)
von: Wisnu, Dyah A. M. G., et al.
Veröffentlicht: (2025)
Towards Robust Assessment of Pathological Voices via Combined Low-Level Descriptors and Foundation Model Representations
von: Ariyanti, Whenty, et al.
Veröffentlicht: (2025)
von: Ariyanti, Whenty, et al.
Veröffentlicht: (2025)
LLM-Codec: Neural Audio Codec Meets Language Model Objectives
von: Chung, Ho-Lam, et al.
Veröffentlicht: (2026)
von: Chung, Ho-Lam, et al.
Veröffentlicht: (2026)
Towards Automatic Evaluation and High-Quality Pseudo-Parallel Dataset Construction for Audio Editing: A Human-in-the-Loop Method
von: Jia, Yuhang, et al.
Veröffentlicht: (2025)
von: Jia, Yuhang, et al.
Veröffentlicht: (2025)
Acoustically Precise Hesitation Tagging Is Essential for End-to-End Verbatim Transcription Systems
von: Lin, Jhen-Ke, et al.
Veröffentlicht: (2025)
von: Lin, Jhen-Ke, et al.
Veröffentlicht: (2025)
Adaptive vector steering: A training-free, layer-wise intervention for hallucination mitigation in large audio and multimodal models
von: Lin, Tsung-En, et al.
Veröffentlicht: (2025)
von: Lin, Tsung-En, et al.
Veröffentlicht: (2025)
TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling
von: Xie, Hao-Hui, et al.
Veröffentlicht: (2026)
von: Xie, Hao-Hui, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2026) -
DRASP: A Dual-Resolution Attentive Statistics Pooling Framework for Automatic MOS Prediction
von: Yang, Cheng-Yeh, et al.
Veröffentlicht: (2025) -
Revealing the Role of Audio Channels in ASR Performance Degradation
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2025) -
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic Perturbation
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2024) -
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
von: Wang, Chien-Chun, et al.
Veröffentlicht: (2026)