Salvato in:
| Autori principali: | Li, Xueqing, Ma, Hao, Li, Zehan, Chen, Rujin, Zhu, Boyu, Jing, Ruihao, Kang, Jian, Li, Jie, Zhang, Chi, Zhang, Xiao-Lei, Li, Xuelong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2504.04721 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multilingual Speech Recognition Using Discrete Tokens with a Two-step Training Strategy
di: Li, Zehan, et al.
Pubblicazione: (2025)
di: Li, Zehan, et al.
Pubblicazione: (2025)
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
di: Jing, Ruihao, et al.
Pubblicazione: (2025)
di: Jing, Ruihao, et al.
Pubblicazione: (2025)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2025)
di: Ma, Hao, et al.
Pubblicazione: (2025)
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
Eliminating Quantization Errors in Classification-Based Sound Source Localization
di: Feng, Linfeng, et al.
Pubblicazione: (2023)
di: Feng, Linfeng, et al.
Pubblicazione: (2023)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
di: Li, Longhao, et al.
Pubblicazione: (2026)
di: Li, Longhao, et al.
Pubblicazione: (2026)
AudioSpa: Spatializing Sound Events with Text
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
di: Song, Yaodong, et al.
Pubblicazione: (2025)
di: Song, Yaodong, et al.
Pubblicazione: (2025)
BoSS: Beyond-Semantic Speech
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Towards Multimodal Query-Based Spatial Audio Source Extraction
di: Yu, Chenxin, et al.
Pubblicazione: (2025)
di: Yu, Chenxin, et al.
Pubblicazione: (2025)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
TELEVAL: A Dynamic Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios
di: Li, Zehan, et al.
Pubblicazione: (2025)
di: Li, Zehan, et al.
Pubblicazione: (2025)
Diffusion-Based Adversarial Purification for Speaker Verification
di: Bai, Yibo, et al.
Pubblicazione: (2023)
di: Bai, Yibo, et al.
Pubblicazione: (2023)
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition
di: Yang, Mu, et al.
Pubblicazione: (2025)
di: Yang, Mu, et al.
Pubblicazione: (2025)
DQR-TTS: Semi-supervised Text-to-speech Synthesis with Dynamic Quantized Representation
di: Wang, Jianzong, et al.
Pubblicazione: (2023)
di: Wang, Jianzong, et al.
Pubblicazione: (2023)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
Speaker Contrastive Learning for Source Speaker Tracing
di: Wang, Qing, et al.
Pubblicazione: (2024)
di: Wang, Qing, et al.
Pubblicazione: (2024)
Pianoroll-Event: A Novel Score Representation for Symbolic Music
di: Qian, Lekai, et al.
Pubblicazione: (2026)
di: Qian, Lekai, et al.
Pubblicazione: (2026)
Enhancing Fully Formatted End-to-End Speech Recognition with Knowledge Distillation via Multi-Codebook Vector Quantization
di: You, Jian, et al.
Pubblicazione: (2025)
di: You, Jian, et al.
Pubblicazione: (2025)
Deep Learning Based Stage-wise Two-dimensional Speaker Localization with Large Ad-hoc Microphone Arrays
di: Liu, Shupei, et al.
Pubblicazione: (2022)
di: Liu, Shupei, et al.
Pubblicazione: (2022)
Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning
di: Pan, Xiaofeng, et al.
Pubblicazione: (2025)
di: Pan, Xiaofeng, et al.
Pubblicazione: (2025)
DIFFA: Large Language Diffusion Models Can Listen and Understand
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems
di: Zhang, Hengfan, et al.
Pubblicazione: (2026)
di: Zhang, Hengfan, et al.
Pubblicazione: (2026)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
di: Li, Jingyi, et al.
Pubblicazione: (2026)
di: Li, Jingyi, et al.
Pubblicazione: (2026)
Bridging the Gap between Audio and Text using Parallel-attention for User-defined Keyword Spotting
di: Kim, Youkyum, et al.
Pubblicazione: (2024)
di: Kim, Youkyum, et al.
Pubblicazione: (2024)
FNSE-SBGAN: Far-field Speech Enhancement with Schrodinger Bridge and Generative Adversarial Networks
di: Lei, Tong, et al.
Pubblicazione: (2025)
di: Lei, Tong, et al.
Pubblicazione: (2025)
Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
di: Li, Haowen, et al.
Pubblicazione: (2026)
di: Li, Haowen, et al.
Pubblicazione: (2026)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
Refining Self-Supervised Learnt Speech Representation using Brain Activations
di: Li, Hengyu, et al.
Pubblicazione: (2024)
di: Li, Hengyu, et al.
Pubblicazione: (2024)
Bridge-SR: Schrödinger Bridge for Efficient SR
di: Li, Chang, et al.
Pubblicazione: (2025)
di: Li, Chang, et al.
Pubblicazione: (2025)
Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
SCDNet: Self-supervised Learning Feature-based Speaker Change Detection
di: Li, Yue, et al.
Pubblicazione: (2024)
di: Li, Yue, et al.
Pubblicazione: (2024)
EchoFree: Towards Ultra Lightweight and Efficient Neural Acoustic Echo Cancellation
di: Li, Xingchen, et al.
Pubblicazione: (2025)
di: Li, Xingchen, et al.
Pubblicazione: (2025)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multilingual Speech Recognition Using Discrete Tokens with a Two-step Training Strategy
di: Li, Zehan, et al.
Pubblicazione: (2025) -
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
di: Jing, Ruihao, et al.
Pubblicazione: (2025) -
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
di: Zhu, Boyu, et al.
Pubblicazione: (2025) -
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2025) -
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026)