Enregistré dans:
| Auteurs principaux: | Xiao, Boda, Wang, Bo, Cheng, Heping |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.13099 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
par: Cheng, Bo, et autres
Publié: (2026)
par: Cheng, Bo, et autres
Publié: (2026)
Scaling Audio-Text Retrieval with Multimodal Large Language Models
par: Xu, Jilan, et autres
Publié: (2026)
par: Xu, Jilan, et autres
Publié: (2026)
MEBM-Speech: Multi-scale Enhanced BrainMagic for Robust MEG Speech Detection
par: Songyi, Li, et autres
Publié: (2026)
par: Songyi, Li, et autres
Publié: (2026)
Magnetoencephalography (MEG) Based Non-Invasive Chinese Speech Decoding
par: Jia, Zhihong, et autres
Publié: (2025)
par: Jia, Zhihong, et autres
Publié: (2025)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
Retrieval-Augmented Audio Deepfake Detection
par: Kang, Zuheng, et autres
Publié: (2024)
par: Kang, Zuheng, et autres
Publié: (2024)
Zero-Day Audio DeepFake Detection via Retrieval Augmentation and Profile Matching
par: Liu, Xuechen, et autres
Publié: (2025)
par: Liu, Xuechen, et autres
Publié: (2025)
Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs
par: Quang, Trung Nguyen, et autres
Publié: (2026)
par: Quang, Trung Nguyen, et autres
Publié: (2026)
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
par: Bi, Chunhao, et autres
Publié: (2026)
par: Bi, Chunhao, et autres
Publié: (2026)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
par: Guo, Xiaoxuan, et autres
Publié: (2026)
par: Guo, Xiaoxuan, et autres
Publié: (2026)
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
par: Chien, Sheng-You, et autres
Publié: (2026)
par: Chien, Sheng-You, et autres
Publié: (2026)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
par: Yin, Han, et autres
Publié: (2025)
par: Yin, Han, et autres
Publié: (2025)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
par: Xue, Jun, et autres
Publié: (2026)
par: Xue, Jun, et autres
Publié: (2026)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
par: Deng, Yimin, et autres
Publié: (2024)
par: Deng, Yimin, et autres
Publié: (2024)
ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
par: Xie, Yuankun, et autres
Publié: (2026)
par: Xie, Yuankun, et autres
Publié: (2026)
PhonemeDF: A Synthetic Speech Dataset for Audio Deepfake Detection and Naturalness Evaluation
par: Nallaguntla, Vamshi, et autres
Publié: (2026)
par: Nallaguntla, Vamshi, et autres
Publié: (2026)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation
par: Cheng, Changhao, et autres
Publié: (2026)
par: Cheng, Changhao, et autres
Publié: (2026)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
par: Lee, Jeehyun, et autres
Publié: (2024)
par: Lee, Jeehyun, et autres
Publié: (2024)
Investigating the Impact of Speech Enhancement on Audio Deepfake Detection in Noisy Environments
par: Anacin, et autres
Publié: (2026)
par: Anacin, et autres
Publié: (2026)
Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models
par: Kabir, Muhammad Ashad, et autres
Publié: (2026)
par: Kabir, Muhammad Ashad, et autres
Publié: (2026)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
par: Ranjan, Rishabh, et autres
Publié: (2025)
par: Ranjan, Rishabh, et autres
Publié: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations
par: Guo, Wenxiang, et autres
Publié: (2025)
par: Guo, Wenxiang, et autres
Publié: (2025)
SHINE: Sequential Hierarchical Integration Network for EEG and MEG
par: Xu, Xiran, et autres
Publié: (2026)
par: Xu, Xiran, et autres
Publié: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
Tadabur: A Large-Scale Quran Audio Dataset
par: Alherran, Faisal
Publié: (2026)
par: Alherran, Faisal
Publié: (2026)
Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting?
par: Pareras, Oriol, et autres
Publié: (2025)
par: Pareras, Oriol, et autres
Publié: (2025)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
par: Lin, Yi-Cheng, et autres
Publié: (2026)
par: Lin, Yi-Cheng, et autres
Publié: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
par: Yin, Han, et autres
Publié: (2026)
par: Yin, Han, et autres
Publié: (2026)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
par: Li, Hongyi, et autres
Publié: (2025)
par: Li, Hongyi, et autres
Publié: (2025)
Application of Audio Fingerprinting Techniques for Real-Time Scalable Speech Retrieval and Speech Clusterization
par: Altwlkany, Kemal, et autres
Publié: (2024)
par: Altwlkany, Kemal, et autres
Publié: (2024)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
par: Xiao, Yixuan, et autres
Publié: (2026)
par: Xiao, Yixuan, et autres
Publié: (2026)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
Documents similaires
-
Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
par: Cheng, Bo, et autres
Publié: (2026) -
Scaling Audio-Text Retrieval with Multimodal Large Language Models
par: Xu, Jilan, et autres
Publié: (2026) -
MEBM-Speech: Multi-scale Enhanced BrainMagic for Robust MEG Speech Detection
par: Songyi, Li, et autres
Publié: (2026) -
Magnetoencephalography (MEG) Based Non-Invasive Chinese Speech Decoding
par: Jia, Zhihong, et autres
Publié: (2025) -
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)