Representation-Regularized Convolutional Audio Transformer for Audio Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Bing, Zhou, Chushu, Yang, Yifan, Wang, Wei, Li, Chenda, Zhang, Wangyou, Qian, Yanmin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
Improving Anomalous Sound Detection via Low-Rank Adaptation Fine-Tuning of Pre-Trained Audio Models
por: Zheng, Xinhu, et al.
Publicado: (2024)
por: Zheng, Xinhu, et al.
Publicado: (2024)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
por: Wang, Wei, et al.
Publicado: (2025)
por: Wang, Wei, et al.
Publicado: (2025)
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
por: Zhang, Wangyou, et al.
Publicado: (2024)
por: Zhang, Wangyou, et al.
Publicado: (2024)
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
por: Zhang, Leying, et al.
Publicado: (2026)
por: Zhang, Leying, et al.
Publicado: (2026)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
por: Yadav, Sarthak, et al.
Publicado: (2024)
por: Yadav, Sarthak, et al.
Publicado: (2024)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
por: Chen, Liyang, et al.
Publicado: (2026)
por: Chen, Liyang, et al.
Publicado: (2026)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
por: Yang, Wanqi, et al.
Publicado: (2024)
por: Yang, Wanqi, et al.
Publicado: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
por: Luong, Justin, et al.
Publicado: (2025)
por: Luong, Justin, et al.
Publicado: (2025)
Exploring Self-Supervised Audio Models for Generalized Anomalous Sound Detection
por: Han, Bing, et al.
Publicado: (2025)
por: Han, Bing, et al.
Publicado: (2025)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
por: Zhang, Zhisheng, et al.
Publicado: (2026)
por: Zhang, Zhisheng, et al.
Publicado: (2026)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
Cross-Domain Audio Deepfake Detection: Dataset and Analysis
por: Li, Yuang, et al.
Publicado: (2024)
por: Li, Yuang, et al.
Publicado: (2024)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
por: Lin, Jiaju, et al.
Publicado: (2024)
por: Lin, Jiaju, et al.
Publicado: (2024)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
por: Zhang, Leying, et al.
Publicado: (2025)
por: Zhang, Leying, et al.
Publicado: (2025)
AAT: Adapting Audio Transformer for Various Acoustics Recognition Tasks
por: Liang, Yun, et al.
Publicado: (2024)
por: Liang, Yun, et al.
Publicado: (2024)
Harder or Different? Understanding Generalization of Audio Deepfake Detection
por: Müller, Nicolas M., et al.
Publicado: (2024)
por: Müller, Nicolas M., et al.
Publicado: (2024)
Raw Audio Classification with Cosine Convolutional Neural Network (CosCovNN)
por: Haque, Kazi Nazmul, et al.
Publicado: (2024)
por: Haque, Kazi Nazmul, et al.
Publicado: (2024)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
por: He, Peize, et al.
Publicado: (2025)
por: He, Peize, et al.
Publicado: (2025)
Audio Atlas: Visualizing and Exploring Audio Datasets
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG
por: Yang, Haoyun, et al.
Publicado: (2026)
por: Yang, Haoyun, et al.
Publicado: (2026)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
por: Shi, Qundong, et al.
Publicado: (2026)
por: Shi, Qundong, et al.
Publicado: (2026)
Towards Controllable Audio Texture Morphing
por: Gupta, Chitralekha, et al.
Publicado: (2023)
por: Gupta, Chitralekha, et al.
Publicado: (2023)
Generalizable Audio Spoofing Detection using Non-Semantic Representations
por: Das, Arnab, et al.
Publicado: (2025)
por: Das, Arnab, et al.
Publicado: (2025)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
por: Li, Chenda, et al.
Publicado: (2024)
por: Li, Chenda, et al.
Publicado: (2024)
Compressing Quaternion Convolutional Neural Networks for Audio Classification
por: Singh, Arshdeep, et al.
Publicado: (2025)
por: Singh, Arshdeep, et al.
Publicado: (2025)
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
por: Wu, Yihan, et al.
Publicado: (2024)
por: Wu, Yihan, et al.
Publicado: (2024)
FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs
por: An, Keyu, et al.
Publicado: (2024)
por: An, Keyu, et al.
Publicado: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
HRTFformer: A Spatially-Aware Transformer for Individual HRTF Upsampling in Immersive Audio Rendering
por: Hu, Xuyi, et al.
Publicado: (2025)
por: Hu, Xuyi, et al.
Publicado: (2025)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
por: Mei, Xinhao, et al.
Publicado: (2026)
por: Mei, Xinhao, et al.
Publicado: (2026)
Audio-to-Image Encoding for Improved Voice Characteristic Detection Using Deep Convolutional Neural Networks
por: Atif, Youness
Publicado: (2025)
por: Atif, Youness
Publicado: (2025)
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
por: Liu, Bei, et al.
Publicado: (2024)
por: Liu, Bei, et al.
Publicado: (2024)
Improving Design of Input Condition Invariant Speech Enhancement
por: Zhang, Wangyou, et al.
Publicado: (2024)
por: Zhang, Wangyou, et al.
Publicado: (2024)
Ejemplares similares
-
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
por: Zhang, Leying, et al.
Publicado: (2024) -
Improving Anomalous Sound Detection via Low-Rank Adaptation Fine-Tuning of Pre-Trained Audio Models
por: Zheng, Xinhu, et al.
Publicado: (2024) -
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
por: Wang, Wei, et al.
Publicado: (2025) -
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
por: Zhang, Wangyou, et al.
Publicado: (2024) -
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
por: Zhang, Leying, et al.
Publicado: (2026)