AAT: Adapting Audio Transformer for Various Acoustics Recognition Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Yun, Lin, Hai, Qiu, Shaojian, Zhang, Yihang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AND: Audio Network Dissection for Interpreting Deep Acoustic Models
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026)
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
di: Zhang, Zhisheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2026)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions
di: Park, Hansol, et al.
Pubblicazione: (2025)
di: Park, Hansol, et al.
Pubblicazione: (2025)
The Computation of Generalized Embeddings for Underwater Acoustic Target Recognition using Contrastive Learning
di: Hummel, Hilde I., et al.
Pubblicazione: (2025)
di: Hummel, Hilde I., et al.
Pubblicazione: (2025)
ViSAGe: Video-to-Spatial Audio Generation
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering
di: Hai, Jiarui, et al.
Pubblicazione: (2025)
di: Hai, Jiarui, et al.
Pubblicazione: (2025)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems
di: Raymondaud, Quentin, et al.
Pubblicazione: (2024)
di: Raymondaud, Quentin, et al.
Pubblicazione: (2024)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
di: Qiu, Kai, et al.
Pubblicazione: (2024)
di: Qiu, Kai, et al.
Pubblicazione: (2024)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
di: Li, Dongyuan, et al.
Pubblicazione: (2024)
di: Li, Dongyuan, et al.
Pubblicazione: (2024)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
di: Gong, Yitian, et al.
Pubblicazione: (2025)
di: Gong, Yitian, et al.
Pubblicazione: (2025)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
di: Feng, Jiu, et al.
Pubblicazione: (2024)
di: Feng, Jiu, et al.
Pubblicazione: (2024)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
A Multi-task Learning Balanced Attention Convolutional Neural Network Model for Few-shot Underwater Acoustic Target Recognition
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
HRTFformer: A Spatially-Aware Transformer for Individual HRTF Upsampling in Immersive Audio Rendering
di: Hu, Xuyi, et al.
Pubblicazione: (2025)
di: Hu, Xuyi, et al.
Pubblicazione: (2025)
Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine
di: Kuznetsova, Anastasia, et al.
Pubblicazione: (2025)
di: Kuznetsova, Anastasia, et al.
Pubblicazione: (2025)
Token Pruning in Audio Transformers: Optimizing Performance and Decoding Patch Importance
di: Lee, Taehan, et al.
Pubblicazione: (2025)
di: Lee, Taehan, et al.
Pubblicazione: (2025)
Self-supervised Learning for Acoustic Few-Shot Classification
di: Liang, Jingyong, et al.
Pubblicazione: (2024)
di: Liang, Jingyong, et al.
Pubblicazione: (2024)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
di: Gao, Ming, et al.
Pubblicazione: (2025)
di: Gao, Ming, et al.
Pubblicazione: (2025)
Persian Speech Emotion Recognition by Fine-Tuning Transformers
di: Shayaninasab, Minoo, et al.
Pubblicazione: (2024)
di: Shayaninasab, Minoo, et al.
Pubblicazione: (2024)
Underwater Acoustic Signal Denoising Algorithms: A Survey of the State-of-the-art
di: Gao, Ruobin, et al.
Pubblicazione: (2024)
di: Gao, Ruobin, et al.
Pubblicazione: (2024)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
di: Luong, Justin, et al.
Pubblicazione: (2025)
di: Luong, Justin, et al.
Pubblicazione: (2025)
Efficient Finetuning for Dimensional Speech Emotion Recognition in the Age of Transformers
di: Sampath, Aneesha, et al.
Pubblicazione: (2025)
di: Sampath, Aneesha, et al.
Pubblicazione: (2025)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
di: Shi, Qundong, et al.
Pubblicazione: (2026)
di: Shi, Qundong, et al.
Pubblicazione: (2026)
How Do Neural Spoofing Countermeasures Detect Partially Spoofed Audio?
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
AFSS: Artifact-Focused Self-Synthesis for Mitigating Bias in Audio Deepfake Detection
di: Nguyen-Le, Hai-Son, et al.
Pubblicazione: (2026)
di: Nguyen-Le, Hai-Son, et al.
Pubblicazione: (2026)
HierCon: Hierarchical Contrastive Attention for Audio Deepfake Detection
di: Liang, Zhili Nicholas, et al.
Pubblicazione: (2026)
di: Liang, Zhili Nicholas, et al.
Pubblicazione: (2026)
Audio Atlas: Visualizing and Exploring Audio Datasets
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls
di: Lin, Liwei, et al.
Pubblicazione: (2024)
di: Lin, Liwei, et al.
Pubblicazione: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AND: Audio Network Dissection for Interpreting Deep Acoustic Models
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024) -
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026) -
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025) -
DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026) -
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
di: Zhang, Zhisheng, et al.
Pubblicazione: (2026)