EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Wenxi, Liang, Yuzhe, Ma, Ziyang, Zheng, Zhisheng, Chen, Xie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
von: Li, Xiquan, et al.
Veröffentlicht: (2024)
von: Li, Xiquan, et al.
Veröffentlicht: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
von: Chen, Wenxi, et al.
Veröffentlicht: (2024)
von: Chen, Wenxi, et al.
Veröffentlicht: (2024)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
von: Ma, Ziyang, et al.
Veröffentlicht: (2024)
von: Ma, Ziyang, et al.
Veröffentlicht: (2024)
BAT: Learning to Reason about Spatial Sounds with Large Language Models
von: Zheng, Zhisheng, et al.
Veröffentlicht: (2024)
von: Zheng, Zhisheng, et al.
Veröffentlicht: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
von: Ma, Ziyang, et al.
Veröffentlicht: (2023)
von: Ma, Ziyang, et al.
Veröffentlicht: (2023)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
von: Wang, Yujin, et al.
Veröffentlicht: (2022)
von: Wang, Yujin, et al.
Veröffentlicht: (2022)
MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization
von: Zhu, Haina, et al.
Veröffentlicht: (2025)
von: Zhu, Haina, et al.
Veröffentlicht: (2025)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
von: Yadav, Sarthak, et al.
Veröffentlicht: (2024)
von: Yadav, Sarthak, et al.
Veröffentlicht: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
von: Wang, Jun, et al.
Veröffentlicht: (2025)
von: Wang, Jun, et al.
Veröffentlicht: (2025)
ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering
von: Song, Yakun, et al.
Veröffentlicht: (2024)
von: Song, Yakun, et al.
Veröffentlicht: (2024)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
von: Wang, Junyu, et al.
Veröffentlicht: (2025)
von: Wang, Junyu, et al.
Veröffentlicht: (2025)
Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods
von: Zhou, Xuanru, et al.
Veröffentlicht: (2026)
von: Zhou, Xuanru, et al.
Veröffentlicht: (2026)
InstructAudio: Unified speech and music generation with natural language instruction
von: Qiang, Chunyu, et al.
Veröffentlicht: (2025)
von: Qiang, Chunyu, et al.
Veröffentlicht: (2025)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
von: Mousavi, Pooneh, et al.
Veröffentlicht: (2024)
von: Mousavi, Pooneh, et al.
Veröffentlicht: (2024)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
von: Luong, Justin, et al.
Veröffentlicht: (2025)
von: Luong, Justin, et al.
Veröffentlicht: (2025)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
von: Song, Zheshu, et al.
Veröffentlicht: (2024)
von: Song, Zheshu, et al.
Veröffentlicht: (2024)
Scaling Rich Style-Prompted Text-to-Speech Datasets
von: Diwan, Anuj, et al.
Veröffentlicht: (2025)
von: Diwan, Anuj, et al.
Veröffentlicht: (2025)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
von: Alex, Tony, et al.
Veröffentlicht: (2025)
von: Alex, Tony, et al.
Veröffentlicht: (2025)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
von: Zhao, Junqi, et al.
Veröffentlicht: (2024)
von: Zhao, Junqi, et al.
Veröffentlicht: (2024)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
von: Li, Kai, et al.
Veröffentlicht: (2025)
von: Li, Kai, et al.
Veröffentlicht: (2025)
MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training
von: Li, Yizhi, et al.
Veröffentlicht: (2023)
von: Li, Yizhi, et al.
Veröffentlicht: (2023)
Studying the Effect of Audio Filters in Pre-Trained Models for Environmental Sound Classification
von: Dawn, Aditya, et al.
Veröffentlicht: (2024)
von: Dawn, Aditya, et al.
Veröffentlicht: (2024)
Improving Anomalous Sound Detection via Low-Rank Adaptation Fine-Tuning of Pre-Trained Audio Models
von: Zheng, Xinhu, et al.
Veröffentlicht: (2024)
von: Zheng, Xinhu, et al.
Veröffentlicht: (2024)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
von: Dai, Yusheng, et al.
Veröffentlicht: (2023)
von: Dai, Yusheng, et al.
Veröffentlicht: (2023)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
von: Foo, Leonardo Haw-Yang, et al.
Veröffentlicht: (2026)
von: Foo, Leonardo Haw-Yang, et al.
Veröffentlicht: (2026)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
von: Chen, Liyang, et al.
Veröffentlicht: (2026)
von: Chen, Liyang, et al.
Veröffentlicht: (2026)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
von: Ieong, Lok-Lam, et al.
Veröffentlicht: (2026)
von: Ieong, Lok-Lam, et al.
Veröffentlicht: (2026)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
von: Cai, Pengfei, et al.
Veröffentlicht: (2024)
von: Cai, Pengfei, et al.
Veröffentlicht: (2024)
Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
von: Li, Gang, et al.
Veröffentlicht: (2025)
von: Li, Gang, et al.
Veröffentlicht: (2025)
Improving Self-supervised Pre-training using Accent-Specific Codebooks
von: Prabhu, Darshan, et al.
Veröffentlicht: (2024)
von: Prabhu, Darshan, et al.
Veröffentlicht: (2024)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
von: Zhang, Wenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Wenyu, et al.
Veröffentlicht: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
von: Zhang, Zhisheng, et al.
Veröffentlicht: (2026)
von: Zhang, Zhisheng, et al.
Veröffentlicht: (2026)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
von: Jiang, Yuxuan, et al.
Veröffentlicht: (2025)
von: Jiang, Yuxuan, et al.
Veröffentlicht: (2025)
AAT: Adapting Audio Transformer for Various Acoustics Recognition Tasks
von: Liang, Yun, et al.
Veröffentlicht: (2024)
von: Liang, Yun, et al.
Veröffentlicht: (2024)
SSPS: Self-Supervised Positive Sampling for Robust Self-Supervised Speaker Verification
von: Lepage, Theo, et al.
Veröffentlicht: (2025)
von: Lepage, Theo, et al.
Veröffentlicht: (2025)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
von: Cai, Pengfei, et al.
Veröffentlicht: (2024)
von: Cai, Pengfei, et al.
Veröffentlicht: (2024)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
von: Han, Bing, et al.
Veröffentlicht: (2026)
von: Han, Bing, et al.
Veröffentlicht: (2026)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
von: Chen, Shunian, et al.
Veröffentlicht: (2025)
von: Chen, Shunian, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
von: Li, Xiquan, et al.
Veröffentlicht: (2024) -
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
von: Chen, Wenxi, et al.
Veröffentlicht: (2024) -
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
von: Ma, Ziyang, et al.
Veröffentlicht: (2024) -
BAT: Learning to Reason about Spatial Sounds with Large Language Models
von: Zheng, Zhisheng, et al.
Veröffentlicht: (2024) -
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
von: Ma, Ziyang, et al.
Veröffentlicht: (2023)