Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio
Fuente:
arXiv
Salvato in:
| Autori principali: | Long, Phillip, Novack, Zachary, Donahue, Chris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
di: Long, Phillip, et al.
Pubblicazione: (2024)
di: Long, Phillip, et al.
Pubblicazione: (2024)
FoleyBench: A Benchmark For Video-to-Audio Models
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
DITTO: Diffusion Inference-Time T-Optimization for Music Generation
di: Novack, Zachary, et al.
Pubblicazione: (2024)
di: Novack, Zachary, et al.
Pubblicazione: (2024)
Aligning Text-to-Music Evaluation with Human Preferences
di: Huang, Yichen, et al.
Pubblicazione: (2025)
di: Huang, Yichen, et al.
Pubblicazione: (2025)
Steering Autoregressive Music Generation with Recursive Feature Machines
di: Zhao, Daniel, et al.
Pubblicazione: (2025)
di: Zhao, Daniel, et al.
Pubblicazione: (2025)
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
CoLLAP: Contrastive Long-form Language-Audio Pretraining with Musical Temporal Structure Augmentation
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
Presto! Distilling Steps and Layers for Accelerating Music Generation
di: Novack, Zachary, et al.
Pubblicazione: (2024)
di: Novack, Zachary, et al.
Pubblicazione: (2024)
Fast Text-to-Audio Generation with Adversarial Post-Training
di: Novack, Zachary, et al.
Pubblicazione: (2025)
di: Novack, Zachary, et al.
Pubblicazione: (2025)
$\texttt{AVROBUSTBENCH}$: Benchmarking the Robustness of Audio-Visual Recognition Models at Test-Time
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2025)
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2025)
Futga: Towards Fine-grained Music Understanding through Temporally-enhanced Generative Augmentation
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
di: Pasini, Marco, et al.
Pubblicazione: (2025)
di: Pasini, Marco, et al.
Pubblicazione: (2025)
MuseTok: Symbolic Music Tokenization for Generation and Semantic Understanding
di: Huang, Jingyue, et al.
Pubblicazione: (2025)
di: Huang, Jingyue, et al.
Pubblicazione: (2025)
CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning
di: Wang, Boyang, et al.
Pubblicazione: (2025)
di: Wang, Boyang, et al.
Pubblicazione: (2025)
Just Label the Repeats for In-The-Wild Audio-to-Score Alignment
di: Bukey, Irmak, et al.
Pubblicazione: (2024)
di: Bukey, Irmak, et al.
Pubblicazione: (2024)
Do Music Generation Models Encode Music Theory?
di: Wei, Megan, et al.
Pubblicazione: (2024)
di: Wei, Megan, et al.
Pubblicazione: (2024)
Music2Latent2: Audio Compression with Summary Embeddings and Autoregressive Decoding
di: Pasini, Marco, et al.
Pubblicazione: (2025)
di: Pasini, Marco, et al.
Pubblicazione: (2025)
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
di: Robinson, David, et al.
Pubblicazione: (2024)
di: Robinson, David, et al.
Pubblicazione: (2024)
AudioGenX: Explainability on Text-to-Audio Generative Models
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
di: Zhang, Wenda, et al.
Pubblicazione: (2026)
di: Zhang, Wenda, et al.
Pubblicazione: (2026)
Content Adaptive Front End For Audio Classification
di: Verma, Prateek, et al.
Pubblicazione: (2023)
di: Verma, Prateek, et al.
Pubblicazione: (2023)
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
di: Cheng, Hao, et al.
Pubblicazione: (2025)
di: Cheng, Hao, et al.
Pubblicazione: (2025)
Prompt-guided Precise Audio Editing with Diffusion Models
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
PoDAR: Power-Disentangled Audio Representation for Generative Modeling
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
Text-Queried Audio Source Separation via Hierarchical Modeling
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
Sparse Autoencoders Make Audio Foundation Models more Explainable
di: Mariotte, Théo, et al.
Pubblicazione: (2025)
di: Mariotte, Théo, et al.
Pubblicazione: (2025)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
SoundReactor: Frame-level Online Video-to-Audio Generation
di: Saito, Koichi, et al.
Pubblicazione: (2025)
di: Saito, Koichi, et al.
Pubblicazione: (2025)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
di: Alex, Tony, et al.
Pubblicazione: (2025)
di: Alex, Tony, et al.
Pubblicazione: (2025)
Open-Amp: Synthetic Data Framework for Audio Effect Foundation Models
di: Wright, Alec, et al.
Pubblicazione: (2024)
di: Wright, Alec, et al.
Pubblicazione: (2024)
MaskSR: Masked Language Model for Full-band Speech Restoration
di: Li, Xu, et al.
Pubblicazione: (2024)
di: Li, Xu, et al.
Pubblicazione: (2024)
Diffused Responsibility: Analyzing the Energy Consumption of Generative Text-to-Audio Diffusion Models
di: Passoni, Riccardo, et al.
Pubblicazione: (2025)
di: Passoni, Riccardo, et al.
Pubblicazione: (2025)
Tuberculosis Screening from Cough Audio: Baseline Models, Clinical Variables, and Uncertainty Quantification
di: Kafentzis, George P., et al.
Pubblicazione: (2026)
di: Kafentzis, George P., et al.
Pubblicazione: (2026)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
HEAR: Holistic Evaluation of Audio Representations
di: Turian, Joseph, et al.
Pubblicazione: (2022)
di: Turian, Joseph, et al.
Pubblicazione: (2022)
Learning Source Disentanglement in Neural Audio Codec
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
TACNET: Temporal Audio Source Counting Network
di: Ahmadnejad, Amirreza, et al.
Pubblicazione: (2023)
di: Ahmadnejad, Amirreza, et al.
Pubblicazione: (2023)
Exploring and Applying Audio-Based Sentiment Analysis in Music
di: Jhanji, Etash
Pubblicazione: (2024)
di: Jhanji, Etash
Pubblicazione: (2024)
Training-Free Multi-Step Audio Source Separation
di: Zang, Yongyi, et al.
Pubblicazione: (2025)
di: Zang, Yongyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
di: Long, Phillip, et al.
Pubblicazione: (2024) -
FoleyBench: A Benchmark For Video-to-Audio Models
di: Dixit, Satvik, et al.
Pubblicazione: (2025) -
DITTO: Diffusion Inference-Time T-Optimization for Music Generation
di: Novack, Zachary, et al.
Pubblicazione: (2024) -
Aligning Text-to-Music Evaluation with Human Preferences
di: Huang, Yichen, et al.
Pubblicazione: (2025) -
Steering Autoregressive Music Generation with Recursive Feature Machines
di: Zhao, Daniel, et al.
Pubblicazione: (2025)