Optimizing Audio Compression Through Entropy-Controlled Dithering
Fuente:
arXiv
Salvato in:
| Autori principali: | Murray, Ellison, Kasher, Morriel, Spasojevic, Predrag |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Low-Complexity Speech Codec Using Parametric Dithering for ASR
di: Murray, Ellison, et al.
Pubblicazione: (2025)
di: Murray, Ellison, et al.
Pubblicazione: (2025)
Distortion-Controlled Dithering with Reduced Recompression Rate
di: Kasher, Morriel, et al.
Pubblicazione: (2024)
di: Kasher, Morriel, et al.
Pubblicazione: (2024)
Robust Lossy Audio Compression Identification
di: Koops, Hendrik Vincent, et al.
Pubblicazione: (2024)
di: Koops, Hendrik Vincent, et al.
Pubblicazione: (2024)
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization
di: Steinmetz, Christian J., et al.
Pubblicazione: (2024)
di: Steinmetz, Christian J., et al.
Pubblicazione: (2024)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
di: Li, Chenxing, et al.
Pubblicazione: (2024)
di: Li, Chenxing, et al.
Pubblicazione: (2024)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
di: Li, Jingyi, et al.
Pubblicazione: (2025)
di: Li, Jingyi, et al.
Pubblicazione: (2025)
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
di: Zhao, Botao, et al.
Pubblicazione: (2025)
di: Zhao, Botao, et al.
Pubblicazione: (2025)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language Models
di: Wang, Linqin, et al.
Pubblicazione: (2024)
di: Wang, Linqin, et al.
Pubblicazione: (2024)
Audio Generation Through Score-Based Generative Modeling: Design Principles and Implementation
di: Zhu, Ge, et al.
Pubblicazione: (2025)
di: Zhu, Ge, et al.
Pubblicazione: (2025)
Online Single-Channel Audio-Based Sound Speed Estimation for Robust Multi-Channel Audio Control
di: Fuglsig, Andreas Jonas, et al.
Pubblicazione: (2026)
di: Fuglsig, Andreas Jonas, et al.
Pubblicazione: (2026)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
di: Tal, Or, et al.
Pubblicazione: (2024)
di: Tal, Or, et al.
Pubblicazione: (2024)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
APCodec+: A Spectrum-Coding-Based High-Fidelity and High-Compression-Rate Neural Audio Codec with Staged Training Paradigm
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
Intuitive Control of Scraping and Rubbing Through Audio-tactile Synthesis
di: Aramaki, Mitsuko, et al.
Pubblicazione: (2024)
di: Aramaki, Mitsuko, et al.
Pubblicazione: (2024)
ITO-Master: Inference-Time Optimization for Audio Effects Modeling of Music Mastering Processors
di: Koo, Junghyun, et al.
Pubblicazione: (2025)
di: Koo, Junghyun, et al.
Pubblicazione: (2025)
Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation
di: Gu, Yi, et al.
Pubblicazione: (2026)
di: Gu, Yi, et al.
Pubblicazione: (2026)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
di: Wang, Junnuo
Pubblicazione: (2025)
di: Wang, Junnuo
Pubblicazione: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
di: Khanjani, Zahra, et al.
Pubblicazione: (2024)
di: Khanjani, Zahra, et al.
Pubblicazione: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
SynthCloner: Synthesizer-style Audio Transfer via Factorized Codec with ADSR Envelope Control
di: Liu, Jeng-Yue, et al.
Pubblicazione: (2025)
di: Liu, Jeng-Yue, et al.
Pubblicazione: (2025)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
di: García, Hugo Flores, et al.
Pubblicazione: (2024)
di: García, Hugo Flores, et al.
Pubblicazione: (2024)
Enhancing Neural Audio Fingerprint Robustness to Audio Degradation for Music Identification
di: Araz, R. Oguz, et al.
Pubblicazione: (2025)
di: Araz, R. Oguz, et al.
Pubblicazione: (2025)
Combining Audio and Non-Audio Inputs in Evolved Neural Networks for Ovenbird
di: Hernandez, Sergio Poo, et al.
Pubblicazione: (2025)
di: Hernandez, Sergio Poo, et al.
Pubblicazione: (2025)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
di: Lin, Jingru, et al.
Pubblicazione: (2026)
di: Lin, Jingru, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Low-Complexity Speech Codec Using Parametric Dithering for ASR
di: Murray, Ellison, et al.
Pubblicazione: (2025) -
Distortion-Controlled Dithering with Reduced Recompression Rate
di: Kasher, Morriel, et al.
Pubblicazione: (2024) -
Robust Lossy Audio Compression Identification
di: Koops, Hendrik Vincent, et al.
Pubblicazione: (2024) -
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026) -
ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization
di: Steinmetz, Christian J., et al.
Pubblicazione: (2024)