Parametric Object Coding in IVAS: Efficient Coding of Multiple Audio Objects at Low Bit Rates
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Eichenseer, Andrea, Korse, Srikanth, Fuchs, Guillaume, Multrus, Markus |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlowMAC: Conditional Flow Matching for Audio Coding at Low Bit Rates
par: Pia, Nicola, et autres
Publié: (2024)
par: Pia, Nicola, et autres
Publié: (2024)
On Improving Error Resilience of Neural End-to-End Speech Coders
par: Gupta, Kishan, et autres
Publié: (2024)
par: Gupta, Kishan, et autres
Publié: (2024)
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
par: Gupta, Kishan, et autres
Publié: (2025)
par: Gupta, Kishan, et autres
Publié: (2025)
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
par: Gupta, Kishan, et autres
Publié: (2022)
par: Gupta, Kishan, et autres
Publié: (2022)
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
par: Brendel, Andreas, et autres
Publié: (2024)
par: Brendel, Andreas, et autres
Publié: (2024)
Sample Rate Offset Compensated Acoustic Echo Cancellation For Multi-Device Scenarios
par: Korse, Srikanth, et autres
Publié: (2025)
par: Korse, Srikanth, et autres
Publié: (2025)
Stereo Reproduction in the Presence of Sample Rate Offsets
par: Korse, Srikanth, et autres
Publié: (2025)
par: Korse, Srikanth, et autres
Publié: (2025)
Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction
par: Korse, Srikanth, et autres
Publié: (2025)
par: Korse, Srikanth, et autres
Publié: (2025)
Zero-Bit Transmission of Adaptive Pre- and De-emphasis Filters for Speech and Audio Coding
par: Piralideh, Niloofar Omidi, et autres
Publié: (2024)
par: Piralideh, Niloofar Omidi, et autres
Publié: (2024)
Perceptual Audio Coding: A 40-Year Historical Perspective
par: Herre, Jürgen, et autres
Publié: (2025)
par: Herre, Jürgen, et autres
Publié: (2025)
Code Drift: Towards Idempotent Neural Audio Codecs
par: O'Reilly, Patrick, et autres
Publié: (2024)
par: O'Reilly, Patrick, et autres
Publié: (2024)
OmniCodec: Low Frame Rate Universal Audio Codec with Semantic-Acoustic Disentanglement
par: Hu, Jingbin, et autres
Publié: (2026)
par: Hu, Jingbin, et autres
Publié: (2026)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Asymmetric Phase Coding Audio Watermarking
par: Yang, Guang, et autres
Publié: (2026)
par: Yang, Guang, et autres
Publié: (2026)
APCodec+: A Spectrum-Coding-Based High-Fidelity and High-Compression-Rate Neural Audio Codec with Staged Training Paradigm
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
par: Coldenhoff, Jozef, et autres
Publié: (2024)
par: Coldenhoff, Jozef, et autres
Publié: (2024)
Low-Complexity Neural Wind Noise Reduction for Audio Recordings
par: Eftekhari, Hesam, et autres
Publié: (2025)
par: Eftekhari, Hesam, et autres
Publié: (2025)
DRED: Deep REDundancy Coding of Speech Using a Rate-Distortion-Optimized Variational Autoencoder
par: Valin, Jean-Marc, et autres
Publié: (2022)
par: Valin, Jean-Marc, et autres
Publié: (2022)
Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
par: Hsu, Tzu-wen, et autres
Publié: (2025)
par: Hsu, Tzu-wen, et autres
Publié: (2025)
A first-order DirAC-based parametric Ambisonic coder for immersive communications
par: Fuchs, Guillaume, et autres
Publié: (2025)
par: Fuchs, Guillaume, et autres
Publié: (2025)
Neural Spectral Band Generation for Audio Coding
par: Choi, Woongjib, et autres
Publié: (2025)
par: Choi, Woongjib, et autres
Publié: (2025)
Dynamic Slimmable Networks for Efficient Speech Separation
par: Elminshawi, Mohamed, et autres
Publié: (2025)
par: Elminshawi, Mohamed, et autres
Publié: (2025)
AudioScene: Integrating Object-Event Audio into 3D Scenes
par: Yuan, Shuaihang, et autres
Publié: (2025)
par: Yuan, Shuaihang, et autres
Publié: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)
par: Karchkhadze, Tornike, et autres
Publié: (2025)
DOTA-ME-CS: Daily Oriented Text Audio-Mandarin English-Code Switching Dataset
par: Li, Yupei, et autres
Publié: (2025)
par: Li, Yupei, et autres
Publié: (2025)
A Low-Complexity Speech Codec Using Parametric Dithering for ASR
par: Murray, Ellison, et autres
Publié: (2025)
par: Murray, Ellison, et autres
Publié: (2025)
SPG-Codec: Exploring the Role and Boundaries of Semantic Priors in Ultra-Low-Bitrate Neural Speech Coding
par: Zhao, Mingyu, et autres
Publié: (2026)
par: Zhao, Mingyu, et autres
Publié: (2026)
From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding
par: Yi, Jayeon, et autres
Publié: (2026)
par: Yi, Jayeon, et autres
Publié: (2026)
Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs
par: Behringer, Lyonel, et autres
Publié: (2026)
par: Behringer, Lyonel, et autres
Publié: (2026)
Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine
par: Kuznetsova, Anastasia, et autres
Publié: (2025)
par: Kuznetsova, Anastasia, et autres
Publié: (2025)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding
par: Cerovaz, Luca, et autres
Publié: (2026)
par: Cerovaz, Luca, et autres
Publié: (2026)
Low-latency Assistive Audio Enhancement for Neurodivergent People
par: Popescu, Alexander, et autres
Publié: (2025)
par: Popescu, Alexander, et autres
Publié: (2025)
Sound Separation and Classification with Object and Semantic Guidance
par: Kwon, Younghoo, et autres
Publié: (2025)
par: Kwon, Younghoo, et autres
Publié: (2025)
Zimtohrli: An Efficient Psychoacoustic Audio Similarity Metric
par: Alakuijala, Jyrki, et autres
Publié: (2025)
par: Alakuijala, Jyrki, et autres
Publié: (2025)
CodeSep: Low-Bitrate Codec-Driven Speech Separation with Base-Token Disentanglement and Auxiliary-Token Serial Prediction
par: Du, Hui-Peng, et autres
Publié: (2026)
par: Du, Hui-Peng, et autres
Publié: (2026)
Variable Bitrate Residual Vector Quantization for Audio Coding
par: Chae, Yunkee, et autres
Publié: (2024)
par: Chae, Yunkee, et autres
Publié: (2024)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
par: Wan, Zixiang, et autres
Publié: (2025)
par: Wan, Zixiang, et autres
Publié: (2025)
Parameter-Efficient Transfer Learning of Audio Spectrogram Transformers
par: Cappellazzo, Umberto, et autres
Publié: (2023)
par: Cappellazzo, Umberto, et autres
Publié: (2023)
Documents similaires
-
FlowMAC: Conditional Flow Matching for Audio Coding at Low Bit Rates
par: Pia, Nicola, et autres
Publié: (2024) -
On Improving Error Resilience of Neural End-to-End Speech Coders
par: Gupta, Kishan, et autres
Publié: (2024) -
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
par: Gupta, Kishan, et autres
Publié: (2025) -
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
par: Gupta, Kishan, et autres
Publié: (2022) -
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
par: Brendel, Andreas, et autres
Publié: (2024)