Representing Sounds as Neural Amplitude Fields: A Benchmark of Coordinate-MLPs and A Fourier Kolmogorov-Arnold Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Linfei, Zhang, Lin, Wang, Zhong, Zhang, Fengyi, Li, Zelin, Shen, Ying |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
INR-Bench: A Unified Benchmark for Implicit Neural Representations in Multi-Domain Regression and Reconstruction
par: Li, Linfei, et autres
Publié: (2025)
par: Li, Linfei, et autres
Publié: (2025)
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
par: Bi, Chunhao, et autres
Publié: (2026)
par: Bi, Chunhao, et autres
Publié: (2026)
Fractional Fourier Sound Synthesis
par: Gutiérrez, Esteban, et autres
Publié: (2025)
par: Gutiérrez, Esteban, et autres
Publié: (2025)
TopSeg: A Multi-Scale Topological Framework for Data-Efficient Heart Sound Segmentation
par: Zhang, Peihong, et autres
Publié: (2025)
par: Zhang, Peihong, et autres
Publié: (2025)
Neural Speech Separation with Parallel Amplitude and Phase Spectrum Estimation
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
Multi-scale Scanning Network for Machine Anomalous Sound Detection
par: Zhang, Yucong, et autres
Publié: (2025)
par: Zhang, Yucong, et autres
Publié: (2025)
ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge Evaluation Plan
par: Zhang, Xueping, et autres
Publié: (2026)
par: Zhang, Xueping, et autres
Publié: (2026)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
par: Lin, Jingru, et autres
Publié: (2026)
par: Lin, Jingru, et autres
Publié: (2026)
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
Transmission of High-Amplitude Sound through Leakages of Ill-fitting Earplugs
par: Yu, Haocheng, et autres
Publié: (2025)
par: Yu, Haocheng, et autres
Publié: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
Efficient Sound Field Reconstruction with Conditional Invertible Neural Networks
par: Karakonstantis, Xenofon, et autres
Publié: (2024)
par: Karakonstantis, Xenofon, et autres
Publié: (2024)
Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models
par: Phuong, Tuan Dat, et autres
Publié: (2025)
par: Phuong, Tuan Dat, et autres
Publié: (2025)
ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)
par: Allauzen, Cyril, et autres
Publié: (2026)
par: Allauzen, Cyril, et autres
Publié: (2026)
HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
Spontaneous Kolmogorov-Arnold Geometry in Shallow MLPs
par: Freedman, Michael H., et autres
Publié: (2025)
par: Freedman, Michael H., et autres
Publié: (2025)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
Massive Sound Embedding Benchmark (MSEB)
par: Heigold, Georg, et autres
Publié: (2026)
par: Heigold, Georg, et autres
Publié: (2026)
Sound Field Reconstruction Using a Compact Acoustics-informed Neural Network
par: Ma, Fei, et autres
Publié: (2024)
par: Ma, Fei, et autres
Publié: (2024)
HQ-MPSD: A Multilingual Artifact-Controlled Benchmark for Partial Deepfake Speech Detection
par: Li, Menglu, et autres
Publié: (2025)
par: Li, Menglu, et autres
Publié: (2025)
RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation
par: Li, Linfei, et autres
Publié: (2026)
par: Li, Linfei, et autres
Publié: (2026)
APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
The First Environmental Sound Deepfake Detection Challenge: Benchmarking Robustness, Evaluation, and Insights
par: Yin, Han, et autres
Publié: (2026)
par: Yin, Han, et autres
Publié: (2026)
Waveform-Logmel Audio Neural Networks for Respiratory Sound Classification
par: Xie, Jiadong, et autres
Publié: (2025)
par: Xie, Jiadong, et autres
Publié: (2025)
Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text Synergy
par: Li, Kewei, et autres
Publié: (2025)
par: Li, Kewei, et autres
Publié: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
par: Sun, Luoyi, et autres
Publié: (2026)
par: Sun, Luoyi, et autres
Publié: (2026)
Learning How to Listen: A Temporal-Frequential Attention Model for Sound Event Detection
par: Shen, Yu-Han, et autres
Publié: (2018)
par: Shen, Yu-Han, et autres
Publié: (2018)
UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion
par: Li, Zhaoqing, et autres
Publié: (2026)
par: Li, Zhaoqing, et autres
Publié: (2026)
Hankel-FNO: Fast Underwater Acoustic Charting Via Physics-Encoded Fourier Neural Operator
par: Sun, Yifan, et autres
Publié: (2025)
par: Sun, Yifan, et autres
Publié: (2025)
Diffuse Sound Field Synthesis
par: Zotter, Franz, et autres
Publié: (2024)
par: Zotter, Franz, et autres
Publié: (2024)
FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
StreamAAD: Decoding Spatial Auditory Attention with a Streaming Architecture
par: Qiu, Zelin, et autres
Publié: (2024)
par: Qiu, Zelin, et autres
Publié: (2024)
C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification
par: Ma, Ziqi, et autres
Publié: (2026)
par: Ma, Ziqi, et autres
Publié: (2026)
LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech
par: Yang, Fei, et autres
Publié: (2026)
par: Yang, Fei, et autres
Publié: (2026)
Vision Transformer Segmentation for Visual Bird Sound Denoising
par: Kumar, Sahil, et autres
Publié: (2024)
par: Kumar, Sahil, et autres
Publié: (2024)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
par: Zhang, Yibo, et autres
Publié: (2026)
par: Zhang, Yibo, et autres
Publié: (2026)
CoDeTT: A Context-Aware Decision Benchmark for Turn-Taking Evaluation
par: Shen, Huan, et autres
Publié: (2026)
par: Shen, Huan, et autres
Publié: (2026)
A Fourier Explanation of AI-music Artifacts
par: Afchar, Darius, et autres
Publié: (2025)
par: Afchar, Darius, et autres
Publié: (2025)
Documents similaires
-
INR-Bench: A Unified Benchmark for Implicit Neural Representations in Multi-Domain Regression and Reconstruction
par: Li, Linfei, et autres
Publié: (2025) -
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
par: Bi, Chunhao, et autres
Publié: (2026) -
Fractional Fourier Sound Synthesis
par: Gutiérrez, Esteban, et autres
Publié: (2025) -
TopSeg: A Multi-Scale Topological Framework for Data-Efficient Heart Sound Segmentation
par: Zhang, Peihong, et autres
Publié: (2025) -
Neural Speech Separation with Parallel Amplitude and Phase Spectrum Estimation
par: Liu, Fei, et autres
Publié: (2025)