Enregistré dans:
| Auteurs principaux: | Paradise, Orr, Muralikrishnan, Pranav, Chen, Liangyuan, García, Hugo Flores, Pardo, Bryan, Diamant, Roee, Gruber, David F., Gero, Shane, Goldwasser, Shafi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.02206 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Detection and Annotation of Sperm Whale Codas
par: Gubnitsky, Guy, et autres
Publié: (2024)
par: Gubnitsky, Guy, et autres
Publié: (2024)
Detecting the presence of sperm whales echolocation clicks in noisy environments
par: Gubnitsky, Guy, et autres
Publié: (2023)
par: Gubnitsky, Guy, et autres
Publié: (2023)
Models That Prove Their Own Correctness
par: Amit, Noga, et autres
Publié: (2024)
par: Amit, Noga, et autres
Publié: (2024)
Unsupervised Translation of Emergent Communication
par: Levy, Ido, et autres
Publié: (2025)
par: Levy, Ido, et autres
Publié: (2025)
Automatic detection and annotation of eastern Caribbean sperm whale codas.
par: Gubnitsky, Guy, et autres
Publié: (2025)
par: Gubnitsky, Guy, et autres
Publié: (2025)
ShipEcho -- An Interactive Tool for Global Mapping of Underwater Radiated Noise from Vessels
par: Shipton, Mark, et autres
Publié: (2026)
par: Shipton, Mark, et autres
Publié: (2026)
Review of Cetacean's click detection algorithms
par: Gracic, Mak, et autres
Publié: (2024)
par: Gracic, Mak, et autres
Publié: (2024)
Investigating the Development of Task-Oriented Communication in Vision-Language Models
par: Carmeli, Boaz, et autres
Publié: (2026)
par: Carmeli, Boaz, et autres
Publié: (2026)
Exploring Musical Roots: Applying Audio Embeddings to Empower Influence Attribution for a Generative Music Model
par: Barnett, Julia, et autres
Publié: (2024)
par: Barnett, Julia, et autres
Publié: (2024)
Multiple Mobile Target Detection and Tracking in Active Sonar Array Using a Track-Before-Detect Approach
par: Abu, Avi, et autres
Publié: (2024)
par: Abu, Avi, et autres
Publié: (2024)
Automated Detection of Dolphin Whistles with Convolutional Networks and Transfer Learning
par: Korkmaz, Burla Nur, et autres
Publié: (2022)
par: Korkmaz, Burla Nur, et autres
Publié: (2022)
Approaching an unknown communication system by latent space exploration and causal inference
par: Beguš, Gašper, et autres
Publié: (2023)
par: Beguš, Gašper, et autres
Publié: (2023)
Mix2Morph: Learning Sound Morphing from Noisy Mixes
par: Chu, Annie, et autres
Publié: (2026)
par: Chu, Annie, et autres
Publié: (2026)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
par: García, Hugo Flores, et autres
Publié: (2024)
par: García, Hugo Flores, et autres
Publié: (2024)
On Non-interactive Evaluation of Animal Communication Translators
par: Paradise, Orr, et autres
Publié: (2025)
par: Paradise, Orr, et autres
Publié: (2025)
Vowel- and Diphthong-Like Spectral Patterns in Sperm Whale Codas.
par: Beguš, Gašper, et autres
Publié: (2025)
par: Beguš, Gašper, et autres
Publié: (2025)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
par: O'Reilly, Patrick, et autres
Publié: (2025)
par: O'Reilly, Patrick, et autres
Publié: (2025)
Towards the Synthesis of Non-speech Vocalizations
par: Hoq, Enjamamul, et autres
Publié: (2024)
par: Hoq, Enjamamul, et autres
Publié: (2024)
Code Drift: Towards Idempotent Neural Audio Codecs
par: O'Reilly, Patrick, et autres
Publié: (2024)
par: O'Reilly, Patrick, et autres
Publié: (2024)
Learning Randomized Reductions
par: Erata, Ferhat, et autres
Publié: (2024)
par: Erata, Ferhat, et autres
Publié: (2024)
High-Fidelity Neural Phonetic Posteriorgrams
par: Churchwell, Cameron, et autres
Publié: (2024)
par: Churchwell, Cameron, et autres
Publié: (2024)
Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
par: Wang, Ju-Chiang, et autres
Publié: (2024)
par: Wang, Ju-Chiang, et autres
Publié: (2024)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
par: Chen, Szu-Chi, et autres
Publié: (2026)
par: Chen, Szu-Chi, et autres
Publié: (2026)
Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack
par: Ziv, Roee, et autres
Publié: (2025)
par: Ziv, Roee, et autres
Publié: (2025)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
par: Chen, Yukun, et autres
Publié: (2026)
par: Chen, Yukun, et autres
Publié: (2026)
Cross-domain Neural Pitch and Periodicity Estimation
par: Morrison, Max, et autres
Publié: (2023)
par: Morrison, Max, et autres
Publié: (2023)
Fine-Grained and Interpretable Neural Speech Editing
par: Morrison, Max, et autres
Publié: (2024)
par: Morrison, Max, et autres
Publié: (2024)
Efficient Vocal Source Separation Through Windowed Sink Attention
par: Benetatos, Christodoulos, et autres
Publié: (2025)
par: Benetatos, Christodoulos, et autres
Publié: (2025)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
par: Shi, Yufei, et autres
Publié: (2026)
par: Shi, Yufei, et autres
Publié: (2026)
NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations
par: Xue, Liumeng, et autres
Publié: (2026)
par: Xue, Liumeng, et autres
Publié: (2026)
Smule Renaissance Small: Efficient General-Purpose Vocal Restoration
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal Vocalizations
par: Cho, Deok-Hyeon, et autres
Publié: (2026)
par: Cho, Deok-Hyeon, et autres
Publié: (2026)
LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation
par: Wang, Qi, et autres
Publié: (2026)
par: Wang, Qi, et autres
Publié: (2026)
Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?
par: Deng, Qixin, et autres
Publié: (2025)
par: Deng, Qixin, et autres
Publié: (2025)
A Dataset for Automatic Vocal Mode Classification
par: Hinrichs, Reemt, et autres
Publié: (2026)
par: Hinrichs, Reemt, et autres
Publié: (2026)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
par: O'Reilly, Patrick, et autres
Publié: (2025)
par: O'Reilly, Patrick, et autres
Publié: (2025)
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
par: Chu, Annie, et autres
Publié: (2024)
par: Chu, Annie, et autres
Publié: (2024)
CVSM: Contrastive Vocal Similarity Modeling
par: Garoufis, Christos, et autres
Publié: (2025)
par: Garoufis, Christos, et autres
Publié: (2025)
VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation
par: Kim, Yubin, et autres
Publié: (2025)
par: Kim, Yubin, et autres
Publié: (2025)
Ethics Statements in AI Music Papers: The Effective and the Ineffective
par: Barnett, Julia, et autres
Publié: (2025)
par: Barnett, Julia, et autres
Publié: (2025)
Documents similaires
-
Automatic Detection and Annotation of Sperm Whale Codas
par: Gubnitsky, Guy, et autres
Publié: (2024) -
Detecting the presence of sperm whales echolocation clicks in noisy environments
par: Gubnitsky, Guy, et autres
Publié: (2023) -
Models That Prove Their Own Correctness
par: Amit, Noga, et autres
Publié: (2024) -
Unsupervised Translation of Emergent Communication
par: Levy, Ido, et autres
Publié: (2025) -
Automatic detection and annotation of eastern Caribbean sperm whale codas.
par: Gubnitsky, Guy, et autres
Publié: (2025)