Point to the Hidden: Exposing Speech Audio Splicing via Signal Pointer Nets
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Moussa, Denise, Hirsch, Germans, Wankerl, Sebastian, Riess, Christian |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks
par: Moussa, Denise, et autres
Publié: (2022)
par: Moussa, Denise, et autres
Publié: (2022)
EnvId: A Metric Learning Approach for Forensic Few-Shot Identification of Unseen Environments
par: Moussa, Denise, et autres
Publié: (2024)
par: Moussa, Denise, et autres
Publié: (2024)
RaD-Net: A Repairing and Denoising Network for Speech Signal Improvement
par: Liu, Mingshuai, et autres
Publié: (2024)
par: Liu, Mingshuai, et autres
Publié: (2024)
Analyzing the Impact of Splicing Artifacts in Partially Fake Speech Signals
par: Negroni, Viola, et autres
Publié: (2024)
par: Negroni, Viola, et autres
Publié: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
HearFit+: Personalized Fitness Monitoring via Audio Signals on Smart Speakers
par: Xie, Yadong, et autres
Publié: (2025)
par: Xie, Yadong, et autres
Publié: (2025)
Enhancing Crowdsourced Audio for Text-to-Speech Models
par: Giraldo, José, et autres
Publié: (2024)
par: Giraldo, José, et autres
Publié: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
par: Hussain, Tassadaq, et autres
Publié: (2024)
par: Hussain, Tassadaq, et autres
Publié: (2024)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
BWSNet: Automatic Perceptual Assessment of Audio Signals
par: Veillon, Clément Le Moine, et autres
Publié: (2023)
par: Veillon, Clément Le Moine, et autres
Publié: (2023)
BreathNet: Generalizable Audio Deepfake Detection via Breath-Cue-Guided Feature Refinement
par: Ye, Zhe, et autres
Publié: (2026)
par: Ye, Zhe, et autres
Publié: (2026)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
par: García, Hugo Flores, et autres
Publié: (2024)
par: García, Hugo Flores, et autres
Publié: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
par: Ranjan, Rishabh, et autres
Publié: (2025)
par: Ranjan, Rishabh, et autres
Publié: (2025)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
par: Daeglau, Mareike, et autres
Publié: (2025)
par: Daeglau, Mareike, et autres
Publié: (2025)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
par: Khodzhaev, Zulfidin
Publié: (2024)
par: Khodzhaev, Zulfidin
Publié: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
GMM-ResNet2: Ensemble of Group ResNet Networks for Synthetic Speech Detection
par: Lei, Zhenchun, et autres
Publié: (2024)
par: Lei, Zhenchun, et autres
Publié: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
SAGE: Spliced-Audio Generated Data for Enhancing Foundational Models in Low-Resource Arabic-English Code-Switched Speech Recognition
par: Farooq, Muhammad Umar, et autres
Publié: (2025)
par: Farooq, Muhammad Umar, et autres
Publié: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
par: Hirano, Masato, et autres
Publié: (2023)
par: Hirano, Masato, et autres
Publié: (2023)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
par: Kumar, Sonal, et autres
Publié: (2024)
par: Kumar, Sonal, et autres
Publié: (2024)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
par: Liao, Yuan, et autres
Publié: (2025)
par: Liao, Yuan, et autres
Publié: (2025)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
par: O'Reilly, Patrick, et autres
Publié: (2025)
par: O'Reilly, Patrick, et autres
Publié: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
Breaking the Barriers of Text-Hungry and Audio-Deficient AI
par: Tembine, Hamidou, et autres
Publié: (2025)
par: Tembine, Hamidou, et autres
Publié: (2025)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
par: Huang, Mengcheng, et autres
Publié: (2026)
par: Huang, Mengcheng, et autres
Publié: (2026)
TF-CorrNet: Leveraging Spatial Correlation for Continuous Speech Separation
par: Shin, Ui-Hyeop, et autres
Publié: (2025)
par: Shin, Ui-Hyeop, et autres
Publié: (2025)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
par: Pierotti, Francesco, et autres
Publié: (2025)
par: Pierotti, Francesco, et autres
Publié: (2025)
Documents similaires
-
Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks
par: Moussa, Denise, et autres
Publié: (2022) -
EnvId: A Metric Learning Approach for Forensic Few-Shot Identification of Unseen Environments
par: Moussa, Denise, et autres
Publié: (2024) -
RaD-Net: A Repairing and Denoising Network for Speech Signal Improvement
par: Liu, Mingshuai, et autres
Publié: (2024) -
Analyzing the Impact of Splicing Artifacts in Partially Fake Speech Signals
par: Negroni, Viola, et autres
Publié: (2024) -
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)