Point to the Hidden: Exposing Speech Audio Splicing via Signal Pointer Nets
Fuente:
arXiv
Guardado en:
| Autores principales: | Moussa, Denise, Hirsch, Germans, Wankerl, Sebastian, Riess, Christian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks
por: Moussa, Denise, et al.
Publicado: (2022)
por: Moussa, Denise, et al.
Publicado: (2022)
EnvId: A Metric Learning Approach for Forensic Few-Shot Identification of Unseen Environments
por: Moussa, Denise, et al.
Publicado: (2024)
por: Moussa, Denise, et al.
Publicado: (2024)
RaD-Net: A Repairing and Denoising Network for Speech Signal Improvement
por: Liu, Mingshuai, et al.
Publicado: (2024)
por: Liu, Mingshuai, et al.
Publicado: (2024)
Analyzing the Impact of Splicing Artifacts in Partially Fake Speech Signals
por: Negroni, Viola, et al.
Publicado: (2024)
por: Negroni, Viola, et al.
Publicado: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
por: Dang, Trung, et al.
Publicado: (2024)
por: Dang, Trung, et al.
Publicado: (2024)
HearFit+: Personalized Fitness Monitoring via Audio Signals on Smart Speakers
por: Xie, Yadong, et al.
Publicado: (2025)
por: Xie, Yadong, et al.
Publicado: (2025)
Enhancing Crowdsourced Audio for Text-to-Speech Models
por: Giraldo, José, et al.
Publicado: (2024)
por: Giraldo, José, et al.
Publicado: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
por: Hussain, Tassadaq, et al.
Publicado: (2024)
por: Hussain, Tassadaq, et al.
Publicado: (2024)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
BWSNet: Automatic Perceptual Assessment of Audio Signals
por: Veillon, Clément Le Moine, et al.
Publicado: (2023)
por: Veillon, Clément Le Moine, et al.
Publicado: (2023)
BreathNet: Generalizable Audio Deepfake Detection via Breath-Cue-Guided Feature Refinement
por: Ye, Zhe, et al.
Publicado: (2026)
por: Ye, Zhe, et al.
Publicado: (2026)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
por: Lin, Zhaofeng, et al.
Publicado: (2024)
por: Lin, Zhaofeng, et al.
Publicado: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
por: Wang, Xinyu, et al.
Publicado: (2024)
por: Wang, Xinyu, et al.
Publicado: (2024)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
por: García, Hugo Flores, et al.
Publicado: (2024)
por: García, Hugo Flores, et al.
Publicado: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
por: Zhang, Xueyao, et al.
Publicado: (2023)
por: Zhang, Xueyao, et al.
Publicado: (2023)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
por: Ranjan, Rishabh, et al.
Publicado: (2025)
por: Ranjan, Rishabh, et al.
Publicado: (2025)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
por: Daeglau, Mareike, et al.
Publicado: (2025)
por: Daeglau, Mareike, et al.
Publicado: (2025)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
por: Khodzhaev, Zulfidin
Publicado: (2024)
por: Khodzhaev, Zulfidin
Publicado: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
por: Zhang, Sidong, et al.
Publicado: (2025)
por: Zhang, Sidong, et al.
Publicado: (2025)
GMM-ResNet2: Ensemble of Group ResNet Networks for Synthetic Speech Detection
por: Lei, Zhenchun, et al.
Publicado: (2024)
por: Lei, Zhenchun, et al.
Publicado: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
por: Ratnarajah, Anton, et al.
Publicado: (2023)
por: Ratnarajah, Anton, et al.
Publicado: (2023)
SAGE: Spliced-Audio Generated Data for Enhancing Foundational Models in Low-Resource Arabic-English Code-Switched Speech Recognition
por: Farooq, Muhammad Umar, et al.
Publicado: (2025)
por: Farooq, Muhammad Umar, et al.
Publicado: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
por: Sang, Wendi, et al.
Publicado: (2025)
por: Sang, Wendi, et al.
Publicado: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
por: Xi, Yu, et al.
Publicado: (2024)
por: Xi, Yu, et al.
Publicado: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
por: Hirano, Masato, et al.
Publicado: (2023)
por: Hirano, Masato, et al.
Publicado: (2023)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
por: Liao, Yuan, et al.
Publicado: (2025)
por: Liao, Yuan, et al.
Publicado: (2025)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
por: O'Reilly, Patrick, et al.
Publicado: (2025)
por: O'Reilly, Patrick, et al.
Publicado: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2025)
por: Lu, Ye-Xin, et al.
Publicado: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
por: Shan, Weiqiao, et al.
Publicado: (2025)
por: Shan, Weiqiao, et al.
Publicado: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
por: Jung, Chaeyoung, et al.
Publicado: (2024)
por: Jung, Chaeyoung, et al.
Publicado: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
por: Li, Guinan, et al.
Publicado: (2024)
por: Li, Guinan, et al.
Publicado: (2024)
Breaking the Barriers of Text-Hungry and Audio-Deficient AI
por: Tembine, Hamidou, et al.
Publicado: (2025)
por: Tembine, Hamidou, et al.
Publicado: (2025)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
por: Huang, Mengcheng, et al.
Publicado: (2026)
por: Huang, Mengcheng, et al.
Publicado: (2026)
TF-CorrNet: Leveraging Spatial Correlation for Continuous Speech Separation
por: Shin, Ui-Hyeop, et al.
Publicado: (2025)
por: Shin, Ui-Hyeop, et al.
Publicado: (2025)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
por: Pierotti, Francesco, et al.
Publicado: (2025)
por: Pierotti, Francesco, et al.
Publicado: (2025)
Ejemplares similares
-
Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks
por: Moussa, Denise, et al.
Publicado: (2022) -
EnvId: A Metric Learning Approach for Forensic Few-Shot Identification of Unseen Environments
por: Moussa, Denise, et al.
Publicado: (2024) -
RaD-Net: A Repairing and Denoising Network for Speech Signal Improvement
por: Liu, Mingshuai, et al.
Publicado: (2024) -
Analyzing the Impact of Splicing Artifacts in Partially Fake Speech Signals
por: Negroni, Viola, et al.
Publicado: (2024) -
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
por: Dang, Trung, et al.
Publicado: (2024)