Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Moussa, Denise, Hirsch, Germans, Riess, Christian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Point to the Hidden: Exposing Speech Audio Splicing via Signal Pointer Nets
di: Moussa, Denise, et al.
Pubblicazione: (2023)
di: Moussa, Denise, et al.
Pubblicazione: (2023)
EnvId: A Metric Learning Approach for Forensic Few-Shot Identification of Unseen Environments
di: Moussa, Denise, et al.
Pubblicazione: (2024)
di: Moussa, Denise, et al.
Pubblicazione: (2024)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
di: Katamneni, Vinaya Sree, et al.
Pubblicazione: (2024)
di: Katamneni, Vinaya Sree, et al.
Pubblicazione: (2024)
From Vision to Sound: Advancing Audio Anomaly Detection with Vision-Based Algorithms
di: Barusco, Manuel, et al.
Pubblicazione: (2025)
di: Barusco, Manuel, et al.
Pubblicazione: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity
di: Pascual, Santiago, et al.
Pubblicazione: (2024)
di: Pascual, Santiago, et al.
Pubblicazione: (2024)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
Spectral and Rhythm Features for Audio Classification with Deep Convolutional Neural Networks
di: Wolf-Monheim, Friedrich
Pubblicazione: (2024)
di: Wolf-Monheim, Friedrich
Pubblicazione: (2024)
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
di: Aneja, Shivangi, et al.
Pubblicazione: (2023)
di: Aneja, Shivangi, et al.
Pubblicazione: (2023)
SAVE: Segment Audio-Visual Easy way using Segment Anything Model
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2024)
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2024)
Unified Cross-modal Translation of Score Images, Symbolic Music, and Performance Audio
di: Jung, Jongmin, et al.
Pubblicazione: (2025)
di: Jung, Jongmin, et al.
Pubblicazione: (2025)
Enriching Multimodal Sentiment Analysis through Textual Emotional Descriptions of Visual-Audio Content
di: Wu, Sheng, et al.
Pubblicazione: (2024)
di: Wu, Sheng, et al.
Pubblicazione: (2024)
Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual Segmentation
di: Yang, Qi, et al.
Pubblicazione: (2023)
di: Yang, Qi, et al.
Pubblicazione: (2023)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
di: Liu, Kai, et al.
Pubblicazione: (2025)
di: Liu, Kai, et al.
Pubblicazione: (2025)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Pindrop it! Audio and Visual Deepfake Countermeasures for Robust Detection and Fine Grained-Localization
di: Klein, Nicholas, et al.
Pubblicazione: (2025)
di: Klein, Nicholas, et al.
Pubblicazione: (2025)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
di: Kang, Minjae, et al.
Pubblicazione: (2025)
di: Kang, Minjae, et al.
Pubblicazione: (2025)
Spectral and Rhythm Feature Performance Evaluation for Category and Class Level Audio Classification with Deep Convolutional Neural Networks
di: Wolf-Monheim, Friedrich
Pubblicazione: (2025)
di: Wolf-Monheim, Friedrich
Pubblicazione: (2025)
Enhancing Lie Detection Accuracy: A Comparative Study of Classic ML, CNN, and GCN Models using Audio-Visual Features
di: Abdelwahab, Abdelrahman, et al.
Pubblicazione: (2024)
di: Abdelwahab, Abdelrahman, et al.
Pubblicazione: (2024)
Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities
di: Li, Yidi, et al.
Pubblicazione: (2024)
di: Li, Yidi, et al.
Pubblicazione: (2024)
VGGSounder: Audio-Visual Evaluations for Foundation Models
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
GaussianSpeech: Audio-Driven Gaussian Avatars
di: Aneja, Shivangi, et al.
Pubblicazione: (2024)
di: Aneja, Shivangi, et al.
Pubblicazione: (2024)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
Multimodal Sentiment Analysis based on Video and Audio Inputs
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
Object-AVEdit: An Object-level Audio-Visual Editing Model
di: Fu, Youquan, et al.
Pubblicazione: (2025)
di: Fu, Youquan, et al.
Pubblicazione: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
di: Burchi, Maxime, et al.
Pubblicazione: (2024)
di: Burchi, Maxime, et al.
Pubblicazione: (2024)
ManiWAV: Learning Robot Manipulation from In-the-Wild Audio-Visual Data
di: Liu, Zeyi, et al.
Pubblicazione: (2024)
di: Liu, Zeyi, et al.
Pubblicazione: (2024)
A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning
di: Vilaca, Luis, et al.
Pubblicazione: (2024)
di: Vilaca, Luis, et al.
Pubblicazione: (2024)
CleanUMamba: A Compact Mamba Network for Speech Denoising using Channel Pruning
di: Groot, Sjoerd, et al.
Pubblicazione: (2024)
di: Groot, Sjoerd, et al.
Pubblicazione: (2024)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
di: Berghi, Davide, et al.
Pubblicazione: (2024)
di: Berghi, Davide, et al.
Pubblicazione: (2024)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
di: Sun, Yu, et al.
Pubblicazione: (2025)
di: Sun, Yu, et al.
Pubblicazione: (2025)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
di: Chen, Yuanhong, et al.
Pubblicazione: (2025)
di: Chen, Yuanhong, et al.
Pubblicazione: (2025)
Weakly-supervised Audio Temporal Forgery Localization via Progressive Audio-language Co-learning Network
di: Wu, Junyan, et al.
Pubblicazione: (2025)
di: Wu, Junyan, et al.
Pubblicazione: (2025)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Point to the Hidden: Exposing Speech Audio Splicing via Signal Pointer Nets
di: Moussa, Denise, et al.
Pubblicazione: (2023) -
EnvId: A Metric Learning Approach for Forensic Few-Shot Identification of Unseen Environments
di: Moussa, Denise, et al.
Pubblicazione: (2024) -
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
di: Katamneni, Vinaya Sree, et al.
Pubblicazione: (2024) -
From Vision to Sound: Advancing Audio Anomaly Detection with Vision-Based Algorithms
di: Barusco, Manuel, et al.
Pubblicazione: (2025) -
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026)