Chirp Localization via Fine-Tuned Transformer Model: A Proof-of-Concept Study
Fuente:
arXiv
Salvato in:
| Autori principali: | Bahador, Nooshin, Lankarany, Milad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Synthesizing Audio from Silent Video using Sequence to Sequence Modeling
di: Belinchon, Hugo Garrido-Lestache, et al.
Pubblicazione: (2024)
di: Belinchon, Hugo Garrido-Lestache, et al.
Pubblicazione: (2024)
NOTA: Multimodal Music Notation Understanding for Visual Large Language Model
di: Tang, Mingni, et al.
Pubblicazione: (2025)
di: Tang, Mingni, et al.
Pubblicazione: (2025)
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
DiffGAP: A Lightweight Diffusion Module in Contrastive Space for Bridging Cross-Model Gap
di: Mo, Shentong, et al.
Pubblicazione: (2025)
di: Mo, Shentong, et al.
Pubblicazione: (2025)
Semi-Supervised Anomaly Detection Pipeline for SOZ Localization Using Ictal-Related Chirp
di: Bahador, Nooshin, et al.
Pubblicazione: (2025)
di: Bahador, Nooshin, et al.
Pubblicazione: (2025)
Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
Density Adaptive Attention is All You Need: Robust Parameter-Efficient Fine-Tuning Across Multiple Modalities
di: Ioannides, Georgios, et al.
Pubblicazione: (2024)
di: Ioannides, Georgios, et al.
Pubblicazione: (2024)
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)
Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
Investigating the Invertibility of Multimodal Latent Spaces: Limitations of Optimization-Based Methods
di: Park, Siwoo
Pubblicazione: (2025)
di: Park, Siwoo
Pubblicazione: (2025)
Hearing Anywhere in Any Environment
di: Liu, Xiulong, et al.
Pubblicazione: (2025)
di: Liu, Xiulong, et al.
Pubblicazione: (2025)
Data Augmentation Using Neural Acoustic Fields With Retrieval-Augmented Pre-training
di: Ick, Christopher, et al.
Pubblicazione: (2025)
di: Ick, Christopher, et al.
Pubblicazione: (2025)
Tell What You Hear From What You See -- Video to Audio Generation Through Text
di: Liu, Xiulong, et al.
Pubblicazione: (2024)
di: Liu, Xiulong, et al.
Pubblicazione: (2024)
InfantCryNet: A Data-driven Framework for Intelligent Analysis of Infant Cries
di: Hong, Mengze, et al.
Pubblicazione: (2024)
di: Hong, Mengze, et al.
Pubblicazione: (2024)
Spectral and Rhythm Feature Performance Evaluation for Category and Class Level Audio Classification with Deep Convolutional Neural Networks
di: Wolf-Monheim, Friedrich
Pubblicazione: (2025)
di: Wolf-Monheim, Friedrich
Pubblicazione: (2025)
Attention-Based Efficient Breath Sound Removal in Studio Audio Recordings
di: Elgiriyewithana, Nidula, et al.
Pubblicazione: (2024)
di: Elgiriyewithana, Nidula, et al.
Pubblicazione: (2024)
SONICS: Synthetic Or Not -- Identifying Counterfeit Songs
di: Rahman, Md Awsafur, et al.
Pubblicazione: (2024)
di: Rahman, Md Awsafur, et al.
Pubblicazione: (2024)
Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
di: Xie, Zhifei, et al.
Pubblicazione: (2024)
di: Xie, Zhifei, et al.
Pubblicazione: (2024)
The Effect of Perceptual Metrics on Music Representation Learning for Genre Classification
di: Namgyal, Tashi, et al.
Pubblicazione: (2024)
di: Namgyal, Tashi, et al.
Pubblicazione: (2024)
Direction-Aware Neural Acoustic Fields for Few-Shot Interpolation of Ambisonic Impulse Responses
di: Ick, Christopher, et al.
Pubblicazione: (2025)
di: Ick, Christopher, et al.
Pubblicazione: (2025)
Spectral and Rhythm Features for Audio Classification with Deep Convolutional Neural Networks
di: Wolf-Monheim, Friedrich
Pubblicazione: (2024)
di: Wolf-Monheim, Friedrich
Pubblicazione: (2024)
VisionScores -- A system-segmented image score dataset for deep learning tasks
di: Amezcua, Alejandro Romero, et al.
Pubblicazione: (2025)
di: Amezcua, Alejandro Romero, et al.
Pubblicazione: (2025)
Integrating Audio Narrations to Strengthen Domain Generalization in Multimodal First-Person Action Recognition
di: Gungor, Cagri, et al.
Pubblicazione: (2024)
di: Gungor, Cagri, et al.
Pubblicazione: (2024)
GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
DPN-GAN: Inducing Periodic Activations in Generative Adversarial Networks for High-Fidelity Audio Synthesis
di: Ahmad, Zeeshan, et al.
Pubblicazione: (2025)
di: Ahmad, Zeeshan, et al.
Pubblicazione: (2025)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
TinyChirp: Bird Song Recognition Using TinyML Models on Low-power Wireless Acoustic Sensors
di: Huang, Zhaolan, et al.
Pubblicazione: (2024)
di: Huang, Zhaolan, et al.
Pubblicazione: (2024)
Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity
di: Pascual, Santiago, et al.
Pubblicazione: (2024)
di: Pascual, Santiago, et al.
Pubblicazione: (2024)
Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks
di: Moussa, Denise, et al.
Pubblicazione: (2022)
di: Moussa, Denise, et al.
Pubblicazione: (2022)
Diffusion-based Unsupervised Audio-visual Speech Enhancement
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2024)
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2024)
WhaleNet: a Novel Deep Learning Architecture for Marine Mammals Vocalizations on Watkins Marine Mammal Sound Database
di: Licciardi, Alessandro, et al.
Pubblicazione: (2024)
di: Licciardi, Alessandro, et al.
Pubblicazione: (2024)
Unified Video-Language Pre-training with Synchronized Audio
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
Multimodal Spatial Language Maps for Robot Navigation and Manipulation
di: Huang, Chenguang, et al.
Pubblicazione: (2025)
di: Huang, Chenguang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Synthesizing Audio from Silent Video using Sequence to Sequence Modeling
di: Belinchon, Hugo Garrido-Lestache, et al.
Pubblicazione: (2024) -
NOTA: Multimodal Music Notation Understanding for Visual Large Language Model
di: Tang, Mingni, et al.
Pubblicazione: (2025) -
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023) -
DiffGAP: A Lightweight Diffusion Module in Contrastive Space for Bridging Cross-Model Gap
di: Mo, Shentong, et al.
Pubblicazione: (2025) -
Semi-Supervised Anomaly Detection Pipeline for SOZ Localization Using Ictal-Related Chirp
di: Bahador, Nooshin, et al.
Pubblicazione: (2025)