Straight Through Gumbel Softmax Estimator based Bimodal Neural Architecture Search for Audio-Visual Deepfake Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | PN, Aravinda Reddy, Ramachandra, Raghavendra, Rao, Krothapalli Sreenivasa, Mitra, Pabitra, Rathod, Vinod |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gumbel Rao Monte Carlo based Bi-Modal Neural Architecture Search for Audio-Visual Deepfake Detection
par: PN, Aravinda Reddy, et autres
Publié: (2024)
par: PN, Aravinda Reddy, et autres
Publié: (2024)
NeuralMultiling: A Novel Neural Architecture Search for Smartphone based Multilingual Speaker Verification
par: PN, Aravinda Reddy, et autres
Publié: (2024)
par: PN, Aravinda Reddy, et autres
Publié: (2024)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
A Unified Framework for Modality-Agnostic Deepfakes Detection
par: Yu, Cai, et autres
Publié: (2023)
par: Yu, Cai, et autres
Publié: (2023)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
par: Zhang, You, et autres
Publié: (2024)
par: Zhang, You, et autres
Publié: (2024)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection
par: Lee, Kyungbok, et autres
Publié: (2024)
par: Lee, Kyungbok, et autres
Publié: (2024)
Building Audio-Visual Digital Twins with Smartphones
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
Trusted Fake Audio Detection Based on Dirichlet Distribution
par: Ding, Chi, et autres
Publié: (2025)
par: Ding, Chi, et autres
Publié: (2025)
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
par: Shimada, Kazuki, et autres
Publié: (2024)
par: Shimada, Kazuki, et autres
Publié: (2024)
Resource-Efficient Reference-Free Evaluation of Audio Captions
par: Mahfuz, Rehana, et autres
Publié: (2024)
par: Mahfuz, Rehana, et autres
Publié: (2024)
Efficient Video to Audio Mapper with Visual Scene Detection
par: Yi, Mingjing, et autres
Publié: (2024)
par: Yi, Mingjing, et autres
Publié: (2024)
Cinematic Audio Source Separation Using Visual Cues
par: Zhang, Kang, et autres
Publié: (2026)
par: Zhang, Kang, et autres
Publié: (2026)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
par: Zhao, Jinzheng, et autres
Publié: (2023)
par: Zhao, Jinzheng, et autres
Publié: (2023)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
par: Zhang, Xiaohui, et autres
Publié: (2024)
par: Zhang, Xiaohui, et autres
Publié: (2024)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
par: Li, Xiaolou, et autres
Publié: (2024)
par: Li, Xiaolou, et autres
Publié: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
par: Yuan, Yi, et autres
Publié: (2024)
par: Yuan, Yi, et autres
Publié: (2024)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
par: Liu, Shengqiang, et autres
Publié: (2024)
par: Liu, Shengqiang, et autres
Publié: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
par: Yu, Fan, et autres
Publié: (2024)
par: Yu, Fan, et autres
Publié: (2024)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
par: Niu, Xinlei, et autres
Publié: (2024)
par: Niu, Xinlei, et autres
Publié: (2024)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
par: Yao, Dong, et autres
Publié: (2023)
par: Yao, Dong, et autres
Publié: (2023)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
par: Huang, Lian, et autres
Publié: (2024)
par: Huang, Lian, et autres
Publié: (2024)
POLIPHONE: A Dataset for Smartphone Model Identification from Audio Recordings
par: Salvi, Davide, et autres
Publié: (2024)
par: Salvi, Davide, et autres
Publié: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)
par: Karchkhadze, Tornike, et autres
Publié: (2025)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024)
par: Liu, Qianhui, et autres
Publié: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
par: Oh, Hyunwoo, et autres
Publié: (2025)
par: Oh, Hyunwoo, et autres
Publié: (2025)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)
par: He, Mao-Kui, et autres
Publié: (2024)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
par: Jin, Ruinan, et autres
Publié: (2026)
par: Jin, Ruinan, et autres
Publié: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
par: Chan, Nolan, et autres
Publié: (2026)
par: Chan, Nolan, et autres
Publié: (2026)
FGAS: Fixed Decoder Network-Based Audio Steganography with Adversarial Perturbation Generation
par: Yan, Jialin, et autres
Publié: (2025)
par: Yan, Jialin, et autres
Publié: (2025)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
par: Zhang, Liqian, et autres
Publié: (2024)
par: Zhang, Liqian, et autres
Publié: (2024)
Documents similaires
-
Gumbel Rao Monte Carlo based Bi-Modal Neural Architecture Search for Audio-Visual Deepfake Detection
par: PN, Aravinda Reddy, et autres
Publié: (2024) -
NeuralMultiling: A Novel Neural Architecture Search for Smartphone based Multilingual Speaker Verification
par: PN, Aravinda Reddy, et autres
Publié: (2024) -
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2025) -
A Unified Framework for Modality-Agnostic Deepfakes Detection
par: Yu, Cai, et autres
Publié: (2023) -
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
par: Zhang, You, et autres
Publié: (2024)