EnvTriCascade: An Environment-Aware Tri-Stage Cascaded Framework for ESDD2 2026 Challenge
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Hengyan, Guo, Xiaoxuan, Zhou, Jiayi, Xie, Yuankun, Liu, Jian, Cheng, Haonan, Ye, Long, Zhang, Qin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026)
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026)
AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge Evaluation Plan
di: Zhang, Xueping, et al.
Pubblicazione: (2026)
di: Zhang, Xueping, et al.
Pubblicazione: (2026)
ESDD 2026: Environmental Sound Deepfake Detection Challenge Evaluation Plan
di: Yin, Han, et al.
Pubblicazione: (2025)
di: Yin, Han, et al.
Pubblicazione: (2025)
BEAT2AASIST model with layer fusion for ESDD 2026 Challenge
di: Chung, Sanghyeok, et al.
Pubblicazione: (2025)
di: Chung, Sanghyeok, et al.
Pubblicazione: (2025)
Temporal Variability and Multi-Viewed Self-Supervised Representations to Tackle the ASVspoof5 Deepfake Challenge
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
di: Chen, Shuangyuan, et al.
Pubblicazione: (2025)
di: Chen, Shuangyuan, et al.
Pubblicazione: (2025)
FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations
di: Chen, Junjie, et al.
Pubblicazione: (2025)
di: Chen, Junjie, et al.
Pubblicazione: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
di: Li, Yaoru, et al.
Pubblicazione: (2025)
di: Li, Yaoru, et al.
Pubblicazione: (2025)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
EnvId: A Metric Learning Approach for Forensic Few-Shot Identification of Unseen Environments
di: Moussa, Denise, et al.
Pubblicazione: (2024)
di: Moussa, Denise, et al.
Pubblicazione: (2024)
Tri-MTL: A Triple Multitask Learning Approach for Respiratory Disease Diagnosis
di: Kim, June-Woo, et al.
Pubblicazione: (2025)
di: Kim, June-Woo, et al.
Pubblicazione: (2025)
Generalized Source Tracing: Detecting Novel Audio Deepfake Algorithm with Real Emphasis and Fake Dispersion Strategy
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
A Dual-Stage Time-Context Network for Speech-Based Alzheimer's Disease Detection
di: Gao, Yifan, et al.
Pubblicazione: (2025)
di: Gao, Yifan, et al.
Pubblicazione: (2025)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
di: Li, Bingliang, et al.
Pubblicazione: (2024)
di: Li, Bingliang, et al.
Pubblicazione: (2024)
EnvSDD: Benchmarking Environmental Sound Deepfake Detection
di: Yin, Han, et al.
Pubblicazione: (2025)
di: Yin, Han, et al.
Pubblicazione: (2025)
Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
GLAD: Global-Local Aware Dynamic Mixture-of-Experts for Multi-Talker ASR
di: Guo, Yujie, et al.
Pubblicazione: (2025)
di: Guo, Yujie, et al.
Pubblicazione: (2025)
MusicFlow: Cascaded Flow Matching for Text Guided Music Generation
di: Prajwal, K R, et al.
Pubblicazione: (2024)
di: Prajwal, K R, et al.
Pubblicazione: (2024)
Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling
di: Fan, Congyi, et al.
Pubblicazione: (2026)
di: Fan, Congyi, et al.
Pubblicazione: (2026)
Cascaded noise reduction and acoustic echo cancellation based on an extended noise reduction
di: Roebben, Arnout, et al.
Pubblicazione: (2024)
di: Roebben, Arnout, et al.
Pubblicazione: (2024)
The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge
di: Ma, Guobin, et al.
Pubblicazione: (2026)
di: Ma, Guobin, et al.
Pubblicazione: (2026)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
di: Niu, Rui, et al.
Pubblicazione: (2025)
di: Niu, Rui, et al.
Pubblicazione: (2025)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
di: Wei, Haojie, et al.
Pubblicazione: (2024)
di: Wei, Haojie, et al.
Pubblicazione: (2024)
Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades
di: Jung, Donghyuk, et al.
Pubblicazione: (2026)
di: Jung, Donghyuk, et al.
Pubblicazione: (2026)
Cascaded Cross-Modal Transformer for Audio-Textual Classification
di: Ristea, Nicolae-Catalin, et al.
Pubblicazione: (2024)
di: Ristea, Nicolae-Catalin, et al.
Pubblicazione: (2024)
Dual Data Scaling for Robust Two-Stage User-Defined Keyword Spotting
di: Ai, Zhiqi, et al.
Pubblicazione: (2025)
di: Ai, Zhiqi, et al.
Pubblicazione: (2025)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
di: Li, Hongyi, et al.
Pubblicazione: (2025)
di: Li, Hongyi, et al.
Pubblicazione: (2025)
ChipChat: Low-Latency Cascaded Conversational Agent in MLX
di: Likhomanenko, Tatiana, et al.
Pubblicazione: (2025)
di: Likhomanenko, Tatiana, et al.
Pubblicazione: (2025)
TidyVoice 2026 Challenge Evaluation Plan
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
ICASSP 2026 URGENT Speech Enhancement Challenge
di: Li, Chenda, et al.
Pubblicazione: (2026)
di: Li, Chenda, et al.
Pubblicazione: (2026)
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions
di: Niu, Shu-Tong, et al.
Pubblicazione: (2024)
di: Niu, Shu-Tong, et al.
Pubblicazione: (2024)
CrossVoice: Crosslingual Prosody Preserving Cascade-S2ST using Transfer Learning
di: Hira, Medha, et al.
Pubblicazione: (2024)
di: Hira, Medha, et al.
Pubblicazione: (2024)
Multiple-Instance, Cascaded Classification for Keyword Spotting in Narrow-Band Audio
di: AbdulKader, Ahmad, et al.
Pubblicazione: (2017)
di: AbdulKader, Ahmad, et al.
Pubblicazione: (2017)
Documenti analoghi
-
EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2025) -
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026) -
AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
di: Xie, Yuankun, et al.
Pubblicazione: (2026) -
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
di: Xie, Yuankun, et al.
Pubblicazione: (2026) -
ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge Evaluation Plan
di: Zhang, Xueping, et al.
Pubblicazione: (2026)