EnvTriCascade: An Environment-Aware Tri-Stage Cascaded Framework for ESDD2 2026 Challenge
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Hengyan, Guo, Xiaoxuan, Zhou, Jiayi, Xie, Yuankun, Liu, Jian, Cheng, Haonan, Ye, Long, Zhang, Qin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge
por: Guo, Xiaoxuan, et al.
Publicado: (2025)
por: Guo, Xiaoxuan, et al.
Publicado: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
por: Xie, Yuankun, et al.
Publicado: (2026)
por: Xie, Yuankun, et al.
Publicado: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
por: Xie, Yuankun, et al.
Publicado: (2026)
por: Xie, Yuankun, et al.
Publicado: (2026)
ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge Evaluation Plan
por: Zhang, Xueping, et al.
Publicado: (2026)
por: Zhang, Xueping, et al.
Publicado: (2026)
ESDD 2026: Environmental Sound Deepfake Detection Challenge Evaluation Plan
por: Yin, Han, et al.
Publicado: (2025)
por: Yin, Han, et al.
Publicado: (2025)
BEAT2AASIST model with layer fusion for ESDD 2026 Challenge
por: Chung, Sanghyeok, et al.
Publicado: (2025)
por: Chung, Sanghyeok, et al.
Publicado: (2025)
Temporal Variability and Multi-Viewed Self-Supervised Representations to Tackle the ASVspoof5 Deepfake Challenge
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
por: Chen, Shuangyuan, et al.
Publicado: (2025)
por: Chen, Shuangyuan, et al.
Publicado: (2025)
FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations
por: Chen, Junjie, et al.
Publicado: (2025)
por: Chen, Junjie, et al.
Publicado: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
por: Li, Yaoru, et al.
Publicado: (2025)
por: Li, Yaoru, et al.
Publicado: (2025)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
EnvId: A Metric Learning Approach for Forensic Few-Shot Identification of Unseen Environments
por: Moussa, Denise, et al.
Publicado: (2024)
por: Moussa, Denise, et al.
Publicado: (2024)
Tri-MTL: A Triple Multitask Learning Approach for Respiratory Disease Diagnosis
por: Kim, June-Woo, et al.
Publicado: (2025)
por: Kim, June-Woo, et al.
Publicado: (2025)
Generalized Source Tracing: Detecting Novel Audio Deepfake Algorithm with Real Emphasis and Fake Dispersion Strategy
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
A Dual-Stage Time-Context Network for Speech-Based Alzheimer's Disease Detection
por: Gao, Yifan, et al.
Publicado: (2025)
por: Gao, Yifan, et al.
Publicado: (2025)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
por: Li, Bingliang, et al.
Publicado: (2024)
por: Li, Bingliang, et al.
Publicado: (2024)
EnvSDD: Benchmarking Environmental Sound Deepfake Detection
por: Yin, Han, et al.
Publicado: (2025)
por: Yin, Han, et al.
Publicado: (2025)
Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
GLAD: Global-Local Aware Dynamic Mixture-of-Experts for Multi-Talker ASR
por: Guo, Yujie, et al.
Publicado: (2025)
por: Guo, Yujie, et al.
Publicado: (2025)
MusicFlow: Cascaded Flow Matching for Text Guided Music Generation
por: Prajwal, K R, et al.
Publicado: (2024)
por: Prajwal, K R, et al.
Publicado: (2024)
Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling
por: Fan, Congyi, et al.
Publicado: (2026)
por: Fan, Congyi, et al.
Publicado: (2026)
Cascaded noise reduction and acoustic echo cancellation based on an extended noise reduction
por: Roebben, Arnout, et al.
Publicado: (2024)
por: Roebben, Arnout, et al.
Publicado: (2024)
The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge
por: Ma, Guobin, et al.
Publicado: (2026)
por: Ma, Guobin, et al.
Publicado: (2026)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
por: Dinkel, Heinrich, et al.
Publicado: (2026)
por: Dinkel, Heinrich, et al.
Publicado: (2026)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
por: Xu, Xinmeng, et al.
Publicado: (2026)
por: Xu, Xinmeng, et al.
Publicado: (2026)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
por: Niu, Rui, et al.
Publicado: (2025)
por: Niu, Rui, et al.
Publicado: (2025)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
por: Wei, Haojie, et al.
Publicado: (2024)
por: Wei, Haojie, et al.
Publicado: (2024)
Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades
por: Jung, Donghyuk, et al.
Publicado: (2026)
por: Jung, Donghyuk, et al.
Publicado: (2026)
Cascaded Cross-Modal Transformer for Audio-Textual Classification
por: Ristea, Nicolae-Catalin, et al.
Publicado: (2024)
por: Ristea, Nicolae-Catalin, et al.
Publicado: (2024)
Dual Data Scaling for Robust Two-Stage User-Defined Keyword Spotting
por: Ai, Zhiqi, et al.
Publicado: (2025)
por: Ai, Zhiqi, et al.
Publicado: (2025)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
por: Li, Hongyi, et al.
Publicado: (2025)
por: Li, Hongyi, et al.
Publicado: (2025)
ChipChat: Low-Latency Cascaded Conversational Agent in MLX
por: Likhomanenko, Tatiana, et al.
Publicado: (2025)
por: Likhomanenko, Tatiana, et al.
Publicado: (2025)
TidyVoice 2026 Challenge Evaluation Plan
por: Farhadipour, Aref, et al.
Publicado: (2026)
por: Farhadipour, Aref, et al.
Publicado: (2026)
ICASSP 2026 URGENT Speech Enhancement Challenge
por: Li, Chenda, et al.
Publicado: (2026)
por: Li, Chenda, et al.
Publicado: (2026)
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions
por: Niu, Shu-Tong, et al.
Publicado: (2024)
por: Niu, Shu-Tong, et al.
Publicado: (2024)
CrossVoice: Crosslingual Prosody Preserving Cascade-S2ST using Transfer Learning
por: Hira, Medha, et al.
Publicado: (2024)
por: Hira, Medha, et al.
Publicado: (2024)
Multiple-Instance, Cascaded Classification for Keyword Spotting in Narrow-Band Audio
por: AbdulKader, Ahmad, et al.
Publicado: (2017)
por: AbdulKader, Ahmad, et al.
Publicado: (2017)
Ejemplares similares
-
EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge
por: Guo, Xiaoxuan, et al.
Publicado: (2025) -
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
por: Guo, Xiaoxuan, et al.
Publicado: (2026) -
AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
por: Xie, Yuankun, et al.
Publicado: (2026) -
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
por: Xie, Yuankun, et al.
Publicado: (2026) -
ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge Evaluation Plan
por: Zhang, Xueping, et al.
Publicado: (2026)