Improving Audio Event Recognition with Consistency Regularization
Fuente:
arXiv
Guardado en:
| Autores principales: | Sadhu, Shanmuka, Wang, Weiran |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
por: Shi, Jiacheng, et al.
Publicado: (2025)
por: Shi, Jiacheng, et al.
Publicado: (2025)
Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
por: Torres, Bernardo, et al.
Publicado: (2025)
por: Torres, Bernardo, et al.
Publicado: (2025)
DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer
por: Liu, Yisu, et al.
Publicado: (2025)
por: Liu, Yisu, et al.
Publicado: (2025)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
Context and Transcripts Improve Detection of Deepfake Audios of Public Figures
por: Gao, Chongyang, et al.
Publicado: (2026)
por: Gao, Chongyang, et al.
Publicado: (2026)
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
por: Luo, Jiehui, et al.
Publicado: (2025)
por: Luo, Jiehui, et al.
Publicado: (2025)
DialogGraph-LLM: Graph-Informed LLMs for End-to-End Audio Dialogue Intent Recognition
por: Liu, HongYu, et al.
Publicado: (2025)
por: Liu, HongYu, et al.
Publicado: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025)
por: Sun, Zhe, et al.
Publicado: (2025)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
por: Wang, Junyou, et al.
Publicado: (2025)
por: Wang, Junyou, et al.
Publicado: (2025)
AudioScene: Integrating Object-Event Audio into 3D Scenes
por: Yuan, Shuaihang, et al.
Publicado: (2025)
por: Yuan, Shuaihang, et al.
Publicado: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
por: Glazer, Neta, et al.
Publicado: (2026)
por: Glazer, Neta, et al.
Publicado: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
por: Zhang, Dan, et al.
Publicado: (2026)
por: Zhang, Dan, et al.
Publicado: (2026)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
por: Xie, Yuankun, et al.
Publicado: (2026)
por: Xie, Yuankun, et al.
Publicado: (2026)
MOSS-Audio Technical Report
por: Yang, Chen, et al.
Publicado: (2026)
por: Yang, Chen, et al.
Publicado: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
por: Li, Xiquan, et al.
Publicado: (2025)
por: Li, Xiquan, et al.
Publicado: (2025)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
por: Zhang, Ruixing, et al.
Publicado: (2026)
por: Zhang, Ruixing, et al.
Publicado: (2026)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
Stable Audio 3
por: Evans, Zach, et al.
Publicado: (2026)
por: Evans, Zach, et al.
Publicado: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
por: Lee, Kuan-Yi, et al.
Publicado: (2025)
por: Lee, Kuan-Yi, et al.
Publicado: (2025)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
por: Aparin, Georgii, et al.
Publicado: (2026)
por: Aparin, Georgii, et al.
Publicado: (2026)
WESR: Scaling and Evaluating Word-level Event-Speech Recognition
por: Yang, Chenchen, et al.
Publicado: (2026)
por: Yang, Chenchen, et al.
Publicado: (2026)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
por: Kang, Mintong, et al.
Publicado: (2026)
por: Kang, Mintong, et al.
Publicado: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
por: Zhao, Feiyu, et al.
Publicado: (2026)
por: Zhao, Feiyu, et al.
Publicado: (2026)
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
por: Iyer, Laya, et al.
Publicado: (2026)
por: Iyer, Laya, et al.
Publicado: (2026)
Self Voice Conversion as an Attack against Neural Audio Watermarking
por: Özer, Yigitcan, et al.
Publicado: (2026)
por: Özer, Yigitcan, et al.
Publicado: (2026)
AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
por: Xie, Yuankun, et al.
Publicado: (2026)
por: Xie, Yuankun, et al.
Publicado: (2026)
AAT: Adapting Audio Transformer for Various Acoustics Recognition Tasks
por: Liang, Yun, et al.
Publicado: (2024)
por: Liang, Yun, et al.
Publicado: (2024)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
por: Xie, Xinyuan, et al.
Publicado: (2026)
por: Xie, Xinyuan, et al.
Publicado: (2026)
Codec-Robust Attacks on Audio LLMs
por: Roh, Jaechul, et al.
Publicado: (2026)
por: Roh, Jaechul, et al.
Publicado: (2026)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
por: Zhang, Qian, et al.
Publicado: (2026)
por: Zhang, Qian, et al.
Publicado: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026)
por: Shi, Yanfeng, et al.
Publicado: (2026)
Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
por: Wang, Tsai-Ning, et al.
Publicado: (2025)
por: Wang, Tsai-Ning, et al.
Publicado: (2025)
Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
por: Ahn, Hyebin, et al.
Publicado: (2025)
por: Ahn, Hyebin, et al.
Publicado: (2025)
RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
por: Gao, Liting, et al.
Publicado: (2025)
por: Gao, Liting, et al.
Publicado: (2025)
FLM-Audio: Natural Monologues Improves Native Full-Duplex Chatbots via Dual Training
por: Yao, Yiqun, et al.
Publicado: (2025)
por: Yao, Yiqun, et al.
Publicado: (2025)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
Adaptive Evidence Weighting for Audio-Spatiotemporal Fusion
por: Ovanger, Oscar, et al.
Publicado: (2026)
por: Ovanger, Oscar, et al.
Publicado: (2026)
Ejemplares similares
-
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
por: Shi, Jiacheng, et al.
Publicado: (2025) -
Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
por: Torres, Bernardo, et al.
Publicado: (2025) -
DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer
por: Liu, Yisu, et al.
Publicado: (2025) -
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026) -
Context and Transcripts Improve Detection of Deepfake Audios of Public Figures
por: Gao, Chongyang, et al.
Publicado: (2026)