MSMT-FN: Multi-segment Multi-task Fusion Network for Marketing Audio Classification
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, HongYu, Wan, Ruijie, Han, Yueju, Li, Junxin, Lu, Liuxing, He, Chao, Cai, Lihua |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DialogGraph-LLM: Graph-Informed LLMs for End-to-End Audio Dialogue Intent Recognition
von: Liu, HongYu, et al.
Veröffentlicht: (2025)
von: Liu, HongYu, et al.
Veröffentlicht: (2025)
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
von: Chen, Yuxuan, et al.
Veröffentlicht: (2026)
von: Chen, Yuxuan, et al.
Veröffentlicht: (2026)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
von: Tao, Ye, et al.
Veröffentlicht: (2025)
von: Tao, Ye, et al.
Veröffentlicht: (2025)
Class-Incremental Learning for Multi-Label Audio Classification
von: Mulimani, Manjunath, et al.
Veröffentlicht: (2024)
von: Mulimani, Manjunath, et al.
Veröffentlicht: (2024)
Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification
von: Rauch, Lukas, et al.
Veröffentlicht: (2025)
von: Rauch, Lukas, et al.
Veröffentlicht: (2025)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
von: Bensaid, Reda, et al.
Veröffentlicht: (2026)
von: Bensaid, Reda, et al.
Veröffentlicht: (2026)
Waveform-Logmel Audio Neural Networks for Respiratory Sound Classification
von: Xie, Jiadong, et al.
Veröffentlicht: (2025)
von: Xie, Jiadong, et al.
Veröffentlicht: (2025)
A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs
von: Lee, Taehan, et al.
Veröffentlicht: (2026)
von: Lee, Taehan, et al.
Veröffentlicht: (2026)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
von: Wang, He, et al.
Veröffentlicht: (2024)
von: Wang, He, et al.
Veröffentlicht: (2024)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
von: Hu, Han, et al.
Veröffentlicht: (2025)
von: Hu, Han, et al.
Veröffentlicht: (2025)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
von: Sun, Siqi, et al.
Veröffentlicht: (2024)
von: Sun, Siqi, et al.
Veröffentlicht: (2024)
Masked Audio Modeling with CLAP and Multi-Objective Learning
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
M3TCM: Multi-modal Multi-task Context Model for Utterance Classification in Motivational Interviews
von: Hossain, Sayed Muddashir, et al.
Veröffentlicht: (2024)
von: Hossain, Sayed Muddashir, et al.
Veröffentlicht: (2024)
Multi-label Zero-Shot Audio Classification with Temporal Attention
von: Dogan, Duygu, et al.
Veröffentlicht: (2024)
von: Dogan, Duygu, et al.
Veröffentlicht: (2024)
Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan
von: Wang, Jialing, et al.
Veröffentlicht: (2026)
von: Wang, Jialing, et al.
Veröffentlicht: (2026)
AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation
von: Sun, Yulin, et al.
Veröffentlicht: (2025)
von: Sun, Yulin, et al.
Veröffentlicht: (2025)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
von: Zhao, Hang, et al.
Veröffentlicht: (2024)
von: Zhao, Hang, et al.
Veröffentlicht: (2024)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
von: Zhou, Xinyu, et al.
Veröffentlicht: (2026)
von: Zhou, Xinyu, et al.
Veröffentlicht: (2026)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
von: Li, Jia, et al.
Veröffentlicht: (2025)
von: Li, Jia, et al.
Veröffentlicht: (2025)
BS-PLCNet: Band-split Packet Loss Concealment Network with Multi-task Learning Framework and Multi-discriminators
von: Zhang, Zihan, et al.
Veröffentlicht: (2024)
von: Zhang, Zihan, et al.
Veröffentlicht: (2024)
LCANets++: Robust Audio Classification using Multi-layer Neural Networks with Lateral Competition
von: Dibbo, Sayanton V., et al.
Veröffentlicht: (2023)
von: Dibbo, Sayanton V., et al.
Veröffentlicht: (2023)
Unified Audio Event Detection
von: Jiang, Yidi, et al.
Veröffentlicht: (2024)
von: Jiang, Yidi, et al.
Veröffentlicht: (2024)
MultiPA: A Multi-task Speech Pronunciation Assessment Model for Open Response Scenarios
von: Chen, Yu-Wen, et al.
Veröffentlicht: (2023)
von: Chen, Yu-Wen, et al.
Veröffentlicht: (2023)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
von: Wen, Penghui, et al.
Veröffentlicht: (2023)
von: Wen, Penghui, et al.
Veröffentlicht: (2023)
From Coarse to Fine: Recursive Audio-Visual Semantic Enhancement for Speech Separation
von: Xue, Ke, et al.
Veröffentlicht: (2025)
von: Xue, Ke, et al.
Veröffentlicht: (2025)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
von: Cai, Yiqiang, et al.
Veröffentlicht: (2024)
von: Cai, Yiqiang, et al.
Veröffentlicht: (2024)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
von: Rong, Yan, et al.
Veröffentlicht: (2025)
von: Rong, Yan, et al.
Veröffentlicht: (2025)
PoolingVQ: A VQVAE Variant for Reducing Audio Redundancy and Boosting Multi-Modal Fusion in Music Emotion Analysis
von: Zou, Dinghao, et al.
Veröffentlicht: (2025)
von: Zou, Dinghao, et al.
Veröffentlicht: (2025)
DGFNet: End-to-End Audio-Visual Source Separation Based on Dynamic Gating Fusion
von: Yu, Yinfeng, et al.
Veröffentlicht: (2025)
von: Yu, Yinfeng, et al.
Veröffentlicht: (2025)
Adaptive Evidence Weighting for Audio-Spatiotemporal Fusion
von: Ovanger, Oscar, et al.
Veröffentlicht: (2026)
von: Ovanger, Oscar, et al.
Veröffentlicht: (2026)
Analytical Exploration of Spatial Audio Cues: A Differentiable Multi-Sphere Scattering Model
von: Galougah, Siminfar Samakoush, et al.
Veröffentlicht: (2026)
von: Galougah, Siminfar Samakoush, et al.
Veröffentlicht: (2026)
Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training
von: Sun, Houmin, et al.
Veröffentlicht: (2026)
von: Sun, Houmin, et al.
Veröffentlicht: (2026)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
von: Sundar, Anirudh S., et al.
Veröffentlicht: (2023)
von: Sundar, Anirudh S., et al.
Veröffentlicht: (2023)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2026)
A Benchmark for Multi-speaker Anonymization
von: Miao, Xiaoxiao, et al.
Veröffentlicht: (2024)
von: Miao, Xiaoxiao, et al.
Veröffentlicht: (2024)
Spatial-Aware Conditioned Fusion for Audio-Visual Navigation
von: Wu, Shaohang, et al.
Veröffentlicht: (2026)
von: Wu, Shaohang, et al.
Veröffentlicht: (2026)
Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text Synergy
von: Li, Kewei, et al.
Veröffentlicht: (2025)
von: Li, Kewei, et al.
Veröffentlicht: (2025)
Enhancing Speech Emotion Recognition with Multi-Task Learning and Dynamic Feature Fusion
von: Wang, Honghong, et al.
Veröffentlicht: (2025)
von: Wang, Honghong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DialogGraph-LLM: Graph-Informed LLMs for End-to-End Audio Dialogue Intent Recognition
von: Liu, HongYu, et al.
Veröffentlicht: (2025) -
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
von: Chen, Yuxuan, et al.
Veröffentlicht: (2026) -
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
von: Tao, Ye, et al.
Veröffentlicht: (2025) -
Class-Incremental Learning for Multi-Label Audio Classification
von: Mulimani, Manjunath, et al.
Veröffentlicht: (2024) -
Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification
von: Rauch, Lukas, et al.
Veröffentlicht: (2025)