Salvato in:
| Autori principali: | Gan, Lindy, Huang, Yifan, Gao, Xiaoyang, Tan, Jiaming, Zhao, Fujun, Yang, Tao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2501.16813 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
di: Manakul, Potsawee, et al.
Pubblicazione: (2026)
di: Manakul, Potsawee, et al.
Pubblicazione: (2026)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
di: Gu, Hao, et al.
Pubblicazione: (2025)
di: Gu, Hao, et al.
Pubblicazione: (2025)
Bridging Language Gaps in Audio-Text Retrieval
di: Yan, Zhiyong, et al.
Pubblicazione: (2024)
di: Yan, Zhiyong, et al.
Pubblicazione: (2024)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
di: Wang, Xuechen, et al.
Pubblicazione: (2024)
di: Wang, Xuechen, et al.
Pubblicazione: (2024)
SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement Learning
di: Wang, Peidong, et al.
Pubblicazione: (2026)
di: Wang, Peidong, et al.
Pubblicazione: (2026)
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
di: Manakul, Potsawee, et al.
Pubblicazione: (2025)
di: Manakul, Potsawee, et al.
Pubblicazione: (2025)
SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection
di: Yi, Jiangyan, et al.
Pubblicazione: (2022)
di: Yi, Jiangyan, et al.
Pubblicazione: (2022)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
Probing Audio-Generation Capabilities of Text-Based Language Models
di: Anbazhagan, Arjun Prasaath, et al.
Pubblicazione: (2025)
di: Anbazhagan, Arjun Prasaath, et al.
Pubblicazione: (2025)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
di: Liao, Huan, et al.
Pubblicazione: (2024)
di: Liao, Huan, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
di: Gao, Yifan, et al.
Pubblicazione: (2025)
di: Gao, Yifan, et al.
Pubblicazione: (2025)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
Unified Audio Event Detection
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
di: Zhao, Botao, et al.
Pubblicazione: (2025)
di: Zhao, Botao, et al.
Pubblicazione: (2025)
MiMo-Audio: Audio Language Models are Few-Shot Learners
di: Core Team, et al.
Pubblicazione: (2025)
di: Core Team, et al.
Pubblicazione: (2025)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection
di: Feng, Yangguang
Pubblicazione: (2024)
di: Feng, Yangguang
Pubblicazione: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
Audio-Guided Fusion Techniques for Multimodal Emotion Analysis
di: Shi, Pujin, et al.
Pubblicazione: (2024)
di: Shi, Pujin, et al.
Pubblicazione: (2024)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding
di: Wang, Juncheng, et al.
Pubblicazione: (2026)
di: Wang, Juncheng, et al.
Pubblicazione: (2026)
WavMark: Watermarking for Audio Generation
di: Chen, Guangyu, et al.
Pubblicazione: (2023)
di: Chen, Guangyu, et al.
Pubblicazione: (2023)
A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks
di: Ishikawa, Takehiro, et al.
Pubblicazione: (2026)
di: Ishikawa, Takehiro, et al.
Pubblicazione: (2026)
AUDDT: Audio Unified Deepfake Detection Benchmark Toolkit
di: Zhu, Yi, et al.
Pubblicazione: (2025)
di: Zhu, Yi, et al.
Pubblicazione: (2025)
STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
di: Mei, Xinhao, et al.
Pubblicazione: (2023)
di: Mei, Xinhao, et al.
Pubblicazione: (2023)
ICLAD: In-Context Learning with Comparison-Guidance for Audio Deepfake Detection
di: Chou, Benjamin, et al.
Pubblicazione: (2026)
di: Chou, Benjamin, et al.
Pubblicazione: (2026)
Step-Audio 2 Technical Report
di: Wu, Boyong, et al.
Pubblicazione: (2025)
di: Wu, Boyong, et al.
Pubblicazione: (2025)
Covo-Audio Technical Report
di: Wang, Wenfu, et al.
Pubblicazione: (2026)
di: Wang, Wenfu, et al.
Pubblicazione: (2026)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
di: Chen, Shunian, et al.
Pubblicazione: (2025)
di: Chen, Shunian, et al.
Pubblicazione: (2025)
Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition
di: Zhao, Ruoyu, et al.
Pubblicazione: (2025)
di: Zhao, Ruoyu, et al.
Pubblicazione: (2025)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
di: Huang, Ailin, et al.
Pubblicazione: (2025)
di: Huang, Ailin, et al.
Pubblicazione: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
di: Manakul, Potsawee, et al.
Pubblicazione: (2026) -
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
di: Wang, Hui, et al.
Pubblicazione: (2025) -
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
di: Gu, Hao, et al.
Pubblicazione: (2025) -
Bridging Language Gaps in Audio-Text Retrieval
di: Yan, Zhiyong, et al.
Pubblicazione: (2024) -
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)