TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Hao-Hui, Chung, Ho-Lam, Lin, Yi-Cheng, Lu, Ke-Han, Ren, Wenze, Chen, Xie, Lee, Hung-yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLM-Codec: Neural Audio Codec Meets Language Model Objectives
di: Chung, Ho-Lam, et al.
Pubblicazione: (2026)
di: Chung, Ho-Lam, et al.
Pubblicazione: (2026)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
di: Li, Chen-An, et al.
Pubblicazione: (2025)
di: Li, Chen-An, et al.
Pubblicazione: (2025)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
di: Du, Jiawei, et al.
Pubblicazione: (2024)
di: Du, Jiawei, et al.
Pubblicazione: (2024)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
Waveform-Logmel Audio Neural Networks for Respiratory Sound Classification
di: Xie, Jiadong, et al.
Pubblicazione: (2025)
di: Xie, Jiadong, et al.
Pubblicazione: (2025)
ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality
di: Luo, Yu-Xiang, et al.
Pubblicazione: (2025)
di: Luo, Yu-Xiang, et al.
Pubblicazione: (2025)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
di: Li, Xiquan, et al.
Pubblicazione: (2025)
di: Li, Xiquan, et al.
Pubblicazione: (2025)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
AudioSpa: Spatializing Sound Events with Text
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
Region-Specific Audio Tagging for Spatial Sound
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
Scaling Audio-Text Retrieval with Multimodal Large Language Models
di: Xu, Jilan, et al.
Pubblicazione: (2026)
di: Xu, Jilan, et al.
Pubblicazione: (2026)
Audio Simulation for Sound Source Localization in Virtual Evironment
di: Di Yuan, Yi, et al.
Pubblicazione: (2024)
di: Di Yuan, Yi, et al.
Pubblicazione: (2024)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
di: Ren, Wenze, et al.
Pubblicazione: (2024)
di: Ren, Wenze, et al.
Pubblicazione: (2024)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
di: Chung, HaeChun
Pubblicazione: (2025)
di: Chung, HaeChun
Pubblicazione: (2025)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
How Contrastive Decoding Enhances Large Audio Language Models?
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
di: Bi, Chunhao, et al.
Pubblicazione: (2026)
di: Bi, Chunhao, et al.
Pubblicazione: (2026)
Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods
di: Hsieh, Fang-Chih, et al.
Pubblicazione: (2026)
di: Hsieh, Fang-Chih, et al.
Pubblicazione: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Sound Check: Auditing Audio Datasets
di: Agnew, William, et al.
Pubblicazione: (2024)
di: Agnew, William, et al.
Pubblicazione: (2024)
Multimodal Transformer Distillation for Audio-Visual Synchronization
di: Chen, Xuanjun, et al.
Pubblicazione: (2022)
di: Chen, Xuanjun, et al.
Pubblicazione: (2022)
Documenti analoghi
-
LLM-Codec: Neural Audio Codec Meets Language Model Objectives
di: Chung, Ho-Lam, et al.
Pubblicazione: (2026) -
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026) -
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
di: Li, Chen-An, et al.
Pubblicazione: (2025) -
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
di: Du, Jiawei, et al.
Pubblicazione: (2024) -
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)