AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Zeyu, Xu, Xuenan, Wu, Zhizheng, Wu, Mengyue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
por: Xie, Zeyu, et al.
Publicado: (2024)
por: Xie, Zeyu, et al.
Publicado: (2024)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
por: Zheng, Zihao, et al.
Publicado: (2025)
por: Zheng, Zihao, et al.
Publicado: (2025)
STAR: Speech-to-Audio Generation via Representation Learning
por: Xie, Zeyu, et al.
Publicado: (2025)
por: Xie, Zeyu, et al.
Publicado: (2025)
FakeSound: Deepfake General Audio Detection
por: Xie, Zeyu, et al.
Publicado: (2024)
por: Xie, Zeyu, et al.
Publicado: (2024)
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
por: Xie, Zeyu, et al.
Publicado: (2025)
por: Xie, Zeyu, et al.
Publicado: (2025)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
por: Zheng, Zihao, et al.
Publicado: (2026)
por: Zheng, Zihao, et al.
Publicado: (2026)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
por: Xie, Zeyu, et al.
Publicado: (2026)
por: Xie, Zeyu, et al.
Publicado: (2026)
When Audio Generators Become Good Listeners: Generative Features for Understanding Tasks
por: Xie, Zeyu, et al.
Publicado: (2025)
por: Xie, Zeyu, et al.
Publicado: (2025)
Enhancing Audio Generation Diversity with Visual Information
por: Xie, Zeyu, et al.
Publicado: (2024)
por: Xie, Zeyu, et al.
Publicado: (2024)
Whole-Song Hierarchical Generation of Symbolic Music Using Cascaded Diffusion Models
por: Wang, Ziyu, et al.
Publicado: (2024)
por: Wang, Ziyu, et al.
Publicado: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
por: Xie, Zeyu, et al.
Publicado: (2023)
por: Xie, Zeyu, et al.
Publicado: (2023)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music
por: Wang, Zihao, et al.
Publicado: (2024)
por: Wang, Zihao, et al.
Publicado: (2024)
Towards Weakly Supervised Text-to-Audio Grounding
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
por: Xu, Xuenan, et al.
Publicado: (2023)
por: Xu, Xuenan, et al.
Publicado: (2023)
SaMoye: Zero-shot Singing Voice Conversion Model Based on Feature Disentanglement and Enhancement
por: Wang, Zihao, et al.
Publicado: (2024)
por: Wang, Zihao, et al.
Publicado: (2024)
MuDiT & MuSiT: Alignment with Colloquial Expression in Description-to-Song Generation
por: Wang, Zihao, et al.
Publicado: (2024)
por: Wang, Zihao, et al.
Publicado: (2024)
DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
por: Li, Baihan, et al.
Publicado: (2024)
por: Li, Baihan, et al.
Publicado: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
por: Zhang, Yaoyun, et al.
Publicado: (2024)
por: Zhang, Yaoyun, et al.
Publicado: (2024)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
por: Sun, Luoyi, et al.
Publicado: (2023)
por: Sun, Luoyi, et al.
Publicado: (2023)
Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
SARA: Stress Test Reasoning in Audio Deepfake Detection
por: Nguyen, Binh, et al.
Publicado: (2026)
por: Nguyen, Binh, et al.
Publicado: (2026)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
por: Niizumi, Daisuke, et al.
Publicado: (2026)
por: Niizumi, Daisuke, et al.
Publicado: (2026)
Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization
por: Wu, Junyan, et al.
Publicado: (2024)
por: Wu, Junyan, et al.
Publicado: (2024)
Learning Robust Spatial Representations from Binaural Audio through Feature Distillation
por: Bovbjerg, Holger Severin, et al.
Publicado: (2025)
por: Bovbjerg, Holger Severin, et al.
Publicado: (2025)
Cross-modal Cognitive Consensus guided Audio-Visual Segmentation
por: Shi, Zhaofeng, et al.
Publicado: (2023)
por: Shi, Zhaofeng, et al.
Publicado: (2023)
ML-ASPA: A Contemplation of Machine Learning-based Acoustic Signal Processing Analysis for Sounds, & Strains Emerging Technology
por: Ali, Ratul, et al.
Publicado: (2023)
por: Ali, Ratul, et al.
Publicado: (2023)
Audio-based Kinship Verification Using Age Domain Conversion
por: Sun, Qiyang, et al.
Publicado: (2024)
por: Sun, Qiyang, et al.
Publicado: (2024)
Distributional Drift Adaptation with Temporal Conditional Variational Autoencoder for Multivariate Time Series Forecasting
por: He, Hui, et al.
Publicado: (2022)
por: He, Hui, et al.
Publicado: (2022)
Symbolic Audio Classification via Modal Decision Tree Learning
por: Marzano, Enrico, et al.
Publicado: (2025)
por: Marzano, Enrico, et al.
Publicado: (2025)
ChordSync: Conformer-Based Alignment of Chord Annotations to Music Audio
por: Poltronieri, Andrea, et al.
Publicado: (2024)
por: Poltronieri, Andrea, et al.
Publicado: (2024)
UniTAF: A Modular Framework for Joint Text-to-Speech and Audio-to-Face Modeling
por: Zhou, Qiangong, et al.
Publicado: (2026)
por: Zhou, Qiangong, et al.
Publicado: (2026)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
por: Jain, Sarthak, et al.
Publicado: (2024)
por: Jain, Sarthak, et al.
Publicado: (2024)
Can Audio Large Language Models Verify Speaker Identity?
por: Ren, Yiming, et al.
Publicado: (2025)
por: Ren, Yiming, et al.
Publicado: (2025)
Ejemplares similares
-
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
por: Xie, Zeyu, et al.
Publicado: (2024) -
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
por: Zheng, Zihao, et al.
Publicado: (2025) -
STAR: Speech-to-Audio Generation via Representation Learning
por: Xie, Zeyu, et al.
Publicado: (2025) -
FakeSound: Deepfake General Audio Detection
por: Xie, Zeyu, et al.
Publicado: (2024) -
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
por: Xie, Zeyu, et al.
Publicado: (2025)