Audio-FLAN: A Preliminary Release
Fuente:
arXiv
Guardado en:
| Autores principales: | Xue, Liumeng, Zhou, Ziya, Pan, Jiahao, Li, Zixuan, Fan, Shuai, Ma, Yinghao, Cheng, Sitong, Yang, Dongchao, Guo, Haohan, Xiao, Yujia, Wang, Xinsheng, Shen, Zixuan, Zhu, Chuanbo, Zhang, Xinshen, Liu, Tianchi, Yuan, Ruibin, Tian, Zeyue, Liu, Haohe, Benetos, Emmanouil, Zhang, Ge, Guo, Yike, Xue, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
por: Zhou, Ziya, et al.
Publicado: (2024)
por: Zhou, Ziya, et al.
Publicado: (2024)
AudioX: A Unified Framework for Anything-to-Audio Generation
por: Tian, Zeyue, et al.
Publicado: (2025)
por: Tian, Zeyue, et al.
Publicado: (2025)
Inference-time Scaling for Diffusion-based Audio Super-resolution
por: Jin, Yizhu, et al.
Publicado: (2025)
por: Jin, Yizhu, et al.
Publicado: (2025)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
por: Cheng, Sitong, et al.
Publicado: (2025)
por: Cheng, Sitong, et al.
Publicado: (2025)
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
por: Zhuo, Le, et al.
Publicado: (2023)
por: Zhuo, Le, et al.
Publicado: (2023)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
por: Taheri, Termeh, et al.
Publicado: (2025)
por: Taheri, Termeh, et al.
Publicado: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
por: Tian, Zeyue, et al.
Publicado: (2024)
por: Tian, Zeyue, et al.
Publicado: (2024)
ComposerX: Multi-Agent Symbolic Music Composition with LLMs
por: Deng, Qixin, et al.
Publicado: (2024)
por: Deng, Qixin, et al.
Publicado: (2024)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
por: Deng, Zihao, et al.
Publicado: (2023)
por: Deng, Zihao, et al.
Publicado: (2023)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
por: Tian, Zeyue, et al.
Publicado: (2026)
por: Tian, Zeyue, et al.
Publicado: (2026)
ChatMusician: Understanding and Generating Music Intrinsically with LLM
por: Yuan, Ruibin, et al.
Publicado: (2024)
por: Yuan, Ruibin, et al.
Publicado: (2024)
CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following
por: Ma, Yinghao, et al.
Publicado: (2025)
por: Ma, Yinghao, et al.
Publicado: (2025)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
por: Huang, Jiawen, et al.
Publicado: (2024)
por: Huang, Jiawen, et al.
Publicado: (2024)
SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model
por: Li, Yan, et al.
Publicado: (2024)
por: Li, Yan, et al.
Publicado: (2024)
You Know What I'm Saying: Jailbreak Attack via Implicit Reference
por: Wu, Tianyu, et al.
Publicado: (2024)
por: Wu, Tianyu, et al.
Publicado: (2024)
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
por: Sun, Peiwen, et al.
Publicado: (2024)
por: Sun, Peiwen, et al.
Publicado: (2024)
Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis
por: Ye, Zhen, et al.
Publicado: (2025)
por: Ye, Zhen, et al.
Publicado: (2025)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
WavCraft: Audio Editing and Generation with Large Language Models
por: Liang, Jinhua, et al.
Publicado: (2024)
por: Liang, Jinhua, et al.
Publicado: (2024)
Smoking gun signature from axion and the constraints with radio telescopes
por: Liu, Zixuan, et al.
Publicado: (2025)
por: Liu, Zixuan, et al.
Publicado: (2025)
Text-aware and Context-aware Expressive Audiobook Speech Synthesis
por: Guo, Dake, et al.
Publicado: (2024)
por: Guo, Dake, et al.
Publicado: (2024)
Transfer the linguistic representations from TTS to accent conversion with non-parallel data
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
por: Tang, Xiaoxuan, et al.
Publicado: (2025)
por: Tang, Xiaoxuan, et al.
Publicado: (2025)
D$^2$-World: An Efficient World Model through Decoupled Dynamic Flow
por: Zhang, Haiming, et al.
Publicado: (2024)
por: Zhang, Haiming, et al.
Publicado: (2024)
SCAPE: A Simple and Strong Category-Agnostic Pose Estimator
por: Liang, Yujia, et al.
Publicado: (2024)
por: Liang, Yujia, et al.
Publicado: (2024)
ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing
por: Chen, Xi, et al.
Publicado: (2026)
por: Chen, Xi, et al.
Publicado: (2026)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
por: Li, Hanzhao, et al.
Publicado: (2024)
por: Li, Hanzhao, et al.
Publicado: (2024)
LLMs Meet Multimodal Generation and Editing: A Survey
por: He, Yingqing, et al.
Publicado: (2024)
por: He, Yingqing, et al.
Publicado: (2024)
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
por: Chang, Sungkyun, et al.
Publicado: (2025)
por: Chang, Sungkyun, et al.
Publicado: (2025)
LC-Protonets: Multi-Label Few-Shot Learning for World Music Audio Tagging
por: Papaioannou, Charilaos, et al.
Publicado: (2024)
por: Papaioannou, Charilaos, et al.
Publicado: (2024)
GraFPrint: A GNN-Based Approach for Audio Identification
por: Bhattacharjee, Aditya, et al.
Publicado: (2024)
por: Bhattacharjee, Aditya, et al.
Publicado: (2024)
Universal Music Representations? Evaluating Foundation Models on World Music Corpora
por: Papaioannou, Charilaos, et al.
Publicado: (2025)
por: Papaioannou, Charilaos, et al.
Publicado: (2025)
Learning Music Audio Representations With Limited Data
por: Plachouras, Christos, et al.
Publicado: (2025)
por: Plachouras, Christos, et al.
Publicado: (2025)
Scalable Evaluation for Audio Identification via Synthetic Latent Fingerprint Generation
por: Bhattacharjee, Aditya, et al.
Publicado: (2025)
por: Bhattacharjee, Aditya, et al.
Publicado: (2025)
Event-assisted 12-stop HDR Imaging of Dynamic Scene
por: Guo, Shi, et al.
Publicado: (2024)
por: Guo, Shi, et al.
Publicado: (2024)
Occurrence form and environmental effect of heavy metal in flue gas desulfurization gypsum from Shanxi Province, China
por: Kezhou Yan, et al.
Publicado: (2025)
por: Kezhou Yan, et al.
Publicado: (2025)
All‐Optical Temperature Sensor Based on Nitrogen‐Vacancy Centers for Dissolution
por: Jia Guo, et al.
Publicado: (2025)
por: Jia Guo, et al.
Publicado: (2025)
Omnidirectional Spatial Modeling from Correlated Panoramas
por: Zhang, Xinshen, et al.
Publicado: (2025)
por: Zhang, Xinshen, et al.
Publicado: (2025)
Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method
por: Zhang, Xinshen, et al.
Publicado: (2025)
por: Zhang, Xinshen, et al.
Publicado: (2025)
Ejemplares similares
-
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
por: Zhou, Ziya, et al.
Publicado: (2024) -
AudioX: A Unified Framework for Anything-to-Audio Generation
por: Tian, Zeyue, et al.
Publicado: (2025) -
Inference-time Scaling for Diffusion-based Audio Super-resolution
por: Jin, Yizhu, et al.
Publicado: (2025) -
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
por: Cheng, Sitong, et al.
Publicado: (2025) -
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
por: Zhuo, Le, et al.
Publicado: (2023)