When Audio Generators Become Good Listeners: Generative Features for Understanding Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Zeyu, Li, Chenxing, Xu, Xuenan, Wu, Mengyue, Wang, Wenfu, Fu, Ruibo, Yu, Meng, Yu, Dong, Zou, Yuexian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
par: Xie, Zeyu, et autres
Publié: (2026)
par: Xie, Zeyu, et autres
Publié: (2026)
STAR: Speech-to-Audio Generation via Representation Learning
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
FakeSound: Deepfake General Audio Detection
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
par: Zheng, Zihao, et autres
Publié: (2025)
par: Zheng, Zihao, et autres
Publié: (2025)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
Verifiable Dropout: Turning Randomness into a Verifiable Claim
par: Lee, Kichang, et autres
Publié: (2025)
par: Lee, Kichang, et autres
Publié: (2025)
Whole-Song Hierarchical Generation of Symbolic Music Using Cascaded Diffusion Models
par: Wang, Ziyu, et autres
Publié: (2024)
par: Wang, Ziyu, et autres
Publié: (2024)
Distributional Drift Adaptation with Temporal Conditional Variational Autoencoder for Multivariate Time Series Forecasting
par: He, Hui, et autres
Publié: (2022)
par: He, Hui, et autres
Publié: (2022)
PairHuman: A High-Fidelity Photographic Dataset for Customized Dual-Person Generation
par: Pan, Ting, et autres
Publié: (2025)
par: Pan, Ting, et autres
Publié: (2025)
Contemporary Agent Technology: LLM-Driven Advancements vs Classic Multi-Agent Systems
par: Bădică, Costin, et autres
Publié: (2025)
par: Bădică, Costin, et autres
Publié: (2025)
RoNFA: Robust Neural Field-based Approach for Few-Shot Image Classification with Noisy Labels
par: Xiang, Nan, et autres
Publié: (2025)
par: Xiang, Nan, et autres
Publié: (2025)
Robust Multivariate Time Series Forecasting against Intra- and Inter-Series Transitional Shift
par: He, Hui, et autres
Publié: (2024)
par: He, Hui, et autres
Publié: (2024)
AI-Driven Innovations in Modern Cloud Computing
par: Kumar, Animesh
Publié: (2024)
par: Kumar, Animesh
Publié: (2024)
Enabling Trustworthy Federated Learning in Industrial IoT: Bridging the Gap Between Interpretability and Robustness
par: Jagatheesaperumal, Senthil Kumar, et autres
Publié: (2024)
par: Jagatheesaperumal, Senthil Kumar, et autres
Publié: (2024)
Redefining Finance: The Influence of Artificial Intelligence (AI) and Machine Learning (ML)
par: Kumar, Animesh
Publié: (2024)
par: Kumar, Animesh
Publié: (2024)
Superior Scoring Rules for Probabilistic Evaluation of Single-Label Multi-Class Classification Tasks
par: Ahmadian, Rouhollah, et autres
Publié: (2024)
par: Ahmadian, Rouhollah, et autres
Publié: (2024)
From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production
par: Shlomov, Segev, et autres
Publié: (2025)
par: Shlomov, Segev, et autres
Publié: (2025)
Any four real numbers are on all fours with analogy
par: Lepage, Yves, et autres
Publié: (2024)
par: Lepage, Yves, et autres
Publié: (2024)
MuDiT & MuSiT: Alignment with Colloquial Expression in Description-to-Song Generation
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
ViMo: Generating Motions from Casual Videos
par: Qiu, Liangdong, et autres
Publié: (2024)
par: Qiu, Liangdong, et autres
Publié: (2024)
VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena
par: Parcalabescu, Letitia, et autres
Publié: (2021)
par: Parcalabescu, Letitia, et autres
Publié: (2021)
VCRScore: Image captioning metric based on V\&L Transformers, CLIP, and precision-recall
par: Ruiz, Guillermo, et autres
Publié: (2025)
par: Ruiz, Guillermo, et autres
Publié: (2025)
MM-SHAP: A Performance-agnostic Metric for Measuring Multimodal Contributions in Vision and Language Models & Tasks
par: Parcalabescu, Letitia, et autres
Publié: (2022)
par: Parcalabescu, Letitia, et autres
Publié: (2022)
Simple Prompt Injection Attacks Can Leak Personal Data Observed by LLM Agents During Task Execution
par: Alizadeh, Meysam, et autres
Publié: (2025)
par: Alizadeh, Meysam, et autres
Publié: (2025)
Conversion rate prediction in online advertising: modeling techniques, performance evaluation and future directions
par: Xue, Tao, et autres
Publié: (2025)
par: Xue, Tao, et autres
Publié: (2025)
Toward a benchmark for CTR prediction in online advertising: datasets, evaluation protocols and perspectives
par: Gao, Shan, et autres
Publié: (2025)
par: Gao, Shan, et autres
Publié: (2025)
Temperature Scaling Attack Disrupting Model Confidence in Federated Learning
par: Lee, Kichang, et autres
Publié: (2026)
par: Lee, Kichang, et autres
Publié: (2026)
Toward Storage-Aware Learning with Compressed Data An Empirical Exploratory Study on JPEG
par: Lee, Kichang, et autres
Publié: (2025)
par: Lee, Kichang, et autres
Publié: (2025)
Enhancing Audio Generation Diversity with Visual Information
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
SaMoye: Zero-shot Singing Voice Conversion Model Based on Feature Disentanglement and Enhancement
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
Koopman operator learning using invertible neural networks
par: Meng, Yuhuang, et autres
Publié: (2023)
par: Meng, Yuhuang, et autres
Publié: (2023)
Adaptive Dataset Quantization: A New Direction for Dataset Pruning
par: Yu, Chenyue, et autres
Publié: (2025)
par: Yu, Chenyue, et autres
Publié: (2025)
On Measuring Faithfulness or Self-consistency of Natural Language Explanations
par: Parcalabescu, Letitia, et autres
Publié: (2023)
par: Parcalabescu, Letitia, et autres
Publié: (2023)
MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
Emergence of heavy tails in homogenized stochastic gradient descent
par: Jiao, Zhe, et autres
Publié: (2024)
par: Jiao, Zhe, et autres
Publié: (2024)
Self-Composing Neural Operators with Depth and Accuracy Scaling via Adaptive Train-and-Unroll Approach
par: He, Juncai, et autres
Publié: (2025)
par: He, Juncai, et autres
Publié: (2025)
GraphCNNpred: A stock market indices prediction using a Graph based deep learning system
par: Jin, Yuhui
Publié: (2024)
par: Jin, Yuhui
Publié: (2024)
Documents similaires
-
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
par: Xie, Zeyu, et autres
Publié: (2026) -
STAR: Speech-to-Audio Generation via Representation Learning
par: Xie, Zeyu, et autres
Publié: (2025) -
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
par: Xie, Zeyu, et autres
Publié: (2025) -
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
par: Xie, Zeyu, et autres
Publié: (2024) -
FakeSound: Deepfake General Audio Detection
par: Xie, Zeyu, et autres
Publié: (2024)