Fish Audio S2 Technical Report
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Shijia, Wang, Yuxuan, Liu, Songting, Cheng, Yifan, Zhang, Ruoyi, Li, Tianyu, Li, Shidong, Zheng, Yisheng, Liu, Xingwei, Wang, Qingzheng, Zhou, Zhizhuo, Liu, Jiahua, Chen, Xin, Han, Dawei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
MOSS-Audio Technical Report
di: Yang, Chen, et al.
Pubblicazione: (2026)
di: Yang, Chen, et al.
Pubblicazione: (2026)
Zero-shot Voice Conversion with Diffusion Transformers
di: Liu, Songting
Pubblicazione: (2024)
di: Liu, Songting
Pubblicazione: (2024)
FCPE: A Fast Context-based Pitch Estimation Model
di: Luo, Yuxin, et al.
Pubblicazione: (2025)
di: Luo, Yuxin, et al.
Pubblicazione: (2025)
QuarkAudio Technical Report
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
di: Mei, Jiahao, et al.
Pubblicazione: (2026)
di: Mei, Jiahao, et al.
Pubblicazione: (2026)
Step-Audio 2 Technical Report
di: Wu, Boyong, et al.
Pubblicazione: (2025)
di: Wu, Boyong, et al.
Pubblicazione: (2025)
Covo-Audio Technical Report
di: Wang, Wenfu, et al.
Pubblicazione: (2026)
di: Wang, Wenfu, et al.
Pubblicazione: (2026)
Fun-Audio-Chat Technical Report
di: Tongyi Fun Team, et al.
Pubblicazione: (2025)
di: Tongyi Fun Team, et al.
Pubblicazione: (2025)
Kimi-Audio Technical Report
di: KimiTeam, et al.
Pubblicazione: (2025)
di: KimiTeam, et al.
Pubblicazione: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
Zero-Day Audio DeepFake Detection via Retrieval Augmentation and Profile Matching
di: Liu, Xuechen, et al.
Pubblicazione: (2025)
di: Liu, Xuechen, et al.
Pubblicazione: (2025)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
di: Wang, Qingzheng, et al.
Pubblicazione: (2025)
di: Wang, Qingzheng, et al.
Pubblicazione: (2025)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models
di: Wang, Hualei, et al.
Pubblicazione: (2025)
di: Wang, Hualei, et al.
Pubblicazione: (2025)
GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks
di: Dai, Lingling, et al.
Pubblicazione: (2026)
di: Dai, Lingling, et al.
Pubblicazione: (2026)
GLM-TTS Technical Report
di: Cui, Jiayan, et al.
Pubblicazione: (2025)
di: Cui, Jiayan, et al.
Pubblicazione: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
EVA-GAN: Enhanced Various Audio Generation via Scalable Generative Adversarial Networks
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
di: Wang, Junyou, et al.
Pubblicazione: (2025)
di: Wang, Junyou, et al.
Pubblicazione: (2025)
HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
di: He, Peize, et al.
Pubblicazione: (2026)
di: He, Peize, et al.
Pubblicazione: (2026)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
IndexTTS 2.5 Technical Report
di: Li, Yunpei, et al.
Pubblicazione: (2026)
di: Li, Yunpei, et al.
Pubblicazione: (2026)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
From Coarse to Fine: Recursive Audio-Visual Semantic Enhancement for Speech Separation
di: Xue, Ke, et al.
Pubblicazione: (2025)
di: Xue, Ke, et al.
Pubblicazione: (2025)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
Step-Audio-R1 Technical Report
di: Tian, Fei, et al.
Pubblicazione: (2025)
di: Tian, Fei, et al.
Pubblicazione: (2025)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
di: Yang, Dongchao, et al.
Pubblicazione: (2025)
di: Yang, Dongchao, et al.
Pubblicazione: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
di: He, Xiang, et al.
Pubblicazione: (2026)
di: He, Xiang, et al.
Pubblicazione: (2026)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
di: Wang, Jiahua, et al.
Pubblicazione: (2025)
di: Wang, Jiahua, et al.
Pubblicazione: (2025)
MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks
di: Niu, Yadong, et al.
Pubblicazione: (2025)
di: Niu, Yadong, et al.
Pubblicazione: (2025)
A Noval Feature via Color Quantisation for Fake Audio Detection
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
di: Liao, Shijia, et al.
Pubblicazione: (2024) -
MOSS-Audio Technical Report
di: Yang, Chen, et al.
Pubblicazione: (2026) -
Zero-shot Voice Conversion with Diffusion Transformers
di: Liu, Songting
Pubblicazione: (2024) -
FCPE: A Fast Context-based Pitch Estimation Model
di: Luo, Yuxin, et al.
Pubblicazione: (2025) -
QuarkAudio Technical Report
di: Liu, Chengwei, et al.
Pubblicazione: (2025)