Qwen3.5-Omni Technical Report
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Qwen Team |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Qwen2.5-Omni Technical Report
par: Xu, Jin, et autres
Publié: (2025)
par: Xu, Jin, et autres
Publié: (2025)
Qwen3-Omni Technical Report
par: Xu, Jin, et autres
Publié: (2025)
par: Xu, Jin, et autres
Publié: (2025)
Qwen3-TTS Technical Report
par: Hu, Hangrui, et autres
Publié: (2026)
par: Hu, Hangrui, et autres
Publié: (2026)
Qwen3-ASR Technical Report
par: Shi, Xian, et autres
Publié: (2026)
par: Shi, Xian, et autres
Publié: (2026)
Qwen2-Audio Technical Report
par: Chu, Yunfei, et autres
Publié: (2024)
par: Chu, Yunfei, et autres
Publié: (2024)
Baichuan-Omni-1.5 Technical Report
par: Li, Yadong, et autres
Publié: (2025)
par: Li, Yadong, et autres
Publié: (2025)
Covo-Audio Technical Report
par: Wang, Wenfu, et autres
Publié: (2026)
par: Wang, Wenfu, et autres
Publié: (2026)
Marco-Voice Technical Report
par: Tian, Fengping, et autres
Publié: (2025)
par: Tian, Fengping, et autres
Publié: (2025)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Step-Audio 2 Technical Report
par: Wu, Boyong, et autres
Publié: (2025)
par: Wu, Boyong, et autres
Publié: (2025)
Fun-Audio-Chat Technical Report
par: Tongyi Fun Team, et autres
Publié: (2025)
par: Tongyi Fun Team, et autres
Publié: (2025)
OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models
par: Zhu, Han, et autres
Publié: (2026)
par: Zhu, Han, et autres
Publié: (2026)
Fun-ASR Technical Report
par: An, Keyu, et autres
Publié: (2025)
par: An, Keyu, et autres
Publié: (2025)
VibeVoice Technical Report
par: Peng, Zhiliang, et autres
Publié: (2025)
par: Peng, Zhiliang, et autres
Publié: (2025)
T5Gemma-TTS Technical Report
par: Arata, Chihiro, et autres
Publié: (2026)
par: Arata, Chihiro, et autres
Publié: (2026)
StepAudio 2.5 Technical Report
par: Lin, Bin, et autres
Publié: (2026)
par: Lin, Bin, et autres
Publié: (2026)
Step-Audio-R1.5 Technical Report
par: Zhang, Yuxin, et autres
Publié: (2026)
par: Zhang, Yuxin, et autres
Publié: (2026)
OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation
par: Zhang, Qinglin, et autres
Publié: (2024)
par: Zhang, Qinglin, et autres
Publié: (2024)
TTS-1 Technical Report
par: Atamanenko, Oleg, et autres
Publié: (2025)
par: Atamanenko, Oleg, et autres
Publié: (2025)
MixedG2P-T5: G2P-free Speech Synthesis for Mixed-script texts using Speech Self-Supervised Learning and Language Model
par: Park, Joonyong, et autres
Publié: (2025)
par: Park, Joonyong, et autres
Publié: (2025)
Kimi-Audio Technical Report
par: KimiTeam, et autres
Publié: (2025)
par: KimiTeam, et autres
Publié: (2025)
OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
par: Lin, Guan-Ting, et autres
Publié: (2026)
par: Lin, Guan-Ting, et autres
Publié: (2026)
Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST
par: Sekoyan, Monica, et autres
Publié: (2025)
par: Sekoyan, Monica, et autres
Publié: (2025)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
par: Wang, Xiong, et autres
Publié: (2024)
par: Wang, Xiong, et autres
Publié: (2024)
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
par: Gong, Jingyao
Publié: (2026)
par: Gong, Jingyao
Publié: (2026)
OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
par: Cheng, Xize, et autres
Publié: (2025)
par: Cheng, Xize, et autres
Publié: (2025)
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
par: Fang, Qingkai, et autres
Publié: (2025)
par: Fang, Qingkai, et autres
Publié: (2025)
Step-Audio-EditX Technical Report
par: Yan, Chao, et autres
Publié: (2025)
par: Yan, Chao, et autres
Publié: (2025)
A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations
par: Dutta, Soumya, et autres
Publié: (2026)
par: Dutta, Soumya, et autres
Publié: (2026)
RECOVER: Robust Entity Correction via agentic Orchestration of hypothesis Variants for Evidence-based Recovery
par: Kumar, Abhishek, et autres
Publié: (2026)
par: Kumar, Abhishek, et autres
Publié: (2026)
Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models
par: Zhao, Xiutian, et autres
Publié: (2026)
par: Zhao, Xiutian, et autres
Publié: (2026)
MiLorE-SSL: Scaling Multilingual Capabilities in Self-Supervised Models without Forgetting
par: Xu, Jing, et autres
Publié: (2026)
par: Xu, Jing, et autres
Publié: (2026)
Dolphin-CN-Dialect: Where Chinese Dialects Matter
par: Meng, Yangyang, et autres
Publié: (2026)
par: Meng, Yangyang, et autres
Publié: (2026)
Interpreting Speaker Characteristics in the Dimensions of Self-Supervised Speech Features
par: van Rensburg, Kyle Janse, et autres
Publié: (2026)
par: van Rensburg, Kyle Janse, et autres
Publié: (2026)
One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech
par: Abebe, Amanuel Gizachew, et autres
Publié: (2026)
par: Abebe, Amanuel Gizachew, et autres
Publié: (2026)
MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models
par: Chien, Chung-Ming, et autres
Publié: (2026)
par: Chien, Chung-Ming, et autres
Publié: (2026)
Sylber 2.0: A Universal Syllable Embedding
par: Cho, Cheol Jun, et autres
Publié: (2026)
par: Cho, Cheol Jun, et autres
Publié: (2026)
STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs
par: Zhang, Kaiyuan, et autres
Publié: (2026)
par: Zhang, Kaiyuan, et autres
Publié: (2026)
Scaling Self-Supervised Speech Models Uncovers Deep Linguistic Relationships: Evidence from the Pacific Cluster
par: Kim, Minu, et autres
Publié: (2026)
par: Kim, Minu, et autres
Publié: (2026)
Documents similaires
-
Qwen2.5-Omni Technical Report
par: Xu, Jin, et autres
Publié: (2025) -
Qwen3-Omni Technical Report
par: Xu, Jin, et autres
Publié: (2025) -
Qwen3-TTS Technical Report
par: Hu, Hangrui, et autres
Publié: (2026) -
Qwen3-ASR Technical Report
par: Shi, Xian, et autres
Publié: (2026) -
Qwen2-Audio Technical Report
par: Chu, Yunfei, et autres
Publié: (2024)