Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Zhifei, Ma, Ziyang, Liu, Zihang, Pang, Kaiyu, Li, Hongyu, Zhang, Jialin, Liao, Yue, Ye, Deheng, Miao, Chunyan, Yan, Shuicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
por: Xie, Zhifei, et al.
Publicado: (2026)
por: Xie, Zhifei, et al.
Publicado: (2026)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
por: Xie, Zhifei, et al.
Publicado: (2025)
por: Xie, Zhifei, et al.
Publicado: (2025)
Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming
por: Xie, Zhifei, et al.
Publicado: (2024)
por: Xie, Zhifei, et al.
Publicado: (2024)
Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
por: Xie, Zhifei, et al.
Publicado: (2024)
por: Xie, Zhifei, et al.
Publicado: (2024)
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
por: Gong, Jingyao
Publicado: (2026)
por: Gong, Jingyao
Publicado: (2026)
Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
por: Xiao, Yunchong, et al.
Publicado: (2026)
por: Xiao, Yunchong, et al.
Publicado: (2026)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
por: Tao, Dehua, et al.
Publicado: (2026)
por: Tao, Dehua, et al.
Publicado: (2026)
Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
por: Zhao, Jinzheng, et al.
Publicado: (2024)
por: Zhao, Jinzheng, et al.
Publicado: (2024)
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
por: Li, Hanzhao, et al.
Publicado: (2024)
por: Li, Hanzhao, et al.
Publicado: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
Acoustic BPE for Speech Generation with Discrete Tokens
por: Shen, Feiyu, et al.
Publicado: (2023)
por: Shen, Feiyu, et al.
Publicado: (2023)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
Continuous Speech Tokenizer in Text To Speech
por: Li, Yixing, et al.
Publicado: (2024)
por: Li, Yixing, et al.
Publicado: (2024)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
por: Zou, Wenhao, et al.
Publicado: (2026)
por: Zou, Wenhao, et al.
Publicado: (2026)
SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
por: Liu, Wenrui, et al.
Publicado: (2025)
por: Liu, Wenrui, et al.
Publicado: (2025)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
EmoOmni: Bridging Emotional Understanding and Expression in Omni-Modal LLMs
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
EmoSSLSphere: Multilingual Emotional Speech Synthesis with Spherical Vectors and Discrete Speech Tokens
por: Park, Joonyong, et al.
Publicado: (2025)
por: Park, Joonyong, et al.
Publicado: (2025)
OmniCodec: Low Frame Rate Universal Audio Codec with Semantic-Acoustic Disentanglement
por: Hu, Jingbin, et al.
Publicado: (2026)
por: Hu, Jingbin, et al.
Publicado: (2026)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025)
por: Wang, Huimeng, et al.
Publicado: (2025)
HAM-TTS: Hierarchical Acoustic Modeling for Token-Based Zero-Shot Text-to-Speech with Model and Data Scaling
por: Wang, Chunhui, et al.
Publicado: (2024)
por: Wang, Chunhui, et al.
Publicado: (2024)
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
por: Halim, Jule Valendo, et al.
Publicado: (2025)
por: Halim, Jule Valendo, et al.
Publicado: (2025)
Who is Speaking or Who is Depressed? A Controlled Study of Speaker Leakage in Speech-Based Depression Detection
por: Yeh, Hsiang-Chen, et al.
Publicado: (2026)
por: Yeh, Hsiang-Chen, et al.
Publicado: (2026)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models
por: Zhu, Han, et al.
Publicado: (2026)
por: Zhu, Han, et al.
Publicado: (2026)
NAST: Noise Aware Speech Tokenization for Speech Language Models
por: Messica, Shoval, et al.
Publicado: (2024)
por: Messica, Shoval, et al.
Publicado: (2024)
Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens
por: Ku, Pin-Jui, et al.
Publicado: (2025)
por: Ku, Pin-Jui, et al.
Publicado: (2025)
JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles
por: Kondo, Yuto, et al.
Publicado: (2025)
por: Kondo, Yuto, et al.
Publicado: (2025)
High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model
por: Lee, Joun Yeop, et al.
Publicado: (2024)
por: Lee, Joun Yeop, et al.
Publicado: (2024)
Mobile Recording Device Recognition Based Cross-Scale and Multi-Level Representation Learning
por: Zeng, Chunyan, et al.
Publicado: (2024)
por: Zeng, Chunyan, et al.
Publicado: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
por: Guo, Hao-Han, et al.
Publicado: (2024)
por: Guo, Hao-Han, et al.
Publicado: (2024)
Low Bitrate High-Quality RVQGAN-based Discrete Speech Tokenizer
por: Shechtman, Slava, et al.
Publicado: (2024)
por: Shechtman, Slava, et al.
Publicado: (2024)
CodeSep: Low-Bitrate Codec-Driven Speech Separation with Base-Token Disentanglement and Auxiliary-Token Serial Prediction
por: Du, Hui-Peng, et al.
Publicado: (2026)
por: Du, Hui-Peng, et al.
Publicado: (2026)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition
por: Xie, Jiamin, et al.
Publicado: (2025)
por: Xie, Jiamin, et al.
Publicado: (2025)
Ejemplares similares
-
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
por: Xie, Zhifei, et al.
Publicado: (2026) -
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
por: Xie, Zhifei, et al.
Publicado: (2025) -
Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming
por: Xie, Zhifei, et al.
Publicado: (2024) -
Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
por: Xie, Zhifei, et al.
Publicado: (2024) -
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
por: Gong, Jingyao
Publicado: (2026)