Guardado en:
| Autores principales: | Du, Xuan, Yan, Qiangyu, Li, Wenshuo, Jiang, Borui, Xiao, Changming, Shu, Han, Chen, Xinghao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.20946 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
Multimodal Latent Reasoning via Hierarchical Visual Cues Injection
por: Zhang, Yiming, et al.
Publicado: (2026)
por: Zhang, Yiming, et al.
Publicado: (2026)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025)
por: Kang, Jialiang, et al.
Publicado: (2025)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
por: Zhang, Yiman, et al.
Publicado: (2025)
por: Zhang, Yiman, et al.
Publicado: (2025)
Can Speech LLMs Think while Listening?
por: Shih, Yi-Jen, et al.
Publicado: (2025)
por: Shih, Yi-Jen, et al.
Publicado: (2025)
Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization
por: Chen, Zhengyu, et al.
Publicado: (2025)
por: Chen, Zhengyu, et al.
Publicado: (2025)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
por: Chen, Dongping, et al.
Publicado: (2024)
por: Chen, Dongping, et al.
Publicado: (2024)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
por: Chen, Liang, et al.
Publicado: (2025)
por: Chen, Liang, et al.
Publicado: (2025)
Steering LLM Thinking with Budget Guidance
por: Li, Junyan, et al.
Publicado: (2025)
por: Li, Junyan, et al.
Publicado: (2025)
Interleaving Reasoning for Better Text-to-Image Generation
por: Huang, Wenxuan, et al.
Publicado: (2025)
por: Huang, Wenxuan, et al.
Publicado: (2025)
When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment
por: Yan, Hanqi, et al.
Publicado: (2025)
por: Yan, Hanqi, et al.
Publicado: (2025)
Controlling Thinking Speed in Reasoning Models
por: Lin, Zhengkai, et al.
Publicado: (2025)
por: Lin, Zhengkai, et al.
Publicado: (2025)
FlashThink: An Early Exit Method For Efficient Reasoning
por: Jiang, Guochao, et al.
Publicado: (2025)
por: Jiang, Guochao, et al.
Publicado: (2025)
Cross-Lingual Interleaving for Speech Language Models
por: Moumen, Adel, et al.
Publicado: (2025)
por: Moumen, Adel, et al.
Publicado: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
por: Futami, Hayato, et al.
Publicado: (2025)
por: Futami, Hayato, et al.
Publicado: (2025)
Think before you speak: Training Language Models With Pause Tokens
por: Goyal, Sachin, et al.
Publicado: (2023)
por: Goyal, Sachin, et al.
Publicado: (2023)
MANTIS: Interleaved Multi-Image Instruction Tuning
por: Jiang, Dongfu, et al.
Publicado: (2024)
por: Jiang, Dongfu, et al.
Publicado: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
por: Li, Yunxin, et al.
Publicado: (2025)
por: Li, Yunxin, et al.
Publicado: (2025)
Reasoning Beyond Language: A Comprehensive Survey on Latent Chain-of-Thought Reasoning
por: Chen, Xinghao, et al.
Publicado: (2025)
por: Chen, Xinghao, et al.
Publicado: (2025)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
SJD-PAC: Accelerating Speculative Jacobi Decoding via Proactive Drafting and Adaptive Continuation
por: Kang, Jialiang, et al.
Publicado: (2026)
por: Kang, Jialiang, et al.
Publicado: (2026)
ExCP: Extreme LLM Checkpoint Compression via Weight-Momentum Joint Shrinking
por: Li, Wenshuo, et al.
Publicado: (2024)
por: Li, Wenshuo, et al.
Publicado: (2024)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
por: Chen, Chao, et al.
Publicado: (2025)
por: Chen, Chao, et al.
Publicado: (2025)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
por: Li, Chengzu, et al.
Publicado: (2025)
por: Li, Chengzu, et al.
Publicado: (2025)
Efficient Reasoning with Hidden Thinking
por: Shen, Xuan, et al.
Publicado: (2025)
por: Shen, Xuan, et al.
Publicado: (2025)
Scaling Analysis of Interleaved Speech-Text Language Models
por: Maimon, Gallil, et al.
Publicado: (2025)
por: Maimon, Gallil, et al.
Publicado: (2025)
Efficient Interleaved Speech Modeling through Knowledge Distillation
por: Nouriborji, Mohammadmahdi, et al.
Publicado: (2025)
por: Nouriborji, Mohammadmahdi, et al.
Publicado: (2025)
An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents
por: Jin, Bowen, et al.
Publicado: (2025)
por: Jin, Bowen, et al.
Publicado: (2025)
VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
por: Long, Zuwei, et al.
Publicado: (2025)
por: Long, Zuwei, et al.
Publicado: (2025)
AssoCiAm: A Benchmark for Evaluating Association Thinking while Circumventing Ambiguity
por: Liu, Yifan, et al.
Publicado: (2025)
por: Liu, Yifan, et al.
Publicado: (2025)
Alleviating Choice Supportive Bias in LLM with Reasoning Dependency Generation
por: Zhuang, Nan, et al.
Publicado: (2025)
por: Zhuang, Nan, et al.
Publicado: (2025)
AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time
por: Zhang, Junyu, et al.
Publicado: (2025)
por: Zhang, Junyu, et al.
Publicado: (2025)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
por: Tian, Xiaoyu, et al.
Publicado: (2025)
por: Tian, Xiaoyu, et al.
Publicado: (2025)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
por: Bai, Richard He, et al.
Publicado: (2025)
por: Bai, Richard He, et al.
Publicado: (2025)
Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient
por: Li, Changming, et al.
Publicado: (2026)
por: Li, Changming, et al.
Publicado: (2026)
Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization
por: Ye, Wengao, et al.
Publicado: (2025)
por: Ye, Wengao, et al.
Publicado: (2025)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
por: Xie, Roy, et al.
Publicado: (2025)
por: Xie, Roy, et al.
Publicado: (2025)
How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning
por: Zhang, Xiangxiang, et al.
Publicado: (2026)
por: Zhang, Xiangxiang, et al.
Publicado: (2026)
Ejemplares similares
-
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
por: Guo, Ziyu, et al.
Publicado: (2025) -
Multimodal Latent Reasoning via Hierarchical Visual Cues Injection
por: Zhang, Yiming, et al.
Publicado: (2026) -
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025) -
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
por: Zhang, Yiman, et al.
Publicado: (2025) -
Can Speech LLMs Think while Listening?
por: Shih, Yi-Jen, et al.
Publicado: (2025)