Universal YOCO for Efficient Depth Scaling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Yutao, Dong, Li, Ye, Tianzhu, Huang, Shaohan, Wang, Jianyong, Wei, Furu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On-Policy Context Distillation for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026)
par: Ye, Tianzhu, et autres
Publié: (2026)
Online Experiential Learning for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026)
par: Ye, Tianzhu, et autres
Publié: (2026)
Black-Box On-Policy Distillation of Large Language Models
par: Ye, Tianzhu, et autres
Publié: (2025)
par: Ye, Tianzhu, et autres
Publié: (2025)
Multimodal Latent Language Modeling with Next-Token Diffusion
par: Sun, Yutao, et autres
Publié: (2024)
par: Sun, Yutao, et autres
Publié: (2024)
Rectified Sparse Attention
par: Sun, Yutao, et autres
Publié: (2025)
par: Sun, Yutao, et autres
Publié: (2025)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
par: Sun, Yutao, et autres
Publié: (2024)
par: Sun, Yutao, et autres
Publié: (2024)
Reinforcement Pre-Training
par: Dong, Qingxiu, et autres
Publié: (2025)
par: Dong, Qingxiu, et autres
Publié: (2025)
YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2026)
par: Wu, You, et autres
Publié: (2026)
Differential Transformer
par: Ye, Tianzhu, et autres
Publié: (2024)
par: Ye, Tianzhu, et autres
Publié: (2024)
Adapting Large Language Models to Domains via Reading Comprehension
par: Cheng, Daixuan, et autres
Publié: (2023)
par: Cheng, Daixuan, et autres
Publié: (2023)
Thinking Augmented Pre-training
par: Wang, Liang, et autres
Publié: (2025)
par: Wang, Liang, et autres
Publié: (2025)
Mixture of LoRA Experts
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
MH-MoE: Multi-Head Mixture-of-Experts
par: Huang, Shaohan, et autres
Publié: (2024)
par: Huang, Shaohan, et autres
Publié: (2024)
Multi-Head Mixture-of-Experts
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
Reward Reasoning Model
par: Guo, Jiaxin, et autres
Publié: (2025)
par: Guo, Jiaxin, et autres
Publié: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
par: Pan, Xichen, et autres
Publié: (2023)
par: Pan, Xichen, et autres
Publié: (2023)
On-Policy RL with Optimal Reward Baseline
par: Hao, Yaru, et autres
Publié: (2025)
par: Hao, Yaru, et autres
Publié: (2025)
Textual Aesthetics in Large Language Models
par: Jiang, Lingjie, et autres
Publié: (2024)
par: Jiang, Lingjie, et autres
Publié: (2024)
The Era of Agentic Organization: Learning to Organize with Language Models
par: Chi, Zewen, et autres
Publié: (2025)
par: Chi, Zewen, et autres
Publié: (2025)
BitNet Distillation
par: Wu, Xun, et autres
Publié: (2025)
par: Wu, Xun, et autres
Publié: (2025)
Instruction Pre-Training: Language Models are Supervised Multitask Learners
par: Cheng, Daixuan, et autres
Publié: (2024)
par: Cheng, Daixuan, et autres
Publié: (2024)
Efficient Attention Mechanisms for Large Language Models: A Survey
par: Sun, Yutao, et autres
Publié: (2025)
par: Sun, Yutao, et autres
Publié: (2025)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
par: Jiang, Lingjie, et autres
Publié: (2025)
par: Jiang, Lingjie, et autres
Publié: (2025)
$Se^2$: Sequential Example Selection for In-Context Learning
par: Liu, Haoyu, et autres
Publié: (2024)
par: Liu, Haoyu, et autres
Publié: (2024)
MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning
par: Jiang, Ting, et autres
Publié: (2024)
par: Jiang, Ting, et autres
Publié: (2024)
Think Only When You Need with Large Hybrid-Reasoning Models
par: Jiang, Lingjie, et autres
Publié: (2025)
par: Jiang, Lingjie, et autres
Publié: (2025)
HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition
par: Liu, Yuxuan, et autres
Publié: (2024)
par: Liu, Yuxuan, et autres
Publié: (2024)
Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models
par: Li, Zongqian, et autres
Publié: (2026)
par: Li, Zongqian, et autres
Publié: (2026)
Code Aesthetics with Agentic Reward Feedback
par: Xiao, Bang, et autres
Publié: (2025)
par: Xiao, Bang, et autres
Publié: (2025)
Reasoning with Exploration: An Entropy Perspective
par: Cheng, Daixuan, et autres
Publié: (2025)
par: Cheng, Daixuan, et autres
Publié: (2025)
The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
par: Ma, Shuming, et autres
Publié: (2024)
par: Ma, Shuming, et autres
Publié: (2024)
Maximum Score Routing For Mixture-of-Experts
par: Dong, Bowen, et autres
Publié: (2025)
par: Dong, Bowen, et autres
Publié: (2025)
Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problems
par: Li, Zongqian, et autres
Publié: (2026)
par: Li, Zongqian, et autres
Publié: (2026)
VibeVoice Technical Report
par: Peng, Zhiliang, et autres
Publié: (2025)
par: Peng, Zhiliang, et autres
Publié: (2025)
WildLong: Synthesizing Realistic Long-Context Instruction Data at Scale
par: Li, Jiaxi, et autres
Publié: (2025)
par: Li, Jiaxi, et autres
Publié: (2025)
Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts
par: Zhang, Di, et autres
Publié: (2025)
par: Zhang, Di, et autres
Publié: (2025)
Little Giants: Synthesizing High-Quality Embedding Data at Scale
par: Chen, Haonan, et autres
Publié: (2024)
par: Chen, Haonan, et autres
Publié: (2024)
GeAR: Generation Augmented Retrieval
par: Liu, Haoyu, et autres
Publié: (2025)
par: Liu, Haoyu, et autres
Publié: (2025)
Improving Domain Adaptation through Extended-Text Reading Comprehension
par: Jiang, Ting, et autres
Publié: (2024)
par: Jiang, Ting, et autres
Publié: (2024)
BitNet b1.58 2B4T Technical Report
par: Ma, Shuming, et autres
Publié: (2025)
par: Ma, Shuming, et autres
Publié: (2025)
Documents similaires
-
On-Policy Context Distillation for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026) -
Online Experiential Learning for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026) -
Black-Box On-Policy Distillation of Large Language Models
par: Ye, Tianzhu, et autres
Publié: (2025) -
Multimodal Latent Language Modeling with Next-Token Diffusion
par: Sun, Yutao, et autres
Publié: (2024) -
Rectified Sparse Attention
par: Sun, Yutao, et autres
Publié: (2025)