Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Luo, Feng, Chuang, Yu-Neng, Wang, Guanchu, Xu, Zicheng, Han, Xiaotian, Zhang, Tianyi, Braverman, Vladimir |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-ensemble: Mitigating Confidence Mis-calibration for Large Language Models
di: Xu, Zicheng, et al.
Pubblicazione: (2025)
di: Xu, Zicheng, et al.
Pubblicazione: (2025)
DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching
di: Xu, Zicheng, et al.
Pubblicazione: (2025)
di: Xu, Zicheng, et al.
Pubblicazione: (2025)
AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models
di: Luo, Feng, et al.
Pubblicazione: (2025)
di: Luo, Feng, et al.
Pubblicazione: (2025)
FaithLM: Towards Faithful Explanations for Large Language Models
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024)
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024)
Confident or Seek Stronger: Exploring Uncertainty-Based On-device LLM Routing From Benchmarking to Generalization
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2025)
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2025)
Taylor Unswift: Secured Weight Release for Large Language Models via Taylor Expansion
di: Wang, Guanchu, et al.
Pubblicazione: (2024)
di: Wang, Guanchu, et al.
Pubblicazione: (2024)
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
di: Sui, Yang, et al.
Pubblicazione: (2025)
di: Sui, Yang, et al.
Pubblicazione: (2025)
Demystifying Verbatim Memorization in Large Language Models
di: Huang, Jing, et al.
Pubblicazione: (2024)
di: Huang, Jing, et al.
Pubblicazione: (2024)
DP-OPD: Differentially Private On-Policy Distillation for Language Models
di: Khadem, Fatemeh, et al.
Pubblicazione: (2026)
di: Khadem, Fatemeh, et al.
Pubblicazione: (2026)
Random Text, Zipf's Law, Critical Length,and Implications for Large Language Models
di: Berman, Vladimir
Pubblicazione: (2025)
di: Berman, Vladimir
Pubblicazione: (2025)
Demystifying Embedding Spaces using Large Language Models
di: Tennenholtz, Guy, et al.
Pubblicazione: (2023)
di: Tennenholtz, Guy, et al.
Pubblicazione: (2023)
Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
di: Wang, Shouren, et al.
Pubblicazione: (2025)
di: Wang, Shouren, et al.
Pubblicazione: (2025)
Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning
di: Li, Zichao, et al.
Pubblicazione: (2026)
di: Li, Zichao, et al.
Pubblicazione: (2026)
Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
di: Tong, Weixi, et al.
Pubblicazione: (2024)
di: Tong, Weixi, et al.
Pubblicazione: (2024)
OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification
di: Zhou, Yuhang, et al.
Pubblicazione: (2026)
di: Zhou, Yuhang, et al.
Pubblicazione: (2026)
LAS: Loss-less ANN-SNN Conversion for Fully Spike-Driven Large Language Models
di: Chen, Long, et al.
Pubblicazione: (2025)
di: Chen, Long, et al.
Pubblicazione: (2025)
SELF: Self-Extend the Context Length With Logistic Growth Function
di: Dang, Phat Thanh, et al.
Pubblicazione: (2025)
di: Dang, Phat Thanh, et al.
Pubblicazione: (2025)
Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct Decoding
di: Yi, Hanling, et al.
Pubblicazione: (2024)
di: Yi, Hanling, et al.
Pubblicazione: (2024)
Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents
di: Yang, Tiannuo, et al.
Pubblicazione: (2025)
di: Yang, Tiannuo, et al.
Pubblicazione: (2025)
BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models
di: Lin, Feng, et al.
Pubblicazione: (2024)
di: Lin, Feng, et al.
Pubblicazione: (2024)
Demystifying Language Model Forgetting with Low-rank Example Associations
di: Jin, Xisen, et al.
Pubblicazione: (2024)
di: Jin, Xisen, et al.
Pubblicazione: (2024)
Demystifying Low-Rank Knowledge Distillation in Large Language Models: Convergence, Generalization, and Information-Theoretic Guarantees
di: Soarez, Alberlucia Rafael, et al.
Pubblicazione: (2026)
di: Soarez, Alberlucia Rafael, et al.
Pubblicazione: (2026)
Hansel: Output Length Controlling Framework for Large Language Models
di: Song, Seoha, et al.
Pubblicazione: (2024)
di: Song, Seoha, et al.
Pubblicazione: (2024)
The Role of Deductive and Inductive Reasoning in Large Language Models
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
FairPy: A Toolkit for Evaluation of Prediction Biases and their Mitigation in Large Language Models
di: Viswanath, Hrishikesh, et al.
Pubblicazione: (2023)
di: Viswanath, Hrishikesh, et al.
Pubblicazione: (2023)
MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate
di: Wang, Jianze, et al.
Pubblicazione: (2026)
di: Wang, Jianze, et al.
Pubblicazione: (2026)
Intrinsic Entropy of Context Length Scaling in LLMs
di: Shi, Jingzhe, et al.
Pubblicazione: (2025)
di: Shi, Jingzhe, et al.
Pubblicazione: (2025)
Breaking the Frozen Subspace: Importance Sampling for Low-Rank Optimization in LLM Pretraining
di: Zhang, Haochen, et al.
Pubblicazione: (2025)
di: Zhang, Haochen, et al.
Pubblicazione: (2025)
Draft-OPD: On-Policy Distillation for Speculative Draft Models
di: Lei, Haodi, et al.
Pubblicazione: (2026)
di: Lei, Haodi, et al.
Pubblicazione: (2026)
Learning to Compress Prompt in Natural Language Formats
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024)
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024)
Demystifying Singular Defects in Large Language Models
di: Wang, Haoqi, et al.
Pubblicazione: (2025)
di: Wang, Haoqi, et al.
Pubblicazione: (2025)
Fast and Effective Weight Update for Pruned Large Language Models
di: Boža, Vladimír
Pubblicazione: (2024)
di: Boža, Vladimír
Pubblicazione: (2024)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning
di: Hu, Chenzhi, et al.
Pubblicazione: (2026)
di: Hu, Chenzhi, et al.
Pubblicazione: (2026)
Assessing and Enhancing Large Language Models in Rare Disease Question-answering
di: Wang, Guanchu, et al.
Pubblicazione: (2024)
di: Wang, Guanchu, et al.
Pubblicazione: (2024)
Winner-Take-All Column Row Sampling for Memory Efficient Adaptation of Language Model
di: Liu, Zirui, et al.
Pubblicazione: (2023)
di: Liu, Zirui, et al.
Pubblicazione: (2023)
Active Layer-Contrastive Decoding Reduces Hallucination in Large Language Model Generation
di: Zhang, Hongxiang, et al.
Pubblicazione: (2025)
di: Zhang, Hongxiang, et al.
Pubblicazione: (2025)
Automated Alignment of Math Items to Content Standards in Large-Scale Assessments Using Language Models
di: Xu, Qingshu, et al.
Pubblicazione: (2025)
di: Xu, Qingshu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Self-ensemble: Mitigating Confidence Mis-calibration for Large Language Models
di: Xu, Zicheng, et al.
Pubblicazione: (2025) -
DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching
di: Xu, Zicheng, et al.
Pubblicazione: (2025) -
AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models
di: Luo, Feng, et al.
Pubblicazione: (2025) -
FaithLM: Towards Faithful Explanations for Large Language Models
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024) -
Confident or Seek Stronger: Exploring Uncertainty-Based On-device LLM Routing From Benchmarking to Generalization
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2025)