Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Shaoning, Cai, Mingzhu, He, Huang, Chen, Bingjin, Bao, Siqi, Yang, Yujiu, Wu, Hua, Wang, Haifeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reward Modeling from Natural Language Human Feedback
di: Wang, Zongqi, et al.
Pubblicazione: (2026)
di: Wang, Zongqi, et al.
Pubblicazione: (2026)
S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models
di: Sun, Shaoning, et al.
Pubblicazione: (2025)
di: Sun, Shaoning, et al.
Pubblicazione: (2025)
A Novel Self-Evolution Framework for Large Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection
di: Liu, Tao, et al.
Pubblicazione: (2026)
di: Liu, Tao, et al.
Pubblicazione: (2026)
Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning
di: Yang, Xuewei, et al.
Pubblicazione: (2026)
di: Yang, Xuewei, et al.
Pubblicazione: (2026)
Towards Boosting Many-to-Many Multilingual Machine Translation with Large Language Models
di: Gao, Pengzhi, et al.
Pubblicazione: (2024)
di: Gao, Pengzhi, et al.
Pubblicazione: (2024)
ProxyAttn: Guided Sparse Attention via Representative Heads
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
SCAN: Structured Capability Assessment and Navigation for LLMs
di: Wang, Zongqi, et al.
Pubblicazione: (2025)
di: Wang, Zongqi, et al.
Pubblicazione: (2025)
Mixture of Hidden-Dimensions Transformer
di: Chen, Yilong, et al.
Pubblicazione: (2024)
di: Chen, Yilong, et al.
Pubblicazione: (2024)
Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning
di: Li, Gengyang, et al.
Pubblicazione: (2026)
di: Li, Gengyang, et al.
Pubblicazione: (2026)
Hierarchical Memory for High-Efficiency Long-Term Reasoning in LLM Agents
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
SongSage: A Large Musical Language Model with Lyric Generative Pre-training
di: Guo, Jiani, et al.
Pubblicazione: (2026)
di: Guo, Jiani, et al.
Pubblicazione: (2026)
LLM-NEO: Parameter Efficient Knowledge Distillation for Large Language Models
di: Yang, Runming, et al.
Pubblicazione: (2024)
di: Yang, Runming, et al.
Pubblicazione: (2024)
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
di: Wu, Pengfei, et al.
Pubblicazione: (2024)
di: Wu, Pengfei, et al.
Pubblicazione: (2024)
Advantageous Parameter Expansion Training Makes Better Large Language Models
di: Gu, Naibin, et al.
Pubblicazione: (2025)
di: Gu, Naibin, et al.
Pubblicazione: (2025)
LiFi: Lightweight Controlled Text Generation with Fine-Grained Control Codes
di: Shi, Chufan, et al.
Pubblicazione: (2024)
di: Shi, Chufan, et al.
Pubblicazione: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2026)
di: Xu, Xin, et al.
Pubblicazione: (2026)
InsCL: A Data-efficient Continual Learning Paradigm for Fine-tuning Large Language Models with Instructions
di: Wang, Yifan, et al.
Pubblicazione: (2024)
di: Wang, Yifan, et al.
Pubblicazione: (2024)
LLM2: Let Large Language Models Harness System 2 Reasoning
di: Yang, Cheng, et al.
Pubblicazione: (2024)
di: Yang, Cheng, et al.
Pubblicazione: (2024)
A Survey on the Honesty of Large Language Models
di: Li, Siheng, et al.
Pubblicazione: (2024)
di: Li, Siheng, et al.
Pubblicazione: (2024)
Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate
di: Liang, Tian, et al.
Pubblicazione: (2023)
di: Liang, Tian, et al.
Pubblicazione: (2023)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
DFA-RAG: Conversational Semantic Router for Large Language Model with Definite Finite Automaton
di: Sun, Yiyou, et al.
Pubblicazione: (2024)
di: Sun, Yiyou, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Cost-Effective, Multilingual Depression Detection and Severity Assessment
di: Xian, Longdi, et al.
Pubblicazione: (2025)
di: Xian, Longdi, et al.
Pubblicazione: (2025)
Large Language Models Can Self-Improve in Long-context Reasoning
di: Li, Siheng, et al.
Pubblicazione: (2024)
di: Li, Siheng, et al.
Pubblicazione: (2024)
Preference-Aware Memory Update for Long-Term LLM Agents
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
AlignX: Advancing Multilingual Large Language Models with Multilingual Representation Alignment
di: Bu, Mengyu, et al.
Pubblicazione: (2025)
di: Bu, Mengyu, et al.
Pubblicazione: (2025)
ToM: Leveraging Tree-oriented MapReduce for Long-Context Reasoning in Large Language Models
di: Guo, Jiani, et al.
Pubblicazione: (2025)
di: Guo, Jiani, et al.
Pubblicazione: (2025)
Assessing the Performance of Chinese Open Source Large Language Models in Information Extraction Tasks
di: Cai, Yida, et al.
Pubblicazione: (2024)
di: Cai, Yida, et al.
Pubblicazione: (2024)
Mitigating Hidden Confounding by Progressive Confounder Imputation via Large Language Models
di: Yang, Hao, et al.
Pubblicazione: (2025)
di: Yang, Hao, et al.
Pubblicazione: (2025)
CLLMs: Consistency Large Language Models
di: Kou, Siqi, et al.
Pubblicazione: (2024)
di: Kou, Siqi, et al.
Pubblicazione: (2024)
From Critique to Clarity: A Pathway to Faithful and Personalized Code Explanations with Large Language Models
di: Xu, Zexing, et al.
Pubblicazione: (2024)
di: Xu, Zexing, et al.
Pubblicazione: (2024)
Hint-enhanced In-Context Learning wakes Large Language Models up for knowledge-intensive tasks
di: Wang, Yifan, et al.
Pubblicazione: (2023)
di: Wang, Yifan, et al.
Pubblicazione: (2023)
DenseMamba: State Space Models with Dense Hidden Connection for Efficient Large Language Models
di: He, Wei, et al.
Pubblicazione: (2024)
di: He, Wei, et al.
Pubblicazione: (2024)
LoCa: Logit Calibration for Knowledge Distillation
di: Yang, Runming, et al.
Pubblicazione: (2024)
di: Yang, Runming, et al.
Pubblicazione: (2024)
Large Language Models as Carriers of Hidden Messages
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2024)
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2024)
Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
di: Guo, Qingyan, et al.
Pubblicazione: (2024)
di: Guo, Qingyan, et al.
Pubblicazione: (2024)
HoLLMwood: Unleashing the Creativity of Large Language Models in Screenwriting via Role Playing
di: Chen, Jing, et al.
Pubblicazione: (2024)
di: Chen, Jing, et al.
Pubblicazione: (2024)
Induced Numerical Instability: Hidden Costs in Multimodal Large Language Models
di: Wong, Wai Tuck, et al.
Pubblicazione: (2026)
di: Wong, Wai Tuck, et al.
Pubblicazione: (2026)
PretrainRL: Alleviating Factuality Hallucination of Large Language Models at the Beginning
di: Liu, Langming, et al.
Pubblicazione: (2026)
di: Liu, Langming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Reward Modeling from Natural Language Human Feedback
di: Wang, Zongqi, et al.
Pubblicazione: (2026) -
S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models
di: Sun, Shaoning, et al.
Pubblicazione: (2025) -
A Novel Self-Evolution Framework for Large Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025) -
ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection
di: Liu, Tao, et al.
Pubblicazione: (2026) -
Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning
di: Yang, Xuewei, et al.
Pubblicazione: (2026)