Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Puri, Isha, Damani, Mehul, Shenfeld, Idan, Ghassemi, Marzyeh, Andreas, Jacob, Kim, Yoon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
di: Damani, Mehul, et al.
Pubblicazione: (2025)
di: Damani, Mehul, et al.
Pubblicazione: (2025)
Learning How Hard to Think: Input-Adaptive Allocation of LM Computation
di: Damani, Mehul, et al.
Pubblicazione: (2024)
di: Damani, Mehul, et al.
Pubblicazione: (2024)
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2026)
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2026)
Value Augmented Sampling for Language Model Alignment and Personalization
di: Han, Seungwook, et al.
Pubblicazione: (2024)
di: Han, Seungwook, et al.
Pubblicazione: (2024)
The Surprising Effectiveness of Test-Time Training for Few-Shot Learning
di: Akyürek, Ekin, et al.
Pubblicazione: (2024)
di: Akyürek, Ekin, et al.
Pubblicazione: (2024)
SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
di: Xiao, Yuxin, et al.
Pubblicazione: (2024)
di: Xiao, Yuxin, et al.
Pubblicazione: (2024)
Aligning Language Models from User Interactions
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2026)
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2026)
Self-Distillation Enables Continual Learning
di: Shenfeld, Idan, et al.
Pubblicazione: (2026)
di: Shenfeld, Idan, et al.
Pubblicazione: (2026)
KScope: A Framework for Characterizing the Knowledge Status of Language Models
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
Latency and Token-Aware Test-Time Compute
di: Huang, Jenny Y., et al.
Pubblicazione: (2025)
di: Huang, Jenny Y., et al.
Pubblicazione: (2025)
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions
di: Chan, Yik Siu, et al.
Pubblicazione: (2025)
di: Chan, Yik Siu, et al.
Pubblicazione: (2025)
Curiosity-driven Red-teaming for Large Language Models
di: Hong, Zhang-Wei, et al.
Pubblicazione: (2024)
di: Hong, Zhang-Wei, et al.
Pubblicazione: (2024)
When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
On the Optimal Reasoning Length for RL-Trained Language Models
di: Nohara, Daisuke, et al.
Pubblicazione: (2026)
di: Nohara, Daisuke, et al.
Pubblicazione: (2026)
FlowRL: Matching Reward Distributions for LLM Reasoning
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models
di: Jha, Basab, et al.
Pubblicazione: (2025)
di: Jha, Basab, et al.
Pubblicazione: (2025)
Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models
di: Sun, Shaoning, et al.
Pubblicazione: (2026)
di: Sun, Shaoning, et al.
Pubblicazione: (2026)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
di: Zhang, Shenao, et al.
Pubblicazione: (2025)
di: Zhang, Shenao, et al.
Pubblicazione: (2025)
LoPT: Low-Rank Prompt Tuning for Parameter Efficient Language Models
di: Guo, Shouchang, et al.
Pubblicazione: (2024)
di: Guo, Shouchang, et al.
Pubblicazione: (2024)
RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
di: Zha, Kaiwen, et al.
Pubblicazione: (2025)
di: Zha, Kaiwen, et al.
Pubblicazione: (2025)
MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making
di: Kim, Yubin, et al.
Pubblicazione: (2024)
di: Kim, Yubin, et al.
Pubblicazione: (2024)
ELF: Embedded Language Flows
di: Hu, Keya, et al.
Pubblicazione: (2026)
di: Hu, Keya, et al.
Pubblicazione: (2026)
Atlas-Alignment: Making Interpretability Transferable Across Language Models
di: Puri, Bruno, et al.
Pubblicazione: (2025)
di: Puri, Bruno, et al.
Pubblicazione: (2025)
AutoTask: Task Aware Multi-Faceted Single Model for Multi-Task Ads Relevance
di: Guo, Shouchang, et al.
Pubblicazione: (2024)
di: Guo, Shouchang, et al.
Pubblicazione: (2024)
MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering
di: Hao, Yuexing, et al.
Pubblicazione: (2025)
di: Hao, Yuexing, et al.
Pubblicazione: (2025)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
Can AI Relate: Testing Large Language Model Response for Mental Health Support
di: Gabriel, Saadia, et al.
Pubblicazione: (2024)
di: Gabriel, Saadia, et al.
Pubblicazione: (2024)
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
di: Kang, Deokhyung, et al.
Pubblicazione: (2025)
di: Kang, Deokhyung, et al.
Pubblicazione: (2025)
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
di: Kabir, Muhammad Rafsan, et al.
Pubblicazione: (2024)
di: Kabir, Muhammad Rafsan, et al.
Pubblicazione: (2024)
Lexicon-Level Contrastive Visual-Grounding Improves Language Modeling
di: Zhuang, Chengxu, et al.
Pubblicazione: (2024)
di: Zhuang, Chengxu, et al.
Pubblicazione: (2024)
Training Language Models to Explain Their Own Computations
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
Circuit Insights: Towards Interpretability Beyond Activations
di: Golimblevskaia, Elena, et al.
Pubblicazione: (2025)
di: Golimblevskaia, Elena, et al.
Pubblicazione: (2025)
Learning to Interpret Weight Differences in Language Models
di: Goel, Avichal, et al.
Pubblicazione: (2025)
di: Goel, Avichal, et al.
Pubblicazione: (2025)
(How) Do Language Models Track State?
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
Chain of Simulation: A Dual-Mode Reasoning Framework for Large Language Models with Dynamic Problem Routing
di: Sheikhi, Saeid
Pubblicazione: (2026)
di: Sheikhi, Saeid
Pubblicazione: (2026)
CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities
di: Mao, Yujun, et al.
Pubblicazione: (2024)
di: Mao, Yujun, et al.
Pubblicazione: (2024)
GLIDE-RL: Grounded Language Instruction through DEmonstration in RL
di: Kharyal, Chaitanya, et al.
Pubblicazione: (2024)
di: Kharyal, Chaitanya, et al.
Pubblicazione: (2024)
Evaluating the Limits of Large Language Models in Multilingual Legal Reasoning
di: Ioannou, Antreas, et al.
Pubblicazione: (2025)
di: Ioannou, Antreas, et al.
Pubblicazione: (2025)
Self-Training Elicits Concise Reasoning in Large Language Models
di: Munkhbat, Tergel, et al.
Pubblicazione: (2025)
di: Munkhbat, Tergel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
di: Damani, Mehul, et al.
Pubblicazione: (2025) -
Learning How Hard to Think: Input-Adaptive Allocation of LM Computation
di: Damani, Mehul, et al.
Pubblicazione: (2024) -
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2026) -
Value Augmented Sampling for Language Model Alignment and Personalization
di: Han, Seungwook, et al.
Pubblicazione: (2024) -
The Surprising Effectiveness of Test-Time Training for Few-Shot Learning
di: Akyürek, Ekin, et al.
Pubblicazione: (2024)