Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiang, Violet, Snell, Charlie, Gandhi, Kanishk, Albalak, Alon, Singh, Anikait, Blagden, Chase, Phung, Duy, Rafailov, Rafael, Lile, Nathan, Mahan, Dakota, Castricato, Louis, Franken, Jan-Philipp, Haber, Nick, Finn, Chelsea |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
di: Albalak, Alon, et al.
Pubblicazione: (2025)
di: Albalak, Alon, et al.
Pubblicazione: (2025)
Generative Reward Models
di: Mahan, Dakota, et al.
Pubblicazione: (2024)
di: Mahan, Dakota, et al.
Pubblicazione: (2024)
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
di: Xiang, Violet, et al.
Pubblicazione: (2025)
di: Xiang, Violet, et al.
Pubblicazione: (2025)
PERSONA: A Reproducible Testbed for Pluralistic Alignment
di: Castricato, Louis, et al.
Pubblicazione: (2024)
di: Castricato, Louis, et al.
Pubblicazione: (2024)
Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)
Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models
di: Havrilla, Alex, et al.
Pubblicazione: (2024)
di: Havrilla, Alex, et al.
Pubblicazione: (2024)
Self-Supervised Alignment with Mutual Information: Learning to Follow Principles without Preference Labels
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing
di: Fein, Daniel, et al.
Pubblicazione: (2025)
di: Fein, Daniel, et al.
Pubblicazione: (2025)
From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Disentangling Length from Quality in Direct Preference Optimization
di: Park, Ryan, et al.
Pubblicazione: (2024)
di: Park, Ryan, et al.
Pubblicazione: (2024)
Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
di: Tajwar, Fahim, et al.
Pubblicazione: (2024)
di: Tajwar, Fahim, et al.
Pubblicazione: (2024)
Suppressing Pink Elephants with Direct Principle Feedback
di: Castricato, Louis, et al.
Pubblicazione: (2024)
di: Castricato, Louis, et al.
Pubblicazione: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
Efficient Imitation Learning with Conservative World Models
di: Kolev, Victor, et al.
Pubblicazione: (2024)
di: Kolev, Victor, et al.
Pubblicazione: (2024)
Stable Code Technical Report
di: Pinnaparaju, Nikhil, et al.
Pubblicazione: (2024)
di: Pinnaparaju, Nikhil, et al.
Pubblicazione: (2024)
Non-literal Understanding of Number Words by Language Models
di: Tsvilodub, Polina, et al.
Pubblicazione: (2025)
di: Tsvilodub, Polina, et al.
Pubblicazione: (2025)
Procedural Dilemma Generation for Evaluating Moral Reasoning in Humans and Language Models
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
Women's Studies: An Examination of Library Use by Researchers in the Field with Special Reference to the Fawcett Library. Library Research Digest No. 14.
di: Blagden, Pauline
Pubblicazione: (1985)
di: Blagden, Pauline
Pubblicazione: (1985)
The Library Needs of Part-Time Students Preparing for Professional Examinations. Library Research Digest No. 10.
di: Blagden, Pauline
Pubblicazione: (1984)
di: Blagden, Pauline
Pubblicazione: (1984)
Are demographics destiny?
di: Jim Blagden
Pubblicazione: (2024)
di: Jim Blagden
Pubblicazione: (2024)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Test-Time Alignment via Hypothesis Reweighting
di: Lee, Yoonho, et al.
Pubblicazione: (2024)
di: Lee, Yoonho, et al.
Pubblicazione: (2024)
D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Reasoning Models Can Be Effective Without Thinking
di: Ma, Wenjie, et al.
Pubblicazione: (2025)
di: Ma, Wenjie, et al.
Pubblicazione: (2025)
MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)
One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
di: Fein, Daniel, et al.
Pubblicazione: (2026)
di: Fein, Daniel, et al.
Pubblicazione: (2026)
Hypothetical Minds: Scaffolding Theory of Mind for Multi-Agent Tasks with Large Language Models
di: Cross, Logan, et al.
Pubblicazione: (2024)
di: Cross, Logan, et al.
Pubblicazione: (2024)
Report on Malay Studies
di: Blagden, Charles Otto
Pubblicazione: (1921)
di: Blagden, Charles Otto
Pubblicazione: (1921)
EARLY INDO-CHINESE INFLUENCE IN THE MALAY PENINSULA. As Illustrated by Some of the Dialects of the Aboriginal Tribes
di: Blagden, Charles Otto
Pubblicazione: (1894)
di: Blagden, Charles Otto
Pubblicazione: (1894)
MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation
di: Juneja, Gurusha, et al.
Pubblicazione: (2025)
di: Juneja, Gurusha, et al.
Pubblicazione: (2025)
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
di: Putta, Pranav, et al.
Pubblicazione: (2024)
di: Putta, Pranav, et al.
Pubblicazione: (2024)
Learning to Simulate Human Dialogue
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
di: Singh, Anikait, et al.
Pubblicazione: (2025)
di: Singh, Anikait, et al.
Pubblicazione: (2025)
Thinking and Killing
di: Segev, Alon
Pubblicazione: (2018)
di: Segev, Alon
Pubblicazione: (2018)
Contrastive Preference Learning: Learning from Human Feedback without RL
di: Hejna, Joey, et al.
Pubblicazione: (2023)
di: Hejna, Joey, et al.
Pubblicazione: (2023)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
Learning Next Action Predictors from Human-Computer Interaction
di: Shaikh, Omar, et al.
Pubblicazione: (2026)
di: Shaikh, Omar, et al.
Pubblicazione: (2026)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Robotic Control via Embodied Chain-of-Thought Reasoning
di: Zawalski, Michał, et al.
Pubblicazione: (2024)
di: Zawalski, Michał, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
di: Albalak, Alon, et al.
Pubblicazione: (2025) -
Generative Reward Models
di: Mahan, Dakota, et al.
Pubblicazione: (2024) -
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
di: Xiang, Violet, et al.
Pubblicazione: (2025) -
PERSONA: A Reproducible Testbed for Pluralistic Alignment
di: Castricato, Louis, et al.
Pubblicazione: (2024) -
Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)