Salvato in:
| Autori principali: | Lehnert, Lucas, Sukhbaatar, Sainbayar, Su, DiJia, Zheng, Qinqing, Mcvay, Paul, Rabbat, Michael, Tian, Yuandong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.14083 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces
di: Su, DiJia, et al.
Pubblicazione: (2024)
di: Su, DiJia, et al.
Pubblicazione: (2024)
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
di: Su, DiJia, et al.
Pubblicazione: (2025)
di: Su, DiJia, et al.
Pubblicazione: (2025)
Training Large Language Models to Reason in a Continuous Latent Space
di: Hao, Shibo, et al.
Pubblicazione: (2024)
di: Hao, Shibo, et al.
Pubblicazione: (2024)
GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection
di: Su, DiJia, et al.
Pubblicazione: (2025)
di: Su, DiJia, et al.
Pubblicazione: (2025)
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
di: Ding, Zihan, et al.
Pubblicazione: (2024)
di: Ding, Zihan, et al.
Pubblicazione: (2024)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
di: Wu, Tianhao, et al.
Pubblicazione: (2024)
di: Wu, Tianhao, et al.
Pubblicazione: (2024)
R.I.P.: Better Models by Survival of the Fittest Prompts
di: Yu, Ping, et al.
Pubblicazione: (2025)
di: Yu, Ping, et al.
Pubblicazione: (2025)
Contextual Position Encoding: Learning to Count What's Important
di: Golovneva, Olga, et al.
Pubblicazione: (2024)
di: Golovneva, Olga, et al.
Pubblicazione: (2024)
Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss
di: Xu, Jing, et al.
Pubblicazione: (2023)
di: Xu, Jing, et al.
Pubblicazione: (2023)
Reverse Training to Nurse the Reversal Curse
di: Golovneva, Olga, et al.
Pubblicazione: (2024)
di: Golovneva, Olga, et al.
Pubblicazione: (2024)
Towards General-Purpose Model-Free Reinforcement Learning
di: Fujimoto, Scott, et al.
Pubblicazione: (2025)
di: Fujimoto, Scott, et al.
Pubblicazione: (2025)
Self-Challenging Language Model Agents
di: Zhou, Yifei, et al.
Pubblicazione: (2025)
di: Zhou, Yifei, et al.
Pubblicazione: (2025)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
di: Liu, Yixin, et al.
Pubblicazione: (2026)
di: Liu, Yixin, et al.
Pubblicazione: (2026)
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
di: Zhou, Yifei, et al.
Pubblicazione: (2025)
di: Zhou, Yifei, et al.
Pubblicazione: (2025)
Thinking LLMs: General Instruction Following with Thought Generation
di: Wu, Tianhao, et al.
Pubblicazione: (2024)
di: Wu, Tianhao, et al.
Pubblicazione: (2024)
Provable Scaling Laws of Feature Emergence from Learning Dynamics of Grokking
di: Tian, Yuandong
Pubblicazione: (2025)
di: Tian, Yuandong
Pubblicazione: (2025)
Iterative Reasoning Preference Optimization
di: Pang, Richard Yuanzhe, et al.
Pubblicazione: (2024)
di: Pang, Richard Yuanzhe, et al.
Pubblicazione: (2024)
SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
di: Wang, Chenyu, et al.
Pubblicazione: (2025)
di: Wang, Chenyu, et al.
Pubblicazione: (2025)
Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback
di: Lin, Yen-Ting, et al.
Pubblicazione: (2025)
di: Lin, Yen-Ting, et al.
Pubblicazione: (2025)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
di: Xiong, Wei, et al.
Pubblicazione: (2025)
di: Xiong, Wei, et al.
Pubblicazione: (2025)
Sail into the Headwind: Alignment via Robust Rewards and Dynamic Labels against Reward Hacking
di: Rashidinejad, Paria, et al.
Pubblicazione: (2024)
di: Rashidinejad, Paria, et al.
Pubblicazione: (2024)
Composing Global Solutions to Reasoning Tasks via Algebraic Objects in Neural Nets
di: Tian, Yuandong
Pubblicazione: (2024)
di: Tian, Yuandong
Pubblicazione: (2024)
Self-Rewarding Language Models
di: Yuan, Weizhe, et al.
Pubblicazione: (2024)
di: Yuan, Weizhe, et al.
Pubblicazione: (2024)
JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention
di: Tian, Yuandong, et al.
Pubblicazione: (2023)
di: Tian, Yuandong, et al.
Pubblicazione: (2023)
Multi-Token Attention
di: Golovneva, Olga, et al.
Pubblicazione: (2025)
di: Golovneva, Olga, et al.
Pubblicazione: (2025)
The Path Not Taken: RLVR Provably Learns Off the Principals
di: Zhu, Hanqing, et al.
Pubblicazione: (2025)
di: Zhu, Hanqing, et al.
Pubblicazione: (2025)
CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
di: Yu, Ping, et al.
Pubblicazione: (2025)
di: Yu, Ping, et al.
Pubblicazione: (2025)
Smaller Abstract State Spaces Enable Cross-Scale Generalization in Reinforcement Learning
di: Mustakim, Nasehatul, et al.
Pubblicazione: (2026)
di: Mustakim, Nasehatul, et al.
Pubblicazione: (2026)
Searching Large Neighborhoods for Integer Linear Programs with Contrastive Learning
di: Huang, Taoan, et al.
Pubblicazione: (2023)
di: Huang, Taoan, et al.
Pubblicazione: (2023)
Dual RL: Unification and New Methods for Reinforcement and Imitation Learning
di: Sikchi, Harshit, et al.
Pubblicazione: (2023)
di: Sikchi, Harshit, et al.
Pubblicazione: (2023)
LLM-Guided Semantic Bootstrapping for Interpretable Text Classification with Tsetlin Machines
di: Gao, Jiechao, et al.
Pubblicazione: (2026)
di: Gao, Jiechao, et al.
Pubblicazione: (2026)
Self-Consistency Preference Optimization
di: Prasad, Archiki, et al.
Pubblicazione: (2024)
di: Prasad, Archiki, et al.
Pubblicazione: (2024)
Stochastic activations
di: Lomeli, Maria, et al.
Pubblicazione: (2025)
di: Lomeli, Maria, et al.
Pubblicazione: (2025)
Bootstrapping Human-Like Planning via LLMs
di: Porfirio, David, et al.
Pubblicazione: (2025)
di: Porfirio, David, et al.
Pubblicazione: (2025)
Scalable Option Learning in High-Throughput Environments
di: Henaff, Mikael, et al.
Pubblicazione: (2025)
di: Henaff, Mikael, et al.
Pubblicazione: (2025)
SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation
di: Zhang, Xichen, et al.
Pubblicazione: (2026)
di: Zhang, Xichen, et al.
Pubblicazione: (2026)
Bootstrapping LLMs via Preference-Based Policy Optimization
di: Jia, Chen
Pubblicazione: (2025)
di: Jia, Chen
Pubblicazione: (2025)
Adaptive Decoding via Latent Preference Optimization
di: Dhuliawala, Shehzaad, et al.
Pubblicazione: (2024)
di: Dhuliawala, Shehzaad, et al.
Pubblicazione: (2024)
Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback
di: Zheng, Qinqing, et al.
Pubblicazione: (2024)
di: Zheng, Qinqing, et al.
Pubblicazione: (2024)
Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM
di: Sukhbaatar, Sainbayar, et al.
Pubblicazione: (2024)
di: Sukhbaatar, Sainbayar, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces
di: Su, DiJia, et al.
Pubblicazione: (2024) -
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
di: Su, DiJia, et al.
Pubblicazione: (2025) -
Training Large Language Models to Reason in a Continuous Latent Space
di: Hao, Shibo, et al.
Pubblicazione: (2024) -
GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection
di: Su, DiJia, et al.
Pubblicazione: (2025) -
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
di: Ding, Zihan, et al.
Pubblicazione: (2024)