Enregistré dans:
| Auteurs principaux: | Gloeckle, Fabian, Rammal, Ahmad, Arnal, Charles, Munos, Remi, Cabannes, Vivien, Synnaeve, Gabriel, Hayat, Amaury |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.03071 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Formalizing Mathematics at Scale
par: Rammal, Ahmad, et autres
Publié: (2026)
par: Rammal, Ahmad, et autres
Publié: (2026)
Touring sampling with pushforward maps
par: Cabannes, Vivien, et autres
Publié: (2023)
par: Cabannes, Vivien, et autres
Publié: (2023)
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
par: Peyronnet, Antoine, et autres
Publié: (2026)
par: Peyronnet, Antoine, et autres
Publié: (2026)
WybeCoder: Verified Imperative Code Generation
par: Gloeckle, Fabian, et autres
Publié: (2026)
par: Gloeckle, Fabian, et autres
Publié: (2026)
Provable Benefits of In-Tool Learning for Large Language Models
par: Houliston, Sam, et autres
Publié: (2025)
par: Houliston, Sam, et autres
Publié: (2025)
Learning with Hidden Factorial Structure
par: Arnal, Charles, et autres
Publié: (2024)
par: Arnal, Charles, et autres
Publié: (2024)
Efficient RL Training for LLMs with Experience Replay
par: Arnal, Charles, et autres
Publié: (2026)
par: Arnal, Charles, et autres
Publié: (2026)
Distilling LLM Feedback for Lean Theorem Proving
par: Narozniak, Gaetan, et autres
Publié: (2026)
par: Narozniak, Gaetan, et autres
Publié: (2026)
Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards
par: Arnal, Charles, et autres
Publié: (2025)
par: Arnal, Charles, et autres
Publié: (2025)
Iteration Head: A Mechanistic Study of Chain-of-Thought
par: Cabannes, Vivien, et autres
Publié: (2024)
par: Cabannes, Vivien, et autres
Publié: (2024)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
par: Cohen, Taco, et autres
Publié: (2025)
par: Cohen, Taco, et autres
Publié: (2025)
The Galerkin method beats Graph-Based Approaches for Spectral Algorithms
par: Cabannes, Vivien, et autres
Publié: (2023)
par: Cabannes, Vivien, et autres
Publié: (2023)
Mode Estimation with Partial Feedback
par: Arnal, Charles, et autres
Publié: (2024)
par: Arnal, Charles, et autres
Publié: (2024)
Learning Associative Memories with Gradient Descent
par: Cabannes, Vivien, et autres
Publié: (2024)
par: Cabannes, Vivien, et autres
Publié: (2024)
Super-Exponential Regret for UCT, AlphaGo and Variants
par: Orseau, Laurent, et autres
Publié: (2024)
par: Orseau, Laurent, et autres
Publié: (2024)
Scaling Laws for Associative Memories
par: Cabannes, Vivien, et autres
Publié: (2023)
par: Cabannes, Vivien, et autres
Publié: (2023)
Optimizing Language Models for Inference Time Objectives using Reinforcement Learning
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
Short window attention enables long-term memorization
par: Cabannes, Loïc, et autres
Publié: (2025)
par: Cabannes, Loïc, et autres
Publié: (2025)
Stochastic activations
par: Lomeli, Maria, et autres
Publié: (2025)
par: Lomeli, Maria, et autres
Publié: (2025)
Spectral bandits
par: Kocák, Tomáš, et autres
Publié: (2026)
par: Kocák, Tomáš, et autres
Publié: (2026)
Positional Encoding via Token-Aware Phase Attention
par: Wang, Yu, et autres
Publié: (2025)
par: Wang, Yu, et autres
Publié: (2025)
ProofOptimizer: Training Language Models to Simplify Proofs without Human Demonstrations
par: Gu, Alex, et autres
Publié: (2025)
par: Gu, Alex, et autres
Publié: (2025)
A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
par: Sancaktar, Cansu, et autres
Publié: (2026)
par: Sancaktar, Cansu, et autres
Publié: (2026)
Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
par: Hassid, Michael, et autres
Publié: (2025)
par: Hassid, Michael, et autres
Publié: (2025)
Correlated Quantization for Faster Nonconvex Distributed Optimization
par: Panferov, Andrei, et autres
Publié: (2024)
par: Panferov, Andrei, et autres
Publié: (2024)
Temporal Difference Flows
par: Farebrother, Jesse, et autres
Publié: (2025)
par: Farebrother, Jesse, et autres
Publié: (2025)
Better & Faster Large Language Models via Multi-token Prediction
par: Gloeckle, Fabian, et autres
Publié: (2024)
par: Gloeckle, Fabian, et autres
Publié: (2024)
The KoLMogorov Test: Compression by Code Generation
par: Yoran, Ori, et autres
Publié: (2025)
par: Yoran, Ori, et autres
Publié: (2025)
Towards a Neural Debugger for Python
par: Beck, Maximilian, et autres
Publié: (2026)
par: Beck, Maximilian, et autres
Publié: (2026)
BigO(Bench) -- Can LLMs Generate Code with Controlled Time and Space Complexity?
par: Chambon, Pierre, et autres
Publié: (2025)
par: Chambon, Pierre, et autres
Publié: (2025)
Safety Alignment of LMs via Non-cooperative Games
par: Paulus, Anselm, et autres
Publié: (2025)
par: Paulus, Anselm, et autres
Publié: (2025)
Learning Mathematical Rules with Large Language Models
par: Gorceix, Antoine, et autres
Publié: (2024)
par: Gorceix, Antoine, et autres
Publié: (2024)
Prompt Selection Matters: Enhancing Text Annotations for Social Sciences with Large Language Models
par: Abraham, Louis, et autres
Publié: (2024)
par: Abraham, Louis, et autres
Publié: (2024)
Reframing Data Value for Large Language Models Through the Lens of Plausibility
par: Rammal, Mohamad Rida, et autres
Publié: (2024)
par: Rammal, Mohamad Rida, et autres
Publié: (2024)
Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification
par: Donhauser, Konstantin, et autres
Publié: (2025)
par: Donhauser, Konstantin, et autres
Publié: (2025)
RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning
par: Gehring, Jonas, et autres
Publié: (2024)
par: Gehring, Jonas, et autres
Publié: (2024)
Meta Large Language Model Compiler: Foundation Models of Compiler Optimization
par: Cummins, Chris, et autres
Publié: (2024)
par: Cummins, Chris, et autres
Publié: (2024)
An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks
par: Stefan, Gabriel, et autres
Publié: (2026)
par: Stefan, Gabriel, et autres
Publié: (2026)
Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
par: Zheng, Kunhao, et autres
Publié: (2026)
par: Zheng, Kunhao, et autres
Publié: (2026)
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
par: Gu, Alex, et autres
Publié: (2024)
par: Gu, Alex, et autres
Publié: (2024)
Documents similaires
-
Formalizing Mathematics at Scale
par: Rammal, Ahmad, et autres
Publié: (2026) -
Touring sampling with pushforward maps
par: Cabannes, Vivien, et autres
Publié: (2023) -
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
par: Peyronnet, Antoine, et autres
Publié: (2026) -
WybeCoder: Verified Imperative Code Generation
par: Gloeckle, Fabian, et autres
Publié: (2026) -
Provable Benefits of In-Tool Learning for Large Language Models
par: Houliston, Sam, et autres
Publié: (2025)