Enregistré dans:
| Auteurs principaux: | Matrenok, Simon, Moalla, Skander, Gulcehre, Caglar |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2507.08068 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
No Representation, No Trust: Connecting Representation, Collapse, and Trust Issues in PPO
par: Moalla, Skander, et autres
Publié: (2024)
par: Moalla, Skander, et autres
Publié: (2024)
Building on Efficient Foundations: Effectively Training LLMs with Structured Feedforward Layers
par: Wei, Xiuying, et autres
Publié: (2024)
par: Wei, Xiuying, et autres
Publié: (2024)
Investigating Low-Rank Training in Transformer Language Models: Efficiency and Scaling Analysis
par: Wei, Xiuying, et autres
Publié: (2024)
par: Wei, Xiuying, et autres
Publié: (2024)
Partition Generative Modeling: Masked Modeling Without Masks
par: Deschenaux, Justin, et autres
Publié: (2025)
par: Deschenaux, Justin, et autres
Publié: (2025)
In Search for Architectures and Loss Functions in Multi-Objective Reinforcement Learning
par: Terekhov, Mikhail, et autres
Publié: (2024)
par: Terekhov, Mikhail, et autres
Publié: (2024)
Augmenting Attention with Exponentially Decaying Memory Improves Query-Aware KV Sparsity
par: Wei, Xiuying, et autres
Publié: (2026)
par: Wei, Xiuying, et autres
Publié: (2026)
BlockGen: Flexible Blockwise Sequence Modeling with Hybrid Samplers
par: Deschenaux, Justin, et autres
Publié: (2026)
par: Deschenaux, Justin, et autres
Publié: (2026)
RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference
par: Wei, Xiuying, et autres
Publié: (2026)
par: Wei, Xiuying, et autres
Publié: (2026)
Beyond Autoregression: Fast LLMs via Self-Distillation Through Time
par: Deschenaux, Justin, et autres
Publié: (2024)
par: Deschenaux, Justin, et autres
Publié: (2024)
Python Machine Learning Research Template
par: Moalla, Skander
Publié: (2025)
par: Moalla, Skander
Publié: (2025)
Regret-Optimized Portfolio Enhancement through Deep Reinforcement Learning and Future Looking Rewards
par: Karzanov, Daniil, et autres
Publié: (2025)
par: Karzanov, Daniil, et autres
Publié: (2025)
The Role of Deep Learning Regularizations on Actors in Offline RL
par: Tarasov, Denis, et autres
Publié: (2024)
par: Tarasov, Denis, et autres
Publié: (2024)
The Diffusion Duality, Chapter II: $Ψ$-Samplers
par: Deschenaux, Justin, et autres
Publié: (2026)
par: Deschenaux, Justin, et autres
Publié: (2026)
Quantile Regression for Distributional Reward Models in RLHF
par: Dorka, Nicolai
Publié: (2024)
par: Dorka, Nicolai
Publié: (2024)
Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall
par: Jo, Mingyu, et autres
Publié: (2025)
par: Jo, Mingyu, et autres
Publié: (2025)
HiPPO-Prophecy: State-Space Models can Provably Learn Dynamical Systems in Context
par: Joseph, Federico Arangath, et autres
Publié: (2024)
par: Joseph, Federico Arangath, et autres
Publié: (2024)
Value-Free Policy Optimization via Reward Partitioning
par: Faye, Bilal, et autres
Publié: (2025)
par: Faye, Bilal, et autres
Publié: (2025)
Control Tax: The Price of Keeping AI in Check
par: Terekhov, Mikhail, et autres
Publié: (2025)
par: Terekhov, Mikhail, et autres
Publié: (2025)
Simple Hierarchical Planning with Diffusion
par: Chen, Chang, et autres
Publié: (2024)
par: Chen, Chang, et autres
Publié: (2024)
Universality of Linear Recurrences Followed by Non-linear Projections: Finite-Width Guarantees and Benefits of Complex Eigenvalues
par: Orvieto, Antonio, et autres
Publié: (2023)
par: Orvieto, Antonio, et autres
Publié: (2023)
Distributional Off-Policy Evaluation with Deep Quantile Process Regression
par: Kuang, Qi, et autres
Publié: (2026)
par: Kuang, Qi, et autres
Publié: (2026)
PlanDQ: Hierarchical Plan Orchestration via D-Conductor and Q-Performer
par: Chen, Chang, et autres
Publié: (2024)
par: Chen, Chang, et autres
Publié: (2024)
Boosting CVaR Policy Optimization with Quantile Gradients
par: Luo, Yudong, et autres
Publié: (2026)
par: Luo, Yudong, et autres
Publié: (2026)
Vector Quantile Regression on Manifolds
par: Pegoraro, Marco, et autres
Publié: (2023)
par: Pegoraro, Marco, et autres
Publié: (2023)
An Exact Pointwise Characterization for Total Variation Denoising in Quantile Regression
par: Ghoshal, Deep, et autres
Publié: (2026)
par: Ghoshal, Deep, et autres
Publié: (2026)
Self-Recognition in Language Models
par: Davidson, Tim R., et autres
Publié: (2024)
par: Davidson, Tim R., et autres
Publié: (2024)
Multi-Fidelity Quantile Regression
par: Liu, Yixiang, et autres
Publié: (2026)
par: Liu, Yixiang, et autres
Publié: (2026)
Quantile Q-Learning: Revisiting Offline Extreme Q-Learning with Quantile Regression
par: Gao, Xinming, et autres
Publié: (2025)
par: Gao, Xinming, et autres
Publié: (2025)
An Efficient Multi Quantile Regression Network with Ad Hoc Prevention of Quantile Crossing
par: Decke, Jens, et autres
Publié: (2024)
par: Decke, Jens, et autres
Publié: (2024)
Symbolic Quantile Regression for the Interpretable Prediction of Conditional Quantiles
par: Hoekstra, Cas Oude, et autres
Publié: (2025)
par: Hoekstra, Cas Oude, et autres
Publié: (2025)
Fleet of Agents: Coordinated Problem Solving with Large Language Models
par: Klein, Lars, et autres
Publié: (2024)
par: Klein, Lars, et autres
Publié: (2024)
Horseshoe Prior Bayesian Quantile Regression
par: Kohns, David, et autres
Publié: (2020)
par: Kohns, David, et autres
Publié: (2020)
On the Pointwise Behavior of Recursive Partitioning and Its Implications for Heterogeneous Causal Effect Estimation
par: Cattaneo, Matias D., et autres
Publié: (2022)
par: Cattaneo, Matias D., et autres
Publié: (2022)
On Learning the Tail Quantiles of Driving Behavior Distributions via Quantile Regression and Flows
par: Tee, Jia Yu, et autres
Publié: (2023)
par: Tee, Jia Yu, et autres
Publié: (2023)
Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
par: Terekhov, Mikhail, et autres
Publié: (2025)
par: Terekhov, Mikhail, et autres
Publié: (2025)
Online Distributionally Robust LLM Alignment via Regression to Relative Reward
par: Sahu, Sharan, et autres
Publié: (2025)
par: Sahu, Sharan, et autres
Publié: (2025)
Interpretable Quantile Regression by Optimal Decision Trees
par: Lemaire, Valentin, et autres
Publié: (2026)
par: Lemaire, Valentin, et autres
Publié: (2026)
ReModels: Quantile Regression Averaging models
par: Zakrzewski, Grzegorz, et autres
Publié: (2024)
par: Zakrzewski, Grzegorz, et autres
Publié: (2024)
IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models
par: Song, Haonan, et autres
Publié: (2026)
par: Song, Haonan, et autres
Publié: (2026)
Integrating Uncertainty Awareness into Conformalized Quantile Regression
par: Rossellini, Raphael, et autres
Publié: (2023)
par: Rossellini, Raphael, et autres
Publié: (2023)
Documents similaires
-
No Representation, No Trust: Connecting Representation, Collapse, and Trust Issues in PPO
par: Moalla, Skander, et autres
Publié: (2024) -
Building on Efficient Foundations: Effectively Training LLMs with Structured Feedforward Layers
par: Wei, Xiuying, et autres
Publié: (2024) -
Investigating Low-Rank Training in Transformer Language Models: Efficiency and Scaling Analysis
par: Wei, Xiuying, et autres
Publié: (2024) -
Partition Generative Modeling: Masked Modeling Without Masks
par: Deschenaux, Justin, et autres
Publié: (2025) -
In Search for Architectures and Loss Functions in Multi-Objective Reinforcement Learning
par: Terekhov, Mikhail, et autres
Publié: (2024)