RL, but don't do anything I wouldn't do
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cohen, Michael K., Hutter, Marcus, Bengio, Yoshua, Russell, Stuart |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why you don't overfit, and don't need Bayes if you only train for one epoch
par: Aitchison, Laurence
Publié: (2024)
par: Aitchison, Laurence
Publié: (2024)
Why don't I remember anything from school?
Publié: (2026)
Publié: (2026)
Baking Symmetry into GFlowNets
par: Ma, George, et autres
Publié: (2024)
par: Ma, George, et autres
Publié: (2024)
Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback
par: Jiralerspong, Thomas, et autres
Publié: (2026)
par: Jiralerspong, Thomas, et autres
Publié: (2026)
On Generalization for Generative Flow Networks
par: Krichel, Anas, et autres
Publié: (2024)
par: Krichel, Anas, et autres
Publié: (2024)
Interventional Causal Representation Learning
par: Ahuja, Kartik, et autres
Publié: (2022)
par: Ahuja, Kartik, et autres
Publié: (2022)
Relative Trajectory Balance is equivalent to Trust-PCL
par: Deleu, Tristan, et autres
Publié: (2025)
par: Deleu, Tristan, et autres
Publié: (2025)
Shh, don't say that! Domain Certification in LLMs
par: Emde, Cornelius, et autres
Publié: (2025)
par: Emde, Cornelius, et autres
Publié: (2025)
Bridging RL Theory and Practice with the Effective Horizon
par: Laidlaw, Cassidy, et autres
Publié: (2023)
par: Laidlaw, Cassidy, et autres
Publié: (2023)
On the consistent reasoning paradox of intelligence and optimal trust in AI: The power of 'I don't know'
par: Bastounis, Alexander, et autres
Publié: (2024)
par: Bastounis, Alexander, et autres
Publié: (2024)
Local Search GFlowNets
par: Kim, Minsu, et autres
Publié: (2023)
par: Kim, Minsu, et autres
Publié: (2023)
“Without the video I wouldn't have known”: An experienced EFL teacher learning to provide oral corrective feedback
par: Xuan V. Ha, et autres
Publié: (2024)
par: Xuan V. Ha, et autres
Publié: (2024)
In-Context Parametric Inference: Point or Distribution Estimators?
par: Mittal, Sarthak, et autres
Publié: (2025)
par: Mittal, Sarthak, et autres
Publié: (2025)
Coercing LLMs to do and reveal (almost) anything
par: Geiping, Jonas, et autres
Publié: (2024)
par: Geiping, Jonas, et autres
Publié: (2024)
GFlowNet Foundations
par: Bengio, Yoshua, et autres
Publié: (2021)
par: Bengio, Yoshua, et autres
Publié: (2021)
Discrete Probabilistic Inference as Control in Multi-path Environments
par: Deleu, Tristan, et autres
Publié: (2024)
par: Deleu, Tristan, et autres
Publié: (2024)
Sliding Window Recurrences for Sequence Models
par: Secrieru, Dragos, et autres
Publié: (2025)
par: Secrieru, Dragos, et autres
Publié: (2025)
Don't Just Say "I don't know"! Self-aligning Large Language Models for Responding to Unknown Questions with Explanations
par: Deng, Yang, et autres
Publié: (2024)
par: Deng, Yang, et autres
Publié: (2024)
A Complexity-Based Theory of Compositionality
par: Elmoznino, Eric, et autres
Publié: (2024)
par: Elmoznino, Eric, et autres
Publié: (2024)
Tree Cross Attention
par: Feng, Leo, et autres
Publié: (2023)
par: Feng, Leo, et autres
Publié: (2023)
Bayesian learning of Causal Structure and Mechanisms with GFlowNets and Variational Bayes
par: Nishikawa-Toomey, Mizu, et autres
Publié: (2022)
par: Nishikawa-Toomey, Mizu, et autres
Publié: (2022)
Monte Carlo Tree Diffusion for System 2 Planning
par: Yoon, Jaesik, et autres
Publié: (2025)
par: Yoon, Jaesik, et autres
Publié: (2025)
Shaping Inductive Bias in Diffusion Models through Frequency-Based Noise Control
par: Jiralerspong, Thomas, et autres
Publié: (2025)
par: Jiralerspong, Thomas, et autres
Publié: (2025)
In-Context Reinforcement Learning through Bayesian Fusion of Context and Value Prior
par: Berkes, Anaïs, et autres
Publié: (2026)
par: Berkes, Anaïs, et autres
Publié: (2026)
Torsional-GFN: a conditional conformation generator for small molecules
par: Volokhova, Alexandra, et autres
Publié: (2025)
par: Volokhova, Alexandra, et autres
Publié: (2025)
Learning to Scale Logits for Temperature-Conditional GFlowNets
par: Kim, Minsu, et autres
Publié: (2023)
par: Kim, Minsu, et autres
Publié: (2023)
The Effective Horizon Explains Deep RL Performance in Stochastic Environments
par: Laidlaw, Cassidy, et autres
Publié: (2023)
par: Laidlaw, Cassidy, et autres
Publié: (2023)
Efficient Causal Graph Discovery Using Large Language Models
par: Jiralerspong, Thomas, et autres
Publié: (2024)
par: Jiralerspong, Thomas, et autres
Publié: (2024)
Solving Bayesian inverse problems with diffusion priors and off-policy RL
par: Scimeca, Luca, et autres
Publié: (2025)
par: Scimeca, Luca, et autres
Publié: (2025)
Were RNNs All We Needed?
par: Feng, Leo, et autres
Publié: (2024)
par: Feng, Leo, et autres
Publié: (2024)
FALCON: Few-step Accurate Likelihoods for Continuous Flows
par: Rehman, Danyal, et autres
Publié: (2025)
par: Rehman, Danyal, et autres
Publié: (2025)
Multi-Fidelity Active Learning with GFlowNets
par: Hernandez-Garcia, Alex, et autres
Publié: (2023)
par: Hernandez-Garcia, Alex, et autres
Publié: (2023)
Attention as an RNN
par: Feng, Leo, et autres
Publié: (2024)
par: Feng, Leo, et autres
Publié: (2024)
‘I mean, I wouldn't say I was sober’: Exploring the psychosocial impact of e‐scooter injuries and aligning a collaborative public health response
par: Timothy Piatkowski, et autres
Publié: (2024)
par: Timothy Piatkowski, et autres
Publié: (2024)
Distributional GFlowNets with Quantile Flows
par: Zhang, Dinghuai, et autres
Publié: (2023)
par: Zhang, Dinghuai, et autres
Publié: (2023)
A Comedy of Estimators: On KL Regularization in RL Training of LLMs
par: Shah, Vedant, et autres
Publié: (2025)
par: Shah, Vedant, et autres
Publié: (2025)
Expert-Guided LLM Reasoning for Battery Discovery: From AI-Driven Hypothesis to Synthesis and Characterization
par: Liu, Shengchao, et autres
Publié: (2025)
par: Liu, Shengchao, et autres
Publié: (2025)
Active Attacks: Red-teaming LLMs via Adaptive Environments
par: Yun, Taeyoung, et autres
Publié: (2025)
par: Yun, Taeyoung, et autres
Publié: (2025)
Adaptive teachers for amortized samplers
par: Kim, Minsu, et autres
Publié: (2024)
par: Kim, Minsu, et autres
Publié: (2024)
Offline Model-Based Optimization: Comprehensive Review
par: Kim, Minsu, et autres
Publié: (2025)
par: Kim, Minsu, et autres
Publié: (2025)
Documents similaires
-
Why you don't overfit, and don't need Bayes if you only train for one epoch
par: Aitchison, Laurence
Publié: (2024) -
Why don't I remember anything from school?
Publié: (2026) -
Baking Symmetry into GFlowNets
par: Ma, George, et autres
Publié: (2024) -
Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback
par: Jiralerspong, Thomas, et autres
Publié: (2026) -
On Generalization for Generative Flow Networks
par: Krichel, Anas, et autres
Publié: (2024)