Reinforcement Learning from Meta-Evaluation: Aligning Language Models Without Ground-Truth Labels
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Rentschler, Micah, Roberts, Jesse |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
The Causally Emergent Alignment Hypothesis: Causal Emergence Aligns with and Predicts Final Reward in Reinforcement Learning Agents
von: Pigozzi, Federico, et al.
Veröffentlicht: (2026)
von: Pigozzi, Federico, et al.
Veröffentlicht: (2026)
Meta-Learning an Evolvable Developmental Encoding
von: Montero, Milton L., et al.
Veröffentlicht: (2024)
von: Montero, Milton L., et al.
Veröffentlicht: (2024)
Spiking World Model with Multi-Compartment Neurons for Model-based Reinforcement Learning
von: Sun, Yinqian, et al.
Veröffentlicht: (2025)
von: Sun, Yinqian, et al.
Veröffentlicht: (2025)
Large Language Model Assisted Automated Algorithm Generation and Evolution via Meta-black-box optimization
von: Yang, Xu, et al.
Veröffentlicht: (2025)
von: Yang, Xu, et al.
Veröffentlicht: (2025)
Function Class Learning with Genetic Programming: Towards Explainable Meta Learning for Tumor Growth Functionals
von: Sijben, E. M. C., et al.
Veröffentlicht: (2024)
von: Sijben, E. M. C., et al.
Veröffentlicht: (2024)
Exploring the True Potential: Evaluating the Black-box Optimization Capability of Large Language Models
von: Huang, Beichen, et al.
Veröffentlicht: (2024)
von: Huang, Beichen, et al.
Veröffentlicht: (2024)
Brain-inspired Computational Modeling of Action Recognition with Recurrent Spiking Neural Networks Equipped with Reinforcement Delay Learning
von: Nadafian, Alireza, et al.
Veröffentlicht: (2024)
von: Nadafian, Alireza, et al.
Veröffentlicht: (2024)
Evolutionary Reinforcement Learning: A Systematic Review and Future Directions
von: Lin, Yuanguo, et al.
Veröffentlicht: (2024)
von: Lin, Yuanguo, et al.
Veröffentlicht: (2024)
Deep Reinforcement Learning-Assisted Component Auto-Configuration of Differential Evolution Algorithm for Constrained Optimization: A Foundation Model
von: Yang, Xu, et al.
Veröffentlicht: (2025)
von: Yang, Xu, et al.
Veröffentlicht: (2025)
EvoRL: A GPU-accelerated Framework for Evolutionary Reinforcement Learning
von: Zheng, Bowen, et al.
Veröffentlicht: (2025)
von: Zheng, Bowen, et al.
Veröffentlicht: (2025)
Evolutionary Reinforcement Learning for Interpretable Decision-Making in Supply Chain Management
von: Genetti, Stefano, et al.
Veröffentlicht: (2025)
von: Genetti, Stefano, et al.
Veröffentlicht: (2025)
Human-in-the-Loop Policy Optimization for Preference-Based Multi-Objective Reinforcement Learning
von: Li, Ke, et al.
Veröffentlicht: (2024)
von: Li, Ke, et al.
Veröffentlicht: (2024)
Deep Reinforcement Learning-Assisted Automated Operator Portfolio for Constrained Multi-objective Optimization
von: Shao, Shuai, et al.
Veröffentlicht: (2026)
von: Shao, Shuai, et al.
Veröffentlicht: (2026)
Lexidate: Model Evaluation and Selection with Lexicase
von: Hernandez, Jose Guadalupe, et al.
Veröffentlicht: (2024)
von: Hernandez, Jose Guadalupe, et al.
Veröffentlicht: (2024)
Evolving Reservoirs for Meta Reinforcement Learning
von: Léger, Corentin, et al.
Veröffentlicht: (2023)
von: Léger, Corentin, et al.
Veröffentlicht: (2023)
CaRe-BN: Precise Moving Statistics for Stabilizing Spiking Neural Networks in Reinforcement Learning
von: Xu, Zijie, et al.
Veröffentlicht: (2025)
von: Xu, Zijie, et al.
Veröffentlicht: (2025)
Learning Symbolic Model-Agnostic Loss Functions via Meta-Learning
von: Raymond, Christian, et al.
Veröffentlicht: (2022)
von: Raymond, Christian, et al.
Veröffentlicht: (2022)
A Unified Platform to Evaluate STDP Learning Rule and Synapse Model using Pattern Recognition in a Spiking Neural Network
von: Maskeen, Jaskirat Singh, et al.
Veröffentlicht: (2025)
von: Maskeen, Jaskirat Singh, et al.
Veröffentlicht: (2025)
Optimizing Interplanetary Trajectories using Hybrid Meta-heuristic
von: Dehkordi, Amin Abdollahi, et al.
Veröffentlicht: (2025)
von: Dehkordi, Amin Abdollahi, et al.
Veröffentlicht: (2025)
Large Language Models as Evolutionary Optimizers
von: Liu, Shengcai, et al.
Veröffentlicht: (2023)
von: Liu, Shengcai, et al.
Veröffentlicht: (2023)
UAV-assisted Joint Mobile Edge Computing and Data Collection via Matching-enabled Deep Reinforcement Learning
von: Wang, Boxiong, et al.
Veröffentlicht: (2025)
von: Wang, Boxiong, et al.
Veröffentlicht: (2025)
Aerial Reliable Collaborative Communications for Terrestrial Mobile Users via Evolutionary Multi-Objective Deep Reinforcement Learning
von: Sun, Geng, et al.
Veröffentlicht: (2025)
von: Sun, Geng, et al.
Veröffentlicht: (2025)
Solving Expensive Optimization Problems in Dynamic Environments with Meta-learning
von: Zhang, Huan, et al.
Veröffentlicht: (2023)
von: Zhang, Huan, et al.
Veröffentlicht: (2023)
Adaptive Spiking Neurons for Vision and Language Modeling
von: Zhou, Chenlin, et al.
Veröffentlicht: (2026)
von: Zhou, Chenlin, et al.
Veröffentlicht: (2026)
When Large Language Model Meets Optimization
von: Huang, Sen, et al.
Veröffentlicht: (2024)
von: Huang, Sen, et al.
Veröffentlicht: (2024)
Exploring Extreme Quantization in Spiking Language Models
von: Bal, Malyaban, et al.
Veröffentlicht: (2024)
von: Bal, Malyaban, et al.
Veröffentlicht: (2024)
Large Language Models as Particle Swarm Optimizers
von: Shinohara, Yamato, et al.
Veröffentlicht: (2025)
von: Shinohara, Yamato, et al.
Veröffentlicht: (2025)
Collaborative Ground-Space Communications via Evolutionary Multi-objective Deep Reinforcement Learning
von: Li, Jiahui, et al.
Veröffentlicht: (2024)
von: Li, Jiahui, et al.
Veröffentlicht: (2024)
Large Language Models as Surrogate Models in Evolutionary Algorithms: A Preliminary Study
von: Hao, Hao, et al.
Veröffentlicht: (2024)
von: Hao, Hao, et al.
Veröffentlicht: (2024)
Winner-Take-All Spiking Transformer for Language Modeling
von: Zhou, Chenlin, et al.
Veröffentlicht: (2026)
von: Zhou, Chenlin, et al.
Veröffentlicht: (2026)
Increasing Computation Resolves Conflicts in Vision Language Models
von: Wang, Bingyang, et al.
Veröffentlicht: (2025)
von: Wang, Bingyang, et al.
Veröffentlicht: (2025)
Reproducing and Dissecting Denoising Language Models for Speech Recognition
von: Koch, Dorian, et al.
Veröffentlicht: (2025)
von: Koch, Dorian, et al.
Veröffentlicht: (2025)
SpikingMamba: Towards Energy-Efficient Large Language Models via Knowledge Distillation from Mamba
von: Huang, Yulong, et al.
Veröffentlicht: (2025)
von: Huang, Yulong, et al.
Veröffentlicht: (2025)
Automatic Design of Optimization Test Problems with Large Language Models
von: Achtelik, Wojciech, et al.
Veröffentlicht: (2026)
von: Achtelik, Wojciech, et al.
Veröffentlicht: (2026)
Controlling the Mutation in Large Language Models for the Efficient Evolution of Algorithms
von: Yin, Haoran, et al.
Veröffentlicht: (2024)
von: Yin, Haoran, et al.
Veröffentlicht: (2024)
Explaining Genetic Programming Trees using Large Language Models
von: Maddigan, Paula, et al.
Veröffentlicht: (2024)
von: Maddigan, Paula, et al.
Veröffentlicht: (2024)
Language Model Crossover: Variation through Few-Shot Prompting
von: Meyerson, Elliot, et al.
Veröffentlicht: (2023)
von: Meyerson, Elliot, et al.
Veröffentlicht: (2023)
Autonomous Multi-Objective Optimization Using Large Language Model
von: Huang, Yuxiao, et al.
Veröffentlicht: (2024)
von: Huang, Yuxiao, et al.
Veröffentlicht: (2024)
ORS: A novel Olive Ridley Survival inspired Meta-heuristic Optimization Algorithm
von: Panigrahi, Niranjan, et al.
Veröffentlicht: (2024)
von: Panigrahi, Niranjan, et al.
Veröffentlicht: (2024)
Large Language Model-Aided Evolutionary Search for Constrained Multiobjective Optimization
von: Wang, Zeyi, et al.
Veröffentlicht: (2024)
von: Wang, Zeyi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
The Causally Emergent Alignment Hypothesis: Causal Emergence Aligns with and Predicts Final Reward in Reinforcement Learning Agents
von: Pigozzi, Federico, et al.
Veröffentlicht: (2026) -
Meta-Learning an Evolvable Developmental Encoding
von: Montero, Milton L., et al.
Veröffentlicht: (2024) -
Spiking World Model with Multi-Compartment Neurons for Model-based Reinforcement Learning
von: Sun, Yinqian, et al.
Veröffentlicht: (2025) -
Large Language Model Assisted Automated Algorithm Generation and Evolution via Meta-black-box optimization
von: Yang, Xu, et al.
Veröffentlicht: (2025) -
Function Class Learning with Genetic Programming: Towards Explainable Meta Learning for Tumor Growth Functionals
von: Sijben, E. M. C., et al.
Veröffentlicht: (2024)