MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Yang, Wang, Hepeng, Ding, Xiao, Ouyang, Yangou, Cai, Bibo, Xiong, Kai, Gao, Jinglong, Sun, Zhouhao, Du, Li, Qin, Bing, Liu, Ting |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
by: Zhao, Yang, et al.
Published: (2026)
by: Zhao, Yang, et al.
Published: (2026)
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
by: Sun, Zhouhao, et al.
Published: (2024)
by: Sun, Zhouhao, et al.
Published: (2024)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
by: Zhao, Yang, et al.
Published: (2025)
by: Zhao, Yang, et al.
Published: (2025)
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
by: He, Yang, et al.
Published: (2025)
by: He, Yang, et al.
Published: (2025)
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
by: Zhao, Yang, et al.
Published: (2025)
by: Zhao, Yang, et al.
Published: (2025)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
by: He, Yang, et al.
Published: (2026)
by: He, Yang, et al.
Published: (2026)
ExpeTrans: LLMs Are Experiential Transfer Learners
by: Gao, Jinglong, et al.
Published: (2025)
by: Gao, Jinglong, et al.
Published: (2025)
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
by: Sun, Zhouhao, et al.
Published: (2026)
by: Sun, Zhouhao, et al.
Published: (2026)
Large Language Models Are Still Misled by Simple Bias Ensembles
by: Sun, Zhouhao, et al.
Published: (2025)
by: Sun, Zhouhao, et al.
Published: (2025)
Self-Evolving GPT: A Lifelong Autonomous Experiential Learner
by: Gao, Jinglong, et al.
Published: (2024)
by: Gao, Jinglong, et al.
Published: (2024)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
by: Zhao, Yang, et al.
Published: (2024)
by: Zhao, Yang, et al.
Published: (2024)
CrossICL: Cross-Task In-Context Learning via Unsupervised Demonstration Transfer
by: Gao, Jinglong, et al.
Published: (2025)
by: Gao, Jinglong, et al.
Published: (2025)
Causal-Guided Active Learning for Debiasing Large Language Models
by: Du, Li, et al.
Published: (2024)
by: Du, Li, et al.
Published: (2024)
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
by: Sun, Zhouhao, et al.
Published: (2025)
by: Sun, Zhouhao, et al.
Published: (2025)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
by: Xiong, Kai, et al.
Published: (2025)
by: Xiong, Kai, et al.
Published: (2025)
Enhancing Complex Causality Extraction via Improved Subtask Interaction and Knowledge Fusion
by: Gao, Jinglong, et al.
Published: (2024)
by: Gao, Jinglong, et al.
Published: (2024)
Meta-Black-Box Optimization with Ensemble Surrogate Modeling for Robustness-Accuracy Trade-off within SAEA
by: Jin, Xiao, et al.
Published: (2026)
by: Jin, Xiao, et al.
Published: (2026)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
by: Zhao, Yang, et al.
Published: (2024)
by: Zhao, Yang, et al.
Published: (2024)
Examining Inter-Consistency of Large Language Models Collaboration: An In-depth Analysis via Debate
by: Xiong, Kai, et al.
Published: (2023)
by: Xiong, Kai, et al.
Published: (2023)
Optimizing Value of Learning in Task-Oriented Federated Meta-Learning Systems
by: Wu, Bibo, et al.
Published: (2025)
by: Wu, Bibo, et al.
Published: (2025)
Adaptive Neyman Allocation
by: Zhao, Jinglong
Published: (2023)
by: Zhao, Jinglong
Published: (2023)
Diagnosing and Remedying Knowledge Deficiencies in LLMs via Label-free Curricular Meaningful Learning
by: Xiong, Kai, et al.
Published: (2024)
by: Xiong, Kai, et al.
Published: (2024)
MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
by: Wu, Boyuan
Published: (2025)
by: Wu, Boyuan
Published: (2025)
Algorithms for Adaptive Experiments that Trade-off Statistical Analysis with Reward: Combining Uniform Random Assignment and Reward Maximization
by: Li, Tong, et al.
Published: (2021)
by: Li, Tong, et al.
Published: (2021)
Experimental Design For Causal Inference Through An Optimization Lens
by: Zhao, Jinglong
Published: (2024)
by: Zhao, Jinglong
Published: (2024)
Statistical-Computational Trade-offs for Recursive Adaptive Partitioning Estimators
by: Tan, Yan Shuo, et al.
Published: (2024)
by: Tan, Yan Shuo, et al.
Published: (2024)
Precision over Diversity: High-Precision Reward Generalizes to Robust Instruction Following
by: Zeng, Yirong, et al.
Published: (2026)
by: Zeng, Yirong, et al.
Published: (2026)
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
by: Zhao, Weixiang, et al.
Published: (2025)
by: Zhao, Weixiang, et al.
Published: (2025)
Science in Movements
by: Jia, Hepeng
Published: (2021)
by: Jia, Hepeng
Published: (2021)
Text Difficulty Study: Do machines behave the same as humans regarding text difficulty?
by: Chen, Bowen, et al.
Published: (2022)
by: Chen, Bowen, et al.
Published: (2022)
Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training
by: Wang, Yisen, et al.
Published: (2025)
by: Wang, Yisen, et al.
Published: (2025)
ReCo: Reliable Causal Chain Reasoning via Structural Causal Recurrent Neural Networks
by: Xiong, Kai, et al.
Published: (2022)
by: Xiong, Kai, et al.
Published: (2022)
Statistical Mean Estimation with Coded Relayed Observations
by: Ling, Yan Hao, et al.
Published: (2025)
by: Ling, Yan Hao, et al.
Published: (2025)
Ensemble RL through Classifier Models: Enhancing Risk-Return Trade-offs in Trading Strategies
by: Xiong, Zheli
Published: (2025)
by: Xiong, Zheli
Published: (2025)
Online Tensor Learning: Computational and Statistical Trade-offs, Adaptivity and Optimal Regret
by: Li, Jingyang, et al.
Published: (2023)
by: Li, Jingyang, et al.
Published: (2023)
Meaningful Learning: Enhancing Abstract Reasoning in Large Language Models via Generic Fact Guidance
by: Xiong, Kai, et al.
Published: (2024)
by: Xiong, Kai, et al.
Published: (2024)
Does the Belt and Road Initiative Promote the Status of Global Agricultural Trade Network?
by: Kai Sun, et al.
Published: (2026)
by: Kai Sun, et al.
Published: (2026)
Trading off Relevance and Revenue in the Jobs Marketplace: Estimation, Optimization and Auction Design
by: Pourbabaee, Farzad, et al.
Published: (2025)
by: Pourbabaee, Farzad, et al.
Published: (2025)
Profiling RNA G‐Quadruplexes In vivo
by: Bibo Yang, et al.
Published: (2025)
by: Bibo Yang, et al.
Published: (2025)
MetaTrading: An Immersion-Aware Model Trading Framework for Vehicular Metaverse Services
by: Wu, Hongjia, et al.
Published: (2024)
by: Wu, Hongjia, et al.
Published: (2024)
Similar Items
-
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
by: Zhao, Yang, et al.
Published: (2026) -
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
by: Sun, Zhouhao, et al.
Published: (2024) -
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
by: Zhao, Yang, et al.
Published: (2025) -
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
by: He, Yang, et al.
Published: (2025) -
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
by: Zhao, Yang, et al.
Published: (2025)