Provable and Practical In-Context Policy Optimization for Self-Improvement
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Tianrun, Yang, Yuxiao, Wang, Zhaoyang, Zhao, Kaixiang, Jenkins, Porter, Zhang, Xuchao, Bansal, Chetan, Yao, Huaxiu, Zhang, Weitong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
por: Gupta, Taneesh, et al.
Publicado: (2025)
por: Gupta, Taneesh, et al.
Publicado: (2025)
FRAME: Forensic Routing and Adaptive Multi-path Evidence Fusion for Image Manipulation Detection
por: Zhao, Kaixiang, et al.
Publicado: (2026)
por: Zhao, Kaixiang, et al.
Publicado: (2026)
Synergistic Weak-Strong Collaboration by Aligning Preferences
por: Jiao, Yizhu, et al.
Publicado: (2025)
por: Jiao, Yizhu, et al.
Publicado: (2025)
OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
por: Yang, Yuxiao, et al.
Publicado: (2026)
por: Yang, Yuxiao, et al.
Publicado: (2026)
CREAM: Consistency Regularized Self-Rewarding Language Models
por: Wang, Zhaoyang, et al.
Publicado: (2024)
por: Wang, Zhaoyang, et al.
Publicado: (2024)
Anyprefer: An Agentic Framework for Preference Data Synthesis
por: Zhou, Yiyang, et al.
Publicado: (2025)
por: Zhou, Yiyang, et al.
Publicado: (2025)
Your Self-Play Algorithm is Secretly an Adversarial Imitator: Understanding LLM Self-Play through the Lens of Imitation Learning
por: Li, Shangzhe, et al.
Publicado: (2026)
por: Li, Shangzhe, et al.
Publicado: (2026)
Return-to-Go Is More Than a Number: Q-Guided Alignment for Return-Conditioned Supervised Learning
por: Yang, Yuxiao, et al.
Publicado: (2026)
por: Yang, Yuxiao, et al.
Publicado: (2026)
Generative Caching for Structurally Similar Prompts and Responses
por: Chakraborty, Sarthak, et al.
Publicado: (2025)
por: Chakraborty, Sarthak, et al.
Publicado: (2025)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
por: Gupta, Taneesh, et al.
Publicado: (2024)
por: Gupta, Taneesh, et al.
Publicado: (2024)
SynthAgent: Adapting Web Agents with Synthetic Supervision
por: Wang, Zhaoyang, et al.
Publicado: (2025)
por: Wang, Zhaoyang, et al.
Publicado: (2025)
REFA: Reference Free Alignment for multi-preference optimization
por: Gupta, Taneesh, et al.
Publicado: (2024)
por: Gupta, Taneesh, et al.
Publicado: (2024)
WebXSkill: Skill Learning for Autonomous Web Agents
por: Wang, Zhaoyang, et al.
Publicado: (2026)
por: Wang, Zhaoyang, et al.
Publicado: (2026)
Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement
por: Liang, Haodong, et al.
Publicado: (2026)
por: Liang, Haodong, et al.
Publicado: (2026)
Hindsight Planner: A Closed-Loop Few-Shot Planner for Embodied Instruction Following
por: Yang, Yuxiao, et al.
Publicado: (2024)
por: Yang, Yuxiao, et al.
Publicado: (2024)
Verifiable Format Control for Large Language Model Generations
por: Wang, Zhaoyang, et al.
Publicado: (2025)
por: Wang, Zhaoyang, et al.
Publicado: (2025)
Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity
por: Xia, Menglin, et al.
Publicado: (2026)
por: Xia, Menglin, et al.
Publicado: (2026)
X-lifecycle Learning for Cloud Incident Management using LLMs
por: Goel, Drishti, et al.
Publicado: (2024)
por: Goel, Drishti, et al.
Publicado: (2024)
CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling
por: Gupta, Taneesh, et al.
Publicado: (2024)
por: Gupta, Taneesh, et al.
Publicado: (2024)
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
por: Yoon, Jaehong, et al.
Publicado: (2024)
por: Yoon, Jaehong, et al.
Publicado: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Towards Monotonic Improvement in In-Context Reinforcement Learning
por: Zhang, Wenhao, et al.
Publicado: (2025)
por: Zhang, Wenhao, et al.
Publicado: (2025)
SIME: Enhancing Policy Self-Improvement with Modal-level Exploration
por: Jin, Yang, et al.
Publicado: (2025)
por: Jin, Yang, et al.
Publicado: (2025)
Efficient Long CoT Reasoning in Small Language Models
por: Wang, Zhaoyang, et al.
Publicado: (2025)
por: Wang, Zhaoyang, et al.
Publicado: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
ActionNex: A Virtual Outage Manager for Cloud Computing
por: Lin, Zhenfeng, et al.
Publicado: (2026)
por: Lin, Zhenfeng, et al.
Publicado: (2026)
RainbowPO: A Unified Framework for Combining Improvements in Preference Optimization
por: Zhao, Hanyang, et al.
Publicado: (2024)
por: Zhao, Hanyang, et al.
Publicado: (2024)
OPSDL: On-Policy Self-Distillation for Long-Context Language Models
por: Zhang, Xinsen, et al.
Publicado: (2026)
por: Zhang, Xinsen, et al.
Publicado: (2026)
It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF
por: Lu, Taiming, et al.
Publicado: (2024)
por: Lu, Taiming, et al.
Publicado: (2024)
Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
por: Han, Siwei, et al.
Publicado: (2025)
por: Han, Siwei, et al.
Publicado: (2025)
Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization
por: Zhang, Yi, et al.
Publicado: (2025)
por: Zhang, Yi, et al.
Publicado: (2025)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
por: Goodall, Alexander W., et al.
Publicado: (2025)
por: Goodall, Alexander W., et al.
Publicado: (2025)
Truth or Deceit? A Bayesian Decoding Game Enhances Consistency and Reliability
por: Zhang, Weitong, et al.
Publicado: (2024)
por: Zhang, Weitong, et al.
Publicado: (2024)
COIN: Chance-Constrained Imitation Learning for Uncertainty-aware Adaptive Resource Oversubscription Policy
por: Wang, Lu, et al.
Publicado: (2024)
por: Wang, Lu, et al.
Publicado: (2024)
TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement
por: He, Haoyang, et al.
Publicado: (2026)
por: He, Haoyang, et al.
Publicado: (2026)
Provable In-Context Vector Arithmetic via Retrieving Task Concepts
por: Bu, Dake, et al.
Publicado: (2025)
por: Bu, Dake, et al.
Publicado: (2025)
Exploring the Frontiers of Softmax: Provable Optimization, Applications in Diffusion Model, and Beyond
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
OS-Copilot: Towards Generalist Computer Agents with Self-Improvement
por: Wu, Zhiyong, et al.
Publicado: (2024)
por: Wu, Zhiyong, et al.
Publicado: (2024)
Learnable Game-theoretic Policy Optimization for Data-centric Self-explanation Rationalization
por: Zhao, Yunxiao, et al.
Publicado: (2025)
por: Zhao, Yunxiao, et al.
Publicado: (2025)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
por: Zheng, Wenhao, et al.
Publicado: (2025)
por: Zheng, Wenhao, et al.
Publicado: (2025)
Ejemplares similares
-
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
por: Gupta, Taneesh, et al.
Publicado: (2025) -
FRAME: Forensic Routing and Adaptive Multi-path Evidence Fusion for Image Manipulation Detection
por: Zhao, Kaixiang, et al.
Publicado: (2026) -
Synergistic Weak-Strong Collaboration by Aligning Preferences
por: Jiao, Yizhu, et al.
Publicado: (2025) -
OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
por: Yang, Yuxiao, et al.
Publicado: (2026) -
CREAM: Consistency Regularized Self-Rewarding Language Models
por: Wang, Zhaoyang, et al.
Publicado: (2024)