SimKO: Simple Pass@K Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Ruotian, Ren, Yi, Yu, Zhouliang, Liu, Weiyang, Wen, Yandong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
Generating Symbolic World Models via Test-time Scaling of Large Language Models
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
di: Walder, Christian, et al.
Pubblicazione: (2025)
di: Walder, Christian, et al.
Pubblicazione: (2025)
Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning
di: Li, Yilong, et al.
Pubblicazione: (2026)
di: Li, Yilong, et al.
Pubblicazione: (2026)
PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization
di: Huang, Renhong, et al.
Pubblicazione: (2026)
di: Huang, Renhong, et al.
Pubblicazione: (2026)
Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients
di: Thrampoulidis, Christos, et al.
Pubblicazione: (2025)
di: Thrampoulidis, Christos, et al.
Pubblicazione: (2025)
Dual Action Policy for Robust Sim-to-Real Reinforcement Learning
di: Terence, Ng Wen Zheng, et al.
Pubblicazione: (2024)
di: Terence, Ng Wen Zheng, et al.
Pubblicazione: (2024)
Graph Signal Adaptive Message Passing
di: Yan, Yi, et al.
Pubblicazione: (2024)
di: Yan, Yi, et al.
Pubblicazione: (2024)
BuildingGym: An open-source toolbox for AI-based building energy management using reinforcement learning
di: Dai, Xilei, et al.
Pubblicazione: (2025)
di: Dai, Xilei, et al.
Pubblicazione: (2025)
Difficulty-Estimated Policy Optimization
di: Zhao, Yu, et al.
Pubblicazione: (2026)
di: Zhao, Yu, et al.
Pubblicazione: (2026)
SimAD: A Simple Dissimilarity-based Approach for Time Series Anomaly Detection
di: Zhong, Zhijie, et al.
Pubblicazione: (2024)
di: Zhong, Zhijie, et al.
Pubblicazione: (2024)
KO: Kinetics-inspired Neural Optimizer with PDE Simulation Approaches
di: Feng, Mingquan, et al.
Pubblicazione: (2025)
di: Feng, Mingquan, et al.
Pubblicazione: (2025)
Sim2Sea: Sim-to-Real Policy Transfer for Maritime Vessel Navigation in Congested Waters
di: Cui, Xinyu, et al.
Pubblicazione: (2026)
di: Cui, Xinyu, et al.
Pubblicazione: (2026)
A Mechanistic Analysis of Sim-and-Real Co-Training in Generative Robot Policies
di: Lei, Yu, et al.
Pubblicazione: (2026)
di: Lei, Yu, et al.
Pubblicazione: (2026)
LitSim: A Conflict-aware Policy for Long-term Interactive Traffic Simulation
di: Xin, Haojie, et al.
Pubblicazione: (2024)
di: Xin, Haojie, et al.
Pubblicazione: (2024)
Beyond Pass-by-Pass Optimization: Intent-Driven IR Optimization with Large Language Models
di: Qiu, Lei, et al.
Pubblicazione: (2026)
di: Qiu, Lei, et al.
Pubblicazione: (2026)
The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination
di: Su, Haoran, et al.
Pubblicazione: (2026)
di: Su, Haoran, et al.
Pubblicazione: (2026)
Failure Forecasting Boosts Robustness of Sim2Real Rhythmic Insertion Policies
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
SPiDR: A Simple Approach for Zero-Shot Safety in Sim-to-Real Transfer
di: As, Yarden, et al.
Pubblicazione: (2025)
di: As, Yarden, et al.
Pubblicazione: (2025)
Generalizable Domain Adaptation for Sim-and-Real Policy Co-Training
di: Cheng, Shuo, et al.
Pubblicazione: (2025)
di: Cheng, Shuo, et al.
Pubblicazione: (2025)
Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation
di: Maddukuri, Abhiram, et al.
Pubblicazione: (2025)
di: Maddukuri, Abhiram, et al.
Pubblicazione: (2025)
RSPO: Risk-Seeking Policy Optimization for Pass@k and Max@k Metrics in Large Language Models
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
SimToolReal: An Object-Centric Policy for Zero-Shot Dexterous Tool Manipulation
di: Kedia, Kushal, et al.
Pubblicazione: (2026)
di: Kedia, Kushal, et al.
Pubblicazione: (2026)
Learning Strategic Language Agents in the Werewolf Game with Iterative Latent Space Policy Optimization
di: Xu, Zelai, et al.
Pubblicazione: (2025)
di: Xu, Zelai, et al.
Pubblicazione: (2025)
PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective
di: Huang, Yangyi, et al.
Pubblicazione: (2026)
di: Huang, Yangyi, et al.
Pubblicazione: (2026)
Truncated Proximal Policy Optimization
di: Fan, Tiantian, et al.
Pubblicazione: (2025)
di: Fan, Tiantian, et al.
Pubblicazione: (2025)
Fire on Motion: Optimizing Video Pass-bands for Efficient Spiking Action Recognition
di: Ye, Shuhan, et al.
Pubblicazione: (2026)
di: Ye, Shuhan, et al.
Pubblicazione: (2026)
Are Large Language Models Good Prompt Optimizers?
di: Ma, Ruotian, et al.
Pubblicazione: (2024)
di: Ma, Ruotian, et al.
Pubblicazione: (2024)
Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization
di: Hua, Xingyuan, et al.
Pubblicazione: (2026)
di: Hua, Xingyuan, et al.
Pubblicazione: (2026)
SimRPD: Optimizing Recruitment Proactive Dialogue Agents through Simulator-Based Data Evaluation and Selection
di: Cao, Zhiyong, et al.
Pubblicazione: (2026)
di: Cao, Zhiyong, et al.
Pubblicazione: (2026)
P-Guide: Parameter-Efficient Prior Steering for Single-Pass CFG Inference
di: Peng, Xin, et al.
Pubblicazione: (2026)
di: Peng, Xin, et al.
Pubblicazione: (2026)
Distributed Conformal Prediction via Message Passing
di: Wen, Haifeng, et al.
Pubblicazione: (2025)
di: Wen, Haifeng, et al.
Pubblicazione: (2025)
Context-Driven Knowledge Graph Completion with Semantic-Aware Relational Message Passing
di: Li, Siyuan, et al.
Pubblicazione: (2025)
di: Li, Siyuan, et al.
Pubblicazione: (2025)
Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
di: Barakat, Anas, et al.
Pubblicazione: (2026)
di: Barakat, Anas, et al.
Pubblicazione: (2026)
Decision Flow Policy Optimization
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
Empirical Analysis of Sim-and-Real Cotraining of Diffusion Policies for Planar Pushing from Pixels
di: Wei, Adam, et al.
Pubblicazione: (2025)
di: Wei, Adam, et al.
Pubblicazione: (2025)
How Particle System Theory Enhances Hypergraph Message Passing
di: Ma, Yixuan, et al.
Pubblicazione: (2025)
di: Ma, Yixuan, et al.
Pubblicazione: (2025)
Learning Sim-Grounded Policies for Bimanual Rope Manipulation from Human Teleoperation Data
di: Wigginghaus, Gina, et al.
Pubblicazione: (2026)
di: Wigginghaus, Gina, et al.
Pubblicazione: (2026)
Sim-to-Real of Humanoid Locomotion Policies via Joint Torque Space Perturbation Injection
di: Cha, Junhyeok Rui, et al.
Pubblicazione: (2026)
di: Cha, Junhyeok Rui, et al.
Pubblicazione: (2026)
On the Sample Complexity of Differentially Private Policy Optimization
di: He, Yi, et al.
Pubblicazione: (2025)
di: He, Yi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
di: Yu, Zhouliang, et al.
Pubblicazione: (2025) -
Generating Symbolic World Models via Test-time Scaling of Large Language Models
di: Yu, Zhouliang, et al.
Pubblicazione: (2025) -
Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
di: Walder, Christian, et al.
Pubblicazione: (2025) -
Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning
di: Li, Yilong, et al.
Pubblicazione: (2026) -
PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization
di: Huang, Renhong, et al.
Pubblicazione: (2026)