Policy-Space Search: Equivalences, Improvements, and Compression
Fuente:
arXiv
Salvato in:
| Autori principali: | Messa, Frederico, Pereira, André Grahl |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Statistical Analysis of Policy Space Compression Problem
di: Molaei, Majid, et al.
Pubblicazione: (2024)
di: Molaei, Majid, et al.
Pubblicazione: (2024)
On-line Policy Improvement using Monte-Carlo Search
di: Tesauro, Gerald, et al.
Pubblicazione: (2025)
di: Tesauro, Gerald, et al.
Pubblicazione: (2025)
From Parameters to Behaviors: Unsupervised Compression of the Policy Space
di: Tenedini, Davide, et al.
Pubblicazione: (2025)
di: Tenedini, Davide, et al.
Pubblicazione: (2025)
Less Greedy Equivalence Search
di: Ejaz, Adiba, et al.
Pubblicazione: (2025)
di: Ejaz, Adiba, et al.
Pubblicazione: (2025)
Searching for Programmatic Policies in Semantic Spaces
di: Moraes, Rubens O., et al.
Pubblicazione: (2024)
di: Moraes, Rubens O., et al.
Pubblicazione: (2024)
Hierarchical Task Network Planning with LLM-Generated Heuristics
di: Meneguzzi, Felipe, et al.
Pubblicazione: (2026)
di: Meneguzzi, Felipe, et al.
Pubblicazione: (2026)
Discovering State Equivalences in UCT Search Trees By Action Pruning
di: Schmöcker, Robin, et al.
Pubblicazione: (2025)
di: Schmöcker, Robin, et al.
Pubblicazione: (2025)
Combinatorial Optimization with Policy Adaptation using Latent Space Search
di: Chalumeau, Felix, et al.
Pubblicazione: (2023)
di: Chalumeau, Felix, et al.
Pubblicazione: (2023)
Compression Repair for Feedforward Neural Networks Based on Model Equivalence Evaluation
di: Mo, Zihao, et al.
Pubblicazione: (2024)
di: Mo, Zihao, et al.
Pubblicazione: (2024)
Reasoning Compression with Mixed-Policy Distillation
di: Yang, Han, et al.
Pubblicazione: (2026)
di: Yang, Han, et al.
Pubblicazione: (2026)
Data-Efficient Safe Policy Improvement Using Parametric Structure
di: Engelen, Kasper, et al.
Pubblicazione: (2025)
di: Engelen, Kasper, et al.
Pubblicazione: (2025)
Safe Explicable Policy Search
di: Hanni, Akkamahadevi, et al.
Pubblicazione: (2025)
di: Hanni, Akkamahadevi, et al.
Pubblicazione: (2025)
Accelerating Constrained Decoding with Token Space Compression
di: Sullivan, Michael, et al.
Pubblicazione: (2026)
di: Sullivan, Michael, et al.
Pubblicazione: (2026)
Provable and Practical In-Context Policy Optimization for Self-Improvement
di: Yu, Tianrun, et al.
Pubblicazione: (2026)
di: Yu, Tianrun, et al.
Pubblicazione: (2026)
Blending Imitation and Reinforcement Learning for Robust Policy Improvement
di: Liu, Xuefeng, et al.
Pubblicazione: (2023)
di: Liu, Xuefeng, et al.
Pubblicazione: (2023)
Optimization of Latent-Space Compression using Game-Theoretic Techniques for Transformer-Based Vector Search
di: Agrawal, Kushagra, et al.
Pubblicazione: (2025)
di: Agrawal, Kushagra, et al.
Pubblicazione: (2025)
Model Space Reasoning as Search in Feedback Space for Planning Domain Generation
di: Oswald, James, et al.
Pubblicazione: (2026)
di: Oswald, James, et al.
Pubblicazione: (2026)
Deep SPI: Safe Policy Improvement via World Models
di: Delgrange, Florent, et al.
Pubblicazione: (2025)
di: Delgrange, Florent, et al.
Pubblicazione: (2025)
Active Policy Improvement from Multiple Black-box Oracles
di: Liu, Xuefeng, et al.
Pubblicazione: (2023)
di: Liu, Xuefeng, et al.
Pubblicazione: (2023)
Generalized Policy Improvement Algorithms with Theoretically Supported Sample Reuse
di: Queeney, James, et al.
Pubblicazione: (2022)
di: Queeney, James, et al.
Pubblicazione: (2022)
Going Beyond Heuristics by Imposing Policy Improvement as a Constraint
di: Lee, Chi-Chang, et al.
Pubblicazione: (2025)
di: Lee, Chi-Chang, et al.
Pubblicazione: (2025)
Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement
di: Liang, Haodong, et al.
Pubblicazione: (2026)
di: Liang, Haodong, et al.
Pubblicazione: (2026)
Policy Improvement using Language Feedback Models
di: Zhong, Victor, et al.
Pubblicazione: (2024)
di: Zhong, Victor, et al.
Pubblicazione: (2024)
Compressed Convolutional Attention: Efficient Attention in a Compressed Latent Space
di: Figliolia, Tomas, et al.
Pubblicazione: (2025)
di: Figliolia, Tomas, et al.
Pubblicazione: (2025)
Scaling Combinatorial Optimization Neural Improvement Heuristics with Online Search and Adaptation
di: Verdù, Federico Julian Camerota, et al.
Pubblicazione: (2024)
di: Verdù, Federico Julian Camerota, et al.
Pubblicazione: (2024)
Functional Equivalence with NARS
di: Johansson, Robert, et al.
Pubblicazione: (2024)
di: Johansson, Robert, et al.
Pubblicazione: (2024)
Subgoal-Guided Policy Heuristic Search with Learned Subgoals
di: Tuero, Jake, et al.
Pubblicazione: (2025)
di: Tuero, Jake, et al.
Pubblicazione: (2025)
Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models
di: Peysakhovich, Alexander, et al.
Pubblicazione: (2026)
di: Peysakhovich, Alexander, et al.
Pubblicazione: (2026)
Searching Latent Program Spaces
di: Macfarlane, Matthew V, et al.
Pubblicazione: (2024)
di: Macfarlane, Matthew V, et al.
Pubblicazione: (2024)
SIME: Enhancing Policy Self-Improvement with Modal-level Exploration
di: Jin, Yang, et al.
Pubblicazione: (2025)
di: Jin, Yang, et al.
Pubblicazione: (2025)
Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion
di: Khandelwal, Nimesh, et al.
Pubblicazione: (2026)
di: Khandelwal, Nimesh, et al.
Pubblicazione: (2026)
Randomized Antipodal Search Done Right for Data Pareto Improvement of LLM Unlearning
di: Liu, Ziwen, et al.
Pubblicazione: (2026)
di: Liu, Ziwen, et al.
Pubblicazione: (2026)
Adaptive Compression of the Latent Space in Variational Autoencoders
di: Sejnova, Gabriela, et al.
Pubblicazione: (2023)
di: Sejnova, Gabriela, et al.
Pubblicazione: (2023)
Zero-shot Imitation Policy via Search in Demonstration Dataset
di: Malato, Federco, et al.
Pubblicazione: (2024)
di: Malato, Federco, et al.
Pubblicazione: (2024)
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
di: Liu, Shiyu, et al.
Pubblicazione: (2026)
di: Liu, Shiyu, et al.
Pubblicazione: (2026)
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
Extracting Problem Structure with LLMs for Optimized SAT Local Search
di: Schidler, André, et al.
Pubblicazione: (2025)
di: Schidler, André, et al.
Pubblicazione: (2025)
Intriguing Equivalence Structures of the Embedding Space of Vision Transformers
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
Reinforced Compressive Neural Architecture Search for Versatile Adversarial Robustness
di: Wang, Dingrong, et al.
Pubblicazione: (2024)
di: Wang, Dingrong, et al.
Pubblicazione: (2024)
RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents
di: Zhu, Jialiang, et al.
Pubblicazione: (2026)
di: Zhu, Jialiang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Statistical Analysis of Policy Space Compression Problem
di: Molaei, Majid, et al.
Pubblicazione: (2024) -
On-line Policy Improvement using Monte-Carlo Search
di: Tesauro, Gerald, et al.
Pubblicazione: (2025) -
From Parameters to Behaviors: Unsupervised Compression of the Policy Space
di: Tenedini, Davide, et al.
Pubblicazione: (2025) -
Less Greedy Equivalence Search
di: Ejaz, Adiba, et al.
Pubblicazione: (2025) -
Searching for Programmatic Policies in Semantic Spaces
di: Moraes, Rubens O., et al.
Pubblicazione: (2024)