Sliding Puzzles Gym: A Scalable Benchmark for State Representation in Visual Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | de Oliveira, Bryan L. M., Martins, Luana G. B., Brandão, Bruno, da Luz, Murilo L., Soares, Telma W. de L., Melo, Luckeciano C. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Partial Reasoning in Language Models: Search and Refinement Guided by Uncertainty
por: da Luz, Murilo, et al.
Publicado: (2026)
por: da Luz, Murilo, et al.
Publicado: (2026)
InfoQuest: Evaluating Multi-Turn Dialogue Agents for Open-Ended Conversations with Hidden Context
por: de Oliveira, Bryan L. M., et al.
Publicado: (2025)
por: de Oliveira, Bryan L. M., et al.
Publicado: (2025)
Learning Without Critics? Revisiting GRPO in Classical Reinforcement Learning Environments
por: de Oliveira, Bryan L. M., et al.
Publicado: (2025)
por: de Oliveira, Bryan L. M., et al.
Publicado: (2025)
Do Reasoning Models Ask Better Questions? A Formal Information-Theoretic Analysis on Multi-Turn LLM Games
por: Pedrozo, Daniel M., et al.
Publicado: (2026)
por: Pedrozo, Daniel M., et al.
Publicado: (2026)
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
por: Melo, Luckeciano C., et al.
Publicado: (2025)
por: Melo, Luckeciano C., et al.
Publicado: (2025)
SLiM-Gym: Reinforcement Learning for Population Genetics
por: Zuppas, Niko, et al.
Publicado: (2025)
por: Zuppas, Niko, et al.
Publicado: (2025)
Temporal-Difference Variational Continual Learning
por: Melo, Luckeciano C., et al.
Publicado: (2024)
por: Melo, Luckeciano C., et al.
Publicado: (2024)
ADAPT: Hybrid Prompt Optimization for LLM Feature Visualization
por: Cardoso, João N., et al.
Publicado: (2026)
por: Cardoso, João N., et al.
Publicado: (2026)
Estrutura genética em microescala espacial de Myrcia splendens (Myrtaceae)
por: Murilo Malveira Brandão
Publicado: (2011)
por: Murilo Malveira Brandão
Publicado: (2011)
Human-Robot Gym: Benchmarking Reinforcement Learning in Human-Robot Collaboration
por: Thumm, Jakob, et al.
Publicado: (2023)
por: Thumm, Jakob, et al.
Publicado: (2023)
PeersimGym: An Environment for Solving the Task Offloading Problem with Reinforcement Learning
por: Metelo, Frederico, et al.
Publicado: (2024)
por: Metelo, Frederico, et al.
Publicado: (2024)
Deep Bayesian Active Learning for Preference Modeling in Large Language Models
por: Melo, Luckeciano C., et al.
Publicado: (2024)
por: Melo, Luckeciano C., et al.
Publicado: (2024)
ClawGym: A Scalable Framework for Building Effective Claw Agents
por: Bai, Fei, et al.
Publicado: (2026)
por: Bai, Fei, et al.
Publicado: (2026)
CrystalGym: A New Benchmark for Materials Discovery Using Reinforcement Learning
por: Govindarajan, Prashant, et al.
Publicado: (2025)
por: Govindarajan, Prashant, et al.
Publicado: (2025)
ShopGym: An Integrated Framework for Realistic Simulation and Scalable Benchmarking of E-Commerce Web Agents
por: Savadikar, Chinmay, et al.
Publicado: (2026)
por: Savadikar, Chinmay, et al.
Publicado: (2026)
TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents
por: Cai, Yifu, et al.
Publicado: (2025)
por: Cai, Yifu, et al.
Publicado: (2025)
Variação da concentração de vitamina C, ºBrix e acidez em néctar de laranja em embalagens cartonadas
por: Telma Lucia de Oliveira
Publicado: (2007)
por: Telma Lucia de Oliveira
Publicado: (2007)
HydroGym: A Reinforcement Learning Platform for Fluid Dynamics
por: Lagemann, Christian, et al.
Publicado: (2025)
por: Lagemann, Christian, et al.
Publicado: (2025)
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
por: Salaorni, Davide, et al.
Publicado: (2025)
por: Salaorni, Davide, et al.
Publicado: (2025)
Scalable Time-Lock Puzzle
por: Abadi, Aydin, et al.
Publicado: (2023)
por: Abadi, Aydin, et al.
Publicado: (2023)
PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models
por: Zhang, Ruizhi, et al.
Publicado: (2026)
por: Zhang, Ruizhi, et al.
Publicado: (2026)
BVR Gym: A Reinforcement Learning Environment for Beyond-Visual-Range Air Combat
por: Scukins, Edvards, et al.
Publicado: (2024)
por: Scukins, Edvards, et al.
Publicado: (2024)
AExGym: Benchmarks and Environments for Adaptive Experimentation
por: Wang, Jimmy, et al.
Publicado: (2024)
por: Wang, Jimmy, et al.
Publicado: (2024)
Approximately Optimal Search on a Higher-dimensional Sliding Puzzle
por: Merleau, Nono SC, et al.
Publicado: (2024)
por: Merleau, Nono SC, et al.
Publicado: (2024)
MedGym:A Unified Continuous-Time Benchmark for Dynamic Medical Treatment Reinforcement Learning
por: Wang, Yuepeng, et al.
Publicado: (2026)
por: Wang, Yuepeng, et al.
Publicado: (2026)
VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents
por: Wang, Zirui, et al.
Publicado: (2026)
por: Wang, Zirui, et al.
Publicado: (2026)
A avaliação em larga escala e suas implicaçõesna prática docente
por: Luana Soares da Silva
Publicado: (2017)
por: Luana Soares da Silva
Publicado: (2017)
Entity Re-identification in Visual Storytelling via Contrastive Reinforcement Learning
por: Oliveira, Daniel A. P., et al.
Publicado: (2025)
por: Oliveira, Daniel A. P., et al.
Publicado: (2025)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
por: Long, Yitao, et al.
Publicado: (2025)
por: Long, Yitao, et al.
Publicado: (2025)
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
por: Dirauf, Richard, et al.
Publicado: (2025)
por: Dirauf, Richard, et al.
Publicado: (2025)
Influência do ritmo Alfa (8-12Hz) no tempo de reação em uma tarefa de controle inibitório
por: Hiago Murilo Melo
Publicado: (2017)
por: Hiago Murilo Melo
Publicado: (2017)
Books, Hallways and Social Butterflies: A Note on Sliding Block Puzzles
por: Brunck, Florestan, et al.
Publicado: (2023)
por: Brunck, Florestan, et al.
Publicado: (2023)
Optimally Solving Colored Generalized Sliding-Tile Puzzles: Complexity and Bounds
por: Gozon, Marcus, et al.
Publicado: (2024)
por: Gozon, Marcus, et al.
Publicado: (2024)
SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems
por: Ramanujam, Asha, et al.
Publicado: (2025)
por: Ramanujam, Asha, et al.
Publicado: (2025)
PC-Gym: Benchmark Environments For Process Control Problems
por: Bloor, Maximilian, et al.
Publicado: (2024)
por: Bloor, Maximilian, et al.
Publicado: (2024)
SeekerGym: A Benchmark for Reliable Information Seeking
por: Kim, Remy, et al.
Publicado: (2026)
por: Kim, Remy, et al.
Publicado: (2026)
InnoGym: Benchmarking the Innovation Potential of AI Agents
por: Zhang, Jintian, et al.
Publicado: (2025)
por: Zhang, Jintian, et al.
Publicado: (2025)
Political dynamics in policymaking of freedom of information in Brazil
por: Temístocles Murilo de Oliveira
Publicado: (2024)
por: Temístocles Murilo de Oliveira
Publicado: (2024)
O NÓ DA REFORMA TRIBUTÁRIA NO BRASIL (1995-2008)
por: Murilo de Oliveira Junqueira
Publicado: (2015)
por: Murilo de Oliveira Junqueira
Publicado: (2015)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
por: Ji, Yuheng, et al.
Publicado: (2025)
por: Ji, Yuheng, et al.
Publicado: (2025)
Ejemplares similares
-
Partial Reasoning in Language Models: Search and Refinement Guided by Uncertainty
por: da Luz, Murilo, et al.
Publicado: (2026) -
InfoQuest: Evaluating Multi-Turn Dialogue Agents for Open-Ended Conversations with Hidden Context
por: de Oliveira, Bryan L. M., et al.
Publicado: (2025) -
Learning Without Critics? Revisiting GRPO in Classical Reinforcement Learning Environments
por: de Oliveira, Bryan L. M., et al.
Publicado: (2025) -
Do Reasoning Models Ask Better Questions? A Formal Information-Theoretic Analysis on Multi-Turn LLM Games
por: Pedrozo, Daniel M., et al.
Publicado: (2026) -
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
por: Melo, Luckeciano C., et al.
Publicado: (2025)