TSSR: Two-Stage Swap-Reward-Driven Reinforcement Learning for Character-Level SMILES Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Levine, Jacob Ede, Luo, Yun Lyan, Kosaraju, Sai Chandra |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
di: Frans, Kevin, et al.
Pubblicazione: (2024)
di: Frans, Kevin, et al.
Pubblicazione: (2024)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
di: Ma, Haozhe, et al.
Pubblicazione: (2024)
di: Ma, Haozhe, et al.
Pubblicazione: (2024)
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
di: Ma, Haozhe, et al.
Pubblicazione: (2024)
di: Ma, Haozhe, et al.
Pubblicazione: (2024)
UniMAP: Universal SMILES-Graph Representation Learning
di: Feng, Shikun, et al.
Pubblicazione: (2023)
di: Feng, Shikun, et al.
Pubblicazione: (2023)
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
di: Kim, Gihoon, et al.
Pubblicazione: (2026)
di: Kim, Gihoon, et al.
Pubblicazione: (2026)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
di: Li, Xin-Ye, et al.
Pubblicazione: (2026)
di: Li, Xin-Ye, et al.
Pubblicazione: (2026)
RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning
di: Xu, Charles, et al.
Pubblicazione: (2024)
di: Xu, Charles, et al.
Pubblicazione: (2024)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
di: Qu, Yun, et al.
Pubblicazione: (2024)
di: Qu, Yun, et al.
Pubblicazione: (2024)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning
di: Zou, Qingyun, et al.
Pubblicazione: (2026)
di: Zou, Qingyun, et al.
Pubblicazione: (2026)
Reinforcement Learning with Action Chunking
di: Li, Qiyang, et al.
Pubblicazione: (2025)
di: Li, Qiyang, et al.
Pubblicazione: (2025)
Reinforcement Learning with Exogenous States and Rewards
di: Trimponias, George, et al.
Pubblicazione: (2023)
di: Trimponias, George, et al.
Pubblicazione: (2023)
Reinforcement Learning with Symbolic Reward Machines
di: Krug, Thomas, et al.
Pubblicazione: (2026)
di: Krug, Thomas, et al.
Pubblicazione: (2026)
Reinforcement Learning with Stochastic Reward Machines
di: Corazza, Jan, et al.
Pubblicazione: (2025)
di: Corazza, Jan, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning with Imputed Rewards
di: Romeo, Carlo, et al.
Pubblicazione: (2024)
di: Romeo, Carlo, et al.
Pubblicazione: (2024)
PCGRL+: Scaling, Control and Generalization in Reinforcement Learning Level Generators
di: Earle, Sam, et al.
Pubblicazione: (2024)
di: Earle, Sam, et al.
Pubblicazione: (2024)
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
di: Lee, Younghwan, et al.
Pubblicazione: (2025)
di: Lee, Younghwan, et al.
Pubblicazione: (2025)
Hybrid Reward-Driven Reinforcement Learning for Efficient Quantum Circuit Synthesis
di: Giordano, Sara, et al.
Pubblicazione: (2025)
di: Giordano, Sara, et al.
Pubblicazione: (2025)
GTA: Generative Trajectory Augmentation with Guidance for Offline Reinforcement Learning
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
t-SMILES: A Scalable Fragment-based Molecular Representation Framework for De Novo Molecule Generation
di: Wu, Juan-Ni, et al.
Pubblicazione: (2023)
di: Wu, Juan-Ni, et al.
Pubblicazione: (2023)
BERT Learns (and Teaches) Chemistry
di: Payne, Josh, et al.
Pubblicazione: (2020)
di: Payne, Josh, et al.
Pubblicazione: (2020)
Beyond Rewards in Reinforcement Learning for Cyber Defence
di: Bates, Elizabeth, et al.
Pubblicazione: (2026)
di: Bates, Elizabeth, et al.
Pubblicazione: (2026)
RLSR: Reinforcement Learning from Self Reward
di: Simonds, Toby, et al.
Pubblicazione: (2025)
di: Simonds, Toby, et al.
Pubblicazione: (2025)
Efficient Reinforcement Learning in Probabilistic Reward Machines
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2025)
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2025)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
di: Ishihara, Yu, et al.
Pubblicazione: (2025)
di: Ishihara, Yu, et al.
Pubblicazione: (2025)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
di: Zhu, Jin, et al.
Pubblicazione: (2023)
di: Zhu, Jin, et al.
Pubblicazione: (2023)
A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning
di: Yoshihara, Hiroshi, et al.
Pubblicazione: (2025)
di: Yoshihara, Hiroshi, et al.
Pubblicazione: (2025)
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
Burning RED: Unlocking Subtask-Driven Reinforcement Learning and Risk-Awareness in Average-Reward Markov Decision Processes
di: Rojas, Juan Sebastian, et al.
Pubblicazione: (2024)
di: Rojas, Juan Sebastian, et al.
Pubblicazione: (2024)
What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning
di: Ma, Yiran, et al.
Pubblicazione: (2024)
di: Ma, Yiran, et al.
Pubblicazione: (2024)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
di: Song, Kefan, et al.
Pubblicazione: (2025)
di: Song, Kefan, et al.
Pubblicazione: (2025)
DrS: Learning Reusable Dense Rewards for Multi-Stage Tasks
di: Mu, Tongzhou, et al.
Pubblicazione: (2024)
di: Mu, Tongzhou, et al.
Pubblicazione: (2024)
Exploration by Random Reward Perturbation
di: Ma, Haozhe, et al.
Pubblicazione: (2025)
di: Ma, Haozhe, et al.
Pubblicazione: (2025)
Adaptive Correlation-Weighted Intrinsic Rewards for Reinforcement Learning
di: Nguyen, Viet Bac, et al.
Pubblicazione: (2026)
di: Nguyen, Viet Bac, et al.
Pubblicazione: (2026)
2048: Reinforcement Learning in a Delayed Reward Environment
di: Saligram, Prady, et al.
Pubblicazione: (2025)
di: Saligram, Prady, et al.
Pubblicazione: (2025)
Reward Models in Deep Reinforcement Learning: A Survey
di: Yu, Rui, et al.
Pubblicazione: (2025)
di: Yu, Rui, et al.
Pubblicazione: (2025)
Pentest-R1: Towards Autonomous Penetration Testing Reasoning Optimized via Two-Stage Reinforcement Learning
di: Kong, He, et al.
Pubblicazione: (2025)
di: Kong, He, et al.
Pubblicazione: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
di: Frans, Kevin, et al.
Pubblicazione: (2024) -
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
di: Ma, Haozhe, et al.
Pubblicazione: (2024) -
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
di: Ma, Haozhe, et al.
Pubblicazione: (2024) -
UniMAP: Universal SMILES-Graph Representation Learning
di: Feng, Shikun, et al.
Pubblicazione: (2023) -
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
di: Kim, Gihoon, et al.
Pubblicazione: (2026)