Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO
Fuente:
arXiv
Guardado en:
| Autores principales: | Pappone, Francesco, Lazzaroni, Ruggero Marino, Califano, Federico, Gentile, Niccolò, Marras, Roberto |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
por: Lazzaroni, Ruggero Marino, et al.
Publicado: (2025)
por: Lazzaroni, Ruggero Marino, et al.
Publicado: (2025)
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
por: Tan, Hongze, et al.
Publicado: (2025)
por: Tan, Hongze, et al.
Publicado: (2025)
Assessing Logical Reasoning Capabilities of Encoder-Only Transformer Models
por: Pirozelli, Paulo, et al.
Publicado: (2023)
por: Pirozelli, Paulo, et al.
Publicado: (2023)
Bridging the Semantic Gap: Contrastive Rewards for Multilingual Text-to-SQL with GRPO
por: Kattamuri, Ashish, et al.
Publicado: (2025)
por: Kattamuri, Ashish, et al.
Publicado: (2025)
Will LLMs Replace the Encoder-Only Models in Temporal Relation Classification?
por: Roccabruna, Gabriel, et al.
Publicado: (2024)
por: Roccabruna, Gabriel, et al.
Publicado: (2024)
Combining Transformers with Natural Language Explanations
por: Ruggeri, Federico, et al.
Publicado: (2021)
por: Ruggeri, Federico, et al.
Publicado: (2021)
Infini-News: Efficiently Queryable Access to 1.3 Billion Processed Common Crawl News Articles
por: Lazzaroni, Ruggero Marino, et al.
Publicado: (2026)
por: Lazzaroni, Ruggero Marino, et al.
Publicado: (2026)
Quasi-symbolic Semantic Geometry over Transformer-based Variational AutoEncoder
por: Zhang, Yingji, et al.
Publicado: (2022)
por: Zhang, Yingji, et al.
Publicado: (2022)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
por: Wei, Kangda, et al.
Publicado: (2026)
por: Wei, Kangda, et al.
Publicado: (2026)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
por: Zhong, Haitian, et al.
Publicado: (2026)
por: Zhong, Haitian, et al.
Publicado: (2026)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
por: Yang, Zixuan, et al.
Publicado: (2026)
por: Yang, Zixuan, et al.
Publicado: (2026)
Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?
por: Zhang, Yudi, et al.
Publicado: (2025)
por: Zhang, Yudi, et al.
Publicado: (2025)
Beyond Semantics: How Temporal Biases Shape Retrieval in Transformer and State-Space Models
por: Bajaj, Anooshka, et al.
Publicado: (2025)
por: Bajaj, Anooshka, et al.
Publicado: (2025)
One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
por: Fein, Daniel, et al.
Publicado: (2026)
por: Fein, Daniel, et al.
Publicado: (2026)
From Spectra to Geography: Intelligent Mapping of RRUFF Mineral Data
por: Pappone, Francesco, et al.
Publicado: (2024)
por: Pappone, Francesco, et al.
Publicado: (2024)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
por: Zhang, Qingru, et al.
Publicado: (2025)
por: Zhang, Qingru, et al.
Publicado: (2025)
Integrating Hierarchical Semantic into Iterative Generation Model for Entailment Tree Explanation
por: Wang, Qin, et al.
Publicado: (2024)
por: Wang, Qin, et al.
Publicado: (2024)
Illocutionary Explanation Planning for Source-Faithful Explanations in Retrieval-Augmented Language Models
por: Sovrano, Francesco, et al.
Publicado: (2026)
por: Sovrano, Francesco, et al.
Publicado: (2026)
LLM Self-Explanations Fail Semantic Invariance
por: Szeider, Stefan
Publicado: (2026)
por: Szeider, Stefan
Publicado: (2026)
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models
por: Maura-Rivero, Roberto-Rafael, et al.
Publicado: (2025)
por: Maura-Rivero, Roberto-Rafael, et al.
Publicado: (2025)
On the Transformations across Reward Model, Parameter Update, and In-Context Prompt
por: Cai, Deng, et al.
Publicado: (2024)
por: Cai, Deng, et al.
Publicado: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
por: Xie, Tianbao, et al.
Publicado: (2023)
por: Xie, Tianbao, et al.
Publicado: (2023)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
por: Elle
Publicado: (2025)
por: Elle
Publicado: (2025)
Transformers and Cortical Waves: Encoders for Pulling In Context Across Time
por: Muller, Lyle, et al.
Publicado: (2024)
por: Muller, Lyle, et al.
Publicado: (2024)
LabelFusion: Fusing Large Language Models with Transformer Encoders for Robust Financial News Classification
por: Schlee, Michael, et al.
Publicado: (2025)
por: Schlee, Michael, et al.
Publicado: (2025)
Learning Disentangled Semantic Spaces of Explanations via Invertible Neural Networks
por: Zhang, Yingji, et al.
Publicado: (2023)
por: Zhang, Yingji, et al.
Publicado: (2023)
Transformer-Encoder Trees for Efficient Multilingual Machine Translation and Speech Translation
por: Guan, Yiwen, et al.
Publicado: (2025)
por: Guan, Yiwen, et al.
Publicado: (2025)
Fine-tuning Transformer-based Encoder for Turkish Language Understanding Tasks
por: Yildirim, Savas
Publicado: (2024)
por: Yildirim, Savas
Publicado: (2024)
Multi-Task Pre-Finetuning of Lightweight Transformer Encoders for Text Classification and NER
por: Zhu, Junyi, et al.
Publicado: (2025)
por: Zhu, Junyi, et al.
Publicado: (2025)
Teaching LLMs to Abstain via Fine-Grained Semantic Confidence Reward
por: An, Hao, et al.
Publicado: (2025)
por: An, Hao, et al.
Publicado: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
por: Zhang, Xiaoying, et al.
Publicado: (2025)
por: Zhang, Xiaoying, et al.
Publicado: (2025)
Tiny Reward Models
por: Pan, Sarah
Publicado: (2025)
por: Pan, Sarah
Publicado: (2025)
Free(): Learning to Forget in Malloc-Only Reasoning Models
por: Zheng, Yilun, et al.
Publicado: (2026)
por: Zheng, Yilun, et al.
Publicado: (2026)
M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization
por: Bai, Bizhe, et al.
Publicado: (2025)
por: Bai, Bizhe, et al.
Publicado: (2025)
GRAM: A Generative Foundation Reward Model for Reward Generalization
por: Wang, Chenglong, et al.
Publicado: (2025)
por: Wang, Chenglong, et al.
Publicado: (2025)
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026)
por: Peng, Hao, et al.
Publicado: (2026)
Layer-Wise Evolution of Representations in Fine-Tuned Transformers: Insights from Sparse AutoEncoders
por: Nadipalli, Suneel
Publicado: (2025)
por: Nadipalli, Suneel
Publicado: (2025)
Ejemplares similares
-
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
por: Lazzaroni, Ruggero Marino, et al.
Publicado: (2025) -
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
por: Tan, Hongze, et al.
Publicado: (2025) -
Assessing Logical Reasoning Capabilities of Encoder-Only Transformer Models
por: Pirozelli, Paulo, et al.
Publicado: (2023) -
Bridging the Semantic Gap: Contrastive Rewards for Multilingual Text-to-SQL with GRPO
por: Kattamuri, Ashish, et al.
Publicado: (2025) -
Will LLMs Replace the Encoder-Only Models in Temporal Relation Classification?
por: Roccabruna, Gabriel, et al.
Publicado: (2024)