Streaming Looking Ahead with Token-level Self-reward
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Hongming, Hong, Ruixin, Yu, Dong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Look Before Leap: Look-Ahead Planning with Uncertainty in Reinforcement Learning
di: Liu, Yongshuai, et al.
Pubblicazione: (2025)
di: Liu, Yongshuai, et al.
Pubblicazione: (2025)
A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning
di: Hong, Ruixin, et al.
Pubblicazione: (2023)
di: Hong, Ruixin, et al.
Pubblicazione: (2023)
Self-rewarding correction for mathematical reasoning
di: Xiong, Wei, et al.
Pubblicazione: (2025)
di: Xiong, Wei, et al.
Pubblicazione: (2025)
Looking Ahead to Avoid Being Late: Solving Hard-Constrained Traveling Salesman Problem
di: Chen, Jingxiao, et al.
Pubblicazione: (2024)
di: Chen, Jingxiao, et al.
Pubblicazione: (2024)
Evidence of Learned Look-Ahead in a Chess-Playing Neural Network
di: Jenner, Erik, et al.
Pubblicazione: (2024)
di: Jenner, Erik, et al.
Pubblicazione: (2024)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
di: Sheng, Leheng, et al.
Pubblicazione: (2026)
di: Sheng, Leheng, et al.
Pubblicazione: (2026)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
Episodic Reinforcement Learning with Expanded State-reward Space
di: Liang, Dayang, et al.
Pubblicazione: (2024)
di: Liang, Dayang, et al.
Pubblicazione: (2024)
Noise-based reward-modulated learning
di: Fernández, Jesús García, et al.
Pubblicazione: (2025)
di: Fernández, Jesús García, et al.
Pubblicazione: (2025)
Active teacher selection for reward learning
di: Freedman, Rachel, et al.
Pubblicazione: (2023)
di: Freedman, Rachel, et al.
Pubblicazione: (2023)
NExT-Guard: Training-Free Streaming Safeguard without Token-Level Labels
di: Fang, Junfeng, et al.
Pubblicazione: (2026)
di: Fang, Junfeng, et al.
Pubblicazione: (2026)
The impact of intrinsic rewards on exploration in Reinforcement Learning
di: Kayal, Aya, et al.
Pubblicazione: (2025)
di: Kayal, Aya, et al.
Pubblicazione: (2025)
EVAL: EigenVector-based Average-reward Learning
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
Local Look-Ahead Guidance via Verifier-in-the-Loop for Automated Theorem Proving
di: Rajaee, Sara, et al.
Pubblicazione: (2025)
di: Rajaee, Sara, et al.
Pubblicazione: (2025)
Look-Ahead-Bench: a Standardized Benchmark of Look-ahead Bias in Point-in-Time LLMs for Finance
di: Benhenda, Mostapha
Pubblicazione: (2026)
di: Benhenda, Mostapha
Pubblicazione: (2026)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
di: Huang, Chengsong, et al.
Pubblicazione: (2025)
di: Huang, Chengsong, et al.
Pubblicazione: (2025)
JTok: On Token Embedding as another Axis of Scaling Law via Joint Token Self-modulation
di: Yang, Yebin, et al.
Pubblicazione: (2026)
di: Yang, Yebin, et al.
Pubblicazione: (2026)
Summoning the Oracle to Slay It: Mitigating Look-Ahead Bias in Financial Backtesting with Large Language Models
di: Li, Weixian Waylon, et al.
Pubblicazione: (2026)
di: Li, Weixian Waylon, et al.
Pubblicazione: (2026)
Risk-averse Total-reward MDPs with ERM and EVaR
di: Su, Xihong, et al.
Pubblicazione: (2024)
di: Su, Xihong, et al.
Pubblicazione: (2024)
reward-lens: A Mechanistic Interpretability Library for Reward Models
di: Nadaf, Mohammed Suhail B
Pubblicazione: (2026)
di: Nadaf, Mohammed Suhail B
Pubblicazione: (2026)
LookAhead Tuning: Safer Language Models via Partial Answer Previews
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
HelpSteer2: Open-source dataset for training top-performing reward models
di: Wang, Zhilin, et al.
Pubblicazione: (2024)
di: Wang, Zhilin, et al.
Pubblicazione: (2024)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
Stream-level flow matching with Gaussian processes
di: Wei, Ganchao, et al.
Pubblicazione: (2024)
di: Wei, Ganchao, et al.
Pubblicazione: (2024)
Zero-Incentive Dynamics: a look at reward sparsity through the lens of unrewarded subgoals
di: Molinghen, Yannick, et al.
Pubblicazione: (2025)
di: Molinghen, Yannick, et al.
Pubblicazione: (2025)
DSAT-HD: Dual-Stream Adaptive Transformer with Hybrid Decomposition for Multivariate Time Series Forecasting
di: Wang, Zixu, et al.
Pubblicazione: (2025)
di: Wang, Zixu, et al.
Pubblicazione: (2025)
Interpreting What Typical Fault Signals Look Like via Prototype-matching
di: Chen, Qian, et al.
Pubblicazione: (2024)
di: Chen, Qian, et al.
Pubblicazione: (2024)
Back to the Future: Look-ahead Augmentation and Parallel Self-Refinement for Time Series Forecasting
di: Kim, Sunho, et al.
Pubblicazione: (2026)
di: Kim, Sunho, et al.
Pubblicazione: (2026)
ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy
di: Li, Hongming, et al.
Pubblicazione: (2024)
di: Li, Hongming, et al.
Pubblicazione: (2024)
Leveraging LLMs for reward function design in reinforcement learning control tasks
di: Cardenoso, Franklin, et al.
Pubblicazione: (2025)
di: Cardenoso, Franklin, et al.
Pubblicazione: (2025)
Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling
di: Ganescu, Bianca-Mihaela, et al.
Pubblicazione: (2025)
di: Ganescu, Bianca-Mihaela, et al.
Pubblicazione: (2025)
A Closer Look at the Application of Causal Inference in Graph Representation Learning
di: Gao, Hang, et al.
Pubblicazione: (2026)
di: Gao, Hang, et al.
Pubblicazione: (2026)
Enhanced Graph Transformer with Serialized Graph Tokens
di: Wang, Ruixiang, et al.
Pubblicazione: (2026)
di: Wang, Ruixiang, et al.
Pubblicazione: (2026)
On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models
di: Zhao, Chongyang, et al.
Pubblicazione: (2026)
di: Zhao, Chongyang, et al.
Pubblicazione: (2026)
Conformal Prediction for Electricity Price Forecasting in the Day-Ahead and Real-Time Balancing Market
di: O'Connor, Ciaran, et al.
Pubblicazione: (2025)
di: O'Connor, Ciaran, et al.
Pubblicazione: (2025)
ProSpec RL: Plan Ahead, then Execute
di: Liu, Liangliang, et al.
Pubblicazione: (2024)
di: Liu, Liangliang, et al.
Pubblicazione: (2024)
Generalized Incremental Learning under Concept Drift across Evolving Data Streams
di: Yu, En, et al.
Pubblicazione: (2025)
di: Yu, En, et al.
Pubblicazione: (2025)
Length-MAX Tokenizer for Language Models
di: Dong, Dong, et al.
Pubblicazione: (2025)
di: Dong, Dong, et al.
Pubblicazione: (2025)
Understanding Hardness of Vision-Language Compositionality from A Token-level Causal Lens
di: Chen, Ziliang, et al.
Pubblicazione: (2025)
di: Chen, Ziliang, et al.
Pubblicazione: (2025)
Towards Unified Approaches in Self-Supervised Event Stream Modeling: Progress and Prospects
di: Zólyomi, Levente, et al.
Pubblicazione: (2025)
di: Zólyomi, Levente, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Look Before Leap: Look-Ahead Planning with Uncertainty in Reinforcement Learning
di: Liu, Yongshuai, et al.
Pubblicazione: (2025) -
A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning
di: Hong, Ruixin, et al.
Pubblicazione: (2023) -
Self-rewarding correction for mathematical reasoning
di: Xiong, Wei, et al.
Pubblicazione: (2025) -
Looking Ahead to Avoid Being Late: Solving Hard-Constrained Traveling Salesman Problem
di: Chen, Jingxiao, et al.
Pubblicazione: (2024) -
Evidence of Learned Look-Ahead in a Chess-Playing Neural Network
di: Jenner, Erik, et al.
Pubblicazione: (2024)