When Is Compositional Reasoning Learnable from Verifiable Rewards?
Fuente:
arXiv
Salvato in:
| Autori principali: | Barzilai, Daniel, Wolf, Yotam, Basri, Ronen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Controlling the Inductive Bias of Wide Neural Networks by Modifying the Kernel's Spectrum
di: Geifman, Amnon, et al.
Pubblicazione: (2023)
di: Geifman, Amnon, et al.
Pubblicazione: (2023)
Querying Kernel Methods Suffices for Reconstructing their Training Data
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
When Models Don't Collapse: On the Consistency of Iterative MLE
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
Likelihood Training of Cascaded Diffusion Models via Hierarchical Volume-preserving Maps
di: Li, Henry, et al.
Pubblicazione: (2025)
di: Li, Henry, et al.
Pubblicazione: (2025)
Reward Hacking Mitigation using Verifiable Composite Rewards
di: Tarek, Mirza Farhan Bin, et al.
Pubblicazione: (2025)
di: Tarek, Mirza Farhan Bin, et al.
Pubblicazione: (2025)
Limitations of SGD for Multi-Index Models Beyond Statistical Queries
di: Barzilai, Daniel, et al.
Pubblicazione: (2026)
di: Barzilai, Daniel, et al.
Pubblicazione: (2026)
SpectralNet: Spectral Clustering using Deep Neural Networks
di: Shaham, Uri, et al.
Pubblicazione: (2018)
di: Shaham, Uri, et al.
Pubblicazione: (2018)
Generalization in Kernel Regression Under Realistic Assumptions
di: Barzilai, Daniel, et al.
Pubblicazione: (2023)
di: Barzilai, Daniel, et al.
Pubblicazione: (2023)
Simple Relative Deviation Bounds for Covariance and Gram Matrices
di: Barzilai, Daniel, et al.
Pubblicazione: (2024)
di: Barzilai, Daniel, et al.
Pubblicazione: (2024)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
di: Kim, Yoonjeon, et al.
Pubblicazione: (2025)
di: Kim, Yoonjeon, et al.
Pubblicazione: (2025)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
Fully Learnable Neural Reward Machines
di: Dewidar, Hazem, et al.
Pubblicazione: (2025)
di: Dewidar, Hazem, et al.
Pubblicazione: (2025)
Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward
di: Chen, Jianlong, et al.
Pubblicazione: (2026)
di: Chen, Jianlong, et al.
Pubblicazione: (2026)
Prediction-sharing During Training and Inference
di: Gafni, Yotam, et al.
Pubblicazione: (2024)
di: Gafni, Yotam, et al.
Pubblicazione: (2024)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
di: Wang, Li, et al.
Pubblicazione: (2026)
di: Wang, Li, et al.
Pubblicazione: (2026)
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
Online Learnability of Chain-of-Thought Verifiers: Soundness and Completeness Trade-offs
di: Balcan, Maria-Florina, et al.
Pubblicazione: (2026)
di: Balcan, Maria-Florina, et al.
Pubblicazione: (2026)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
di: Stojanovski, Zafir, et al.
Pubblicazione: (2025)
di: Stojanovski, Zafir, et al.
Pubblicazione: (2025)
Identifying and Evaluating Inactive Heads in Pretrained LLMs
di: Sandoval-Segura, Pedro, et al.
Pubblicazione: (2025)
di: Sandoval-Segura, Pedro, et al.
Pubblicazione: (2025)
Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards
di: Zhu, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2026)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
Beyond Benign Overfitting in Nadaraya-Watson Interpolators
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems
di: Röpke, Willem, et al.
Pubblicazione: (2026)
di: Röpke, Willem, et al.
Pubblicazione: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
di: Zhang, Zijing, et al.
Pubblicazione: (2025)
di: Zhang, Zijing, et al.
Pubblicazione: (2025)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2025)
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2025)
Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards
di: Heckel, Reinhard, et al.
Pubblicazione: (2026)
di: Heckel, Reinhard, et al.
Pubblicazione: (2026)
Generative Verifiers: Reward Modeling as Next-Token Prediction
di: Zhang, Lunjun, et al.
Pubblicazione: (2024)
di: Zhang, Lunjun, et al.
Pubblicazione: (2024)
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
di: Singhi, Nishad, et al.
Pubblicazione: (2025)
di: Singhi, Nishad, et al.
Pubblicazione: (2025)
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
di: Zhang, Junjie, et al.
Pubblicazione: (2026)
di: Zhang, Junjie, et al.
Pubblicazione: (2026)
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
di: Zeng, Guanning, et al.
Pubblicazione: (2025)
di: Zeng, Guanning, et al.
Pubblicazione: (2025)
Learning to Reason at the Frontier of Learnability
di: Foster, Thomas, et al.
Pubblicazione: (2025)
di: Foster, Thomas, et al.
Pubblicazione: (2025)
CinePile: A Long Video Question Answering Dataset and Benchmark
di: Rawal, Ruchit, et al.
Pubblicazione: (2024)
di: Rawal, Ruchit, et al.
Pubblicazione: (2024)
Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs
di: Alam, Md Tanvirul, et al.
Pubblicazione: (2026)
di: Alam, Md Tanvirul, et al.
Pubblicazione: (2026)
An Imperfect Verifier is Good Enough: Learning with Noisy Rewards
di: Plesner, Andreas, et al.
Pubblicazione: (2026)
di: Plesner, Andreas, et al.
Pubblicazione: (2026)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning
di: Wachi, Akifumi, et al.
Pubblicazione: (2026)
di: Wachi, Akifumi, et al.
Pubblicazione: (2026)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
di: Zhang, Feng, et al.
Pubblicazione: (2026)
di: Zhang, Feng, et al.
Pubblicazione: (2026)
Are Convex Optimization Curves Convex?
di: Barzilai, Guy, et al.
Pubblicazione: (2025)
di: Barzilai, Guy, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Controlling the Inductive Bias of Wide Neural Networks by Modifying the Kernel's Spectrum
di: Geifman, Amnon, et al.
Pubblicazione: (2023) -
Querying Kernel Methods Suffices for Reconstructing their Training Data
di: Barzilai, Daniel, et al.
Pubblicazione: (2025) -
When Models Don't Collapse: On the Consistency of Iterative MLE
di: Barzilai, Daniel, et al.
Pubblicazione: (2025) -
Likelihood Training of Cascaded Diffusion Models via Hierarchical Volume-preserving Maps
di: Li, Henry, et al.
Pubblicazione: (2025) -
Reward Hacking Mitigation using Verifiable Composite Rewards
di: Tarek, Mirza Farhan Bin, et al.
Pubblicazione: (2025)