V-STaR: Training Verifiers for Self-Taught Reasoners
Fuente:
arXiv
Salvato in:
| Autori principali: | Hosseini, Arian, Yuan, Xingdi, Malkin, Nikolay, Courville, Aaron, Sordoni, Alessandro, Agarwal, Rishabh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
di: Xiong, Feng, et al.
Pubblicazione: (2025)
di: Xiong, Feng, et al.
Pubblicazione: (2025)
RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner
di: Chang, Fu-Chieh, et al.
Pubblicazione: (2024)
di: Chang, Fu-Chieh, et al.
Pubblicazione: (2024)
Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers
di: Sareen, Kusha, et al.
Pubblicazione: (2025)
di: Sareen, Kusha, et al.
Pubblicazione: (2025)
AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
di: Koh, Woosung, et al.
Pubblicazione: (2025)
di: Koh, Woosung, et al.
Pubblicazione: (2025)
Not All LLM Reasoners Are Created Equal
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
STaR-SQL: Self-Taught Reasoner for Text-to-SQL
di: He, Mingqian, et al.
Pubblicazione: (2025)
di: He, Mingqian, et al.
Pubblicazione: (2025)
Kwai-STaR: Transform LLMs into State-Transition Reasoners
di: Lu, Xingyu, et al.
Pubblicazione: (2024)
di: Lu, Xingyu, et al.
Pubblicazione: (2024)
Guiding Language Model Reasoning with Planning Tokens
di: Wang, Xinyi, et al.
Pubblicazione: (2023)
di: Wang, Xinyi, et al.
Pubblicazione: (2023)
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
di: Zelikman, Eric, et al.
Pubblicazione: (2024)
di: Zelikman, Eric, et al.
Pubblicazione: (2024)
Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks
di: Chandra, Abhranil, et al.
Pubblicazione: (2025)
di: Chandra, Abhranil, et al.
Pubblicazione: (2025)
The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning
di: Aghajohari, Milad, et al.
Pubblicazione: (2025)
di: Aghajohari, Milad, et al.
Pubblicazione: (2025)
STaR-GATE: Teaching Language Models to Ask Clarifying Questions
di: Andukuri, Chinmaya, et al.
Pubblicazione: (2024)
di: Andukuri, Chinmaya, et al.
Pubblicazione: (2024)
Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
STaR-DRO: Stateful Tsallis Reweighting for Group-Robust Structured Prediction
di: Fodeh, Samah, et al.
Pubblicazione: (2026)
di: Fodeh, Samah, et al.
Pubblicazione: (2026)
STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models
di: Zhou, Jingjing, et al.
Pubblicazione: (2026)
di: Zhou, Jingjing, et al.
Pubblicazione: (2026)
Lean-STaR: Learning to Interleave Thinking and Proving
di: Lin, Haohan, et al.
Pubblicazione: (2024)
di: Lin, Haohan, et al.
Pubblicazione: (2024)
Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
di: Singhi, Nishad, et al.
Pubblicazione: (2025)
di: Singhi, Nishad, et al.
Pubblicazione: (2025)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
UnStar: Unlearning with Self-Taught Anti-Sample Reasoning for LLMs
di: Sinha, Yash, et al.
Pubblicazione: (2024)
di: Sinha, Yash, et al.
Pubblicazione: (2024)
Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)
STaR: Scalable Task-Conditioned Retrieval for Long-Horizon Multimodal Robot Memory
di: Yuan, Mingfeng, et al.
Pubblicazione: (2026)
di: Yuan, Mingfeng, et al.
Pubblicazione: (2026)
STaR: Towards Effective and Stable Table Reasoning via Slow-Thinking Large Language Models
di: Zhang, Huajian, et al.
Pubblicazione: (2025)
di: Zhang, Huajian, et al.
Pubblicazione: (2025)
Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation
di: Zelikman, Eric, et al.
Pubblicazione: (2023)
di: Zelikman, Eric, et al.
Pubblicazione: (2023)
Self-Taught Evaluators
di: Wang, Tianlu, et al.
Pubblicazione: (2024)
di: Wang, Tianlu, et al.
Pubblicazione: (2024)
Improving Context-Aware Preference Modeling for Language Models
di: Pitis, Silviu, et al.
Pubblicazione: (2024)
di: Pitis, Silviu, et al.
Pubblicazione: (2024)
Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play
di: Ye, Ziyu, et al.
Pubblicazione: (2024)
di: Ye, Ziyu, et al.
Pubblicazione: (2024)
STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models
di: Guo, Shaoxiong, et al.
Pubblicazione: (2025)
di: Guo, Shaoxiong, et al.
Pubblicazione: (2025)
Policy Improvement using Language Feedback Models
di: Zhong, Victor, et al.
Pubblicazione: (2024)
di: Zhong, Victor, et al.
Pubblicazione: (2024)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
di: Liu, Yixin, et al.
Pubblicazione: (2026)
di: Liu, Yixin, et al.
Pubblicazione: (2026)
Forgetting Transformer: Softmax Attention with a Forget Gate
di: Lin, Zhixuan, et al.
Pubblicazione: (2025)
di: Lin, Zhixuan, et al.
Pubblicazione: (2025)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
di: Lin, Weizhe, et al.
Pubblicazione: (2025)
di: Lin, Weizhe, et al.
Pubblicazione: (2025)
Mixtures of In-Context Learners
di: Hong, Giwon, et al.
Pubblicazione: (2024)
di: Hong, Giwon, et al.
Pubblicazione: (2024)
FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models
di: Lee, Seunghan, et al.
Pubblicazione: (2026)
di: Lee, Seunghan, et al.
Pubblicazione: (2026)
VinePPO: Refining Credit Assignment in RL Training of LLMs
di: Kazemnejad, Amirhossein, et al.
Pubblicazione: (2024)
di: Kazemnejad, Amirhossein, et al.
Pubblicazione: (2024)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
di: Wu, Di, et al.
Pubblicazione: (2026)
di: Wu, Di, et al.
Pubblicazione: (2026)
Adaptive Computation Pruning for the Forgetting Transformer
di: Lin, Zhixuan, et al.
Pubblicazione: (2025)
di: Lin, Zhixuan, et al.
Pubblicazione: (2025)
Scaling Stick-Breaking Attention: An Efficient Implementation and In-depth Study
di: Tan, Shawn, et al.
Pubblicazione: (2024)
di: Tan, Shawn, et al.
Pubblicazione: (2024)
Documenti analoghi
-
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
di: Zeng, Weihao, et al.
Pubblicazione: (2024) -
HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
di: Xiong, Feng, et al.
Pubblicazione: (2025) -
RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner
di: Chang, Fu-Chieh, et al.
Pubblicazione: (2024) -
Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers
di: Sareen, Kusha, et al.
Pubblicazione: (2025) -
AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
di: Koh, Woosung, et al.
Pubblicazione: (2025)