Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
Fuente:
arXiv
Salvato in:
| Autori principali: | Bansal, Hritik, Hosseini, Arian, Agarwal, Rishabh, Tran, Vinh Q., Kazemi, Mehran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
di: Singhi, Nishad, et al.
Pubblicazione: (2025)
di: Singhi, Nishad, et al.
Pubblicazione: (2025)
V-STaR: Training Verifiers for Self-Taught Reasoners
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers
di: Sareen, Kusha, et al.
Pubblicazione: (2025)
di: Sareen, Kusha, et al.
Pubblicazione: (2025)
Generative Verifiers: Reward Modeling as Next-Token Prediction
di: Zhang, Lunjun, et al.
Pubblicazione: (2024)
di: Zhang, Lunjun, et al.
Pubblicazione: (2024)
Smaller = Weaker? Benchmarking Robustness of Quantized LLMs in Code Generation
di: Fang, Sen, et al.
Pubblicazione: (2025)
di: Fang, Sen, et al.
Pubblicazione: (2025)
Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators
di: Bansal, Hritik, et al.
Pubblicazione: (2025)
di: Bansal, Hritik, et al.
Pubblicazione: (2025)
Mixed Distillation Helps Smaller Language Model Better Reasoning
di: Li, Chenglin, et al.
Pubblicazione: (2023)
di: Li, Chenglin, et al.
Pubblicazione: (2023)
Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
Weaker LLMs' Opinions Also Matter: Mixture of Opinions Enhances LLM's Mathematical Reasoning
di: Chen, Yanan, et al.
Pubblicazione: (2025)
di: Chen, Yanan, et al.
Pubblicazione: (2025)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
di: Bansal, Hritik, et al.
Pubblicazione: (2023)
di: Bansal, Hritik, et al.
Pubblicazione: (2023)
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
di: Suvarna, Ashima, et al.
Pubblicazione: (2026)
di: Suvarna, Ashima, et al.
Pubblicazione: (2026)
Fractal Patterns May Illuminate the Success of Next-Token Prediction
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2024)
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2024)
Better LLM Reasoning via Dual-Play
di: Zhang, Zhengxin, et al.
Pubblicazione: (2025)
di: Zhang, Zhengxin, et al.
Pubblicazione: (2025)
MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation
di: Bansal, Prakhar, et al.
Pubblicazione: (2026)
di: Bansal, Prakhar, et al.
Pubblicazione: (2026)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
Learning From Mistakes Makes LLM Better Reasoner
di: An, Shengnan, et al.
Pubblicazione: (2023)
di: An, Shengnan, et al.
Pubblicazione: (2023)
Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks
di: Chandra, Abhranil, et al.
Pubblicazione: (2025)
di: Chandra, Abhranil, et al.
Pubblicazione: (2025)
LLM-REVal: Can We Trust LLM Reviewers Yet?
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
Towards Compute-Optimal Many-Shot In-Context Learning
di: Golchin, Shahriar, et al.
Pubblicazione: (2025)
di: Golchin, Shahriar, et al.
Pubblicazione: (2025)
Enhancing Generalization in Chain of Thought Reasoning for Smaller Models
di: Yin, Maxwell J., et al.
Pubblicazione: (2025)
di: Yin, Maxwell J., et al.
Pubblicazione: (2025)
Large Language Models Cannot Self-Correct Reasoning Yet
di: Huang, Jie, et al.
Pubblicazione: (2023)
di: Huang, Jie, et al.
Pubblicazione: (2023)
Linguistic Complexity and Socio-cultural Patterns in Hip-Hop Lyrics
di: Bansal, Aayam, et al.
Pubblicazione: (2025)
di: Bansal, Aayam, et al.
Pubblicazione: (2025)
Integrating Arithmetic Learning Improves Mathematical Reasoning in Smaller Models
di: Gangwar, Neeraj, et al.
Pubblicazione: (2025)
di: Gangwar, Neeraj, et al.
Pubblicazione: (2025)
Extending Token Computation for LLM Reasoning
di: Liao, Bingli, et al.
Pubblicazione: (2024)
di: Liao, Bingli, et al.
Pubblicazione: (2024)
Training With "Paraphrasing the Original Text" Teaches LLM to Better Retrieve in Long-context Tasks
di: Yu, Yijiong, et al.
Pubblicazione: (2023)
di: Yu, Yijiong, et al.
Pubblicazione: (2023)
A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
SynBullying: A Multi LLM Synthetic Conversational Dataset for Cyberbullying Detection
di: Kazemi, Arefeh, et al.
Pubblicazione: (2025)
di: Kazemi, Arefeh, et al.
Pubblicazione: (2025)
Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling
di: Wan, Guangya, et al.
Pubblicazione: (2024)
di: Wan, Guangya, et al.
Pubblicazione: (2024)
In-context Learning with Retrieved Demonstrations for Language Models: A Survey
di: Luo, Man, et al.
Pubblicazione: (2024)
di: Luo, Man, et al.
Pubblicazione: (2024)
Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling
di: Trung, Bui The, et al.
Pubblicazione: (2026)
di: Trung, Bui The, et al.
Pubblicazione: (2026)
Phenomenal Yet Puzzling: Testing Inductive Reasoning Capabilities of Language Models with Hypothesis Refinement
di: Qiu, Linlu, et al.
Pubblicazione: (2023)
di: Qiu, Linlu, et al.
Pubblicazione: (2023)
Scaling LLM Inference with Optimized Sample Compute Allocation
di: Zhang, Kexun, et al.
Pubblicazione: (2024)
di: Zhang, Kexun, et al.
Pubblicazione: (2024)
ViBidirectionMT-Eval: Machine Translation for Vietnamese-Chinese and Vietnamese-Lao language pair
di: Tran, Hong-Viet, et al.
Pubblicazione: (2025)
di: Tran, Hong-Viet, et al.
Pubblicazione: (2025)
Reasoning Models Better Express Their Confidence
di: Yoon, Dongkeun, et al.
Pubblicazione: (2025)
di: Yoon, Dongkeun, et al.
Pubblicazione: (2025)
AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents
di: Yang, Ke, et al.
Pubblicazione: (2024)
di: Yang, Ke, et al.
Pubblicazione: (2024)
Current Practices for Building LLM-Powered Reasoning Tools Are Ad Hoc -- and We Can Do Better
di: Bembenek, Aaron
Pubblicazione: (2025)
di: Bembenek, Aaron
Pubblicazione: (2025)
Can Small Language Models Help Large Language Models Reason Better?: LM-Guided Chain-of-Thought
di: Lee, Jooyoung, et al.
Pubblicazione: (2024)
di: Lee, Jooyoung, et al.
Pubblicazione: (2024)
Documenti analoghi
-
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
di: Singhi, Nishad, et al.
Pubblicazione: (2025) -
V-STaR: Training Verifiers for Self-Taught Reasoners
di: Hosseini, Arian, et al.
Pubblicazione: (2024) -
Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers
di: Sareen, Kusha, et al.
Pubblicazione: (2025) -
Generative Verifiers: Reward Modeling as Next-Token Prediction
di: Zhang, Lunjun, et al.
Pubblicazione: (2024) -
Smaller = Weaker? Benchmarking Robustness of Quantized LLMs in Code Generation
di: Fang, Sen, et al.
Pubblicazione: (2025)