Small Language Models Need Strong Verifiers to Self-Correct Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yunxiang, Khalifa, Muhammad, Logeswaran, Lajanugen, Kim, Jaekyeom, Lee, Moontae, Lee, Honglak, Wang, Lu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2023)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2023)
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2026)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2026)
Process Reward Models That Think
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025)
Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agents
von: Kim, Jaekyeom, et al.
Veröffentlicht: (2024)
von: Kim, Jaekyeom, et al.
Veröffentlicht: (2024)
Understanding the Capabilities and Limitations of Large Language Models for Cultural Commonsense
von: Shen, Siqi, et al.
Veröffentlicht: (2024)
von: Shen, Siqi, et al.
Veröffentlicht: (2024)
MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?
von: Zhang, Yunxiang, et al.
Veröffentlicht: (2025)
von: Zhang, Yunxiang, et al.
Veröffentlicht: (2025)
AutoGuide: Automated Generation and Selection of Context-Aware Guidelines for Large Language Model Agents
von: Fu, Yao, et al.
Veröffentlicht: (2024)
von: Fu, Yao, et al.
Veröffentlicht: (2024)
Revisiting LLM Value Probing Strategies: Are They Robust and Expressive?
von: Shen, Siqi, et al.
Veröffentlicht: (2025)
von: Shen, Siqi, et al.
Veröffentlicht: (2025)
Selective LoRA for Visual Tokens and Attention Heads
von: Luo, Tiange, et al.
Veröffentlicht: (2025)
von: Luo, Tiange, et al.
Veröffentlicht: (2025)
SPRIG: Improving Large Language Model Performance by System Prompt Optimization
von: Zhang, Lechen, et al.
Veröffentlicht: (2024)
von: Zhang, Lechen, et al.
Veröffentlicht: (2024)
When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models
von: Zheng, Mingqian, et al.
Veröffentlicht: (2023)
von: Zheng, Mingqian, et al.
Veröffentlicht: (2023)
Scaling Web Agent Training through Automatic Data Generation and Fine-grained Evaluation
von: Logeswaran, Lajanugen, et al.
Veröffentlicht: (2026)
von: Logeswaran, Lajanugen, et al.
Veröffentlicht: (2026)
Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages
von: Zhang, Lechen, et al.
Veröffentlicht: (2025)
von: Zhang, Lechen, et al.
Veröffentlicht: (2025)
You don't need a personality test to know these models are unreliable: Assessing the Reliability of Large Language Models on Psychometric Instruments
von: Shu, Bangzhao, et al.
Veröffentlicht: (2023)
von: Shu, Bangzhao, et al.
Veröffentlicht: (2023)
Visual Test-time Scaling for GUI Agent Grounding
von: Luo, Tiange, et al.
Veröffentlicht: (2025)
von: Luo, Tiange, et al.
Veröffentlicht: (2025)
Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents
von: Jang, Yunseok, et al.
Veröffentlicht: (2025)
von: Jang, Yunseok, et al.
Veröffentlicht: (2025)
Source-Aware Training Enables Knowledge Attribution in Language Models
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2024)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2024)
Interactive and Expressive Code-Augmented Planning with Large Language Models
von: Liu, Anthony Z., et al.
Veröffentlicht: (2024)
von: Liu, Anthony Z., et al.
Veröffentlicht: (2024)
Small Language Models are Equation Reasoners
von: Kim, Bumjun, et al.
Veröffentlicht: (2024)
von: Kim, Bumjun, et al.
Veröffentlicht: (2024)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
von: Zhang, Yunxiang, et al.
Veröffentlicht: (2025)
von: Zhang, Yunxiang, et al.
Veröffentlicht: (2025)
Self-Correcting Code Generation Using Small Language Models
von: Cho, Jeonghun, et al.
Veröffentlicht: (2025)
von: Cho, Jeonghun, et al.
Veröffentlicht: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
von: Zhang, Yunxiang, et al.
Veröffentlicht: (2025)
von: Zhang, Yunxiang, et al.
Veröffentlicht: (2025)
DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation
von: Han, Janghoon, et al.
Veröffentlicht: (2025)
von: Han, Janghoon, et al.
Veröffentlicht: (2025)
LitCab: Lightweight Language Model Calibration over Short- and Long-form Responses
von: Liu, Xin, et al.
Veröffentlicht: (2023)
von: Liu, Xin, et al.
Veröffentlicht: (2023)
Lost in the Noise: How Reasoning Models Fail with Contextual Distractors
von: Lee, Seongyun, et al.
Veröffentlicht: (2026)
von: Lee, Seongyun, et al.
Veröffentlicht: (2026)
LG AI Research & KAIST at EHRSQL 2024: Self-Training Large Language Models with Pseudo-Labeled Unanswerable Questions for a Reliable Text-to-SQL System on EHRs
von: Jo, Yongrae, et al.
Veröffentlicht: (2024)
von: Jo, Yongrae, et al.
Veröffentlicht: (2024)
Do LLMs Need Inherent Reasoning Before Reinforcement Learning? A Study in Korean Self-Correction
von: Kim, Hongjin, et al.
Veröffentlicht: (2026)
von: Kim, Hongjin, et al.
Veröffentlicht: (2026)
Mentor-KD: Making Small Language Models Better Multi-step Reasoners
von: Lee, Hojae, et al.
Veröffentlicht: (2024)
von: Lee, Hojae, et al.
Veröffentlicht: (2024)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
von: Kim, Kyuyoung, et al.
Veröffentlicht: (2026)
von: Kim, Kyuyoung, et al.
Veröffentlicht: (2026)
Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models
von: Kim, Jiyeon, et al.
Veröffentlicht: (2026)
von: Kim, Jiyeon, et al.
Veröffentlicht: (2026)
Learning to Self-Verify Makes Language Models Better Reasoners
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
VerifiNER: Verification-augmented NER via Knowledge-grounded Reasoning with Large Language Models
von: Kim, Seoyeon, et al.
Veröffentlicht: (2024)
von: Kim, Seoyeon, et al.
Veröffentlicht: (2024)
If You Can't Use Them, Recycle Them: Optimizing Merging at Scale Mitigates Performance Tradeoffs
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2024)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2024)
Small Language Models Learn Enhanced Reasoning Skills from Medical Textbooks
von: Kim, Hyunjae, et al.
Veröffentlicht: (2024)
von: Kim, Hyunjae, et al.
Veröffentlicht: (2024)
Reinforcement Learning from Reflective Feedback (RLRF): Aligning and Improving LLMs via Fine-Grained Self-Reflection
von: Lee, Kyungjae, et al.
Veröffentlicht: (2024)
von: Lee, Kyungjae, et al.
Veröffentlicht: (2024)
In Their Own Words: Reasoning Traces Tailored for Small Models Make Them Better Reasoners
von: Kim, Jaehoon, et al.
Veröffentlicht: (2025)
von: Kim, Jaehoon, et al.
Veröffentlicht: (2025)
Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models
von: Kim, Seungone, et al.
Veröffentlicht: (2024)
von: Kim, Seungone, et al.
Veröffentlicht: (2024)
One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL
von: Chae, Hyungjoo, et al.
Veröffentlicht: (2025)
von: Chae, Hyungjoo, et al.
Veröffentlicht: (2025)
Learning to Reason via Self-Iterative Process Feedback for Small Language Models
von: Chen, Kaiyuan, et al.
Veröffentlicht: (2024)
von: Chen, Kaiyuan, et al.
Veröffentlicht: (2024)
On Many-Shot In-Context Learning for Long-Context Evaluation
von: Zou, Kaijian, et al.
Veröffentlicht: (2024)
von: Zou, Kaijian, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2023) -
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2026) -
Process Reward Models That Think
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025) -
Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agents
von: Kim, Jaekyeom, et al.
Veröffentlicht: (2024) -
Understanding the Capabilities and Limitations of Large Language Models for Cultural Commonsense
von: Shen, Siqi, et al.
Veröffentlicht: (2024)