Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Kyuyoung, Wang, Kevin, Xie, Yunfei, Xu, Peiyang, Sheng, Peiyao, Wei, Chen, Wang, Zhangyang, Shin, Jinwoo, Viswanath, Pramod, Oh, Sewoong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CHANCERY: Evaluating Corporate Governance Reasoning Capabilities in Language Models
by: Irwin, Lucas, et al.
Published: (2025)
by: Irwin, Lucas, et al.
Published: (2025)
Scalable Fingerprinting of Large Language Models
by: Nasery, Anshul, et al.
Published: (2025)
by: Nasery, Anshul, et al.
Published: (2025)
Training AI to be Loyal
by: Oh, Sewoong, et al.
Published: (2025)
by: Oh, Sewoong, et al.
Published: (2025)
Personalized Language Models via Privacy-Preserving Evolutionary Model Merging
by: Kim, Kyuyoung, et al.
Published: (2025)
by: Kim, Kyuyoung, et al.
Published: (2025)
Self-Refining Language Model Anonymizers via Adversarial Distillation
by: Kim, Kyuyoung, et al.
Published: (2025)
by: Kim, Kyuyoung, et al.
Published: (2025)
Optimized Feature Generation for Tabular Data via LLMs with Decision Tree Reasoning
by: Nam, Jaehyun, et al.
Published: (2024)
by: Nam, Jaehyun, et al.
Published: (2024)
RedacBench: Can AI Erase Your Secrets?
by: Jeon, Hyunjun, et al.
Published: (2026)
by: Jeon, Hyunjun, et al.
Published: (2026)
Scalable and Robust LLM Unlearning by Correcting Responses with Retrieved Exclusions
by: Kim, Junbeom, et al.
Published: (2025)
by: Kim, Junbeom, et al.
Published: (2025)
DeepPolar: Inventing Nonlinear Large-Kernel Polar Codes via Deep Learning
by: Hebbar, S Ashwin, et al.
Published: (2024)
by: Hebbar, S Ashwin, et al.
Published: (2024)
Are Robust LLM Fingerprints Adversarially Robust?
by: Nasery, Anshul, et al.
Published: (2025)
by: Nasery, Anshul, et al.
Published: (2025)
Proof of Diligence: Cryptoeconomic Security for Rollups
by: Sheng, Peiyao, et al.
Published: (2024)
by: Sheng, Peiyao, et al.
Published: (2024)
BFT-PoLoc: A Byzantine Fortified Trigonometric Proof of Location Protocol using Internet Delays
by: Sheng, Peiyao, et al.
Published: (2024)
by: Sheng, Peiyao, et al.
Published: (2024)
Unconditionally Safe Light Client
by: Moshrefi, Niusha, et al.
Published: (2024)
by: Moshrefi, Niusha, et al.
Published: (2024)
SPIN-Bench: How Well Do LLMs Plan Strategically and Reason Socially?
by: Yao, Jianzhu, et al.
Published: (2025)
by: Yao, Jianzhu, et al.
Published: (2025)
Real AI Agents with Fake Memories: Fatal Context Manipulation Attacks on Web3 Agents
by: Patlan, Atharv Singh, et al.
Published: (2025)
by: Patlan, Atharv Singh, et al.
Published: (2025)
MURMUR: Using cross-user chatter to break collaborative language agents in groups
by: Patlan, Atharv Singh, et al.
Published: (2025)
by: Patlan, Atharv Singh, et al.
Published: (2025)
CFT-Forensics: High-Performance Byzantine Accountability for Crash Fault Tolerant Protocols
by: Tang, Weizhao, et al.
Published: (2023)
by: Tang, Weizhao, et al.
Published: (2023)
Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback
by: Kim, Kyuyoung, et al.
Published: (2024)
by: Kim, Kyuyoung, et al.
Published: (2024)
VeRA: Verified Reasoning Data Augmentation at Scale
by: Cheng, Zerui, et al.
Published: (2026)
by: Cheng, Zerui, et al.
Published: (2026)
MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games
by: Xie, Yunfei, et al.
Published: (2026)
by: Xie, Yunfei, et al.
Published: (2026)
Verifier-free Test-Time Sampling for Vision Language Action Models
by: Jang, Suhyeok, et al.
Published: (2025)
by: Jang, Suhyeok, et al.
Published: (2025)
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
by: Chen, Ding, et al.
Published: (2025)
by: Chen, Ding, et al.
Published: (2025)
Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models
by: Kim, Kyuyoung, et al.
Published: (2024)
by: Kim, Kyuyoung, et al.
Published: (2024)
Split the Yield, Share the Risk: Pricing, Hedging and Fixed rates in DeFi
by: Nadkarni, Viraj, et al.
Published: (2025)
by: Nadkarni, Viraj, et al.
Published: (2025)
From <Answer> to <Think>: Multidimensional Supervision of Reasoning Process for LLM Optimization
by: Wang, Beining, et al.
Published: (2025)
by: Wang, Beining, et al.
Published: (2025)
Open Deep Search: Democratizing Search with Open-source Reasoning Agents
by: Alzubi, Salaheddin, et al.
Published: (2025)
by: Alzubi, Salaheddin, et al.
Published: (2025)
Beyond Correctness: Learning Robust Reasoning via Transfer
by: Lee, Hyunseok, et al.
Published: (2026)
by: Lee, Hyunseok, et al.
Published: (2026)
Verifying Correctness of Shared Channels in a Cooperatively Scheduled Process-Oriented Language
by: Pedersen, Jan, et al.
Published: (2025)
by: Pedersen, Jan, et al.
Published: (2025)
Small Language Models Need Strong Verifiers to Self-Correct Reasoning
by: Zhang, Yunxiang, et al.
Published: (2024)
by: Zhang, Yunxiang, et al.
Published: (2024)
Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents
by: Lee, Dongjun, et al.
Published: (2025)
by: Lee, Dongjun, et al.
Published: (2025)
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
by: Jeon, Byungwoo, et al.
Published: (2026)
by: Jeon, Byungwoo, et al.
Published: (2026)
TabularMath: Evaluating Computational Extrapolation in Tabular Learning via Program-Verified Synthesis
by: Cheng, Zerui, et al.
Published: (2026)
by: Cheng, Zerui, et al.
Published: (2026)
Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision
by: Sun, Lingzhuang, et al.
Published: (2026)
by: Sun, Lingzhuang, et al.
Published: (2026)
EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
by: Gull, Ayesha, et al.
Published: (2025)
by: Gull, Ayesha, et al.
Published: (2025)
RoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learning
by: Kim, Seungku, et al.
Published: (2026)
by: Kim, Seungku, et al.
Published: (2026)
AgileRate: Bringing Adaptivity and Robustness to DeFi Lending Markets
by: Bastankhah, Mahsa, et al.
Published: (2024)
by: Bastankhah, Mahsa, et al.
Published: (2024)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
by: Yoon, Deokgyu, et al.
Published: (2026)
by: Yoon, Deokgyu, et al.
Published: (2026)
Question-Answer Cross Language Image Matching for Weakly Supervised Semantic Segmentation
by: Deng, Songhe, et al.
Published: (2024)
by: Deng, Songhe, et al.
Published: (2024)
Adaptive Curves for Optimally Efficient Market Making
by: Nadkarni, Viraj, et al.
Published: (2024)
by: Nadkarni, Viraj, et al.
Published: (2024)
Privacy-Preserving Instructions for Aligning Large Language Models
by: Yu, Da, et al.
Published: (2024)
by: Yu, Da, et al.
Published: (2024)
Similar Items
-
CHANCERY: Evaluating Corporate Governance Reasoning Capabilities in Language Models
by: Irwin, Lucas, et al.
Published: (2025) -
Scalable Fingerprinting of Large Language Models
by: Nasery, Anshul, et al.
Published: (2025) -
Training AI to be Loyal
by: Oh, Sewoong, et al.
Published: (2025) -
Personalized Language Models via Privacy-Preserving Evolutionary Model Merging
by: Kim, Kyuyoung, et al.
Published: (2025) -
Self-Refining Language Model Anonymizers via Adversarial Distillation
by: Kim, Kyuyoung, et al.
Published: (2025)