Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Yifei, Chakraborty, Tusher, Sharma, Srinagesh, Nunes, Leonardo, Sharma, Swati, Demopulos, Kate Drakos, Kıcıman, Emre, Lu, Songwu, Chandra, Ranveer |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SibylSense: Adaptive Rubric Learning via Memory Tuning and Adversarial Probing
by: Xu, Yifei, et al.
Published: (2026)
by: Xu, Yifei, et al.
Published: (2026)
Domain Adaptation for Sustainable Soil Management using Causal and Contrastive Constraint Minimization
by: Sharma, Somya, et al.
Published: (2024)
by: Sharma, Somya, et al.
Published: (2024)
RLTHF: Targeted Human Feedback for LLM Alignment
by: Xu, Yifei, et al.
Published: (2025)
by: Xu, Yifei, et al.
Published: (2025)
Enabling Adoption of Regenerative Agriculture through Soil Carbon Copilots
by: Capetz, Margaret, et al.
Published: (2024)
by: Capetz, Margaret, et al.
Published: (2024)
Causal Reasoning and Large Language Models: Opening a New Frontier for Causality
by: Kıcıman, Emre, et al.
Published: (2023)
by: Kıcıman, Emre, et al.
Published: (2023)
Orchestration for Domain-specific Edge-Cloud Language Models
by: Patidar, Prasoon, et al.
Published: (2025)
by: Patidar, Prasoon, et al.
Published: (2025)
Diagnosing Capability Gaps in Fine-Tuning Data
by: Taghanaki, Saeid Asgari, et al.
Published: (2026)
by: Taghanaki, Saeid Asgari, et al.
Published: (2026)
Modeling the Data-Generating Process is Necessary for Out-of-Distribution Generalization
by: Kaur, Jivat Neet, et al.
Published: (2022)
by: Kaur, Jivat Neet, et al.
Published: (2022)
Steering Large Language Models between Code Execution and Textual Reasoning
by: Chen, Yongchao, et al.
Published: (2024)
by: Chen, Yongchao, et al.
Published: (2024)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
by: Wang, Yuanfu, et al.
Published: (2026)
by: Wang, Yuanfu, et al.
Published: (2026)
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
by: Sharma, Swati, et al.
Published: (2026)
by: Sharma, Swati, et al.
Published: (2026)
Principles of experimental research / K. Srinagesh
by: Srinagesh, K
by: Srinagesh, K
DeepSpecs: Expert-Level Questions Answering in 5G
by: Manvattira, Aman Ganapathy, et al.
Published: (2025)
by: Manvattira, Aman Ganapathy, et al.
Published: (2025)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
by: Xu, Tianze, et al.
Published: (2026)
by: Xu, Tianze, et al.
Published: (2026)
Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
by: Sanders, Kate, et al.
Published: (2026)
by: Sanders, Kate, et al.
Published: (2026)
Enterprise AI Must Enforce Participant-Aware Access Control
by: Bhatt, Shashank Shreedhar, et al.
Published: (2025)
by: Bhatt, Shashank Shreedhar, et al.
Published: (2025)
SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes
by: Nandi, Palash, et al.
Published: (2024)
by: Nandi, Palash, et al.
Published: (2024)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
by: Jia, Mengzhao, et al.
Published: (2025)
by: Jia, Mengzhao, et al.
Published: (2025)
Temporal Reasoning in AI systems
by: Sharma, Abhishek
Published: (2025)
by: Sharma, Abhishek
Published: (2025)
Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
by: Sharma, Aman, et al.
Published: (2025)
by: Sharma, Aman, et al.
Published: (2025)
Queueing-Aware Optimization of Reasoning Tokens for Accuracy-Latency Trade-offs in LLM Servers
by: Ozbas, Emre, et al.
Published: (2026)
by: Ozbas, Emre, et al.
Published: (2026)
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
by: Liu, Xue, et al.
Published: (2026)
by: Liu, Xue, et al.
Published: (2026)
Inverse design of heterodeformations for strain soliton networks in bilayer 2D materials
by: Ahmed, Md Tusher, et al.
Published: (2026)
by: Ahmed, Md Tusher, et al.
Published: (2026)
Step-wise Rubric Rewards for LLM Reasoning
by: Xie, Weichu, et al.
Published: (2026)
by: Xie, Weichu, et al.
Published: (2026)
Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations
by: Matton, Katie, et al.
Published: (2025)
by: Matton, Katie, et al.
Published: (2025)
Narcotweets: Social Media in Wartime
by: Monroy-Hernández, Andrés, et al.
Published: (2015)
by: Monroy-Hernández, Andrés, et al.
Published: (2015)
Graphene Enriched Separators for Lithium‐Sulfur Batteries: Recent Advancements and Progress
by: Swati Gahlot, et al.
Published: (2026)
by: Swati Gahlot, et al.
Published: (2026)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
by: Sheng, Leheng, et al.
Published: (2026)
by: Sheng, Leheng, et al.
Published: (2026)
Self-Resolving Prediction Markets for Unverifiable Outcomes
by: Srinivasan, Siddarth, et al.
Published: (2023)
by: Srinivasan, Siddarth, et al.
Published: (2023)
Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks
by: Sharma, Arun
Published: (2026)
by: Sharma, Arun
Published: (2026)
Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance
by: Yu, Jiachen, et al.
Published: (2026)
by: Yu, Jiachen, et al.
Published: (2026)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
by: Lee, Jinu, et al.
Published: (2025)
by: Lee, Jinu, et al.
Published: (2025)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
by: Yuan, Youliang, et al.
Published: (2025)
by: Yuan, Youliang, et al.
Published: (2025)
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
by: Bhattarai, Manish, et al.
Published: (2026)
by: Bhattarai, Manish, et al.
Published: (2026)
Can LLMs Compute with Reasons?
by: Sandilya, Harshit, et al.
Published: (2024)
by: Sandilya, Harshit, et al.
Published: (2024)
DeduCE: Deductive Consistency as a Framework to Evaluate LLM Reasoning
by: Pandey, Atharva, et al.
Published: (2025)
by: Pandey, Atharva, et al.
Published: (2025)
DarkVesselNet: Multi-Modal Remote Sensing and Trajectory Reasoning for Dark Vessel Detection
by: Sharma, Arun
Published: (2026)
by: Sharma, Arun
Published: (2026)
Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text
by: Lu, Ximing, et al.
Published: (2026)
by: Lu, Ximing, et al.
Published: (2026)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
by: Lin, Zicheng, et al.
Published: (2024)
by: Lin, Zicheng, et al.
Published: (2024)
mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
by: Anugraha, David, et al.
Published: (2025)
by: Anugraha, David, et al.
Published: (2025)
Similar Items
-
SibylSense: Adaptive Rubric Learning via Memory Tuning and Adversarial Probing
by: Xu, Yifei, et al.
Published: (2026) -
Domain Adaptation for Sustainable Soil Management using Causal and Contrastive Constraint Minimization
by: Sharma, Somya, et al.
Published: (2024) -
RLTHF: Targeted Human Feedback for LLM Alignment
by: Xu, Yifei, et al.
Published: (2025) -
Enabling Adoption of Regenerative Agriculture through Soil Carbon Copilots
by: Capetz, Margaret, et al.
Published: (2024) -
Causal Reasoning and Large Language Models: Opening a New Frontier for Causality
by: Kıcıman, Emre, et al.
Published: (2023)