Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Haoran, Li, Yafu, Hu, Xuyang, Liu, Dongrui, Wang, Zhilin, Li, Bo, Cheng, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
par: Li, Yafu, et autres
Publié: (2025)
par: Li, Yafu, et autres
Publié: (2025)
Characterizing, Evaluating, and Optimizing Complex Reasoning
par: Zhang, Haoran, et autres
Publié: (2026)
par: Zhang, Haoran, et autres
Publié: (2026)
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
par: Wang, Zhilin, et autres
Publié: (2026)
par: Wang, Zhilin, et autres
Publié: (2026)
SEE: Continual Fine-tuning with Sequential Ensemble of Experts
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
Rethinking Entropy Regularization in Large Reasoning Models
par: Jiang, Yuxian, et autres
Publié: (2025)
par: Jiang, Yuxian, et autres
Publié: (2025)
From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning
par: Li, Yafu, et autres
Publié: (2025)
par: Li, Yafu, et autres
Publié: (2025)
Unveiling Attractor Cycles in Large Language Models: A Dynamical Systems View of Successive Paraphrasing
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
Towards an AI Musician: Synthesizing Sheet Music Problems for Musical Reasoning
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
ExGRPO: Learning to Reason from Experience
par: Zhan, Runzhe, et autres
Publié: (2025)
par: Zhan, Runzhe, et autres
Publié: (2025)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
par: Chen, Guanxu, et autres
Publié: (2025)
par: Chen, Guanxu, et autres
Publié: (2025)
FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization
par: Gui, Runquan, et autres
Publié: (2026)
par: Gui, Runquan, et autres
Publié: (2026)
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
par: Fu, Tingchen, et autres
Publié: (2025)
par: Fu, Tingchen, et autres
Publié: (2025)
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
par: Li, Yafu, et autres
Publié: (2026)
par: Li, Yafu, et autres
Publié: (2026)
Enhancing Language Model Rationality with Bi-Directional Deliberation Reasoning
par: Zhang, Yadong, et autres
Publié: (2024)
par: Zhang, Yadong, et autres
Publié: (2024)
Spotting AI's Touch: Identifying LLM-Paraphrased Spans in Text
par: Li, Yafu, et autres
Publié: (2024)
par: Li, Yafu, et autres
Publié: (2024)
Learning to Reason under Off-Policy Guidance
par: Yan, Jianhao, et autres
Publié: (2025)
par: Yan, Jianhao, et autres
Publié: (2025)
Lost in Literalism: How Supervised Training Shapes Translationese in LLMs
par: Li, Yafu, et autres
Publié: (2025)
par: Li, Yafu, et autres
Publié: (2025)
A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning
par: Ji, Yixin, et autres
Publié: (2025)
par: Ji, Yixin, et autres
Publié: (2025)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
par: Qu, Xiaoye, et autres
Publié: (2025)
par: Qu, Xiaoye, et autres
Publié: (2025)
Multilingual Safety Alignment via Self-Distillation
par: Qin, Ruiyang, et autres
Publié: (2026)
par: Qin, Ruiyang, et autres
Publié: (2026)
MAGE: Machine-generated Text Detection in the Wild
par: Li, Yafu, et autres
Publié: (2023)
par: Li, Yafu, et autres
Publié: (2023)
Multi-LLM Collaborative Search for Complex Problem Solving
par: Yang, Sen, et autres
Publié: (2025)
par: Yang, Sen, et autres
Publié: (2025)
Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
par: Zhang, Zhiwei, et autres
Publié: (2025)
par: Zhang, Zhiwei, et autres
Publié: (2025)
FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving
par: Chen, Guizhen, et autres
Publié: (2025)
par: Chen, Guizhen, et autres
Publié: (2025)
Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
par: Liu, Zhenghao, et autres
Publié: (2026)
par: Liu, Zhenghao, et autres
Publié: (2026)
Multi-hop Reasoning via Early Knowledge Alignment
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
par: Wang, Xinming, et autres
Publié: (2025)
par: Wang, Xinming, et autres
Publié: (2025)
Draft-OPD: On-Policy Distillation for Speculative Draft Models
par: Lei, Haodi, et autres
Publié: (2026)
par: Lei, Haodi, et autres
Publié: (2026)
Confidence Calibration and Rationalization for LLMs via Multi-Agent Deliberation
par: Yang, Ruixin, et autres
Publié: (2024)
par: Yang, Ruixin, et autres
Publié: (2024)
Potential and Challenges of Model Editing for Social Debiasing
par: Yan, Jianhao, et autres
Publié: (2024)
par: Yan, Jianhao, et autres
Publié: (2024)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
par: Tian, Xiaoyu, et autres
Publié: (2025)
par: Tian, Xiaoyu, et autres
Publié: (2025)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
par: Wang, Zezhong, et autres
Publié: (2025)
par: Wang, Zezhong, et autres
Publié: (2025)
Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
par: Zhang, Yong, et autres
Publié: (2025)
par: Zhang, Yong, et autres
Publié: (2025)
From Conflict to Consensus: Boosting Medical Reasoning via Multi-Round Agentic RAG
par: Wu, Wenhao, et autres
Publié: (2026)
par: Wu, Wenhao, et autres
Publié: (2026)
ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging
par: Yang, Junyao, et autres
Publié: (2026)
par: Yang, Junyao, et autres
Publié: (2026)
Keys to Robust Edits: from Theoretical Insights to Practical Advances
par: Yan, Jianhao, et autres
Publié: (2024)
par: Yan, Jianhao, et autres
Publié: (2024)
SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning
par: Feng, Kehua, et autres
Publié: (2025)
par: Feng, Kehua, et autres
Publié: (2025)
MGT-Prism: Enhancing Domain Generalization for Machine-Generated Text Detection via Spectral Alignment
par: Liu, Shengchao, et autres
Publié: (2025)
par: Liu, Shengchao, et autres
Publié: (2025)
LayAlign: Enhancing Multilingual Reasoning in Large Language Models via Layer-Wise Adaptive Fusion and Alignment Strategy
par: Ruan, Zhiwen, et autres
Publié: (2025)
par: Ruan, Zhiwen, et autres
Publié: (2025)
Documents similaires
-
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
par: Li, Yafu, et autres
Publié: (2025) -
Characterizing, Evaluating, and Optimizing Complex Reasoning
par: Zhang, Haoran, et autres
Publié: (2026) -
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
par: Wang, Zhilin, et autres
Publié: (2026) -
SEE: Continual Fine-tuning with Sequential Ensemble of Experts
par: Wang, Zhilin, et autres
Publié: (2025) -
Rethinking Entropy Regularization in Large Reasoning Models
par: Jiang, Yuxian, et autres
Publié: (2025)