Learning to Self-Verify Makes Language Models Better Reasoners
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Yuxin, Wang, Yu, Zhang, Yi, Ye, Ziang, Cai, Zhengzhou, Shi, Yaorui, Gu, Qi, Su, Hui, Cai, Xunliang, Wang, Xiang, Zhang, An, Chua, Tat-Seng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Look Before You Leap: Autonomous Exploration for LLM Agents
por: Ye, Ziang, et al.
Publicado: (2026)
por: Ye, Ziang, et al.
Publicado: (2026)
Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments
por: Chen, Yuxin, et al.
Publicado: (2026)
por: Chen, Yuxin, et al.
Publicado: (2026)
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
por: Chen, Yuxin, et al.
Publicado: (2026)
por: Chen, Yuxin, et al.
Publicado: (2026)
MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning
por: Shi, Yaorui, et al.
Publicado: (2026)
por: Shi, Yaorui, et al.
Publicado: (2026)
AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
por: Wang, Ruipeng, et al.
Publicado: (2026)
por: Wang, Ruipeng, et al.
Publicado: (2026)
Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
por: Shi, Yaorui, et al.
Publicado: (2025)
por: Shi, Yaorui, et al.
Publicado: (2025)
Rethinking Tokenizer and Decoder in Masked Graph Modeling for Molecules
por: Liu, Zhiyuan, et al.
Publicado: (2023)
por: Liu, Zhiyuan, et al.
Publicado: (2023)
Language Representations Can be What Recommenders Need: Findings and Potentials
por: Sheng, Leheng, et al.
Publicado: (2024)
por: Sheng, Leheng, et al.
Publicado: (2024)
When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoning
por: Sheng, Leheng, et al.
Publicado: (2026)
por: Sheng, Leheng, et al.
Publicado: (2026)
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
por: Shi, Yaorui, et al.
Publicado: (2026)
por: Shi, Yaorui, et al.
Publicado: (2026)
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
por: Miao, Yuchun, et al.
Publicado: (2026)
por: Miao, Yuchun, et al.
Publicado: (2026)
ReactXT: Understanding Molecular "Reaction-ship" via Reaction-Contextualized Molecule-Text Pretraining
por: Liu, Zhiyuan, et al.
Publicado: (2024)
por: Liu, Zhiyuan, et al.
Publicado: (2024)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
por: Sheng, Leheng, et al.
Publicado: (2026)
por: Sheng, Leheng, et al.
Publicado: (2026)
On Generative Agents in Recommendation
por: Zhang, An, et al.
Publicado: (2023)
por: Zhang, An, et al.
Publicado: (2023)
When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
S^3cMath: Spontaneous Step-level Self-correction Makes Large Language Models Better Mathematical Reasoners
por: Yan, Yuchen, et al.
Publicado: (2024)
por: Yan, Yuchen, et al.
Publicado: (2024)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
por: Zhang, An, et al.
Publicado: (2024)
por: Zhang, An, et al.
Publicado: (2024)
VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation
por: Ye, Ziang, et al.
Publicado: (2025)
por: Ye, Ziang, et al.
Publicado: (2025)
On Reasoning Strength Planning in Large Reasoning Models
por: Sheng, Leheng, et al.
Publicado: (2025)
por: Sheng, Leheng, et al.
Publicado: (2025)
NExT-Mol: 3D Diffusion Meets 1D Language Modeling for 3D Molecule Generation
por: Liu, Zhiyuan, et al.
Publicado: (2025)
por: Liu, Zhiyuan, et al.
Publicado: (2025)
MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning
por: Liu, Yuxin, et al.
Publicado: (2026)
por: Liu, Yuxin, et al.
Publicado: (2026)
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
por: Wang, Lin, et al.
Publicado: (2026)
por: Wang, Lin, et al.
Publicado: (2026)
Verifiable Reasoning for LLM-based Generative Recommendation
por: Lin, Xinyu, et al.
Publicado: (2026)
por: Lin, Xinyu, et al.
Publicado: (2026)
Transport and Merge: Cross-Architecture Merging for Large Language Models
por: Cui, Chenhang, et al.
Publicado: (2026)
por: Cui, Chenhang, et al.
Publicado: (2026)
Reasoning over Semantic IDs Enhances Generative Recommendation
por: He, Yingzhi, et al.
Publicado: (2026)
por: He, Yingzhi, et al.
Publicado: (2026)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
por: Cui, Chenhang, et al.
Publicado: (2024)
por: Cui, Chenhang, et al.
Publicado: (2024)
Self-Guard: Defending Large Reasoning Models via enhanced self-reflection
por: Zheng, Jingnan, et al.
Publicado: (2026)
por: Zheng, Jingnan, et al.
Publicado: (2026)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
por: Fang, Junfeng, et al.
Publicado: (2025)
por: Fang, Junfeng, et al.
Publicado: (2025)
Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning
por: Shi, Yaorui, et al.
Publicado: (2025)
por: Shi, Yaorui, et al.
Publicado: (2025)
LightPROF: A Lightweight Reasoning Framework for Large Language Model on Knowledge Graph
por: Ao, Tu, et al.
Publicado: (2025)
por: Ao, Tu, et al.
Publicado: (2025)
A Study of Implicit Ranking Unfairness in Large Language Models
por: Xu, Chen, et al.
Publicado: (2023)
por: Xu, Chen, et al.
Publicado: (2023)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Making Mathematical Reasoning Adaptive
por: Lai, Zhejian, et al.
Publicado: (2025)
por: Lai, Zhejian, et al.
Publicado: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
por: Jin, Zhe, et al.
Publicado: (2025)
por: Jin, Zhe, et al.
Publicado: (2025)
On Softmax Direct Preference Optimization for Recommendation
por: Chen, Yuxin, et al.
Publicado: (2024)
por: Chen, Yuxin, et al.
Publicado: (2024)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
por: Wang, Jianing, et al.
Publicado: (2025)
por: Wang, Jianing, et al.
Publicado: (2025)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
por: Li, Moxin, et al.
Publicado: (2024)
por: Li, Moxin, et al.
Publicado: (2024)
Reasoning-Enhanced Large Language Models for Molecular Property Prediction
por: Zhuang, Jiaxi, et al.
Publicado: (2025)
por: Zhuang, Jiaxi, et al.
Publicado: (2025)
Large Language Models Empowered Personalized Web Agents
por: Cai, Hongru, et al.
Publicado: (2024)
por: Cai, Hongru, et al.
Publicado: (2024)
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
por: Zhu, Fengbin, et al.
Publicado: (2024)
por: Zhu, Fengbin, et al.
Publicado: (2024)
Ejemplares similares
-
Look Before You Leap: Autonomous Exploration for LLM Agents
por: Ye, Ziang, et al.
Publicado: (2026) -
Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments
por: Chen, Yuxin, et al.
Publicado: (2026) -
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
por: Chen, Yuxin, et al.
Publicado: (2026) -
MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning
por: Shi, Yaorui, et al.
Publicado: (2026) -
AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
por: Wang, Ruipeng, et al.
Publicado: (2026)