Verified Critical Step Optimization for LLM Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Mukai, Zeng, Qingcheng, Fang, Tianqing, Liang, Zhenwen, Song, Linfeng, Liu, Qi, Mi, Haitao, Yu, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
por: Li, Mukai, et al.
Publicado: (2025)
por: Li, Mukai, et al.
Publicado: (2025)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
por: Panaganti, Kishan, et al.
Publicado: (2026)
por: Panaganti, Kishan, et al.
Publicado: (2026)
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025)
por: Yu, Wenhao, et al.
Publicado: (2025)
CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
por: Liang, Zhenwen, et al.
Publicado: (2025)
por: Liang, Zhenwen, et al.
Publicado: (2025)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
por: Fang, Tianqing, et al.
Publicado: (2025)
por: Fang, Tianqing, et al.
Publicado: (2025)
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
por: Zhou, Yujun, et al.
Publicado: (2025)
por: Zhou, Yujun, et al.
Publicado: (2025)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
por: He, Zhiwei, et al.
Publicado: (2025)
por: He, Zhiwei, et al.
Publicado: (2025)
Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories
por: Lu, Sidi, et al.
Publicado: (2026)
por: Lu, Sidi, et al.
Publicado: (2026)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
por: Zhang, Zhisong, et al.
Publicado: (2025)
por: Zhang, Zhisong, et al.
Publicado: (2025)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
por: Zhang, Ziyin, et al.
Publicado: (2025)
por: Zhang, Ziyin, et al.
Publicado: (2025)
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
por: Tian, Ye, et al.
Publicado: (2024)
por: Tian, Ye, et al.
Publicado: (2024)
Inconsistent dialogue responses and how to recover from them
por: Zhang, Mian, et al.
Publicado: (2024)
por: Zhang, Mian, et al.
Publicado: (2024)
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
por: Ma, Junyu, et al.
Publicado: (2025)
por: Ma, Junyu, et al.
Publicado: (2025)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
por: Liu, Haolin, et al.
Publicado: (2026)
por: Liu, Haolin, et al.
Publicado: (2026)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation
por: Li, Xiangci, et al.
Publicado: (2024)
por: Li, Xiangci, et al.
Publicado: (2024)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
por: Dai, Runpeng, et al.
Publicado: (2025)
por: Dai, Runpeng, et al.
Publicado: (2025)
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
por: Yu, Dian, et al.
Publicado: (2024)
por: Yu, Dian, et al.
Publicado: (2024)
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
por: Das, Souvik, et al.
Publicado: (2024)
por: Das, Souvik, et al.
Publicado: (2024)
Collaborative decoding of critical tokens for boosting factuality of large language models
por: Jin, Lifeng, et al.
Publicado: (2024)
por: Jin, Lifeng, et al.
Publicado: (2024)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
por: Liu, Xiaoyuan, et al.
Publicado: (2025)
por: Liu, Xiaoyuan, et al.
Publicado: (2025)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
por: Yu, Dian, et al.
Publicado: (2025)
por: Yu, Dian, et al.
Publicado: (2025)
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
por: Wang, Ante, et al.
Publicado: (2025)
por: Wang, Ante, et al.
Publicado: (2025)
Teaching LLMs to Refine with Tools
por: Yu, Dian, et al.
Publicado: (2024)
por: Yu, Dian, et al.
Publicado: (2024)
LiteSearch: Efficacious Tree Search for LLM
por: Wang, Ante, et al.
Publicado: (2024)
por: Wang, Ante, et al.
Publicado: (2024)
WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback
por: Hu, Minda, et al.
Publicado: (2025)
por: Hu, Minda, et al.
Publicado: (2025)
HDFlow: Enhancing LLM Complex Problem-Solving with Hybrid Thinking and Dynamic Workflows
por: Yao, Wenlin, et al.
Publicado: (2024)
por: Yao, Wenlin, et al.
Publicado: (2024)
Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training
por: Fang, Tianqing, et al.
Publicado: (2025)
por: Fang, Tianqing, et al.
Publicado: (2025)
Towards Solving More Challenging IMO Problems via Decoupled Reasoning and Proving
por: Liang, Zhenwen, et al.
Publicado: (2025)
por: Liang, Zhenwen, et al.
Publicado: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
Using LLM to select the right SQL Query from candidates
por: Li, Zhenwen, et al.
Publicado: (2024)
por: Li, Zhenwen, et al.
Publicado: (2024)
UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
por: Deng, Chenlong, et al.
Publicado: (2025)
por: Deng, Chenlong, et al.
Publicado: (2025)
InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing
por: Li, Shuaiyi, et al.
Publicado: (2025)
por: Li, Shuaiyi, et al.
Publicado: (2025)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
HunyuanProver: A Scalable Data Synthesis Framework and Guided Tree Search for Automated Theorem Proving
por: Li, Yang, et al.
Publicado: (2024)
por: Li, Yang, et al.
Publicado: (2024)
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
por: Liu, Rui, et al.
Publicado: (2026)
por: Liu, Rui, et al.
Publicado: (2026)
Let's Verify Math Questions Step by Step
por: Shen, Chengyu, et al.
Publicado: (2025)
por: Shen, Chengyu, et al.
Publicado: (2025)
The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents
por: Xuan, Weihao, et al.
Publicado: (2026)
por: Xuan, Weihao, et al.
Publicado: (2026)
Ejemplares similares
-
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
por: Li, Mukai, et al.
Publicado: (2025) -
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
por: Panaganti, Kishan, et al.
Publicado: (2026) -
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025) -
CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
por: Liang, Zhenwen, et al.
Publicado: (2025) -
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
por: Su, Yi, et al.
Publicado: (2025)