Guardado en:
| Autores principales: | Hu, Zhiyuan, Wang, Yibo, Dong, Hanze, Xu, Yuhui, Saha, Amrita, Xiong, Caiming, Hooi, Bryan, Li, Junnan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2505.10554 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reward Models Identify Consistency, Not Causality
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
Scalable Chain of Thoughts via Elastic Reasoning
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
por: Zhao, Zirui, et al.
Publicado: (2024)
por: Zhao, Zirui, et al.
Publicado: (2024)
Fractured Chain-of-Thought Reasoning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
por: Wang, Lei, et al.
Publicado: (2024)
por: Wang, Lei, et al.
Publicado: (2024)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
ThinK: Thinner Key Cache by Query-Driven Pruning
por: Xu, Yuhui, et al.
Publicado: (2024)
por: Xu, Yuhui, et al.
Publicado: (2024)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
por: Li, Yibo, et al.
Publicado: (2025)
por: Li, Yibo, et al.
Publicado: (2025)
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
por: Luo, Ziyang, et al.
Publicado: (2025)
por: Luo, Ziyang, et al.
Publicado: (2025)
BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation
por: Pang, Bo, et al.
Publicado: (2025)
por: Pang, Bo, et al.
Publicado: (2025)
JudgeLRM: Large Reasoning Models as a Judge
por: Chen, Nuo, et al.
Publicado: (2025)
por: Chen, Nuo, et al.
Publicado: (2025)
XForecast: Evaluating Natural Language Explanations for Time Series Forecasting
por: Aksu, Taha, et al.
Publicado: (2024)
por: Aksu, Taha, et al.
Publicado: (2024)
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
por: Wang, Yuquan, et al.
Publicado: (2025)
por: Wang, Yuquan, et al.
Publicado: (2025)
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
por: Sui, Yuan, et al.
Publicado: (2026)
por: Sui, Yuan, et al.
Publicado: (2026)
How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning
por: Zhang, Xiangxiang, et al.
Publicado: (2026)
por: Zhang, Xiangxiang, et al.
Publicado: (2026)
EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems
por: He, Yufei, et al.
Publicado: (2025)
por: He, Yufei, et al.
Publicado: (2025)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
por: Zhao, James Xu, et al.
Publicado: (2025)
por: Zhao, James Xu, et al.
Publicado: (2025)
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
por: Wang, Xinming, et al.
Publicado: (2025)
por: Wang, Xinming, et al.
Publicado: (2025)
Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs
por: Xiong, Miao, et al.
Publicado: (2023)
por: Xiong, Miao, et al.
Publicado: (2023)
Towards A Unified View of Answer Calibration for Multi-Step Reasoning
por: Deng, Shumin, et al.
Publicado: (2023)
por: Deng, Shumin, et al.
Publicado: (2023)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
por: Parmar, Mihir, et al.
Publicado: (2024)
por: Parmar, Mihir, et al.
Publicado: (2024)
Entropy-Based Block Pruning for Efficient Large Language Models
por: Yang, Liangwei, et al.
Publicado: (2025)
por: Yang, Liangwei, et al.
Publicado: (2025)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
por: Xu, Yiheng, et al.
Publicado: (2024)
por: Xu, Yiheng, et al.
Publicado: (2024)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
por: Zhou, Kaiwen, et al.
Publicado: (2025)
por: Zhou, Kaiwen, et al.
Publicado: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
por: Dong, Hanze, et al.
Publicado: (2024)
por: Dong, Hanze, et al.
Publicado: (2024)
FiDeLiS: Faithful Reasoning in Large Language Model for Knowledge Graph Question Answering
por: Sui, Yuan, et al.
Publicado: (2024)
por: Sui, Yuan, et al.
Publicado: (2024)
Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability
por: Jia, Jinghan, et al.
Publicado: (2025)
por: Jia, Jinghan, et al.
Publicado: (2025)
Entity Alignment with Noisy Annotations from Large Language Models
por: Chen, Shengyuan, et al.
Publicado: (2024)
por: Chen, Shengyuan, et al.
Publicado: (2024)
Enhancing Multi-Agent Debate System Performance via Confidence Expression
por: Lin, Zijie, et al.
Publicado: (2025)
por: Lin, Zijie, et al.
Publicado: (2025)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
por: Hu, Zhiyuan, et al.
Publicado: (2025)
por: Hu, Zhiyuan, et al.
Publicado: (2025)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
por: Niu, Tong, et al.
Publicado: (2024)
por: Niu, Tong, et al.
Publicado: (2024)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
por: Deng, Ailin, et al.
Publicado: (2024)
por: Deng, Ailin, et al.
Publicado: (2024)
Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models
por: Yuan, Aojie, et al.
Publicado: (2026)
por: Yuan, Aojie, et al.
Publicado: (2026)
KLong: Training LLM Agent for Extremely Long-horizon Tasks
por: Liu, Yue, et al.
Publicado: (2026)
por: Liu, Yue, et al.
Publicado: (2026)
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
por: Sui, Yuan, et al.
Publicado: (2024)
por: Sui, Yuan, et al.
Publicado: (2024)
Beyond Chains of Thought: Benchmarking Latent-Space Reasoning Abilities in Large Language Models
por: Hagendorff, Thilo, et al.
Publicado: (2025)
por: Hagendorff, Thilo, et al.
Publicado: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
por: Gu, Yifeng, et al.
Publicado: (2025)
por: Gu, Yifeng, et al.
Publicado: (2025)
LMFlow: An Extensible Toolkit for Finetuning and Inference of Large Foundation Models
por: Diao, Shizhe, et al.
Publicado: (2023)
por: Diao, Shizhe, et al.
Publicado: (2023)
Safety in Large Reasoning Models: A Survey
por: Wang, Cheng, et al.
Publicado: (2025)
por: Wang, Cheng, et al.
Publicado: (2025)
Ejemplares similares
-
Reward Models Identify Consistency, Not Causality
por: Xu, Yuhui, et al.
Publicado: (2025) -
Scalable Chain of Thoughts via Elastic Reasoning
por: Xu, Yuhui, et al.
Publicado: (2025) -
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
por: Zhao, Zirui, et al.
Publicado: (2024) -
Fractured Chain-of-Thought Reasoning
por: Liao, Baohao, et al.
Publicado: (2025) -
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
por: Wang, Lei, et al.
Publicado: (2024)