Salvato in:
| Autori principali: | Hu, Zhiyuan, Wang, Yibo, Dong, Hanze, Xu, Yuhui, Saha, Amrita, Xiong, Caiming, Hooi, Bryan, Li, Junnan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2505.10554 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reward Models Identify Consistency, Not Causality
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
Scalable Chain of Thoughts via Elastic Reasoning
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
di: Zhao, Zirui, et al.
Pubblicazione: (2024)
di: Zhao, Zirui, et al.
Pubblicazione: (2024)
Fractured Chain-of-Thought Reasoning
di: Liao, Baohao, et al.
Pubblicazione: (2025)
di: Liao, Baohao, et al.
Pubblicazione: (2025)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
di: Wang, Lei, et al.
Pubblicazione: (2024)
di: Wang, Lei, et al.
Pubblicazione: (2024)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
di: Liao, Baohao, et al.
Pubblicazione: (2025)
di: Liao, Baohao, et al.
Pubblicazione: (2025)
ThinK: Thinner Key Cache by Query-Driven Pruning
di: Xu, Yuhui, et al.
Pubblicazione: (2024)
di: Xu, Yuhui, et al.
Pubblicazione: (2024)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
di: Xiong, Wei, et al.
Pubblicazione: (2025)
di: Xiong, Wei, et al.
Pubblicazione: (2025)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
di: Li, Yibo, et al.
Pubblicazione: (2025)
di: Li, Yibo, et al.
Pubblicazione: (2025)
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation
di: Pang, Bo, et al.
Pubblicazione: (2025)
di: Pang, Bo, et al.
Pubblicazione: (2025)
JudgeLRM: Large Reasoning Models as a Judge
di: Chen, Nuo, et al.
Pubblicazione: (2025)
di: Chen, Nuo, et al.
Pubblicazione: (2025)
XForecast: Evaluating Natural Language Explanations for Time Series Forecasting
di: Aksu, Taha, et al.
Pubblicazione: (2024)
di: Aksu, Taha, et al.
Pubblicazione: (2024)
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
di: Wang, Yuquan, et al.
Pubblicazione: (2025)
di: Wang, Yuquan, et al.
Pubblicazione: (2025)
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
di: Sui, Yuan, et al.
Pubblicazione: (2026)
di: Sui, Yuan, et al.
Pubblicazione: (2026)
How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning
di: Zhang, Xiangxiang, et al.
Pubblicazione: (2026)
di: Zhang, Xiangxiang, et al.
Pubblicazione: (2026)
EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems
di: He, Yufei, et al.
Pubblicazione: (2025)
di: He, Yufei, et al.
Pubblicazione: (2025)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
di: Wang, Xinming, et al.
Pubblicazione: (2025)
di: Wang, Xinming, et al.
Pubblicazione: (2025)
Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs
di: Xiong, Miao, et al.
Pubblicazione: (2023)
di: Xiong, Miao, et al.
Pubblicazione: (2023)
Towards A Unified View of Answer Calibration for Multi-Step Reasoning
di: Deng, Shumin, et al.
Pubblicazione: (2023)
di: Deng, Shumin, et al.
Pubblicazione: (2023)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
di: Parmar, Mihir, et al.
Pubblicazione: (2024)
di: Parmar, Mihir, et al.
Pubblicazione: (2024)
Entropy-Based Block Pruning for Efficient Large Language Models
di: Yang, Liangwei, et al.
Pubblicazione: (2025)
di: Yang, Liangwei, et al.
Pubblicazione: (2025)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
di: Xu, Yiheng, et al.
Pubblicazione: (2024)
di: Xu, Yiheng, et al.
Pubblicazione: (2024)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
di: Dong, Hanze, et al.
Pubblicazione: (2024)
di: Dong, Hanze, et al.
Pubblicazione: (2024)
FiDeLiS: Faithful Reasoning in Large Language Model for Knowledge Graph Question Answering
di: Sui, Yuan, et al.
Pubblicazione: (2024)
di: Sui, Yuan, et al.
Pubblicazione: (2024)
Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability
di: Jia, Jinghan, et al.
Pubblicazione: (2025)
di: Jia, Jinghan, et al.
Pubblicazione: (2025)
Entity Alignment with Noisy Annotations from Large Language Models
di: Chen, Shengyuan, et al.
Pubblicazione: (2024)
di: Chen, Shengyuan, et al.
Pubblicazione: (2024)
Enhancing Multi-Agent Debate System Performance via Confidence Expression
di: Lin, Zijie, et al.
Pubblicazione: (2025)
di: Lin, Zijie, et al.
Pubblicazione: (2025)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
di: Niu, Tong, et al.
Pubblicazione: (2024)
di: Niu, Tong, et al.
Pubblicazione: (2024)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
di: Deng, Ailin, et al.
Pubblicazione: (2024)
di: Deng, Ailin, et al.
Pubblicazione: (2024)
Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models
di: Yuan, Aojie, et al.
Pubblicazione: (2026)
di: Yuan, Aojie, et al.
Pubblicazione: (2026)
KLong: Training LLM Agent for Extremely Long-horizon Tasks
di: Liu, Yue, et al.
Pubblicazione: (2026)
di: Liu, Yue, et al.
Pubblicazione: (2026)
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
di: Sui, Yuan, et al.
Pubblicazione: (2024)
di: Sui, Yuan, et al.
Pubblicazione: (2024)
Beyond Chains of Thought: Benchmarking Latent-Space Reasoning Abilities in Large Language Models
di: Hagendorff, Thilo, et al.
Pubblicazione: (2025)
di: Hagendorff, Thilo, et al.
Pubblicazione: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
di: Gu, Yifeng, et al.
Pubblicazione: (2025)
di: Gu, Yifeng, et al.
Pubblicazione: (2025)
LMFlow: An Extensible Toolkit for Finetuning and Inference of Large Foundation Models
di: Diao, Shizhe, et al.
Pubblicazione: (2023)
di: Diao, Shizhe, et al.
Pubblicazione: (2023)
Safety in Large Reasoning Models: A Survey
di: Wang, Cheng, et al.
Pubblicazione: (2025)
di: Wang, Cheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reward Models Identify Consistency, Not Causality
di: Xu, Yuhui, et al.
Pubblicazione: (2025) -
Scalable Chain of Thoughts via Elastic Reasoning
di: Xu, Yuhui, et al.
Pubblicazione: (2025) -
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
di: Zhao, Zirui, et al.
Pubblicazione: (2024) -
Fractured Chain-of-Thought Reasoning
di: Liao, Baohao, et al.
Pubblicazione: (2025) -
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
di: Wang, Lei, et al.
Pubblicazione: (2024)