Enregistré dans:
| Auteurs principaux: | Li, Xiaoyuan, Bao, Keqin, Ma, Yubo, Li, Moxin, Wang, Wenjie, Men, Rui, Zhang, Yichang, Feng, Fuli, Liu, Dayiheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2505.17123 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2025)
par: Li, Xiaoyuan, et autres
Publié: (2025)
MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2025)
par: Li, Xiaoyuan, et autres
Publié: (2025)
SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation
par: Li, Xiaoyuan, et autres
Publié: (2026)
par: Li, Xiaoyuan, et autres
Publié: (2026)
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
par: Li, Xiaoyuan, et autres
Publié: (2026)
par: Li, Xiaoyuan, et autres
Publié: (2026)
SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs
par: Li, Xiaoyuan, et autres
Publié: (2026)
par: Li, Xiaoyuan, et autres
Publié: (2026)
On Predicting the Post-training Potential of Pre-trained LLMs
par: Li, Xiaoyuan, et autres
Publié: (2026)
par: Li, Xiaoyuan, et autres
Publié: (2026)
Unified Data Selection for LLM Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2026)
par: Li, Xiaoyuan, et autres
Publié: (2026)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
par: Li, Xiaoyuan, et autres
Publié: (2024)
par: Li, Xiaoyuan, et autres
Publié: (2024)
Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
par: Bao, Keqin, et autres
Publié: (2025)
par: Bao, Keqin, et autres
Publié: (2025)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
par: Li, Moxin, et autres
Publié: (2024)
par: Li, Moxin, et autres
Publié: (2024)
Counterfactual Debating with Preset Stances for Hallucination Elimination of LLMs
par: Fang, Yi, et autres
Publié: (2024)
par: Fang, Yi, et autres
Publié: (2024)
Chain of Execution Supervision Promotes General Reasoning in Large Language Models
par: Chen, Nuo, et autres
Publié: (2025)
par: Chen, Nuo, et autres
Publié: (2025)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
par: Zhang, He, et autres
Publié: (2025)
par: Zhang, He, et autres
Publié: (2025)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
par: Li, Moxin, et autres
Publié: (2025)
par: Li, Moxin, et autres
Publié: (2025)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
par: Zhang, Yiran, et autres
Publié: (2025)
par: Zhang, Yiran, et autres
Publié: (2025)
Robust Prompt Optimization for Large Language Models Against Distribution Shifts
par: Li, Moxin, et autres
Publié: (2023)
par: Li, Moxin, et autres
Publié: (2023)
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
par: Fang, Yi, et autres
Publié: (2026)
par: Fang, Yi, et autres
Publié: (2026)
Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge
par: Liu, Zhuo, et autres
Publié: (2025)
par: Liu, Zhuo, et autres
Publié: (2025)
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
par: Ruan, Junhao, et autres
Publié: (2026)
par: Ruan, Junhao, et autres
Publié: (2026)
Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text Documents via Semantic-Oriented Hierarchical Graphs
par: Zhu, Fengbin, et autres
Publié: (2023)
par: Zhu, Fengbin, et autres
Publié: (2023)
Consistency of Large Reasoning Models Under Multi-Turn Attacks
par: Li, Yubo, et autres
Publié: (2026)
par: Li, Yubo, et autres
Publié: (2026)
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
par: Wan, Luanbo, et autres
Publié: (2025)
par: Wan, Luanbo, et autres
Publié: (2025)
Prospect Personalized Recommendation on Large Language Model-based Agent Platform
par: Zhang, Jizhi, et autres
Publié: (2024)
par: Zhang, Jizhi, et autres
Publié: (2024)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
par: Chen, Junhao, et autres
Publié: (2025)
par: Chen, Junhao, et autres
Publié: (2025)
Teaching Language Models to Reason with Tools
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
Dual-Phase Accelerated Prompt Optimization
par: Yang, Muchen, et autres
Publié: (2024)
par: Yang, Muchen, et autres
Publié: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
par: Men, Tianyi, et autres
Publié: (2025)
par: Men, Tianyi, et autres
Publié: (2025)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
par: Jin, Zhuoran, et autres
Publié: (2024)
par: Jin, Zhuoran, et autres
Publié: (2024)
ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
par: Luo, Sichun, et autres
Publié: (2025)
par: Luo, Sichun, et autres
Publié: (2025)
BioProBench: Comprehensive Dataset and Benchmark in Biological Protocol Understanding and Reasoning
par: Liu, Yuyang, et autres
Publié: (2025)
par: Liu, Yuyang, et autres
Publié: (2025)
CoRT: Code-integrated Reasoning within Thinking
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
par: Huang, Junquan, et autres
Publié: (2025)
par: Huang, Junquan, et autres
Publié: (2025)
CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases
par: Xue, Xiaona, et autres
Publié: (2026)
par: Xue, Xiaona, et autres
Publié: (2026)
AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment
par: Xiao, Jianfei, et autres
Publié: (2026)
par: Xiao, Jianfei, et autres
Publié: (2026)
Direct Multi-Turn Preference Optimization for Language Agents
par: Shi, Wentao, et autres
Publié: (2024)
par: Shi, Wentao, et autres
Publié: (2024)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
par: Zheng, Yu, et autres
Publié: (2025)
par: Zheng, Yu, et autres
Publié: (2025)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
par: Liu, Junyu, et autres
Publié: (2026)
par: Liu, Junyu, et autres
Publié: (2026)
Medical Reasoning with Large Language Models: A Survey and MR-Bench
par: Ren, Xiaohan, et autres
Publié: (2026)
par: Ren, Xiaohan, et autres
Publié: (2026)
Documents similaires
-
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2025) -
MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2025) -
SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation
par: Li, Xiaoyuan, et autres
Publié: (2026) -
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
par: Li, Xiaoyuan, et autres
Publié: (2026) -
SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs
par: Li, Xiaoyuan, et autres
Publié: (2026)