Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Qiyuan, Wang, Yufei, Jiang, Yuxin, Li, Liangyou, Wu, Chuhan, Wang, Yasheng, Jiang, Xin, Shang, Lifeng, Tang, Ruiming, Lyu, Fuyuan, Ma, Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RevisEval: Improving LLM-as-a-Judge via Response-Adapted References
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
di: Jiang, Yuxin, et al.
Pubblicazione: (2024)
di: Jiang, Yuxin, et al.
Pubblicazione: (2024)
Instruction-Tuning Data Synthesis from Scratch via Web Reconstruction
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
Learning to Edit: Aligning LLMs with Knowledge Editing
di: Jiang, Yuxin, et al.
Pubblicazione: (2024)
di: Jiang, Yuxin, et al.
Pubblicazione: (2024)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
di: Wang, Zezhong, et al.
Pubblicazione: (2025)
di: Wang, Zezhong, et al.
Pubblicazione: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
di: Jiang, Yuxin, et al.
Pubblicazione: (2026)
di: Jiang, Yuxin, et al.
Pubblicazione: (2026)
ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue Synthesis
di: Wang, Zezhong, et al.
Pubblicazione: (2024)
di: Wang, Zezhong, et al.
Pubblicazione: (2024)
ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation
di: Zeng, Xingshan, et al.
Pubblicazione: (2026)
di: Zeng, Xingshan, et al.
Pubblicazione: (2026)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step
di: Wang, Zezhong, et al.
Pubblicazione: (2024)
di: Wang, Zezhong, et al.
Pubblicazione: (2024)
Entropy Law: The Story Behind Data Compression and LLM Performance
di: Yin, Mingjia, et al.
Pubblicazione: (2024)
di: Yin, Mingjia, et al.
Pubblicazione: (2024)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
di: Jiang, Yuxin, et al.
Pubblicazione: (2023)
di: Jiang, Yuxin, et al.
Pubblicazione: (2023)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
Performance Law of Large Language Models
di: Wu, Chuhan, et al.
Pubblicazione: (2024)
di: Wu, Chuhan, et al.
Pubblicazione: (2024)
Position: The Real Barrier to LLM Agent Usability is Agentic ROI
di: Liu, Weiwen, et al.
Pubblicazione: (2025)
di: Liu, Weiwen, et al.
Pubblicazione: (2025)
NILE: Internal Consistency Alignment in Large Language Models
di: Hu, Minda, et al.
Pubblicazione: (2024)
di: Hu, Minda, et al.
Pubblicazione: (2024)
DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities
di: Zhuang, Tianyi, et al.
Pubblicazione: (2025)
di: Zhuang, Tianyi, et al.
Pubblicazione: (2025)
Collaborative Performance Prediction for Large Language Models
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
Learning to Align Multi-Faceted Evaluation: A Unified and Robust Framework
di: Xu, Kaishuai, et al.
Pubblicazione: (2025)
di: Xu, Kaishuai, et al.
Pubblicazione: (2025)
Evaluating the External and Parametric Knowledge Fusion of Large Language Models
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2023)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2023)
Beyond Utility: Evaluating LLM as Recommender
di: Jiang, Chumeng, et al.
Pubblicazione: (2024)
di: Jiang, Chumeng, et al.
Pubblicazione: (2024)
GUI Agents with Foundation Models: A Comprehensive Survey
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
di: Xu, Kaishuai, et al.
Pubblicazione: (2024)
di: Xu, Kaishuai, et al.
Pubblicazione: (2024)
Teaching LLMs According to Their Aptitude: Adaptive Reasoning for Mathematical Problem Solving
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
ToolACE: Winning the Points of LLM Function Calling
di: Liu, Weiwen, et al.
Pubblicazione: (2024)
di: Liu, Weiwen, et al.
Pubblicazione: (2024)
Teaching Large Reasoning Models Effective Reflection
di: Wang, Hanbin, et al.
Pubblicazione: (2026)
di: Wang, Hanbin, et al.
Pubblicazione: (2026)
On the Dirichlet problem for the degenerate $k$-Hessian equation
di: Lyu, Yasheng
Pubblicazione: (2025)
di: Lyu, Yasheng
Pubblicazione: (2025)
Remarks on the Pogorelov type estimate for the degenerate $k$-Hessian equation
di: Lyu, Yasheng
Pubblicazione: (2026)
di: Lyu, Yasheng
Pubblicazione: (2026)
Second-order estimates for degenerate complex $k$-Hessian and Christoffel-Minkowski equations
di: Lyu, Yasheng
Pubblicazione: (2026)
di: Lyu, Yasheng
Pubblicazione: (2026)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
di: Gao, Fan, et al.
Pubblicazione: (2025)
di: Gao, Fan, et al.
Pubblicazione: (2025)
WESE: Weak Exploration to Strong Exploitation for LLM Agents
di: Huang, Xu, et al.
Pubblicazione: (2024)
di: Huang, Xu, et al.
Pubblicazione: (2024)
Understanding the planning of LLM agents: A survey
di: Huang, Xu, et al.
Pubblicazione: (2024)
di: Huang, Xu, et al.
Pubblicazione: (2024)
ToolACE-DEV: Self-Improving Tool Learning via Decomposition and EVolution
di: Huang, Xu, et al.
Pubblicazione: (2025)
di: Huang, Xu, et al.
Pubblicazione: (2025)
CoIR: A Comprehensive Benchmark for Code Information Retrieval Models
di: Li, Xiangyang, et al.
Pubblicazione: (2024)
di: Li, Xiangyang, et al.
Pubblicazione: (2024)
YODA: Teacher-Student Progressive Learning for Language Models
di: Lu, Jianqiao, et al.
Pubblicazione: (2024)
di: Lu, Jianqiao, et al.
Pubblicazione: (2024)
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
di: Huang, Shijue, et al.
Pubblicazione: (2024)
di: Huang, Shijue, et al.
Pubblicazione: (2024)
Flat-LoRA: Low-Rank Adaptation over a Flat Loss Landscape
di: Li, Tao, et al.
Pubblicazione: (2024)
di: Li, Tao, et al.
Pubblicazione: (2024)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RevisEval: Improving LLM-as-a-Judge via Response-Adapted References
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024) -
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
di: Jiang, Yuxin, et al.
Pubblicazione: (2024) -
Instruction-Tuning Data Synthesis from Scratch via Web Reconstruction
di: Jiang, Yuxin, et al.
Pubblicazione: (2025) -
Learning to Edit: Aligning LLMs with Knowledge Editing
di: Jiang, Yuxin, et al.
Pubblicazione: (2024) -
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
di: Wang, Zezhong, et al.
Pubblicazione: (2025)