League: Leaderboard Generation on Demand
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Jian, Zhang, Jiayu, Li, Dongyuan, Yang, Linyi, Zhong, Aoxiao, Jiang, Renhe, Wen, Qingsong, Zhang, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CulturePark: Boosting Cross-cultural Understanding in Large Language Models
di: Li, Cheng, et al.
Pubblicazione: (2024)
di: Li, Cheng, et al.
Pubblicazione: (2024)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
di: Xie, Qiujie, et al.
Pubblicazione: (2025)
di: Xie, Qiujie, et al.
Pubblicazione: (2025)
LLM Agents for Education: Advances and Applications
di: Chu, Zhendong, et al.
Pubblicazione: (2025)
di: Chu, Zhendong, et al.
Pubblicazione: (2025)
MULTI: Multimodal Understanding Leaderboard with Text and Images
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
di: Zhang, Hongbo, et al.
Pubblicazione: (2025)
di: Zhang, Hongbo, et al.
Pubblicazione: (2025)
Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards
di: Tamber, Manveer Singh, et al.
Pubblicazione: (2025)
di: Tamber, Manveer Singh, et al.
Pubblicazione: (2025)
Exploring the Latest LLMs for Leaderboard Extraction
di: Kabongo, Salomon, et al.
Pubblicazione: (2024)
di: Kabongo, Salomon, et al.
Pubblicazione: (2024)
AI Scientists Fail Without Strong Implementation Capability
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
How Likely Do LLMs with CoT Mimic Human Reasoning?
di: Bao, Guangsheng, et al.
Pubblicazione: (2024)
di: Bao, Guangsheng, et al.
Pubblicazione: (2024)
The Leaderboard Illusion
di: Singh, Shivalika, et al.
Pubblicazione: (2025)
di: Singh, Shivalika, et al.
Pubblicazione: (2025)
ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation
di: Zhang, Xiaoman, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2024)
Know Your Needs Better: Towards Structured Understanding of Marketer Demands with Analogical Reasoning Augmented LLMs
di: Wang, Junjie, et al.
Pubblicazione: (2024)
di: Wang, Junjie, et al.
Pubblicazione: (2024)
Improving LLM Leaderboards with Psychometrical Methodology
di: Federiakin, Denis
Pubblicazione: (2025)
di: Federiakin, Denis
Pubblicazione: (2025)
The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality
di: Cheng, Aileen, et al.
Pubblicazione: (2025)
di: Cheng, Aileen, et al.
Pubblicazione: (2025)
Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation
di: Kapoor, Sayash, et al.
Pubblicazione: (2025)
di: Kapoor, Sayash, et al.
Pubblicazione: (2025)
Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety
di: Huang, Wei-Chieh, et al.
Pubblicazione: (2025)
di: Huang, Wei-Chieh, et al.
Pubblicazione: (2025)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare
di: Shi, Zhengliang, et al.
Pubblicazione: (2025)
di: Shi, Zhengliang, et al.
Pubblicazione: (2025)
Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs
di: Li, Yangning, et al.
Pubblicazione: (2025)
di: Li, Yangning, et al.
Pubblicazione: (2025)
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
Constrain Alignment with Sparse Autoencoders
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
Knowledge Tagging System on Math Questions via LLMs with Flexible Demonstration Retriever
di: Li, Hang, et al.
Pubblicazione: (2024)
di: Li, Hang, et al.
Pubblicazione: (2024)
Knowledge Tagging with Large Language Model based Multi-Agent System
di: Li, Hang, et al.
Pubblicazione: (2024)
di: Li, Hang, et al.
Pubblicazione: (2024)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
di: Li, Zherui, et al.
Pubblicazione: (2025)
di: Li, Zherui, et al.
Pubblicazione: (2025)
Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM Leaderboard
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective
di: Yang, Wen, et al.
Pubblicazione: (2025)
di: Yang, Wen, et al.
Pubblicazione: (2025)
CycleResearcher: Improving Automated Research via Automated Review
di: Weng, Yixuan, et al.
Pubblicazione: (2024)
di: Weng, Yixuan, et al.
Pubblicazione: (2024)
Large Language Models as Urban Residents: An LLM Agent Framework for Personal Mobility Generation
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
DatasetResearch: Benchmarking Agent Systems for Demand-Driven Dataset Discovery
di: Li, Keyu, et al.
Pubblicazione: (2025)
di: Li, Keyu, et al.
Pubblicazione: (2025)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena
di: Myrzakhan, Aidar, et al.
Pubblicazione: (2024)
di: Myrzakhan, Aidar, et al.
Pubblicazione: (2024)
LLMs Meet Finance: Fine-Tuning Foundation Models for the Open FinLLM Leaderboard
di: Rao, Varun, et al.
Pubblicazione: (2025)
di: Rao, Varun, et al.
Pubblicazione: (2025)
TEaR: Improving LLM-based Machine Translation with Systematic Self-Refinement
di: Feng, Zhaopeng, et al.
Pubblicazione: (2024)
di: Feng, Zhaopeng, et al.
Pubblicazione: (2024)
PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization
di: Wang, Yidong, et al.
Pubblicazione: (2023)
di: Wang, Yidong, et al.
Pubblicazione: (2023)
UrbanCLIP: Learning Text-enhanced Urban Region Profiling with Contrastive Language-Image Pretraining from the Web
di: Yan, Yibo, et al.
Pubblicazione: (2023)
di: Yan, Yibo, et al.
Pubblicazione: (2023)
KnowledgeGain: Evaluating and Optimizing Science News Generation for Reader Learning
di: Soós, Dominik, et al.
Pubblicazione: (2026)
di: Soós, Dominik, et al.
Pubblicazione: (2026)
A Call for Collaborative Intelligence: Why Human-Agent Systems Should Precede AI Autonomy
di: Zou, Henry Peng, et al.
Pubblicazione: (2025)
di: Zou, Henry Peng, et al.
Pubblicazione: (2025)
Maintaining Informative Coherence: Migrating Hallucinations in Large Language Models via Absorbing Markov Chains
di: Wu, Jiemin, et al.
Pubblicazione: (2024)
di: Wu, Jiemin, et al.
Pubblicazione: (2024)
Supervised Knowledge Makes Large Language Models Better In-context Learners
di: Yang, Linyi, et al.
Pubblicazione: (2023)
di: Yang, Linyi, et al.
Pubblicazione: (2023)
When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards
di: Alzahrani, Norah, et al.
Pubblicazione: (2024)
di: Alzahrani, Norah, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CulturePark: Boosting Cross-cultural Understanding in Large Language Models
di: Li, Cheng, et al.
Pubblicazione: (2024) -
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
di: Xie, Qiujie, et al.
Pubblicazione: (2025) -
LLM Agents for Education: Advances and Applications
di: Chu, Zhendong, et al.
Pubblicazione: (2025) -
MULTI: Multimodal Understanding Leaderboard with Text and Images
di: Zhu, Zichen, et al.
Pubblicazione: (2024) -
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
di: Zhang, Hongbo, et al.
Pubblicazione: (2025)