Efficient Performance Tracking: Leveraging Large Language Models for Automated Construction of Scientific Leaderboards
Fuente:
arXiv
Salvato in:
| Autori principali: | Şahinuç, Furkan, Tran, Thy Thy, Grishina, Yulia, Hou, Yufang, Chen, Bei, Gurevych, Iryna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Automated Error Discovery: A Study in Conversational AI
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
Reward Modeling for Scientific Writing Evaluation
di: Şahinuç, Furkan, et al.
Pubblicazione: (2026)
di: Şahinuç, Furkan, et al.
Pubblicazione: (2026)
Systematic Task Exploration with LLMs: A Study in Citation Text Generation
di: Şahinuç, Furkan, et al.
Pubblicazione: (2024)
di: Şahinuç, Furkan, et al.
Pubblicazione: (2024)
Learning from Implicit User Feedback, Emotions and Demographic Information in Task-Oriented and Document-Grounded Dialogues
di: Petrak, Dominic, et al.
Pubblicazione: (2024)
di: Petrak, Dominic, et al.
Pubblicazione: (2024)
Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
Expert Preference-based Evaluation of Automated Related Work Generation
di: Şahinuç, Furkan, et al.
Pubblicazione: (2025)
di: Şahinuç, Furkan, et al.
Pubblicazione: (2025)
A Course Shared Task on Evaluating LLM Output for Clinical Questions
di: Hou, Yufang, et al.
Pubblicazione: (2024)
di: Hou, Yufang, et al.
Pubblicazione: (2024)
Grounding Fallacies Misrepresenting Scientific Publications in Evidence
di: Glockner, Max, et al.
Pubblicazione: (2024)
di: Glockner, Max, et al.
Pubblicazione: (2024)
Transforming Scholarly Landscapes: Influence of Large Language Models on Academic Fields beyond Computer Science
di: Pramanick, Aniket, et al.
Pubblicazione: (2024)
di: Pramanick, Aniket, et al.
Pubblicazione: (2024)
ClaimFlow: Tracing the Evolution of Scientific Claims in NLP
di: Pramanick, Aniket, et al.
Pubblicazione: (2026)
di: Pramanick, Aniket, et al.
Pubblicazione: (2026)
How to Handle Different Types of Out-of-Distribution Scenarios in Computational Argumentation? A Comprehensive and Fine-Grained Field Study
di: Waldis, Andreas, et al.
Pubblicazione: (2023)
di: Waldis, Andreas, et al.
Pubblicazione: (2023)
Dive into the Chasm: Probing the Gap between In- and Cross-Topic Generalization
di: Waldis, Andreas, et al.
Pubblicazione: (2024)
di: Waldis, Andreas, et al.
Pubblicazione: (2024)
Holmes: A Benchmark to Assess the Linguistic Competence of Language Models
di: Waldis, Andreas, et al.
Pubblicazione: (2024)
di: Waldis, Andreas, et al.
Pubblicazione: (2024)
Are Large Language Models Good Classifiers? A Study on Edit Intent Classification in Scientific Document Revisions
di: Ruan, Qian, et al.
Pubblicazione: (2024)
di: Ruan, Qian, et al.
Pubblicazione: (2024)
Missci: Reconstructing Fallacies in Misrepresented Science
di: Glockner, Max, et al.
Pubblicazione: (2024)
di: Glockner, Max, et al.
Pubblicazione: (2024)
The Nature of NLP: Analyzing Contributions in NLP Papers
di: Pramanick, Aniket, et al.
Pubblicazione: (2024)
di: Pramanick, Aniket, et al.
Pubblicazione: (2024)
Attribute or Abstain: Large Language Models as Long Document Assistants
di: Buchmann, Jan, et al.
Pubblicazione: (2024)
di: Buchmann, Jan, et al.
Pubblicazione: (2024)
SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026)
Robust Utility-Preserving Text Anonymization Based on Large Language Models
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
Citation Failure: Definition, Analysis and Efficient Mitigation
di: Buchmann, Jan, et al.
Pubblicazione: (2025)
di: Buchmann, Jan, et al.
Pubblicazione: (2025)
A Position Paper on the Automatic Generation of Machine Learning Leaderboards
di: Timmer, Roelien C, et al.
Pubblicazione: (2025)
di: Timmer, Roelien C, et al.
Pubblicazione: (2025)
Patches of Nonlinearity: Instruction Vectors in Large Language Models
di: Bigoulaeva, Irina, et al.
Pubblicazione: (2026)
di: Bigoulaeva, Irina, et al.
Pubblicazione: (2026)
Cultural Learning-Based Culture Adaptation of Language Models
di: Liu, Chen Cecilia, et al.
Pubblicazione: (2025)
di: Liu, Chen Cecilia, et al.
Pubblicazione: (2025)
Token Weighting for Long-Range Language Modeling
di: Helm, Falko, et al.
Pubblicazione: (2025)
di: Helm, Falko, et al.
Pubblicazione: (2025)
Differentially Private Steering for Large Language Model Alignment
di: Goel, Anmol, et al.
Pubblicazione: (2025)
di: Goel, Anmol, et al.
Pubblicazione: (2025)
How Quantization Shapes Bias in Large Language Models
di: Marcuzzi, Federico, et al.
Pubblicazione: (2025)
di: Marcuzzi, Federico, et al.
Pubblicazione: (2025)
ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
di: Bates, Luke, et al.
Pubblicazione: (2025)
di: Bates, Luke, et al.
Pubblicazione: (2025)
IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code Generators
di: Paul, Indraneil, et al.
Pubblicazione: (2024)
di: Paul, Indraneil, et al.
Pubblicazione: (2024)
Multimodal Large Language Models to Support Real-World Fact-Checking
di: Geng, Jiahui, et al.
Pubblicazione: (2024)
di: Geng, Jiahui, et al.
Pubblicazione: (2024)
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025)
CATfOOD: Counterfactual Augmented Training for Improving Out-of-Domain Performance and Calibration
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2023)
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2023)
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
di: Wang, Yike, et al.
Pubblicazione: (2025)
di: Wang, Yike, et al.
Pubblicazione: (2025)
Are Emergent Abilities in Large Language Models just In-Context Learning?
di: Lu, Sheng, et al.
Pubblicazione: (2023)
di: Lu, Sheng, et al.
Pubblicazione: (2023)
Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework
di: Dycke, Nils, et al.
Pubblicazione: (2025)
di: Dycke, Nils, et al.
Pubblicazione: (2025)
Like a Good Nearest Neighbor: Practical Content Moderation and Text Classification
di: Bates, Luke, et al.
Pubblicazione: (2023)
di: Bates, Luke, et al.
Pubblicazione: (2023)
La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America
di: Grandury, María, et al.
Pubblicazione: (2025)
di: Grandury, María, et al.
Pubblicazione: (2025)
DARA: Decomposition-Alignment-Reasoning Autonomous Language Agent for Question Answering over Knowledge Graphs
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
MiDe22: An Annotated Multi-Event Tweet Dataset for Misinformation Detection
di: Toraman, Cagri, et al.
Pubblicazione: (2022)
di: Toraman, Cagri, et al.
Pubblicazione: (2022)
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
LEGOBench: Scientific Leaderboard Generation Benchmark
di: Singh, Shruti, et al.
Pubblicazione: (2024)
di: Singh, Shruti, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Towards Automated Error Discovery: A Study in Conversational AI
di: Petrak, Dominic, et al.
Pubblicazione: (2025) -
Reward Modeling for Scientific Writing Evaluation
di: Şahinuç, Furkan, et al.
Pubblicazione: (2026) -
Systematic Task Exploration with LLMs: A Study in Citation Text Generation
di: Şahinuç, Furkan, et al.
Pubblicazione: (2024) -
Learning from Implicit User Feedback, Emotions and Demographic Information in Task-Oriented and Document-Grounded Dialogues
di: Petrak, Dominic, et al.
Pubblicazione: (2024) -
Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities
di: Geng, Jiahui, et al.
Pubblicazione: (2025)