Prediction-Powered Ranking of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chatzi, Ivi, Straitouri, Eleni, Thejaswi, Suhas, Rodriguez, Manuel Gomez |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Controlling Counterfactual Harm in Decision Support Systems Based on Prediction Sets
par: Straitouri, Eleni, et autres
Publié: (2024)
par: Straitouri, Eleni, et autres
Publié: (2024)
Towards Human-AI Complementarity with Prediction Sets
par: De Toni, Giovanni, et autres
Publié: (2024)
par: De Toni, Giovanni, et autres
Publié: (2024)
Evaluation of Large Language Models via Coupled Token Generation
par: Benz, Nina Corvelo, et autres
Publié: (2025)
par: Benz, Nina Corvelo, et autres
Publié: (2025)
Designing Decision Support Systems Using Counterfactual Prediction Sets
par: Straitouri, Eleni, et autres
Publié: (2023)
par: Straitouri, Eleni, et autres
Publié: (2023)
Narrowing Action Choices with AI Improves Human Sequential Decisions
par: Straitouri, Eleni, et autres
Publié: (2025)
par: Straitouri, Eleni, et autres
Publié: (2025)
Counterfactual Token Generation in Large Language Models
par: Chatzi, Ivi, et autres
Publié: (2024)
par: Chatzi, Ivi, et autres
Publié: (2024)
Learning to Decide with AI Assistance under Human-Alignment
par: Benz, Nina Corvelo, et autres
Publié: (2026)
par: Benz, Nina Corvelo, et autres
Publié: (2026)
Linear Representations of Political Perspective Emerge in Large Language Models
par: Kim, Junsol, et autres
Publié: (2025)
par: Kim, Junsol, et autres
Publié: (2025)
Can Large Language Models Unlock Novel Scientific Research Ideas?
par: Kumar, Sandeep, et autres
Publié: (2024)
par: Kumar, Sandeep, et autres
Publié: (2024)
Computational Approaches to Understanding Large Language Model Impact on Writing and Information Ecosystems
par: Liang, Weixin
Publié: (2025)
par: Liang, Weixin
Publié: (2025)
Large Language Models Can Infer Personality from Free-Form User Interactions
par: Peters, Heinrich, et autres
Publié: (2024)
par: Peters, Heinrich, et autres
Publié: (2024)
LLM4PM: A case study on using Large Language Models for Process Modeling in Enterprise Organizations
par: Ziche, Clara, et autres
Publié: (2024)
par: Ziche, Clara, et autres
Publié: (2024)
When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models
par: Zheng, Mingqian, et autres
Publié: (2023)
par: Zheng, Mingqian, et autres
Publié: (2023)
Causal Reasoning and Large Language Models: Opening a New Frontier for Causality
par: Kıcıman, Emre, et autres
Publié: (2023)
par: Kıcıman, Emre, et autres
Publié: (2023)
Implicit Personalization in Language Models: A Systematic Study
par: Jin, Zhijing, et autres
Publié: (2024)
par: Jin, Zhijing, et autres
Publié: (2024)
MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes
par: Chiu, Yu Ying, et autres
Publié: (2025)
par: Chiu, Yu Ying, et autres
Publié: (2025)
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
par: Karamolegkou, Antonia, et autres
Publié: (2025)
par: Karamolegkou, Antonia, et autres
Publié: (2025)
Asking For It: Question-Answering for Predicting Rule Infractions in Online Content Moderation
par: Samory, Mattia, et autres
Publié: (2025)
par: Samory, Mattia, et autres
Publié: (2025)
Llms, Virtual Users, and Bias: Predicting Any Survey Question Without Human Data
par: Sinacola, Enzo, et autres
Publié: (2025)
par: Sinacola, Enzo, et autres
Publié: (2025)
Conversational AI Powered by Large Language Models Amplifies False Memories in Witness Interviews
par: Chan, Samantha, et autres
Publié: (2024)
par: Chan, Samantha, et autres
Publié: (2024)
Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers
par: Si, Chenglei, et autres
Publié: (2024)
par: Si, Chenglei, et autres
Publié: (2024)
AI Meets the Classroom: When Do Large Language Models Harm Learning?
par: Lehmann, Matthias, et autres
Publié: (2024)
par: Lehmann, Matthias, et autres
Publié: (2024)
Communication Bias in Large Language Models: A Regulatory Perspective
par: Kuenzler, Adrian, et autres
Publié: (2025)
par: Kuenzler, Adrian, et autres
Publié: (2025)
Large Language Models Can Infer Psychological Dispositions of Social Media Users
par: Peters, Heinrich, et autres
Publié: (2023)
par: Peters, Heinrich, et autres
Publié: (2023)
Large Language Models for Cancer Communication: Evaluating Linguistic Quality, Safety, and Accessibility in Generative AI
par: Saha, Agnik, et autres
Publié: (2025)
par: Saha, Agnik, et autres
Publié: (2025)
Wordflow: Social Prompt Engineering for Large Language Models
par: Wang, Zijie J., et autres
Publié: (2024)
par: Wang, Zijie J., et autres
Publié: (2024)
Benchmarking Gender and Political Bias in Large Language Models
par: Yang, Jinrui, et autres
Publié: (2025)
par: Yang, Jinrui, et autres
Publié: (2025)
Heterogeneous Value Alignment Evaluation for Large Language Models
par: Zhang, Zhaowei, et autres
Publié: (2023)
par: Zhang, Zhaowei, et autres
Publié: (2023)
ProgressGym: Alignment with a Millennium of Moral Progress
par: Qiu, Tianyi, et autres
Publié: (2024)
par: Qiu, Tianyi, et autres
Publié: (2024)
What are human values, and how do we align AI to them?
par: Klingefjord, Oliver, et autres
Publié: (2024)
par: Klingefjord, Oliver, et autres
Publié: (2024)
The Good, the Bad, and the Ugly: The Role of AI Quality Disclosure in Lie Detection
par: Bhattacharya, Haimanti, et autres
Publié: (2024)
par: Bhattacharya, Haimanti, et autres
Publié: (2024)
Properties and Challenges of LLM-Generated Explanations
par: Kunz, Jenny, et autres
Publié: (2024)
par: Kunz, Jenny, et autres
Publié: (2024)
Artificial intelligence to improve clinical coding practice in Scandinavia: a crossover randomized controlled trial
par: Chomutare, Taridzo, et autres
Publié: (2024)
par: Chomutare, Taridzo, et autres
Publié: (2024)
Representation Bias of Adolescents in AI: A Bilingual, Bicultural Study
par: Wolfe, Robert, et autres
Publié: (2024)
par: Wolfe, Robert, et autres
Publié: (2024)
LLMs as Writing Assistants: Exploring Perspectives on Sense of Ownership and Reasoning
par: Wasi, Azmine Toushik, et autres
Publié: (2024)
par: Wasi, Azmine Toushik, et autres
Publié: (2024)
EduAgent: Generative Student Agents in Learning
par: Xu, Songlin, et autres
Publié: (2024)
par: Xu, Songlin, et autres
Publié: (2024)
The opportunities and risks of large language models in mental health
par: Lawrence, Hannah R., et autres
Publié: (2024)
par: Lawrence, Hannah R., et autres
Publié: (2024)
"They are uncultured": Unveiling Covert Harms and Social Threats in LLM Generated Conversations
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2024)
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2024)
MentalChat16K: A Benchmark Dataset for Conversational Mental Health Assistance
par: Xu, Jia, et autres
Publié: (2025)
par: Xu, Jia, et autres
Publié: (2025)
Think Like a Person Before Responding: A Multi-Faceted Evaluation of Persona-Guided LLMs for Countering Hate
par: Ngueajio, Mikel K., et autres
Publié: (2025)
par: Ngueajio, Mikel K., et autres
Publié: (2025)
Documents similaires
-
Controlling Counterfactual Harm in Decision Support Systems Based on Prediction Sets
par: Straitouri, Eleni, et autres
Publié: (2024) -
Towards Human-AI Complementarity with Prediction Sets
par: De Toni, Giovanni, et autres
Publié: (2024) -
Evaluation of Large Language Models via Coupled Token Generation
par: Benz, Nina Corvelo, et autres
Publié: (2025) -
Designing Decision Support Systems Using Counterfactual Prediction Sets
par: Straitouri, Eleni, et autres
Publié: (2023) -
Narrowing Action Choices with AI Improves Human Sequential Decisions
par: Straitouri, Eleni, et autres
Publié: (2025)