TextClass Benchmark: A Continuous Elo Rating of LLMs in Social Sciences
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | González-Bustamante, Bastián |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking LLMs in Political Content Text-Annotation: Proof-of-Concept with Toxicity and Incivility Data
par: González-Bustamante, Bastián
Publié: (2024)
par: González-Bustamante, Bastián
Publié: (2024)
Emulating Public Opinion: A Proof-of-Concept of AI-Generated Synthetic Survey Responses for the Chilean Case
par: González-Bustamante, Bastián, et autres
Publié: (2025)
par: González-Bustamante, Bastián, et autres
Publié: (2025)
Extracting and Validating Explanatory Word Archipelagoes using Dual Entropy
par: Ohsawa, Yukio
Publié: (2020)
par: Ohsawa, Yukio
Publié: (2020)
Extracting Abstraction Dimensions by Identifying Syntax Pattern from Texts
par: Zhou, Jian, et autres
Publié: (2025)
par: Zhou, Jian, et autres
Publié: (2025)
Increasing the Difficulty of Automatically Generated Questions via Reinforcement Learning with Synthetic Preference
par: Thorne, William, et autres
Publié: (2024)
par: Thorne, William, et autres
Publié: (2024)
Large Language Models are Inconsistent and Biased Evaluators
par: Stureborg, Rickard, et autres
Publié: (2024)
par: Stureborg, Rickard, et autres
Publié: (2024)
Tailoring Vaccine Messaging with Common-Ground Opinions
par: Stureborg, Rickard, et autres
Publié: (2024)
par: Stureborg, Rickard, et autres
Publié: (2024)
Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora
par: Skorski, Maciej
Publié: (2026)
par: Skorski, Maciej
Publié: (2026)
Unveiling factors influencing judgment variation in Sentiment Analysis with Natural Language Processing and Statistics
par: Kellert, Olga, et autres
Publié: (2024)
par: Kellert, Olga, et autres
Publié: (2024)
Fine-Tuning Transformers: Vocabulary Transfer
par: Mosin, Vladislav, et autres
Publié: (2021)
par: Mosin, Vladislav, et autres
Publié: (2021)
Smotrom tvoja pa ander drogoj verden! Resurrecting Dead Pidgin with Generative Models: Russenorsk Case Study
par: Tikhonov, Alexey, et autres
Publié: (2025)
par: Tikhonov, Alexey, et autres
Publié: (2025)
What is lost in Normalization? Exploring Pitfalls in Multilingual ASR Model Evaluations
par: Manohar, Kavya, et autres
Publié: (2024)
par: Manohar, Kavya, et autres
Publié: (2024)
Comparative Global AI Regulation: Policy Perspectives from the EU, China, and the US
par: Chun, Jon, et autres
Publié: (2024)
par: Chun, Jon, et autres
Publié: (2024)
A Characterization of Complexity in Public Goods Games
par: Gilboa, Matan
Publié: (2023)
par: Gilboa, Matan
Publié: (2023)
Modeling Story Expectations to Understand Engagement: A Generative Framework Using LLMs
par: Fong, Hortense, et autres
Publié: (2024)
par: Fong, Hortense, et autres
Publié: (2024)
AI in Investment Analysis: LLMs for Equity Stock Ratings
par: Papasotiriou, Kassiani, et autres
Publié: (2024)
par: Papasotiriou, Kassiani, et autres
Publié: (2024)
Synthetic Founders: AI-Generated Social Simulations for Startup Validation Research in Computational Social Science
par: Teutloff, Jorn K.
Publié: (2025)
par: Teutloff, Jorn K.
Publié: (2025)
Effect of Electoral Seat Bias on Political Polarization: A Computational Perspective
par: Boratyn, Daria, et autres
Publié: (2026)
par: Boratyn, Daria, et autres
Publié: (2026)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
par: Agrawal, Yogesh, et autres
Publié: (2026)
par: Agrawal, Yogesh, et autres
Publié: (2026)
Generative AI and Large Language Models in Language Preservation: Opportunities and Challenges
par: Koc, Vincent
Publié: (2025)
par: Koc, Vincent
Publié: (2025)
Invertibility in the misère multiverse
par: Davies, Alfie, et autres
Publié: (2024)
par: Davies, Alfie, et autres
Publié: (2024)
Sentiment Analysis of Spanish Political Party Tweets Using Pre-trained Language Models
par: Song, Chuqiao, et autres
Publié: (2024)
par: Song, Chuqiao, et autres
Publié: (2024)
Uncovering Uncertainty in Transformer Inference
par: Brothers, Greyson, et autres
Publié: (2024)
par: Brothers, Greyson, et autres
Publié: (2024)
MultiFinRAG: An Optimized Multimodal Retrieval-Augmented Generation (RAG) Framework for Financial Question Answering
par: Gondhalekar, Chinmay, et autres
Publié: (2025)
par: Gondhalekar, Chinmay, et autres
Publié: (2025)
Hive is PSPACE-Hard
par: Andel, Daniël, et autres
Publié: (2025)
par: Andel, Daniël, et autres
Publié: (2025)
From Zipf's Law to Neural Scaling through Heaps' Law and Hilberg's Hypothesis
par: Dębowski, Łukasz
Publié: (2025)
par: Dębowski, Łukasz
Publié: (2025)
CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas
par: Tewolde, Emanuel, et autres
Publié: (2026)
par: Tewolde, Emanuel, et autres
Publié: (2026)
Attention-Enhanced Reinforcement Learning for Dynamic Portfolio Optimization
par: Xue, Pei, et autres
Publié: (2025)
par: Xue, Pei, et autres
Publié: (2025)
EF1 Allocations for Identical Trilean and Separable Single-Peaked Valuations
par: Bhaskar, Umang, et autres
Publié: (2024)
par: Bhaskar, Umang, et autres
Publié: (2024)
Equilibrium Computation in the Hotelling-Downs Model of Spatial Competition
par: Bhaskar, Umang, et autres
Publié: (2024)
par: Bhaskar, Umang, et autres
Publié: (2024)
FANAL -- Financial Activity News Alerting Language Modeling Framework
par: Patel, Urjitkumar, et autres
Publié: (2024)
par: Patel, Urjitkumar, et autres
Publié: (2024)
Imperfect-Recall Games: Equilibrium Concepts and Their Complexity
par: Tewolde, Emanuel, et autres
Publié: (2024)
par: Tewolde, Emanuel, et autres
Publié: (2024)
Quantum NLP models on Natural Language Inference
par: Sun, Ling, et autres
Publié: (2025)
par: Sun, Ling, et autres
Publié: (2025)
The Association of Transformer-based Sentiment Analysis with Symptom Distress and Deterioration in Routine Psychotherapy Care
par: Faust, Douglas K., et autres
Publié: (2026)
par: Faust, Douglas K., et autres
Publié: (2026)
Kernels of Selfhood: GPT-4o shows humanlike patterns of cognitive consistency moderated by free choice
par: Lehr, Steven A., et autres
Publié: (2025)
par: Lehr, Steven A., et autres
Publié: (2025)
Perturbing Best Responses in Zero-Sum Games
par: Dziwoki, Adam, et autres
Publié: (2025)
par: Dziwoki, Adam, et autres
Publié: (2025)
CANAL -- Cyber Activity News Alerting Language Model: Empirical Approach vs. Expensive LLM
par: Patel, Urjitkumar, et autres
Publié: (2024)
par: Patel, Urjitkumar, et autres
Publié: (2024)
An Integrated Framework of Prompt Engineering and Multidimensional Knowledge Graphs for Legal Dispute Analysis
par: Zhang, Mingda, et autres
Publié: (2025)
par: Zhang, Mingda, et autres
Publié: (2025)
Computing Game Symmetries and Equilibria That Respect Them
par: Tewolde, Emanuel, et autres
Publié: (2025)
par: Tewolde, Emanuel, et autres
Publié: (2025)
Machine Learning for Sentiment Analysis of Imported Food in Trinidad and Tobago
par: Daniels, Cassandra, et autres
Publié: (2024)
par: Daniels, Cassandra, et autres
Publié: (2024)
Documents similaires
-
Benchmarking LLMs in Political Content Text-Annotation: Proof-of-Concept with Toxicity and Incivility Data
par: González-Bustamante, Bastián
Publié: (2024) -
Emulating Public Opinion: A Proof-of-Concept of AI-Generated Synthetic Survey Responses for the Chilean Case
par: González-Bustamante, Bastián, et autres
Publié: (2025) -
Extracting and Validating Explanatory Word Archipelagoes using Dual Entropy
par: Ohsawa, Yukio
Publié: (2020) -
Extracting Abstraction Dimensions by Identifying Syntax Pattern from Texts
par: Zhou, Jian, et autres
Publié: (2025) -
Increasing the Difficulty of Automatically Generated Questions via Reinforcement Learning with Synthetic Preference
par: Thorne, William, et autres
Publié: (2024)