Evalita-LLM: Benchmarking Large Language Models on Italian
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Magnini, Bernardo, Zanoli, Roberto, Resta, Michele, Cimmino, Martin, Albano, Paolo, Madeddu, Marco, Patti, Viviana |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Testimole-Conversational: A 30-Billion-Word Italian Discussion Board Corpus (1996-2024) for Language Modeling and Sociolinguistic Research
par: Rinaldi, Matteo, et autres
Publié: (2026)
par: Rinaldi, Matteo, et autres
Publié: (2026)
Small LLMs for Medical NLP: a Systematic Analysis of Few-Shot, Constraint Decoding, Fine-Tuning and Continual Pre-Training in Italian
par: Ferrazzi, Pietro, et autres
Publié: (2026)
par: Ferrazzi, Pietro, et autres
Publié: (2026)
Evaluating Task-Oriented Dialogue Consistency through Constraint Satisfaction
par: Labruna, Tiziano, et autres
Publié: (2024)
par: Labruna, Tiziano, et autres
Publié: (2024)
Toward Automatic Filling of Case Report Forms: A Case Study on Data from an Italian Emergency Department
par: Kaczmarek, Gabriela Anna, et autres
Publié: (2026)
par: Kaczmarek, Gabriela Anna, et autres
Publié: (2026)
Challenging the Abilities of Large Language Models in Italian: a Community Initiative
par: Nissim, Malvina, et autres
Publié: (2025)
par: Nissim, Malvina, et autres
Publié: (2025)
Converting Annotated Clinical Cases into Structured Case Report Forms
par: Ferrazzi, Pietro, et autres
Publié: (2025)
par: Ferrazzi, Pietro, et autres
Publié: (2025)
GFG -- Gender-Fair Generation: A CALAMITA Challenge
par: Frenda, Simona, et autres
Publié: (2024)
par: Frenda, Simona, et autres
Publié: (2024)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
par: Lazzaroni, Ruggero Marino, et autres
Publié: (2025)
par: Lazzaroni, Ruggero Marino, et autres
Publié: (2025)
Unipa-GPT: Large Language Models for university-oriented QA in Italian
par: Siragusa, Irene, et autres
Publié: (2024)
par: Siragusa, Irene, et autres
Publié: (2024)
Self-generated Replay Memories for Continual Neural Machine Translation
par: Resta, Michele, et autres
Publié: (2024)
par: Resta, Michele, et autres
Publié: (2024)
The Invalsi Benchmarks: measuring Linguistic and Mathematical understanding of Large Language Models in Italian
par: Puccetti, Giovanni, et autres
Publié: (2024)
par: Puccetti, Giovanni, et autres
Publié: (2024)
All-in-one: Understanding and Generation in Multimodal Reasoning with the MAIA Benchmark
par: Testa, Davide, et autres
Publié: (2025)
par: Testa, Davide, et autres
Publié: (2025)
An Empirical Investigation of Gender Stereotype Representation in Large Language Models: The Italian Case
par: Giachino, Gioele, et autres
Publié: (2025)
par: Giachino, Gioele, et autres
Publié: (2025)
Prompting Encoder Models for Zero-Shot Classification: A Cross-Domain Study in Italian
par: Auriemma, Serena, et autres
Publié: (2024)
par: Auriemma, Serena, et autres
Publié: (2024)
Practising responsibility: Ethics in NLP as a hands-on course
par: Nissim, Malvina, et autres
Publié: (2025)
par: Nissim, Malvina, et autres
Publié: (2025)
IMB: An Italian Medical Benchmark for Question Answering
par: Romano, Antonio, et autres
Publié: (2025)
par: Romano, Antonio, et autres
Publié: (2025)
FAMA: The First Large-Scale Open-Science Speech Foundation Model for English and Italian
par: Papi, Sara, et autres
Publié: (2025)
par: Papi, Sara, et autres
Publié: (2025)
Wikibio: a Semantic Resource for the Intersectional Analysis of Biographical Events
par: Stranisci, Marco Antonio, et autres
Publié: (2023)
par: Stranisci, Marco Antonio, et autres
Publié: (2023)
Dealing with Controversy: An Emotion and Coping Strategy Corpus Based on Role Playing
par: Troiano, Enrica, et autres
Publié: (2024)
par: Troiano, Enrica, et autres
Publié: (2024)
Compromesso! Italian Many-Shot Jailbreaks Undermine the Safety of Large Language Models
par: Pernisi, Fabio, et autres
Publié: (2024)
par: Pernisi, Fabio, et autres
Publié: (2024)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
par: Yang, Tiankai, et autres
Publié: (2024)
par: Yang, Tiankai, et autres
Publié: (2024)
Large language models as oracles for instantiating ontologies with domain-specific knowledge
par: Ciatto, Giovanni, et autres
Publié: (2024)
par: Ciatto, Giovanni, et autres
Publié: (2024)
MD-LLM-1: A Large Language Model for Molecular Dynamics
par: Murtada, Mhd Hussein, et autres
Publié: (2025)
par: Murtada, Mhd Hussein, et autres
Publié: (2025)
PM-LLM-Benchmark: Evaluating Large Language Models on Process Mining Tasks
par: Berti, Alessandro, et autres
Publié: (2024)
par: Berti, Alessandro, et autres
Publié: (2024)
A Transparent Fairness Evaluation Protocol for Open-Source Language Model Benchmarking on the Blockchain
par: Massaroli, Hugo, et autres
Publié: (2025)
par: Massaroli, Hugo, et autres
Publié: (2025)
Low-resource Information Extraction with the European Clinical Case Corpus
par: Ghosh, Soumitra, et autres
Publié: (2025)
par: Ghosh, Soumitra, et autres
Publié: (2025)
BAMBI: Developing Baby Language Models for Italian
par: Suozzi, Alice, et autres
Publié: (2025)
par: Suozzi, Alice, et autres
Publié: (2025)
AI Blob! LLM-Driven Recontextualization of Italian Television Archives
par: Balestri, Roberto
Publié: (2025)
par: Balestri, Roberto
Publié: (2025)
SLIMER-IT: Zero-Shot NER on Italian Language
par: Zamai, Andrew, et autres
Publié: (2024)
par: Zamai, Andrew, et autres
Publié: (2024)
Entropy in Large Language Models
par: Scharringhausen, Marco
Publié: (2026)
par: Scharringhausen, Marco
Publié: (2026)
Exploring Large Language Models for Hate Speech Detection in Rioplatense Spanish
par: Pérez, Juan Manuel, et autres
Publié: (2024)
par: Pérez, Juan Manuel, et autres
Publié: (2024)
BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
par: Sokol, Anna, et autres
Publié: (2024)
par: Sokol, Anna, et autres
Publié: (2024)
A Survey on Large Language Model Benchmarks
par: Ni, Shiwen, et autres
Publié: (2025)
par: Ni, Shiwen, et autres
Publié: (2025)
Estonian Native Large Language Model Benchmark
par: Lillepalu, Helena Grete, et autres
Publié: (2025)
par: Lillepalu, Helena Grete, et autres
Publié: (2025)
Benchmarking Linguistic Diversity of Large Language Models
par: Guo, Yanzhu, et autres
Publié: (2024)
par: Guo, Yanzhu, et autres
Publié: (2024)
EventNet-ITA: Italian Frame Parsing for Events
par: Rovera, Marco
Publié: (2023)
par: Rovera, Marco
Publié: (2023)
DiscussLLM: Teaching Large Language Models When to Speak
par: Patel, Deep Anil, et autres
Publié: (2025)
par: Patel, Deep Anil, et autres
Publié: (2025)
LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction
par: Rubungo, Andre Niyongabo, et autres
Publié: (2024)
par: Rubungo, Andre Niyongabo, et autres
Publié: (2024)
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
par: Wang, Zekun Moore, et autres
Publié: (2023)
par: Wang, Zekun Moore, et autres
Publié: (2023)
Non Verbis, Sed Rebus: Large Language Models are Weak Solvers of Italian Rebuses
par: Sarti, Gabriele, et autres
Publié: (2024)
par: Sarti, Gabriele, et autres
Publié: (2024)
Documents similaires
-
Testimole-Conversational: A 30-Billion-Word Italian Discussion Board Corpus (1996-2024) for Language Modeling and Sociolinguistic Research
par: Rinaldi, Matteo, et autres
Publié: (2026) -
Small LLMs for Medical NLP: a Systematic Analysis of Few-Shot, Constraint Decoding, Fine-Tuning and Continual Pre-Training in Italian
par: Ferrazzi, Pietro, et autres
Publié: (2026) -
Evaluating Task-Oriented Dialogue Consistency through Constraint Satisfaction
par: Labruna, Tiziano, et autres
Publié: (2024) -
Toward Automatic Filling of Case Report Forms: A Case Study on Data from an Italian Emergency Department
par: Kaczmarek, Gabriela Anna, et autres
Publié: (2026) -
Challenging the Abilities of Large Language Models in Italian: a Community Initiative
par: Nissim, Malvina, et autres
Publié: (2025)