The Invalsi Benchmarks: measuring Linguistic and Mathematical understanding of Large Language Models in Italian
Fuente:
arXiv
Salvato in:
| Autori principali: | Puccetti, Giovanni, Cassese, Maria, Esuli, Andrea |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AI "News" Content Farms Are Easy to Make and Hard to Detect: A Case Study in Italian
di: Puccetti, Giovanni, et al.
Pubblicazione: (2024)
di: Puccetti, Giovanni, et al.
Pubblicazione: (2024)
Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectors
di: Pedrotti, Andrea, et al.
Pubblicazione: (2025)
di: Pedrotti, Andrea, et al.
Pubblicazione: (2025)
Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation
di: Moroni, Luca, et al.
Pubblicazione: (2025)
di: Moroni, Luca, et al.
Pubblicazione: (2025)
Challenging the Abilities of Large Language Models in Italian: a Community Initiative
di: Nissim, Malvina, et al.
Pubblicazione: (2025)
di: Nissim, Malvina, et al.
Pubblicazione: (2025)
Benchmarking Linguistic Diversity of Large Language Models
di: Guo, Yanzhu, et al.
Pubblicazione: (2024)
di: Guo, Yanzhu, et al.
Pubblicazione: (2024)
Evalita-LLM: Benchmarking Large Language Models on Italian
di: Magnini, Bernardo, et al.
Pubblicazione: (2025)
di: Magnini, Bernardo, et al.
Pubblicazione: (2025)
MathRobust-LV: Evaluation of Large Language Models' Robustness to Linguistic Variations in Mathematical Reasoning
di: Kirtane, Neeraja, et al.
Pubblicazione: (2025)
di: Kirtane, Neeraja, et al.
Pubblicazione: (2025)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
di: Xue, Boyang, et al.
Pubblicazione: (2025)
di: Xue, Boyang, et al.
Pubblicazione: (2025)
Linguistic Minimal Pairs Elicit Linguistic Similarity in Large Language Models
di: Zhou, Xinyu, et al.
Pubblicazione: (2024)
di: Zhou, Xinyu, et al.
Pubblicazione: (2024)
GAUSS: Benchmarking Structured Mathematical Skills for Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
UrBLiMP: A Benchmark for Evaluating the Linguistic Competence of Large Language Models in Urdu
di: Adeeba, Farah, et al.
Pubblicazione: (2025)
di: Adeeba, Farah, et al.
Pubblicazione: (2025)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
di: Lazzaroni, Ruggero Marino, et al.
Pubblicazione: (2025)
di: Lazzaroni, Ruggero Marino, et al.
Pubblicazione: (2025)
Linguistic Intelligence in Large Language Models for Telecommunications
di: Ahmed, Tasnim, et al.
Pubblicazione: (2024)
di: Ahmed, Tasnim, et al.
Pubblicazione: (2024)
Unveiling Linguistic Regions in Large Language Models
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
Holmes: A Benchmark to Assess the Linguistic Competence of Language Models
di: Waldis, Andreas, et al.
Pubblicazione: (2024)
di: Waldis, Andreas, et al.
Pubblicazione: (2024)
Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
di: Gao, Bofei, et al.
Pubblicazione: (2024)
di: Gao, Bofei, et al.
Pubblicazione: (2024)
NSMQ Riddles: A Benchmark of Scientific and Mathematical Riddles for Quizzing Large Language Models
di: Boateng, George, et al.
Pubblicazione: (2026)
di: Boateng, George, et al.
Pubblicazione: (2026)
Multi-Objective Linguistic Control of Large Language Models
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges
di: Yan, Yibo, et al.
Pubblicazione: (2024)
di: Yan, Yibo, et al.
Pubblicazione: (2024)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
di: Amjad, Husnain, et al.
Pubblicazione: (2026)
di: Amjad, Husnain, et al.
Pubblicazione: (2026)
A Comparative Approach to Assessing Linguistic Creativity of Large Language Models and Humans
di: Dinu, Anca, et al.
Pubblicazione: (2025)
di: Dinu, Anca, et al.
Pubblicazione: (2025)
Inductive Linguistic Reasoning with Large Language Models
di: Ramji, Raghav, et al.
Pubblicazione: (2024)
di: Ramji, Raghav, et al.
Pubblicazione: (2024)
Unipa-GPT: Large Language Models for university-oriented QA in Italian
di: Siragusa, Irene, et al.
Pubblicazione: (2024)
di: Siragusa, Irene, et al.
Pubblicazione: (2024)
The Shrinking Landscape of Linguistic Diversity in the Age of Large Language Models
di: Sourati, Zhivar, et al.
Pubblicazione: (2025)
di: Sourati, Zhivar, et al.
Pubblicazione: (2025)
MorphPiece : A Linguistic Tokenizer for Large Language Models
di: Jabbar, Haris
Pubblicazione: (2023)
di: Jabbar, Haris
Pubblicazione: (2023)
Large Language Models as Proxies for Theories of Human Linguistic Cognition
di: Ziv, Imry, et al.
Pubblicazione: (2025)
di: Ziv, Imry, et al.
Pubblicazione: (2025)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection
di: Yan, Yibo, et al.
Pubblicazione: (2024)
di: Yan, Yibo, et al.
Pubblicazione: (2024)
TeleMath: A Benchmark for Large Language Models in Telecom Mathematical Problem Solving
di: Colle, Vincenzo, et al.
Pubblicazione: (2025)
di: Colle, Vincenzo, et al.
Pubblicazione: (2025)
Compromesso! Italian Many-Shot Jailbreaks Undermine the Safety of Large Language Models
di: Pernisi, Fabio, et al.
Pubblicazione: (2024)
di: Pernisi, Fabio, et al.
Pubblicazione: (2024)
Generative Linguistics, Large Language Models, and the Social Nature of Scientific Success
di: Hao, Sophie
Pubblicazione: (2025)
di: Hao, Sophie
Pubblicazione: (2025)
Probing Large Language Models in Reasoning and Translating Complex Linguistic Puzzles
di: Lin, Zheng-Lin, et al.
Pubblicazione: (2025)
di: Lin, Zheng-Lin, et al.
Pubblicazione: (2025)
Are Large Language Models the future crowd workers of Linguistics?
di: Ferrazzo, Iris
Pubblicazione: (2025)
di: Ferrazzo, Iris
Pubblicazione: (2025)
Large Language Models for Mathematical Analysis
di: Chen, Ziye, et al.
Pubblicazione: (2024)
di: Chen, Ziye, et al.
Pubblicazione: (2024)
Large Language Models for Mathematical Reasoning: Progresses and Challenges
di: Ahn, Janice, et al.
Pubblicazione: (2024)
di: Ahn, Janice, et al.
Pubblicazione: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
Large Language Model enabled Mathematical Modeling
di: Zhang, Guoyun
Pubblicazione: (2025)
di: Zhang, Guoyun
Pubblicazione: (2025)
Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
Linguistic Blind Spots of Large Language Models
di: Cheng, Jiali, et al.
Pubblicazione: (2025)
di: Cheng, Jiali, et al.
Pubblicazione: (2025)
CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models
di: Oba, Miyu, et al.
Pubblicazione: (2026)
di: Oba, Miyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AI "News" Content Farms Are Easy to Make and Hard to Detect: A Case Study in Italian
di: Puccetti, Giovanni, et al.
Pubblicazione: (2024) -
Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectors
di: Pedrotti, Andrea, et al.
Pubblicazione: (2025) -
Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation
di: Moroni, Luca, et al.
Pubblicazione: (2025) -
Challenging the Abilities of Large Language Models in Italian: a Community Initiative
di: Nissim, Malvina, et al.
Pubblicazione: (2025) -
Benchmarking Linguistic Diversity of Large Language Models
di: Guo, Yanzhu, et al.
Pubblicazione: (2024)