Unipa-GPT: Large Language Models for university-oriented QA in Italian
Fuente:
arXiv
Saved in:
| Main Authors: | Siragusa, Irene, Pirrone, Roberto |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evalita-LLM: Benchmarking Large Language Models on Italian
by: Magnini, Bernardo, et al.
Published: (2025)
by: Magnini, Bernardo, et al.
Published: (2025)
Promoting Heritage Language in Northwest Russia
by: Siragusa, Laura
Published: (2025)
by: Siragusa, Laura
Published: (2025)
KG-Rank: Enhancing Large Language Models for Medical QA with Knowledge Graphs and Ranking Techniques
by: Yang, Rui, et al.
Published: (2024)
by: Yang, Rui, et al.
Published: (2024)
KatotohananQA: Evaluating Truthfulness of Large Language Models in Filipino
by: Nery, Lorenzo Alfred, et al.
Published: (2025)
by: Nery, Lorenzo Alfred, et al.
Published: (2025)
Large Language Models are Pattern Matchers: Editing Semi-Structured and Structured Documents with ChatGPT
by: Weber, Irene
Published: (2024)
by: Weber, Irene
Published: (2024)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
SportQA: A Benchmark for Sports Understanding in Large Language Models
by: Xia, Haotian, et al.
Published: (2024)
by: Xia, Haotian, et al.
Published: (2024)
CodeSimpleQA: Scaling Factuality in Code Large Language Models
by: Yang, Jian, et al.
Published: (2025)
by: Yang, Jian, et al.
Published: (2025)
Challenging the Abilities of Large Language Models in Italian: a Community Initiative
by: Nissim, Malvina, et al.
Published: (2025)
by: Nissim, Malvina, et al.
Published: (2025)
MedPix 2.0: A Comprehensive Multimodal Biomedical Data set for Advanced AI Applications with Retrieval Augmented Generation and Knowledge Graphs
by: Siragusa, Irene, et al.
Published: (2024)
by: Siragusa, Irene, et al.
Published: (2024)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
by: He, Yancheng, et al.
Published: (2024)
by: He, Yancheng, et al.
Published: (2024)
QA-prompting: Improving Summarization with Large Language Models using Question-Answering
by: Sinha, Neelabh
Published: (2025)
by: Sinha, Neelabh
Published: (2025)
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
by: Li, Guangwei, et al.
Published: (2025)
by: Li, Guangwei, et al.
Published: (2025)
AceGPT, Localizing Large Language Models in Arabic
by: Huang, Huang, et al.
Published: (2023)
by: Huang, Huang, et al.
Published: (2023)
ChatQA: Surpassing GPT-4 on Conversational QA and RAG
by: Liu, Zihan, et al.
Published: (2024)
by: Liu, Zihan, et al.
Published: (2024)
Compromesso! Italian Many-Shot Jailbreaks Undermine the Safety of Large Language Models
by: Pernisi, Fabio, et al.
Published: (2024)
by: Pernisi, Fabio, et al.
Published: (2024)
The Invalsi Benchmarks: measuring Linguistic and Mathematical understanding of Large Language Models in Italian
by: Puccetti, Giovanni, et al.
Published: (2024)
by: Puccetti, Giovanni, et al.
Published: (2024)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
by: Alonso, Iñigo, et al.
Published: (2024)
by: Alonso, Iñigo, et al.
Published: (2024)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
by: Chang, Yaoyao, et al.
Published: (2024)
by: Chang, Yaoyao, et al.
Published: (2024)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
by: Yu, Ping, et al.
Published: (2024)
by: Yu, Ping, et al.
Published: (2024)
Unchecked and Overlooked: Addressing the Checkbox Blind Spot in Large Language Models with CheckboxQA
by: Turski, Michał, et al.
Published: (2025)
by: Turski, Michał, et al.
Published: (2025)
RephQA: Evaluating Readability of Large Language Models in Public Health Question Answering
by: Qiu, Weikang, et al.
Published: (2025)
by: Qiu, Weikang, et al.
Published: (2025)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
by: Chen, Jiangxi, et al.
Published: (2026)
by: Chen, Jiangxi, et al.
Published: (2026)
GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding
by: Long, Weicai, et al.
Published: (2026)
by: Long, Weicai, et al.
Published: (2026)
DateLogicQA: Benchmarking Temporal Biases in Large Language Models
by: Bhatia, Gagan, et al.
Published: (2024)
by: Bhatia, Gagan, et al.
Published: (2024)
EcoVerse: An Annotated Twitter Dataset for Eco-Relevance Classification, Environmental Impact Analysis, and Stance Detection
by: Grasso, Francesca, et al.
Published: (2024)
by: Grasso, Francesca, et al.
Published: (2024)
ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
by: Molfese, Francesco Maria, et al.
Published: (2025)
by: Molfese, Francesco Maria, et al.
Published: (2025)
DiversityMedQA: Assessing Demographic Biases in Medical Diagnosis using Large Language Models
by: Rawat, Rajat, et al.
Published: (2024)
by: Rawat, Rajat, et al.
Published: (2024)
CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation
by: Kuai, Chenchen, et al.
Published: (2025)
by: Kuai, Chenchen, et al.
Published: (2025)
Assessing Large Language Models for Medical QA: Zero-Shot and LLM-as-a-Judge Evaluation
by: Adib, Shefayat E Shams, et al.
Published: (2026)
by: Adib, Shefayat E Shams, et al.
Published: (2026)
PclGPT: A Large Language Model for Patronizing and Condescending Language Detection
by: Wang, Hongbo, et al.
Published: (2024)
by: Wang, Hongbo, et al.
Published: (2024)
GPT-Fathom: Benchmarking Large Language Models to Decipher the Evolutionary Path towards GPT-4 and Beyond
by: Zheng, Shen, et al.
Published: (2023)
by: Zheng, Shen, et al.
Published: (2023)
BAMBI: Developing Baby Language Models for Italian
by: Suozzi, Alice, et al.
Published: (2025)
by: Suozzi, Alice, et al.
Published: (2025)
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
by: Lin, Hong Yi, et al.
Published: (2025)
by: Lin, Hong Yi, et al.
Published: (2025)
Self-Prompting Large Language Models for Zero-Shot Open-Domain QA
by: Li, Junlong, et al.
Published: (2022)
by: Li, Junlong, et al.
Published: (2022)
On the Performance of an Explainable Language Model on PubMedQA
by: Srinivasan, Venkat, et al.
Published: (2025)
by: Srinivasan, Venkat, et al.
Published: (2025)
UrbanGPT: Spatio-Temporal Large Language Models
by: Li, Zhonghang, et al.
Published: (2024)
by: Li, Zhonghang, et al.
Published: (2024)
IntentGPT: Few-shot Intent Discovery with Large Language Models
by: Rodriguez, Juan A., et al.
Published: (2024)
by: Rodriguez, Juan A., et al.
Published: (2024)
Can Large Language Models Automatically Jailbreak GPT-4V?
by: Wu, Yuanwei, et al.
Published: (2024)
by: Wu, Yuanwei, et al.
Published: (2024)
HSC-GPT: A Large Language Model for Human Settlements Construction
by: Ran, Chen, et al.
Published: (2023)
by: Ran, Chen, et al.
Published: (2023)
Similar Items
-
Evalita-LLM: Benchmarking Large Language Models on Italian
by: Magnini, Bernardo, et al.
Published: (2025) -
Promoting Heritage Language in Northwest Russia
by: Siragusa, Laura
Published: (2025) -
KG-Rank: Enhancing Large Language Models for Medical QA with Knowledge Graphs and Ranking Techniques
by: Yang, Rui, et al.
Published: (2024) -
KatotohananQA: Evaluating Truthfulness of Large Language Models in Filipino
by: Nery, Lorenzo Alfred, et al.
Published: (2025) -
Large Language Models are Pattern Matchers: Editing Semi-Structured and Structured Documents with ChatGPT
by: Weber, Irene
Published: (2024)