On the Calibration of Multilingual Question Answering LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Yahan, Dan, Soham, Roth, Dan, Lee, Insup |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking LLM Guardrails in Handling Multilingual Toxicity
di: Yang, Yahan, et al.
Pubblicazione: (2024)
di: Yang, Yahan, et al.
Pubblicazione: (2024)
MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety
di: Yang, Yahan, et al.
Pubblicazione: (2025)
di: Yang, Yahan, et al.
Pubblicazione: (2025)
Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models
di: Hengle, Amey, et al.
Pubblicazione: (2024)
di: Hengle, Amey, et al.
Pubblicazione: (2024)
FoQA: A Faroese Question-Answering Dataset
di: Simonsen, Annika, et al.
Pubblicazione: (2025)
di: Simonsen, Annika, et al.
Pubblicazione: (2025)
Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models
di: Park, Jean, et al.
Pubblicazione: (2024)
di: Park, Jean, et al.
Pubblicazione: (2024)
Calibrated Large Language Models for Binary Question Answering
di: Giovannotti, Patrizio, et al.
Pubblicazione: (2024)
di: Giovannotti, Patrizio, et al.
Pubblicazione: (2024)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering
di: Müller, Philip, et al.
Pubblicazione: (2026)
di: Müller, Philip, et al.
Pubblicazione: (2026)
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
di: Endait, Sharvi, et al.
Pubblicazione: (2025)
di: Endait, Sharvi, et al.
Pubblicazione: (2025)
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
di: Wang, Zhanliang, et al.
Pubblicazione: (2026)
di: Wang, Zhanliang, et al.
Pubblicazione: (2026)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
di: Romero, David, et al.
Pubblicazione: (2024)
di: Romero, David, et al.
Pubblicazione: (2024)
Uncertainty as Feature Gaps: Epistemic Uncertainty Quantification of LLMs in Contextual Question-Answering
di: Bakman, Yavuz, et al.
Pubblicazione: (2025)
di: Bakman, Yavuz, et al.
Pubblicazione: (2025)
Evaluating LLMs' Mathematical Reasoning in Financial Document Question Answering
di: Srivastava, Pragya, et al.
Pubblicazione: (2024)
di: Srivastava, Pragya, et al.
Pubblicazione: (2024)
CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question Answering
di: Liu, Yu, et al.
Pubblicazione: (2026)
di: Liu, Yu, et al.
Pubblicazione: (2026)
Enhancing Temporal Understanding in LLMs for Semi-structured Tables
di: Deng, Irwin, et al.
Pubblicazione: (2024)
di: Deng, Irwin, et al.
Pubblicazione: (2024)
Multilingual Non-Factoid Question Answering with Answer Paragraph Selection
di: Mishra, Ritwik, et al.
Pubblicazione: (2024)
di: Mishra, Ritwik, et al.
Pubblicazione: (2024)
Explainable Fact-checking through Question Answering
di: Yang, Jing, et al.
Pubblicazione: (2021)
di: Yang, Jing, et al.
Pubblicazione: (2021)
Do LLMs Understand Your Translations? Evaluating Paragraph-level MT with Question Answering
di: Fernandes, Patrick, et al.
Pubblicazione: (2025)
di: Fernandes, Patrick, et al.
Pubblicazione: (2025)
Uncertainty in Language Models: Assessment through Rank-Calibration
di: Huang, Xinmeng, et al.
Pubblicazione: (2024)
di: Huang, Xinmeng, et al.
Pubblicazione: (2024)
Structured RAG for Answering Aggregative Questions
di: Koshorek, Omri, et al.
Pubblicazione: (2025)
di: Koshorek, Omri, et al.
Pubblicazione: (2025)
On Mechanistic Circuits for Extractive Question-Answering
di: Basu, Samyadeep, et al.
Pubblicazione: (2025)
di: Basu, Samyadeep, et al.
Pubblicazione: (2025)
ESQA: Event Sequences Question Answering
di: Abdullaeva, Irina, et al.
Pubblicazione: (2024)
di: Abdullaeva, Irina, et al.
Pubblicazione: (2024)
Retrieval Augmented Question Answering: When Should LLMs Admit Ignorance?
di: Wang, Dingmin, et al.
Pubblicazione: (2025)
di: Wang, Dingmin, et al.
Pubblicazione: (2025)
Do LLMs Understand Romanian Driving Laws? A Study on Multimodal and Fine-Tuned Question Answering
di: Barbu, Eduard, et al.
Pubblicazione: (2025)
di: Barbu, Eduard, et al.
Pubblicazione: (2025)
Multilingual Amnesia: On the Transferability of Unlearning in Multilingual LLMs
di: Farashah, Alireza Dehghanpour, et al.
Pubblicazione: (2026)
di: Farashah, Alireza Dehghanpour, et al.
Pubblicazione: (2026)
Who's Asking? Evaluating LLM Robustness to Inquiry Personas in Factual Question Answering
di: Akpinar, Nil-Jana, et al.
Pubblicazione: (2025)
di: Akpinar, Nil-Jana, et al.
Pubblicazione: (2025)
Interpretable LLM-based Table Question Answering
di: Nguyen, Giang, et al.
Pubblicazione: (2024)
di: Nguyen, Giang, et al.
Pubblicazione: (2024)
Comprehensive Modeling and Question Answering of Cancer Clinical Practice Guidelines using LLMs
di: Gupta, Bhumika, et al.
Pubblicazione: (2025)
di: Gupta, Bhumika, et al.
Pubblicazione: (2025)
Fine-Tuning vs. RAG for Multi-Hop Question Answering with Novel Knowledge
di: Yang, Zhuoyi, et al.
Pubblicazione: (2026)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2026)
L3Cube-IndicQuest: A Benchmark Question Answering Dataset for Evaluating Knowledge of LLMs in Indic Context
di: Rohera, Pritika, et al.
Pubblicazione: (2024)
di: Rohera, Pritika, et al.
Pubblicazione: (2024)
OWLViz: An Open-World Benchmark for Visual Question Answering
di: Nguyen, Thuy, et al.
Pubblicazione: (2025)
di: Nguyen, Thuy, et al.
Pubblicazione: (2025)
PocketLLM: Enabling On-Device Fine-Tuning for Personalized LLMs
di: Peng, Dan, et al.
Pubblicazione: (2024)
di: Peng, Dan, et al.
Pubblicazione: (2024)
Are Smaller Open-Weight LLMs Closing the Gap to Proprietary Models for Biomedical Question Answering?
di: Stachura, Damian, et al.
Pubblicazione: (2025)
di: Stachura, Damian, et al.
Pubblicazione: (2025)
On the Utility of Domain-Adjacent Fine-Tuned Model Ensembles for Few-shot Problems
di: Alam, Md Ibrahim Ibne, et al.
Pubblicazione: (2024)
di: Alam, Md Ibrahim Ibne, et al.
Pubblicazione: (2024)
Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering
di: Shi, Yuling, et al.
Pubblicazione: (2026)
di: Shi, Yuling, et al.
Pubblicazione: (2026)
Investigating the Multilingual Calibration Effects of Language Model Instruction-Tuning
di: Huang, Jerry, et al.
Pubblicazione: (2026)
di: Huang, Jerry, et al.
Pubblicazione: (2026)
Language Model Knowledge Distillation for Efficient Question Answering in Spanish
di: Bazaga, Adrián, et al.
Pubblicazione: (2023)
di: Bazaga, Adrián, et al.
Pubblicazione: (2023)
Evaluating NL2SQL via SQL2NL
di: Safarzadeh, Mohammadtaher, et al.
Pubblicazione: (2025)
di: Safarzadeh, Mohammadtaher, et al.
Pubblicazione: (2025)
Enhancing Question Answering Precision with Optimized Vector Retrieval and Instructions
di: Yang, Lixiao, et al.
Pubblicazione: (2024)
di: Yang, Lixiao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Benchmarking LLM Guardrails in Handling Multilingual Toxicity
di: Yang, Yahan, et al.
Pubblicazione: (2024) -
MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety
di: Yang, Yahan, et al.
Pubblicazione: (2025) -
Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models
di: Hengle, Amey, et al.
Pubblicazione: (2024) -
FoQA: A Faroese Question-Answering Dataset
di: Simonsen, Annika, et al.
Pubblicazione: (2025) -
Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models
di: Park, Jean, et al.
Pubblicazione: (2024)