Could We Have Had Better Multilingual LLMs If English Was Not the Central Language?
Fuente:
arXiv
Saved in:
| Main Authors: | Diandaru, Ryandito, Susanto, Lucky, Tang, Zilu, Purwarianti, Ayu, Wijaya, Derry |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Transfer Accuracy: Faithful Circuits for Controlled Low-Resource Adaptation
by: Nur'aini, Khumaisa, et al.
Published: (2026)
by: Nur'aini, Khumaisa, et al.
Published: (2026)
NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts
by: Adilazuarda, Muhammad Farid, et al.
Published: (2025)
by: Adilazuarda, Muhammad Farid, et al.
Published: (2025)
MetaMetrics-MT: Tuning Meta-Metrics for Machine Translation via Human Preference Calibration
by: Anugraha, David, et al.
Published: (2024)
by: Anugraha, David, et al.
Published: (2024)
Enhancing Natural Language Inference Performance with Knowledge Graph for COVID-19 Automated Fact-Checking in Indonesian Language
by: Muharram, Arief Purnama, et al.
Published: (2024)
by: Muharram, Arief Purnama, et al.
Published: (2024)
Is Active Persona Inference Necessary for Aligning Small Models to Personal Preferences?
by: Tang, Zilu, et al.
Published: (2025)
by: Tang, Zilu, et al.
Published: (2025)
IndoToxic2024: A Demographically-Enriched Dataset of Hate Speech and Toxicity Types for Indonesian Language
by: Susanto, Lucky, et al.
Published: (2024)
by: Susanto, Lucky, et al.
Published: (2024)
MetaMetrics: Calibrating Metrics For Generation Tasks Using Human Preferences
by: Winata, Genta Indra, et al.
Published: (2024)
by: Winata, Genta Indra, et al.
Published: (2024)
Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models
by: Susanto, Lucky, et al.
Published: (2026)
by: Susanto, Lucky, et al.
Published: (2026)
Do Language Models Track Entities Across State Changes?
by: Tang, Zilu, et al.
Published: (2026)
by: Tang, Zilu, et al.
Published: (2026)
mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
by: Anugraha, David, et al.
Published: (2025)
by: Anugraha, David, et al.
Published: (2025)
What Do Indonesians Really Need from Language Technology? A Nationwide Survey
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
Do Large Language Models Have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMs
by: Guo, Yanzhu, et al.
Published: (2024)
by: Guo, Yanzhu, et al.
Published: (2024)
Predicting LLM Correctness in Prosthodontics Using Metadata and Hallucination Signals
by: Susanto, Lucky, et al.
Published: (2025)
by: Susanto, Lucky, et al.
Published: (2025)
IndoPref: A Multi-Domain Pairwise Preference Dataset for Indonesian
by: Wiyono, Vanessa Rebecca, et al.
Published: (2025)
by: Wiyono, Vanessa Rebecca, et al.
Published: (2025)
Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM
by: Chimoto, Everlyn Asiko, et al.
Published: (2026)
by: Chimoto, Everlyn Asiko, et al.
Published: (2026)
A Multi-Labeled Dataset for Indonesian Discourse: Examining Toxicity, Polarization, and Demographics Information
by: Susanto, Lucky, et al.
Published: (2025)
by: Susanto, Lucky, et al.
Published: (2025)
R3: Robust Rubric-Agnostic Reward Models
by: Anugraha, David, et al.
Published: (2025)
by: Anugraha, David, et al.
Published: (2025)
QLESS: A Quantized Approach for Data Valuation and Selection in Large Language Model Fine-Tuning
by: Ananta, Moses, et al.
Published: (2025)
by: Ananta, Moses, et al.
Published: (2025)
Beyond English-Centric LLMs: What Language Do Multilingual Language Models Think in?
by: Zhong, Chengzhi, et al.
Published: (2024)
by: Zhong, Chengzhi, et al.
Published: (2024)
DriveThru: a Document Extraction Platform and Benchmark Datasets for Indonesian Local Language Archives
by: Farhansyah, Mohammad Rifqi, et al.
Published: (2024)
by: Farhansyah, Mohammad Rifqi, et al.
Published: (2024)
What Causes Knowledge Loss in Multilingual Language Models?
by: Khelli, Maria, et al.
Published: (2025)
by: Khelli, Maria, et al.
Published: (2025)
Generating Faithful Text From a Knowledge Graph with Noisy Reference Text
by: Hashem, Tahsina, et al.
Published: (2023)
by: Hashem, Tahsina, et al.
Published: (2023)
Eliciting Better Multilingual Structured Reasoning from LLMs through Code
by: Li, Bryan, et al.
Published: (2024)
by: Li, Bryan, et al.
Published: (2024)
Do Multilingual LLMs Think In English?
by: Schut, Lisa, et al.
Published: (2025)
by: Schut, Lisa, et al.
Published: (2025)
The Roles of English in Evaluating Multilingual Language Models
by: Poelman, Wessel, et al.
Published: (2024)
by: Poelman, Wessel, et al.
Published: (2024)
Multilingual Mathematical Reasoning: Advancing Open-Source LLMs in Hindi and English
by: Anand, Avinash, et al.
Published: (2024)
by: Anand, Avinash, et al.
Published: (2024)
English K_Quantization of LLMs Does Not Disproportionately Diminish Multilingual Performance
by: Borgersen, Karl Audun, et al.
Published: (2025)
by: Borgersen, Karl Audun, et al.
Published: (2025)
Continual Learning in Machine Speech Chain Using Gradient Episodic Memory
by: Tyndall, Geoffrey, et al.
Published: (2024)
by: Tyndall, Geoffrey, et al.
Published: (2024)
MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignment
by: Kargaran, Amir Hossein, et al.
Published: (2024)
by: Kargaran, Amir Hossein, et al.
Published: (2024)
Uncovering the Potential Risks in Unlearning: Danger of English-only Unlearning in Multilingual LLMs
by: Hwang, Kyomin, et al.
Published: (2025)
by: Hwang, Kyomin, et al.
Published: (2025)
Mitigating Hallucinated Translations in Large Language Models with Hallucination-focused Preference Optimization
by: Tang, Zilu, et al.
Published: (2025)
by: Tang, Zilu, et al.
Published: (2025)
Languages Still Left Behind: Toward a Better Multilingual Machine Translation Benchmark
by: Taguchi, Chihiro, et al.
Published: (2025)
by: Taguchi, Chihiro, et al.
Published: (2025)
A Framework to Assess Multilingual Vulnerabilities of LLMs
by: Tang, Likai, et al.
Published: (2025)
by: Tang, Likai, et al.
Published: (2025)
Large Language Models Could Be Rote Learners
by: Xu, Yuyang, et al.
Published: (2025)
by: Xu, Yuyang, et al.
Published: (2025)
The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual Contexts
by: Shen, Lingfeng, et al.
Published: (2024)
by: Shen, Lingfeng, et al.
Published: (2024)
Framing Political Bias in Multilingual LLMs Across Pakistani Languages
by: Nadeem, Afrozah, et al.
Published: (2025)
by: Nadeem, Afrozah, et al.
Published: (2025)
Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages
by: Li, Haolin, et al.
Published: (2025)
by: Li, Haolin, et al.
Published: (2025)
We Need to Measure Data Diversity in NLP -- Better and Broader
by: Nguyen, Dong, et al.
Published: (2025)
by: Nguyen, Dong, et al.
Published: (2025)
Shared Path: Unraveling Memorization in Multilingual LLMs through Language Similarities
by: Luo, Xiaoyu, et al.
Published: (2025)
by: Luo, Xiaoyu, et al.
Published: (2025)
Better as Generators Than Classifiers: Leveraging LLMs and Synthetic Data for Low-Resource Multilingual Classification
by: Pecher, Branislav, et al.
Published: (2026)
by: Pecher, Branislav, et al.
Published: (2026)
Similar Items
-
Beyond Transfer Accuracy: Faithful Circuits for Controlled Low-Resource Adaptation
by: Nur'aini, Khumaisa, et al.
Published: (2026) -
NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts
by: Adilazuarda, Muhammad Farid, et al.
Published: (2025) -
MetaMetrics-MT: Tuning Meta-Metrics for Machine Translation via Human Preference Calibration
by: Anugraha, David, et al.
Published: (2024) -
Enhancing Natural Language Inference Performance with Knowledge Graph for COVID-19 Automated Fact-Checking in Indonesian Language
by: Muharram, Arief Purnama, et al.
Published: (2024) -
Is Active Persona Inference Necessary for Aligning Small Models to Personal Preferences?
by: Tang, Zilu, et al.
Published: (2025)