Beyond Data Quantity: Key Factors Driving Performance in Multilingual Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Nezhad, Sina Bagheri, Agrawal, Ameeta, Pokharel, Rhitabrat |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Impact of Model Scaling on Seen and Unseen Language Performance
by: Pokharel, Rhitabrat, et al.
Published: (2025)
by: Pokharel, Rhitabrat, et al.
Published: (2025)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
by: Pokharel, Rhitabrat, et al.
Published: (2025)
by: Pokharel, Rhitabrat, et al.
Published: (2025)
Cross-Lingual Activation Steering for Multilingual Language Models
by: Pokharel, Rhitabrat, et al.
Published: (2026)
by: Pokharel, Rhitabrat, et al.
Published: (2026)
What Drives Performance in Multilingual Language Models?
by: Nezhad, Sina Bagheri, et al.
Published: (2024)
by: Nezhad, Sina Bagheri, et al.
Published: (2024)
CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences
by: Pokharel, Rhitabrat, et al.
Published: (2025)
by: Pokharel, Rhitabrat, et al.
Published: (2025)
Evaluating Multilingual Long-Context Models for Retrieval and Reasoning
by: Agrawal, Ameeta, et al.
Published: (2024)
by: Agrawal, Ameeta, et al.
Published: (2024)
Enhancing Large Language Models with Neurosymbolic Reasoning for Multilingual Tasks
by: Nezhad, Sina Bagheri, et al.
Published: (2025)
by: Nezhad, Sina Bagheri, et al.
Published: (2025)
From Policy to Logic for Efficient and Interpretable Coverage Assessment
by: Pokharel, Rhitabrat, et al.
Published: (2026)
by: Pokharel, Rhitabrat, et al.
Published: (2026)
Fair Summarization: Bridging Quality and Diversity in Extractive Summaries
by: Nezhad, Sina Bagheri, et al.
Published: (2024)
by: Nezhad, Sina Bagheri, et al.
Published: (2024)
Exploring the Maze of Multilingual Modeling
by: Nezhad, Sina Bagheri, et al.
Published: (2023)
by: Nezhad, Sina Bagheri, et al.
Published: (2023)
SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation
by: Nezhad, Sina Bagheri, et al.
Published: (2025)
by: Nezhad, Sina Bagheri, et al.
Published: (2025)
Understanding Position Bias Effects on Fairness in Social Multi-Document Summarization
by: Olabisi, Olubusayo, et al.
Published: (2024)
by: Olabisi, Olubusayo, et al.
Published: (2024)
No-Worse Context-Aware Decoding: Preventing Neutral Regression in Context-Conditioned Generation
by: Tao, Yufei, et al.
Published: (2026)
by: Tao, Yufei, et al.
Published: (2026)
"Lost-in-the-Later": Framework for Quantifying Contextual Grounding in Large Language Models
by: Tao, Yufei, et al.
Published: (2025)
by: Tao, Yufei, et al.
Published: (2025)
Toward Culturally Grounded Natural Language Processing
by: Nezhad, Sina Bagheri
Published: (2026)
by: Nezhad, Sina Bagheri
Published: (2026)
Correct-Detect: Balancing Performance and Ambiguity Through the Lens of Coreference Resolution in LLMs
by: Shore, Amber, et al.
Published: (2025)
by: Shore, Amber, et al.
Published: (2025)
When Context Leads but Parametric Memory Follows in Large Language Models
by: Tao, Yufei, et al.
Published: (2024)
by: Tao, Yufei, et al.
Published: (2024)
Reliable Classroom AI via Neuro-Symbolic Multimodal Reasoning
by: Nezhad, Sina Bagheri
Published: (2026)
by: Nezhad, Sina Bagheri
Published: (2026)
Mitigation of Gender and Ethnicity Bias in AI-Generated Stories through Model Explanations
by: Dimgba, Martha O., et al.
Published: (2025)
by: Dimgba, Martha O., et al.
Published: (2025)
Explain-then-Process: Using Grammar Prompting to Enhance Grammatical Acceptability Judgments
by: Scheinberg, Russell, et al.
Published: (2025)
by: Scheinberg, Russell, et al.
Published: (2025)
Is Training Data Quality or Quantity More Impactful to Small Language Model Performance?
by: Sajith, Aryan, et al.
Published: (2024)
by: Sajith, Aryan, et al.
Published: (2024)
Breaking Language Barriers: Equitable Performance in Multilingual Language Models
by: Nagar, Tanay, et al.
Published: (2025)
by: Nagar, Tanay, et al.
Published: (2025)
Multilingual Performance Biases of Large Language Models in Education
by: Gupta, Vansh, et al.
Published: (2025)
by: Gupta, Vansh, et al.
Published: (2025)
Beyond English-Centric LLMs: What Language Do Multilingual Language Models Think in?
by: Zhong, Chengzhi, et al.
Published: (2024)
by: Zhong, Chengzhi, et al.
Published: (2024)
Exploring Cultural Variations in Moral Judgments with Large Language Models
by: Mohammadi, Hadi, et al.
Published: (2025)
by: Mohammadi, Hadi, et al.
Published: (2025)
Is It Good Data for Multilingual Instruction Tuning or Just Bad Multilingual Evaluation for Large Language Models?
by: Chen, Pinzhen, et al.
Published: (2024)
by: Chen, Pinzhen, et al.
Published: (2024)
Multilingual Relative Clause Attachment Ambiguity Resolution in Large Language Models
by: Lee, So Young, et al.
Published: (2025)
by: Lee, So Young, et al.
Published: (2025)
Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM
by: Chimoto, Everlyn Asiko, et al.
Published: (2026)
by: Chimoto, Everlyn Asiko, et al.
Published: (2026)
Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models
by: Nguyen, Thao, et al.
Published: (2025)
by: Nguyen, Thao, et al.
Published: (2025)
Reinforcement Learning Problem Solving with Large Language Models
by: Gholamian, Sina, et al.
Published: (2024)
by: Gholamian, Sina, et al.
Published: (2024)
What Drives Cross-lingual Ranking? Retrieval Approaches with Multilingual Language Models
by: Goworek, Roksana, et al.
Published: (2025)
by: Goworek, Roksana, et al.
Published: (2025)
Large Language Models as Mirrors of Societal Moral Standards
by: Papadopoulou, Evi, et al.
Published: (2024)
by: Papadopoulou, Evi, et al.
Published: (2024)
Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining
by: Guo, Ping, et al.
Published: (2025)
by: Guo, Ping, et al.
Published: (2025)
Rethinking Cross-lingual Alignment: Balancing Transfer and Cultural Erasure in Multilingual LLMs
by: Han, HyoJung, et al.
Published: (2025)
by: Han, HyoJung, et al.
Published: (2025)
Multilingual Pretraining for Pixel Language Models
by: Kesen, Ilker, et al.
Published: (2025)
by: Kesen, Ilker, et al.
Published: (2025)
Beyond Translation: LLM-Based Data Generation for Multilingual Fact-Checking
by: Chung, Yi-Ling, et al.
Published: (2025)
by: Chung, Yi-Ling, et al.
Published: (2025)
The Price of Thought: A Multilingual Analysis of Reasoning, Performance, and Cost of Negotiation in Large Language Models
by: Hakimov, Sherzod, et al.
Published: (2025)
by: Hakimov, Sherzod, et al.
Published: (2025)
Accelerating Multilingual Language Model for Excessively Tokenized Languages
by: Hong, Jimin, et al.
Published: (2024)
by: Hong, Jimin, et al.
Published: (2024)
Revisiting Multilingual Data Mixtures in Language Model Pretraining
by: Foroutan, Negar, et al.
Published: (2025)
by: Foroutan, Negar, et al.
Published: (2025)
EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
by: Mohammadi, Hadi, et al.
Published: (2025)
by: Mohammadi, Hadi, et al.
Published: (2025)
Similar Items
-
The Impact of Model Scaling on Seen and Unseen Language Performance
by: Pokharel, Rhitabrat, et al.
Published: (2025) -
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
by: Pokharel, Rhitabrat, et al.
Published: (2025) -
Cross-Lingual Activation Steering for Multilingual Language Models
by: Pokharel, Rhitabrat, et al.
Published: (2026) -
What Drives Performance in Multilingual Language Models?
by: Nezhad, Sina Bagheri, et al.
Published: (2024) -
CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences
by: Pokharel, Rhitabrat, et al.
Published: (2025)