UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages
Fuente:
arXiv
Salvato in:
| Autori principali: | Chitale, Pranjal A., Gumma, Varun, Ahuja, Sanchit, Kodali, Prashant, Uppadhyay, Manan, Sudharsan, Deepthi, Sitaram, Sunayana |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DEPART: DEcomposing PARiTy across Multilingual LLMs
di: Uppadhyay, Manan, et al.
Pubblicazione: (2026)
di: Uppadhyay, Manan, et al.
Pubblicazione: (2026)
Contamination Report for Multilingual Benchmarks
di: Ahuja, Sanchit, et al.
Pubblicazione: (2024)
di: Ahuja, Sanchit, et al.
Pubblicazione: (2024)
Towards Inducing Long-Context Abilities in Multilingual Neural Machine Translation Models
di: Gumma, Varun, et al.
Pubblicazione: (2024)
di: Gumma, Varun, et al.
Pubblicazione: (2024)
MAFIA: Multi-Adapter Fused Inclusive LanguAge Models
di: Jain, Prachi, et al.
Pubblicazione: (2024)
di: Jain, Prachi, et al.
Pubblicazione: (2024)
HEALTH-PARIKSHA: Assessing RAG Models for Health Chatbots in Real-World Multilingual Settings
di: Gumma, Varun, et al.
Pubblicazione: (2024)
di: Gumma, Varun, et al.
Pubblicazione: (2024)
DOSA: A Dataset of Social Artifacts from Different Indian Geographical Subcultures
di: Seth, Agrima, et al.
Pubblicazione: (2024)
di: Seth, Agrima, et al.
Pubblicazione: (2024)
METAL: Towards Multilingual Meta-Evaluation
di: Hada, Rishav, et al.
Pubblicazione: (2024)
di: Hada, Rishav, et al.
Pubblicazione: (2024)
MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks
di: Ahuja, Sanchit, et al.
Pubblicazione: (2023)
di: Ahuja, Sanchit, et al.
Pubblicazione: (2023)
PARIKSHA: A Large-Scale Investigation of Human-LLM Evaluator Agreement on Multilingual and Multi-Cultural Data
di: Watts, Ishaan, et al.
Pubblicazione: (2024)
di: Watts, Ishaan, et al.
Pubblicazione: (2024)
Are Large Language Model-based Evaluators the Solution to Scaling Up Multilingual Evaluation?
di: Hada, Rishav, et al.
Pubblicazione: (2023)
di: Hada, Rishav, et al.
Pubblicazione: (2023)
M5 -- A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasks
di: Schneider, Florian, et al.
Pubblicazione: (2024)
di: Schneider, Florian, et al.
Pubblicazione: (2024)
Beyond Metrics: Evaluating LLMs' Effectiveness in Culturally Nuanced, Low-Resource Real-World Scenarios
di: Ochieng, Millicent, et al.
Pubblicazione: (2024)
di: Ochieng, Millicent, et al.
Pubblicazione: (2024)
sPhinX: Sample Efficient Multilingual Instruction Fine-Tuning Through N-shot Guided Prompting
di: Ahuja, Sanchit, et al.
Pubblicazione: (2024)
di: Ahuja, Sanchit, et al.
Pubblicazione: (2024)
Exploring Continual Fine-Tuning for Enhancing Language Ability in Large Language Model
di: Aggarwal, Divyanshu, et al.
Pubblicazione: (2024)
di: Aggarwal, Divyanshu, et al.
Pubblicazione: (2024)
Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR
di: Mazumder, Debajyoti, et al.
Pubblicazione: (2026)
di: Mazumder, Debajyoti, et al.
Pubblicazione: (2026)
Exploring Pretraining via Active Forgetting for Improving Cross Lingual Transfer for Decoder Language Models
di: Aggarwal, Divyanshu, et al.
Pubblicazione: (2024)
di: Aggarwal, Divyanshu, et al.
Pubblicazione: (2024)
Parameter Alignment Mitigates Catastrophic Forgetting in Multilingual Expert Language Models
di: Ahuja, Sanchit, et al.
Pubblicazione: (2026)
di: Ahuja, Sanchit, et al.
Pubblicazione: (2026)
ELR-1000: A Community-Generated Dataset for Endangered Indic Indigenous Languages
di: Joshi, Neha, et al.
Pubblicazione: (2025)
di: Joshi, Neha, et al.
Pubblicazione: (2025)
Speech Representation Learning Revisited: The Necessity of Separate Learnable Parameters and Robust Data Augmentation
di: Yadav, Hemant, et al.
Pubblicazione: (2024)
di: Yadav, Hemant, et al.
Pubblicazione: (2024)
MS-HuBERT: Mitigating Pre-training and Inference Mismatch in Masked Language Modelling methods for learning Speech Representations
di: Yadav, Hemant, et al.
Pubblicazione: (2024)
di: Yadav, Hemant, et al.
Pubblicazione: (2024)
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models
di: Sathe, Ashutosh, et al.
Pubblicazione: (2024)
di: Sathe, Ashutosh, et al.
Pubblicazione: (2024)
An Empirical Study of In-context Learning in LLMs for Machine Translation
di: Chitale, Pranjal A., et al.
Pubblicazione: (2024)
di: Chitale, Pranjal A., et al.
Pubblicazione: (2024)
MAPLE: Multilingual Evaluation of Parameter Efficient Finetuning of Large Language Models
di: Aggarwal, Divyanshu, et al.
Pubblicazione: (2024)
di: Aggarwal, Divyanshu, et al.
Pubblicazione: (2024)
Evaluating the Effectiveness and Scalability of LLM-Based Data Augmentation for Retrieval
di: Chitale, Pranjal A., et al.
Pubblicazione: (2025)
di: Chitale, Pranjal A., et al.
Pubblicazione: (2025)
Improving Self Consistency in LLMs through Probabilistic Tokenization
di: Sathe, Ashutosh, et al.
Pubblicazione: (2024)
di: Sathe, Ashutosh, et al.
Pubblicazione: (2024)
JOOCI: a Framework for Learning Comprehensive Speech Representations
di: Yadav, Hemant, et al.
Pubblicazione: (2024)
di: Yadav, Hemant, et al.
Pubblicazione: (2024)
MASCA: LLM based-Multi Agents System for Credit Assessment
di: Jajoo, Gautam, et al.
Pubblicazione: (2025)
di: Jajoo, Gautam, et al.
Pubblicazione: (2025)
Bridging the Language Gap: Dynamic Learning Strategies for Improving Multilingual Performance in LLMs
di: Kumar, Somnath, et al.
Pubblicazione: (2023)
di: Kumar, Somnath, et al.
Pubblicazione: (2023)
Minimal-Edit Instruction Tuning for Low-Resource Indic GEC
di: P, Akhil Rajeev
Pubblicazione: (2025)
di: P, Akhil Rajeev
Pubblicazione: (2025)
IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages
di: Jayakumar, Thanmay, et al.
Pubblicazione: (2026)
di: Jayakumar, Thanmay, et al.
Pubblicazione: (2026)
CultureLLM: Incorporating Cultural Differences into Large Language Models
di: Li, Cheng, et al.
Pubblicazione: (2024)
di: Li, Cheng, et al.
Pubblicazione: (2024)
EfficientXLang: Towards Improving Token Efficiency Through Cross-Lingual Reasoning
di: Ahuja, Sanchit, et al.
Pubblicazione: (2025)
di: Ahuja, Sanchit, et al.
Pubblicazione: (2025)
IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian Languages
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2024)
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2024)
Fluent but Foreign: Even Regional LLMs Lack Cultural Alignment
di: Agarwal, Dhruv, et al.
Pubblicazione: (2025)
di: Agarwal, Dhruv, et al.
Pubblicazione: (2025)
Building Benchmarks from the Ground Up: Community-Centered Evaluation of LLMs in Healthcare Chatbot Settings
di: Hamna, Hamna, et al.
Pubblicazione: (2025)
di: Hamna, Hamna, et al.
Pubblicazione: (2025)
Bridging the Gap: Dynamic Learning Strategies for Improving Multilingual Performance in LLMs
di: Kumar, Somnath, et al.
Pubblicazione: (2024)
di: Kumar, Somnath, et al.
Pubblicazione: (2024)
Indic-TunedLens: Interpreting Multilingual Models in Indian Languages
di: Panchal, Mihir, et al.
Pubblicazione: (2026)
di: Panchal, Mihir, et al.
Pubblicazione: (2026)
Synthesizing Instruction-Tuning Datasets with Contrastive Decoding
di: Ichinose, Tatsuya, et al.
Pubblicazione: (2026)
di: Ichinose, Tatsuya, et al.
Pubblicazione: (2026)
Balancing Continuous Pre-Training and Instruction Fine-Tuning: Optimizing Instruction-Following in LLMs
di: Jindal, Ishan, et al.
Pubblicazione: (2024)
di: Jindal, Ishan, et al.
Pubblicazione: (2024)
Are Language Models Agnostic to Linguistically Grounded Perturbations? A Case Study of Indic Languages
di: Ghosh, Poulami, et al.
Pubblicazione: (2024)
di: Ghosh, Poulami, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DEPART: DEcomposing PARiTy across Multilingual LLMs
di: Uppadhyay, Manan, et al.
Pubblicazione: (2026) -
Contamination Report for Multilingual Benchmarks
di: Ahuja, Sanchit, et al.
Pubblicazione: (2024) -
Towards Inducing Long-Context Abilities in Multilingual Neural Machine Translation Models
di: Gumma, Varun, et al.
Pubblicazione: (2024) -
MAFIA: Multi-Adapter Fused Inclusive LanguAge Models
di: Jain, Prachi, et al.
Pubblicazione: (2024) -
HEALTH-PARIKSHA: Assessing RAG Models for Health Chatbots in Real-World Multilingual Settings
di: Gumma, Varun, et al.
Pubblicazione: (2024)