IndicRAGSuite: Large-Scale Datasets and a Benchmark for Indian Language RAG Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Prasanjith, Pasunuti, More, Prathmesh B, Kunchukuttan, Anoop, Dabre, Raj |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages
par: Jayakumar, Thanmay, et autres
Publié: (2026)
par: Jayakumar, Thanmay, et autres
Publié: (2026)
Pralekha: Cross-Lingual Document Alignment for Indic Languages
par: Suryanarayanan, Sanjay, et autres
Publié: (2024)
par: Suryanarayanan, Sanjay, et autres
Publié: (2024)
IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian Languages
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2024)
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2024)
Towards Building Large Scale Datasets and State-of-the-Art Automatic Speech Translation Systems for 14 Indian Languages
par: Sankar, Ashwin, et autres
Publié: (2024)
par: Sankar, Ashwin, et autres
Publié: (2024)
How Good is Zero-Shot MT Evaluation for Low Resource Indian Languages?
par: Singh, Anushka, et autres
Publié: (2024)
par: Singh, Anushka, et autres
Publié: (2024)
The Reasoning Lingua Franca: A Double-Edged Sword for Multilingual AI
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
RiddleBench: A New Generative Reasoning Benchmark for LLMs
par: Halder, Deepon, et autres
Publié: (2025)
par: Halder, Deepon, et autres
Publié: (2025)
Are Language Models Agnostic to Linguistically Grounded Perturbations? A Case Study of Indic Languages
par: Ghosh, Poulami, et autres
Publié: (2024)
par: Ghosh, Poulami, et autres
Publié: (2024)
RomanSetu: Efficiently unlocking multilingual capabilities of Large Language Models via Romanization
par: Husain, Jaavid Aktar, et autres
Publié: (2024)
par: Husain, Jaavid Aktar, et autres
Publié: (2024)
An Empirical Comparison of Vocabulary Expansion and Initialization Approaches for Language Models
par: Mundra, Nandini, et autres
Publié: (2024)
par: Mundra, Nandini, et autres
Publié: (2024)
Cross-Lingual Auto Evaluation for Assessing Multilingual LLMs
par: Doddapaneni, Sumanth, et autres
Publié: (2024)
par: Doddapaneni, Sumanth, et autres
Publié: (2024)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
How effective is Multi-source pivoting for Translation of Low Resource Indian Languages?
par: Gaikwad, Pranav, et autres
Publié: (2024)
par: Gaikwad, Pranav, et autres
Publié: (2024)
Top-b: Entropic Regulation of Relative Probability Bands in Autoregressive Language Processes
par: Halder, Deepon, et autres
Publié: (2026)
par: Halder, Deepon, et autres
Publié: (2026)
IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages
par: Javed, Tahir, et autres
Publié: (2024)
par: Javed, Tahir, et autres
Publié: (2024)
IndicMMLU-Pro: Benchmarking Indic Large Language Models on Multi-Task Language Understanding
par: KJ, Sankalp, et autres
Publié: (2025)
par: KJ, Sankalp, et autres
Publié: (2025)
Pretraining Language Models Using Translationese
par: Doshi, Meet, et autres
Publié: (2024)
par: Doshi, Meet, et autres
Publié: (2024)
IndicParam: Benchmark to evaluate LLMs on low-resource Indic Languages
par: Maheshwari, Ayush, et autres
Publié: (2025)
par: Maheshwari, Ayush, et autres
Publié: (2025)
CharSpan: Utilizing Lexical Similarity to Enable Zero-Shot Machine Translation for Extremely Low-resource Languages
par: Maurya, Kaushal Kumar, et autres
Publié: (2023)
par: Maurya, Kaushal Kumar, et autres
Publié: (2023)
IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages
par: Dawar, Aviral, et autres
Publié: (2026)
par: Dawar, Aviral, et autres
Publié: (2026)
IndianBailJudgments-1200: A Multi-Attribute Dataset for Legal NLP on Indian Bail Orders
par: Deshmukh, Sneha, et autres
Publié: (2025)
par: Deshmukh, Sneha, et autres
Publié: (2025)
IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages
par: Singh, Harman, et autres
Publié: (2024)
par: Singh, Harman, et autres
Publié: (2024)
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
par: Endait, Sharvi, et autres
Publié: (2025)
par: Endait, Sharvi, et autres
Publié: (2025)
IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models
par: Bharti, Saurabh, et autres
Publié: (2026)
par: Bharti, Saurabh, et autres
Publié: (2026)
Scripts Through Time: A Survey of the Evolving Role of Transliteration in NLP
par: Jayakumar, Thanmay, et autres
Publié: (2026)
par: Jayakumar, Thanmay, et autres
Publié: (2026)
Indic-TunedLens: Interpreting Multilingual Models in Indian Languages
par: Panchal, Mihir, et autres
Publié: (2026)
par: Panchal, Mihir, et autres
Publié: (2026)
L3Cube-IndicQuest: A Benchmark Question Answering Dataset for Evaluating Knowledge of LLMs in Indic Context
par: Rohera, Pritika, et autres
Publié: (2024)
par: Rohera, Pritika, et autres
Publié: (2024)
MILU: A Multi-task Indic Language Understanding Benchmark
par: Verma, Sshubam, et autres
Publié: (2024)
par: Verma, Sshubam, et autres
Publié: (2024)
An Empirical Study of In-context Learning in LLMs for Machine Translation
par: Chitale, Pranjal A., et autres
Publié: (2024)
par: Chitale, Pranjal A., et autres
Publié: (2024)
CycleDistill: Bootstrapping Machine Translation using LLMs with Cyclical Distillation
par: Halder, Deepon, et autres
Publié: (2025)
par: Halder, Deepon, et autres
Publié: (2025)
L3Cube-IndicNews: News-based Short Text and Long Document Classification Datasets in Indic Languages
par: Mirashi, Aishwarya, et autres
Publié: (2024)
par: Mirashi, Aishwarya, et autres
Publié: (2024)
Airavata: Introducing Hindi Instruction-tuned LLM
par: Gala, Jay, et autres
Publié: (2024)
par: Gala, Jay, et autres
Publié: (2024)
Synthetic Data Generation and Joint Learning for Robust Code-Mixed Translation
par: Kartik, Kartik, et autres
Publié: (2024)
par: Kartik, Kartik, et autres
Publié: (2024)
L3Cube-IndicHeadline-ID: A Dataset for Headline Identification and Semantic Evaluation in Low-Resource Indian Languages
par: Tanksale, Nishant, et autres
Publié: (2025)
par: Tanksale, Nishant, et autres
Publié: (2025)
Improving Multilingual Neural Machine Translation System for Indic Languages
par: Das, Sudhansu Bala, et autres
Publié: (2022)
par: Das, Sudhansu Bala, et autres
Publié: (2022)
Mark My Words: A Robust Multilingual Model for Punctuation in Text and Speech Transcripts
par: Pulipaka, Sidharth, et autres
Publié: (2025)
par: Pulipaka, Sidharth, et autres
Publié: (2025)
A Morphology-Based Investigation of Positional Encodings
par: Ghosh, Poulami, et autres
Publié: (2024)
par: Ghosh, Poulami, et autres
Publié: (2024)
Natural Language Processing for Dialects of a Language: A Survey
par: Joshi, Aditya, et autres
Publié: (2024)
par: Joshi, Aditya, et autres
Publié: (2024)
HITSZ's End-To-End Speech Translation Systems Combining Sequence-to-Sequence Auto Speech Recognition Model and Indic Large Language Model for IWSLT 2025 in Indic Track
par: Wei, Xuchen, et autres
Publié: (2025)
par: Wei, Xuchen, et autres
Publié: (2025)
ELR-1000: A Community-Generated Dataset for Endangered Indic Indigenous Languages
par: Joshi, Neha, et autres
Publié: (2025)
par: Joshi, Neha, et autres
Publié: (2025)
Documents similaires
-
IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages
par: Jayakumar, Thanmay, et autres
Publié: (2026) -
Pralekha: Cross-Lingual Document Alignment for Indic Languages
par: Suryanarayanan, Sanjay, et autres
Publié: (2024) -
IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian Languages
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2024) -
Towards Building Large Scale Datasets and State-of-the-Art Automatic Speech Translation Systems for 14 Indian Languages
par: Sankar, Ashwin, et autres
Publié: (2024) -
How Good is Zero-Shot MT Evaluation for Low Resource Indian Languages?
par: Singh, Anushka, et autres
Publié: (2024)