Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rachamalla, Neel Prabhanjan, Konakalla, Aravind, Rajeev, Gautam, Kulkarni, Ashish, Khatri, Chandra, Agarwal, Shubham |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages
par: Manoj, Guduru, et autres
Publié: (2025)
par: Manoj, Guduru, et autres
Publié: (2025)
VoiceAgentBench: Are Voice Assistants ready for agentic tasks?
par: Jain, Dhruv, et autres
Publié: (2025)
par: Jain, Dhruv, et autres
Publié: (2025)
MUTANT: A Recipe for Multilingual Tokenizer Design
par: Rana, Souvik, et autres
Publié: (2025)
par: Rana, Souvik, et autres
Publié: (2025)
Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
par: Khan, Shaharukh, et autres
Publié: (2026)
par: Khan, Shaharukh, et autres
Publié: (2026)
Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation
par: Khan, Shaharukh, et autres
Publié: (2025)
par: Khan, Shaharukh, et autres
Publié: (2025)
Krutrim LLM: A Novel Tokenization Strategy for Multilingual Indic Languages with Petabyte-Scale Data Processing
par: Kumar, Rahul, et autres
Publié: (2024)
par: Kumar, Rahul, et autres
Publié: (2024)
Scalable Vision Language Model Training via High Quality Data Curation
par: Dong, Hongyuan, et autres
Publié: (2025)
par: Dong, Hongyuan, et autres
Publié: (2025)
Use of a Structured Knowledge Base Enhances Metadata Curation by Large Language Models
par: Sundaram, Sowmya S., et autres
Publié: (2024)
par: Sundaram, Sowmya S., et autres
Publié: (2024)
Krutrim LLM: Multilingual Foundational Model for over a Billion People
par: Kallappa, Aditya, et autres
Publié: (2025)
par: Kallappa, Aditya, et autres
Publié: (2025)
Seeing Straight: Document Orientation Detection for Efficient OCR
par: Goswami, Suranjan, et autres
Publié: (2025)
par: Goswami, Suranjan, et autres
Publié: (2025)
YesBut: A High-Quality Annotated Multimodal Dataset for evaluating Satire Comprehension capability of Vision-Language Models
par: Nandy, Abhilash, et autres
Publié: (2024)
par: Nandy, Abhilash, et autres
Publié: (2024)
Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems
par: Faraz, Ali, et autres
Publié: (2026)
par: Faraz, Ali, et autres
Publié: (2026)
Bharat Scene Text: A Novel Comprehensive Dataset and Benchmark for Indian Language Scene Text Understanding
par: De, Anik, et autres
Publié: (2025)
par: De, Anik, et autres
Publié: (2025)
INSURE-Dial: A Phase-Aware Conversational Dataset & Benchmark for Compliance Verification and Phase Detection
par: Kulkarni, Shubham, et autres
Publié: (2026)
par: Kulkarni, Shubham, et autres
Publié: (2026)
KULCQ: An Unsupervised Keyword-based Utterance Level Clustering Quality Metric
par: Guruprasad, Pranav, et autres
Publié: (2024)
par: Guruprasad, Pranav, et autres
Publié: (2024)
Accent Placement Models for Rigvedic Sanskrit Text
par: P, Akhil Rajeev, et autres
Publié: (2025)
par: P, Akhil Rajeev, et autres
Publié: (2025)
Chitrarth: Bridging Vision and Language for a Billion People
par: Khan, Shaharukh, et autres
Publié: (2025)
par: Khan, Shaharukh, et autres
Publié: (2025)
TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering
par: Joshi, Vinay, et autres
Publié: (2025)
par: Joshi, Vinay, et autres
Publié: (2025)
Recover-LoRA: Data-Free Accuracy Recovery of Degraded Language Models via Low-Rank Adaptation
par: Das, Devleena, et autres
Publié: (2025)
par: Das, Devleena, et autres
Publié: (2025)
IndiBias: A Benchmark Dataset to Measure Social Biases in Language Models for Indian Context
par: Sahoo, Nihar Ranjan, et autres
Publié: (2024)
par: Sahoo, Nihar Ranjan, et autres
Publié: (2024)
AdiBhashaa: A Community-Curated Benchmark for Machine Translation into Indian Tribal Languages
par: Singh, Pooja, et autres
Publié: (2025)
par: Singh, Pooja, et autres
Publié: (2025)
Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation
par: P, Akhil Rajeev, et autres
Publié: (2026)
par: P, Akhil Rajeev, et autres
Publié: (2026)
The NaijaVoices Dataset: Cultivating Large-Scale, High-Quality, Culturally-Rich Speech Data for African Languages
par: Emezue, Chris, et autres
Publié: (2025)
par: Emezue, Chris, et autres
Publié: (2025)
Code2Doc: A Quality-First Curated Dataset for Code Documentation
par: Karaman, Recep Kaan, et autres
Publié: (2025)
par: Karaman, Recep Kaan, et autres
Publié: (2025)
MATHSENSEI: A Tool-Augmented Large Language Model for Mathematical Reasoning
par: Das, Debrup, et autres
Publié: (2024)
par: Das, Debrup, et autres
Publié: (2024)
The Esethu Framework: Reimagining Sustainable Dataset Governance and Curation for Low-Resource Languages
par: Rajab, Jenalea, et autres
Publié: (2025)
par: Rajab, Jenalea, et autres
Publié: (2025)
Beyond Training for Cultural Awareness: The Role of Dataset Linguistic Structure in Large Language Models
par: Masoud, Reem I., et autres
Publié: (2026)
par: Masoud, Reem I., et autres
Publié: (2026)
SmolKalam: Ensemble Quality-Filtered Translation at Scale for High Quality Arabic Post-Training Data
par: Alrashed, Sultan, et autres
Publié: (2025)
par: Alrashed, Sultan, et autres
Publié: (2025)
AlignCultura: Towards Culturally Aligned Large Language Models?
par: Kashyap, Gautam Siddharth, et autres
Publié: (2026)
par: Kashyap, Gautam Siddharth, et autres
Publié: (2026)
Kinship in Speech: Leveraging Linguistic Relatedness for Zero-Shot TTS in Indian Languages
par: Pathak, Utkarsh, et autres
Publié: (2025)
par: Pathak, Utkarsh, et autres
Publié: (2025)
Curation of a Palaeohispanic Dataset for Machine Learning
par: Martínez-Fernández, Gonzalo, et autres
Publié: (2026)
par: Martínez-Fernández, Gonzalo, et autres
Publié: (2026)
Post-training Large Language Models for Diverse High-Quality Responses
par: Chen, Yilei, et autres
Publié: (2025)
par: Chen, Yilei, et autres
Publié: (2025)
Towards Automatic Evaluation of Task-Oriented Dialogue Flows
par: Mirtaheri, Mehrnoosh, et autres
Publié: (2024)
par: Mirtaheri, Mehrnoosh, et autres
Publié: (2024)
SemiKong: Curating, Training, and Evaluating A Semiconductor Industry-Specific Large Language Model
par: Nguyen, Christopher, et autres
Publié: (2024)
par: Nguyen, Christopher, et autres
Publié: (2024)
Agentic Code Reasoning
par: Ugare, Shubham, et autres
Publié: (2026)
par: Ugare, Shubham, et autres
Publié: (2026)
Measuring Social Biases in Masked Language Models by Proxy of Prediction Quality
par: Zalkikar, Rahul, et autres
Publié: (2024)
par: Zalkikar, Rahul, et autres
Publié: (2024)
PBBQ: A Persian Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models
par: Farsi, Farhan, et autres
Publié: (2025)
par: Farsi, Farhan, et autres
Publié: (2025)
Disentangling Geometry, Performance, and Training in Language Models
par: Kulkarni, Atharva, et autres
Publié: (2026)
par: Kulkarni, Atharva, et autres
Publié: (2026)
Revisiting Metric Reliability for Fine-grained Evaluation of Machine Translation and Summarization in Indian Languages
par: Yari, Amir Hossein, et autres
Publié: (2025)
par: Yari, Amir Hossein, et autres
Publié: (2025)
LLM Unlearning Without an Expert Curated Dataset
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
Documents similaires
-
BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages
par: Manoj, Guduru, et autres
Publié: (2025) -
VoiceAgentBench: Are Voice Assistants ready for agentic tasks?
par: Jain, Dhruv, et autres
Publié: (2025) -
MUTANT: A Recipe for Multilingual Tokenizer Design
par: Rana, Souvik, et autres
Publié: (2025) -
Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
par: Khan, Shaharukh, et autres
Publié: (2026) -
Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation
par: Khan, Shaharukh, et autres
Publié: (2025)