Multilingual TinyStories: A Synthetic Combinatorial Corpus of Indic Children's Stories for Training Small Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Halder, Deepon, Mukherjee, Angira |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Top-b: Entropic Regulation of Relative Probability Bands in Autoregressive Language Processes
di: Halder, Deepon, et al.
Pubblicazione: (2026)
di: Halder, Deepon, et al.
Pubblicazione: (2026)
Regional Tiny Stories: Using Small Models to Compare Language Learning and Tokenizer Performance
di: Patil, Nirvan, et al.
Pubblicazione: (2025)
di: Patil, Nirvan, et al.
Pubblicazione: (2025)
Scripts Through Time: A Survey of the Evolving Role of Transliteration in NLP
di: Jayakumar, Thanmay, et al.
Pubblicazione: (2026)
di: Jayakumar, Thanmay, et al.
Pubblicazione: (2026)
BERTtime Stories: Investigating the Role of Synthetic Story Data in Language Pre-training
di: Theodoropoulos, Nikitas, et al.
Pubblicazione: (2024)
di: Theodoropoulos, Nikitas, et al.
Pubblicazione: (2024)
CycleDistill: Bootstrapping Machine Translation using LLMs with Cyclical Distillation
di: Halder, Deepon, et al.
Pubblicazione: (2025)
di: Halder, Deepon, et al.
Pubblicazione: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
di: Xia, Haotian, et al.
Pubblicazione: (2026)
di: Xia, Haotian, et al.
Pubblicazione: (2026)
IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages
di: Singh, Harman, et al.
Pubblicazione: (2024)
di: Singh, Harman, et al.
Pubblicazione: (2024)
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
di: Endait, Sharvi, et al.
Pubblicazione: (2025)
di: Endait, Sharvi, et al.
Pubblicazione: (2025)
Multilingual Synopses of Movie Narratives: A Dataset for Vision-Language Story Understanding
di: Sun, Yidan, et al.
Pubblicazione: (2024)
di: Sun, Yidan, et al.
Pubblicazione: (2024)
Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation
di: Mukherjee, Arka, et al.
Pubblicazione: (2025)
di: Mukherjee, Arka, et al.
Pubblicazione: (2025)
Indic-TunedLens: Interpreting Multilingual Models in Indian Languages
di: Panchal, Mihir, et al.
Pubblicazione: (2026)
di: Panchal, Mihir, et al.
Pubblicazione: (2026)
Do Language Models Enjoy Their Own Stories? Prompting Large Language Models for Automatic Story Evaluation
di: Chhun, Cyril, et al.
Pubblicazione: (2024)
di: Chhun, Cyril, et al.
Pubblicazione: (2024)
Improving Multilingual Neural Machine Translation System for Indic Languages
di: Das, Sudhansu Bala, et al.
Pubblicazione: (2022)
di: Das, Sudhansu Bala, et al.
Pubblicazione: (2022)
Multilingual State Space Models for Structured Question Answering in Indic Languages
di: Vats, Arpita, et al.
Pubblicazione: (2025)
di: Vats, Arpita, et al.
Pubblicazione: (2025)
Parameterized Synthetic Text Generation with SimpleStories
di: Finke, Lennart, et al.
Pubblicazione: (2025)
di: Finke, Lennart, et al.
Pubblicazione: (2025)
IndicSentEval: How Effectively do Multilingual Transformer Models encode Linguistic Properties for Indic Languages?
di: Aravapalli, Akhilesh, et al.
Pubblicazione: (2024)
di: Aravapalli, Akhilesh, et al.
Pubblicazione: (2024)
StorySparkQA: Expert-Annotated QA Pairs with Real-World Knowledge for Children's Story-Based Learning
di: Chen, Jiaju, et al.
Pubblicazione: (2023)
di: Chen, Jiaju, et al.
Pubblicazione: (2023)
Small Models, Big Impact: Efficient Corpus and Graph-Based Adaptation of Small Multilingual Language Models for Low-Resource Languages
di: Gurgurov, Daniil, et al.
Pubblicazione: (2025)
di: Gurgurov, Daniil, et al.
Pubblicazione: (2025)
RiddleBench: A New Generative Reasoning Benchmark for LLMs
di: Halder, Deepon, et al.
Pubblicazione: (2025)
di: Halder, Deepon, et al.
Pubblicazione: (2025)
IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages
di: Javed, Tahir, et al.
Pubblicazione: (2024)
di: Javed, Tahir, et al.
Pubblicazione: (2024)
Previously on the Stories: Recap Snippet Identification for Story Reading
di: Li, Jiangnan, et al.
Pubblicazione: (2024)
di: Li, Jiangnan, et al.
Pubblicazione: (2024)
Biased Tales: Cultural and Topic Bias in Generating Children's Stories
di: Rooein, Donya, et al.
Pubblicazione: (2025)
di: Rooein, Donya, et al.
Pubblicazione: (2025)
AmharicStoryQA: A Multicultural Story Question Answering Benchmark in Amharic
di: Azime, Israel Abebe, et al.
Pubblicazione: (2026)
di: Azime, Israel Abebe, et al.
Pubblicazione: (2026)
Creating Suspenseful Stories: Iterative Planning with Large Language Models
di: Xie, Kaige, et al.
Pubblicazione: (2024)
di: Xie, Kaige, et al.
Pubblicazione: (2024)
Do Language Models Agree with Human Perceptions of Suspense in Stories?
di: Matlin, Glenn, et al.
Pubblicazione: (2025)
di: Matlin, Glenn, et al.
Pubblicazione: (2025)
IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages
di: Dawar, Aviral, et al.
Pubblicazione: (2026)
di: Dawar, Aviral, et al.
Pubblicazione: (2026)
BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories
di: Ouyang, Yuxuan, et al.
Pubblicazione: (2026)
di: Ouyang, Yuxuan, et al.
Pubblicazione: (2026)
World Models for Math Story Problems
di: Opedal, Andreas, et al.
Pubblicazione: (2023)
di: Opedal, Andreas, et al.
Pubblicazione: (2023)
Automatic Emotion Modelling in Written Stories
di: Christ, Lukas, et al.
Pubblicazione: (2022)
di: Christ, Lukas, et al.
Pubblicazione: (2022)
IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS
di: Sankar, Ashwin, et al.
Pubblicazione: (2024)
di: Sankar, Ashwin, et al.
Pubblicazione: (2024)
Arabic Automatic Story Generation with Large Language Models
di: El-Shangiti, Ahmed Oumar, et al.
Pubblicazione: (2024)
di: El-Shangiti, Ahmed Oumar, et al.
Pubblicazione: (2024)
BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages
di: Manoj, Guduru, et al.
Pubblicazione: (2025)
di: Manoj, Guduru, et al.
Pubblicazione: (2025)
IndicParam: Benchmark to evaluate LLMs on low-resource Indic Languages
di: Maheshwari, Ayush, et al.
Pubblicazione: (2025)
di: Maheshwari, Ayush, et al.
Pubblicazione: (2025)
Krutrim LLM: A Novel Tokenization Strategy for Multilingual Indic Languages with Petabyte-Scale Data Processing
di: Kumar, Rahul, et al.
Pubblicazione: (2024)
di: Kumar, Rahul, et al.
Pubblicazione: (2024)
MMCFND: Multimodal Multilingual Caption-aware Fake News Detection for Low-resource Indic Languages
di: Bansal, Shubhi, et al.
Pubblicazione: (2024)
di: Bansal, Shubhi, et al.
Pubblicazione: (2024)
Low-Resource Counterspeech Generation for Indic Languages: The Case of Bengali and Hindi
di: Das, Mithun, et al.
Pubblicazione: (2024)
di: Das, Mithun, et al.
Pubblicazione: (2024)
StoryWriter: A Multi-Agent Framework for Long Story Generation
di: Xia, Haotian, et al.
Pubblicazione: (2025)
di: Xia, Haotian, et al.
Pubblicazione: (2025)
SS-GEN: A Social Story Generation Framework with Large Language Models
di: Feng, Yi, et al.
Pubblicazione: (2024)
di: Feng, Yi, et al.
Pubblicazione: (2024)
IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages
di: Jayakumar, Thanmay, et al.
Pubblicazione: (2026)
di: Jayakumar, Thanmay, et al.
Pubblicazione: (2026)
IndicMMLU-Pro: Benchmarking Indic Large Language Models on Multi-Task Language Understanding
di: KJ, Sankalp, et al.
Pubblicazione: (2025)
di: KJ, Sankalp, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Top-b: Entropic Regulation of Relative Probability Bands in Autoregressive Language Processes
di: Halder, Deepon, et al.
Pubblicazione: (2026) -
Regional Tiny Stories: Using Small Models to Compare Language Learning and Tokenizer Performance
di: Patil, Nirvan, et al.
Pubblicazione: (2025) -
Scripts Through Time: A Survey of the Evolving Role of Transliteration in NLP
di: Jayakumar, Thanmay, et al.
Pubblicazione: (2026) -
BERTtime Stories: Investigating the Role of Synthetic Story Data in Language Pre-training
di: Theodoropoulos, Nikitas, et al.
Pubblicazione: (2024) -
CycleDistill: Bootstrapping Machine Translation using LLMs with Cyclical Distillation
di: Halder, Deepon, et al.
Pubblicazione: (2025)