Bridging the Data Gap: Creating a Hindi Text Summarization Dataset from the English XSUM
Fuente:
arXiv
Salvato in:
| Autori principali: | Katwe, Praveenkumar, Balabantaray, RakeshChandra, Vittala, Kaliprasad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reducing Hallucinations in Summarization via Reinforcement Learning with Entity Hallucination Index
di: Katwe, Praveenkumar, et al.
Pubblicazione: (2025)
di: Katwe, Praveenkumar, et al.
Pubblicazione: (2025)
MedSumm: A Multimodal Approach to Summarizing Code-Mixed Hindi-English Clinical Queries
di: Ghosh, Akash, et al.
Pubblicazione: (2024)
di: Ghosh, Akash, et al.
Pubblicazione: (2024)
Advantages of Domain Knowledge Injection for Legal Document Summarization: A Case Study on Summarizing Indian Court Judgments in English and Hindi
di: Datta, Debtanu, et al.
Pubblicazione: (2026)
di: Datta, Debtanu, et al.
Pubblicazione: (2026)
Survey of Pseudonymization, Abstractive Summarization & Spell Checker for Hindi and Marathi
di: Ransing, Rasika, et al.
Pubblicazione: (2024)
di: Ransing, Rasika, et al.
Pubblicazione: (2024)
COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing
di: Sheth, Rajvee, et al.
Pubblicazione: (2025)
di: Sheth, Rajvee, et al.
Pubblicazione: (2025)
Multilingual Mathematical Reasoning: Advancing Open-Source LLMs in Hindi and English
di: Anand, Avinash, et al.
Pubblicazione: (2024)
di: Anand, Avinash, et al.
Pubblicazione: (2024)
HindiLLM: Large Language Model for Hindi
di: Chouhan, Sanjay, et al.
Pubblicazione: (2024)
di: Chouhan, Sanjay, et al.
Pubblicazione: (2024)
HeSum: a Novel Dataset for Abstractive Text Summarization in Hebrew
di: Paz-Argaman, Tzuf, et al.
Pubblicazione: (2024)
di: Paz-Argaman, Tzuf, et al.
Pubblicazione: (2024)
Generating Query-Focused Summarization Datasets from Query-Free Summarization Datasets
di: Chali, Yllias, et al.
Pubblicazione: (2026)
di: Chali, Yllias, et al.
Pubblicazione: (2026)
Bridging Writing Manner Gap in Visual Instruction Tuning by Creating LLM-aligned Instructions
di: Jing, Dong, et al.
Pubblicazione: (2025)
di: Jing, Dong, et al.
Pubblicazione: (2025)
An Under-Explored Application for Explainable Multimodal Misogyny Detection in code-mixed Hindi-English
di: Yadav, Sargam, et al.
Pubblicazione: (2026)
di: Yadav, Sargam, et al.
Pubblicazione: (2026)
Building pre-train LLM Dataset for the INDIC Languages: a case study on Hindi
di: Parida, Shantipriya, et al.
Pubblicazione: (2024)
di: Parida, Shantipriya, et al.
Pubblicazione: (2024)
Bridging the Semantic Gap: Contrastive Rewards for Multilingual Text-to-SQL with GRPO
di: Kattamuri, Ashish, et al.
Pubblicazione: (2025)
di: Kattamuri, Ashish, et al.
Pubblicazione: (2025)
Bridging the Data Provenance Gap Across Text, Speech and Video
di: Longpre, Shayne, et al.
Pubblicazione: (2024)
di: Longpre, Shayne, et al.
Pubblicazione: (2024)
MultiBanAbs: A Comprehensive Multi-Domain Bangla Abstractive Text Summarization Dataset
di: Ferdous, Md. Tanzim, et al.
Pubblicazione: (2025)
di: Ferdous, Md. Tanzim, et al.
Pubblicazione: (2025)
From Text to Forecasts: Bridging Modality Gap with Temporal Evolution Semantic Space
di: Li, Lehui, et al.
Pubblicazione: (2026)
di: Li, Lehui, et al.
Pubblicazione: (2026)
Suvach -- Generated Hindi QA benchmark
di: Narayanan, Vaishak, et al.
Pubblicazione: (2024)
di: Narayanan, Vaishak, et al.
Pubblicazione: (2024)
Classification of Radiological Text in Small and Imbalanced Datasets in a Non-English Language
di: Beliveau, Vincent, et al.
Pubblicazione: (2024)
di: Beliveau, Vincent, et al.
Pubblicazione: (2024)
Revealing the impact of synthetic native samples and multi-tasking strategies in Hindi-English code-mixed humour and sarcasm detection
di: Mazumder, Debajyoti, et al.
Pubblicazione: (2024)
di: Mazumder, Debajyoti, et al.
Pubblicazione: (2024)
Fair Summarization: Bridging Quality and Diversity in Extractive Summaries
di: Nezhad, Sina Bagheri, et al.
Pubblicazione: (2024)
di: Nezhad, Sina Bagheri, et al.
Pubblicazione: (2024)
DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing
di: Lu, Shuo, et al.
Pubblicazione: (2025)
di: Lu, Shuo, et al.
Pubblicazione: (2025)
Airavata: Introducing Hindi Instruction-tuned LLM
di: Gala, Jay, et al.
Pubblicazione: (2024)
di: Gala, Jay, et al.
Pubblicazione: (2024)
CNsum:Automatic Summarization for Chinese News Text
di: Zhao, Yu, et al.
Pubblicazione: (2025)
di: Zhao, Yu, et al.
Pubblicazione: (2025)
Bridging the Gap in Bangla Healthcare: Machine Learning Based Disease Prediction Using a Symptoms-Disease Dataset
di: Zannat, Rowzatul, et al.
Pubblicazione: (2026)
di: Zannat, Rowzatul, et al.
Pubblicazione: (2026)
Multi-class Regret Detection in Hindi Devanagari Script
di: Sharma, Renuka, et al.
Pubblicazione: (2024)
di: Sharma, Renuka, et al.
Pubblicazione: (2024)
Multilingual LLMs Are Not Multilingual Thinkers: Evidence from Hindi Analogy Evaluation
di: Gupta, Ashray, et al.
Pubblicazione: (2025)
di: Gupta, Ashray, et al.
Pubblicazione: (2025)
MovieSum: An Abstractive Summarization Dataset for Movie Screenplays
di: Saxena, Rohit, et al.
Pubblicazione: (2024)
di: Saxena, Rohit, et al.
Pubblicazione: (2024)
Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance
di: Zheng, Weihua, et al.
Pubblicazione: (2026)
di: Zheng, Weihua, et al.
Pubblicazione: (2026)
BOE-XSUM: Extreme Summarization in Clear Language of Spanish Legal Decrees and Notifications
di: García, Andrés Fernández, et al.
Pubblicazione: (2025)
di: García, Andrés Fernández, et al.
Pubblicazione: (2025)
Prompt Chaining or Stepwise Prompt? Refinement in Text Summarization
di: Sun, Shichao, et al.
Pubblicazione: (2024)
di: Sun, Shichao, et al.
Pubblicazione: (2024)
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
di: Liu, Dongqi, et al.
Pubblicazione: (2025)
di: Liu, Dongqi, et al.
Pubblicazione: (2025)
Improving Long Text Understanding with Knowledge Distilled from Summarization Model
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
SQL-GEN: Bridging the Dialect Gap for Text-to-SQL Via Synthetic Data And Model Merging
di: Pourreza, Mohammadreza, et al.
Pubblicazione: (2024)
di: Pourreza, Mohammadreza, et al.
Pubblicazione: (2024)
NoticIA: A Clickbait Article Summarization Dataset in Spanish
di: García-Ferrero, Iker, et al.
Pubblicazione: (2024)
di: García-Ferrero, Iker, et al.
Pubblicazione: (2024)
Towards Enhancing Coherence in Extractive Summarization: Dataset and Experiments with LLMs
di: Parmar, Mihir, et al.
Pubblicazione: (2024)
di: Parmar, Mihir, et al.
Pubblicazione: (2024)
From Sub-Ability Diagnosis to Human-Aligned Generation: Bridging the Gap for Text Length Control via MARKERGEN
di: Yuan, Peiwen, et al.
Pubblicazione: (2025)
di: Yuan, Peiwen, et al.
Pubblicazione: (2025)
Investigating Text Shortening Strategy in BERT: Truncation vs Summarization
di: Mutasodirin, Mirza Alim, et al.
Pubblicazione: (2024)
di: Mutasodirin, Mirza Alim, et al.
Pubblicazione: (2024)
Abstractive Text Summarization for Contemporary Sanskrit Prose: Issues and Challenges
di: Sinha, Shagun
Pubblicazione: (2025)
di: Sinha, Shagun
Pubblicazione: (2025)
ChallengeMe: An Adversarial Learning-enabled Text Summarization Framework
di: Deng, Xiaoyu, et al.
Pubblicazione: (2025)
di: Deng, Xiaoyu, et al.
Pubblicazione: (2025)
QAPyramid: Fine-grained Evaluation of Content Selection for Text Summarization
di: Zhang, Shiyue, et al.
Pubblicazione: (2024)
di: Zhang, Shiyue, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Reducing Hallucinations in Summarization via Reinforcement Learning with Entity Hallucination Index
di: Katwe, Praveenkumar, et al.
Pubblicazione: (2025) -
MedSumm: A Multimodal Approach to Summarizing Code-Mixed Hindi-English Clinical Queries
di: Ghosh, Akash, et al.
Pubblicazione: (2024) -
Advantages of Domain Knowledge Injection for Legal Document Summarization: A Case Study on Summarizing Indian Court Judgments in English and Hindi
di: Datta, Debtanu, et al.
Pubblicazione: (2026) -
Survey of Pseudonymization, Abstractive Summarization & Spell Checker for Hindi and Marathi
di: Ransing, Rasika, et al.
Pubblicazione: (2024) -
COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing
di: Sheth, Rajvee, et al.
Pubblicazione: (2025)