Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | P, Akhil Rajeev, Kulkarni, Annarao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Accent Placement Models for Rigvedic Sanskrit Text
por: P, Akhil Rajeev, et al.
Publicado: (2025)
por: P, Akhil Rajeev, et al.
Publicado: (2025)
Chandomitra: Towards Generating Structured Sanskrit Poetry from Natural Language Inputs
por: Jagadeeshan, Manoj Balaji, et al.
Publicado: (2025)
por: Jagadeeshan, Manoj Balaji, et al.
Publicado: (2025)
WikiNER-fr-gold: A Gold-Standard NER Corpus
por: Cao, Danrun, et al.
Publicado: (2024)
por: Cao, Danrun, et al.
Publicado: (2024)
Automating SPARQL Query Translations between DBpedia and Wikidata
por: Bartels, Malte Christian, et al.
Publicado: (2025)
por: Bartels, Malte Christian, et al.
Publicado: (2025)
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
por: Dekoninck, Jasper, et al.
Publicado: (2025)
por: Dekoninck, Jasper, et al.
Publicado: (2025)
BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages
por: Manoj, Guduru, et al.
Publicado: (2025)
por: Manoj, Guduru, et al.
Publicado: (2025)
Automatic Speech Recognition for Sanskrit with Transfer Learning
por: Sadhukhan, Bidit, et al.
Publicado: (2025)
por: Sadhukhan, Bidit, et al.
Publicado: (2025)
PaDeLLM-NER: Parallel Decoding in Large Language Models for Named Entity Recognition
por: Lu, Jinghui, et al.
Publicado: (2024)
por: Lu, Jinghui, et al.
Publicado: (2024)
Dynamic Context Evolution for Scalable Synthetic Data Generation
por: Lingo, Ryan, et al.
Publicado: (2026)
por: Lingo, Ryan, et al.
Publicado: (2026)
TRIDIS: A Comprehensive Medieval and Early Modern Corpus for HTR and NER
por: Aguilar, Sergio Torres
Publicado: (2025)
por: Aguilar, Sergio Torres
Publicado: (2025)
Abstractive Text Summarization for Contemporary Sanskrit Prose: Issues and Challenges
por: Sinha, Shagun
Publicado: (2025)
por: Sinha, Shagun
Publicado: (2025)
HILGEN: Hierarchically-Informed Data Generation for Biomedical NER Using Knowledgebases and Large Language Models
por: Ge, Yao, et al.
Publicado: (2025)
por: Ge, Yao, et al.
Publicado: (2025)
2M-NER: Contrastive Learning for Multilingual and Multimodal NER with Language and Modal Fusion
por: Wang, Dongsheng, et al.
Publicado: (2024)
por: Wang, Dongsheng, et al.
Publicado: (2024)
Matina: A Large-Scale 73B Token Persian Text Corpus
por: Hosseinbeigi, Sara Bourbour, et al.
Publicado: (2025)
por: Hosseinbeigi, Sara Bourbour, et al.
Publicado: (2025)
Using Large Language Model for End-to-End Chinese ASR and NER
por: Li, Yuang, et al.
Publicado: (2024)
por: Li, Yuang, et al.
Publicado: (2024)
Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies
por: Kulkarni, Siddhant, et al.
Publicado: (2026)
por: Kulkarni, Siddhant, et al.
Publicado: (2026)
NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated Data
por: Bogdanov, Sergei, et al.
Publicado: (2024)
por: Bogdanov, Sergei, et al.
Publicado: (2024)
DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition
por: Luo, Hanjun, et al.
Publicado: (2024)
por: Luo, Hanjun, et al.
Publicado: (2024)
ReverseNER: A Self-Generated Example-Driven Framework for Zero-Shot Named Entity Recognition with Large Language Models
por: Wang, Anbang, et al.
Publicado: (2024)
por: Wang, Anbang, et al.
Publicado: (2024)
BaiJia: A Large-Scale Role-Playing Agent Corpus of Chinese Historical Characters
por: Bai, Ting, et al.
Publicado: (2024)
por: Bai, Ting, et al.
Publicado: (2024)
ToNER: Type-oriented Named Entity Recognition with Generative Language Model
por: Jiang, Guochao, et al.
Publicado: (2024)
por: Jiang, Guochao, et al.
Publicado: (2024)
NER- RoBERTa: Fine-Tuning RoBERTa for Named Entity Recognition (NER) within low-resource languages
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2024)
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2024)
Pragya: An AI-Based Semantic Recommendation System for Sanskrit Subhasitas
por: Raorane, Tanisha, et al.
Publicado: (2026)
por: Raorane, Tanisha, et al.
Publicado: (2026)
QueryNER: Segmentation of E-commerce Queries
por: Palen-Michel, Chester, et al.
Publicado: (2024)
por: Palen-Michel, Chester, et al.
Publicado: (2024)
Diagnosing Representation Dynamics in NER Model Extension
por: Zhang, Xirui, et al.
Publicado: (2025)
por: Zhang, Xirui, et al.
Publicado: (2025)
OpenMed NER: Open-Source, Domain-Adapted State-of-the-Art Transformers for Biomedical NER Across 12 Public Datasets
por: Panahi, Maziyar
Publicado: (2025)
por: Panahi, Maziyar
Publicado: (2025)
Synthetic Dialogue Dataset Generation using LLM Agents
por: Abdullin, Yelaman, et al.
Publicado: (2024)
por: Abdullin, Yelaman, et al.
Publicado: (2024)
Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation
por: He, Linda, et al.
Publicado: (2025)
por: He, Linda, et al.
Publicado: (2025)
Guiding Clinical Reasoning with Large Language Models via Knowledge Seeds
por: WU, Jiageng, et al.
Publicado: (2024)
por: WU, Jiageng, et al.
Publicado: (2024)
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
por: Rajgarhia, Harshit, et al.
Publicado: (2026)
por: Rajgarhia, Harshit, et al.
Publicado: (2026)
Tokenization Matters: Improving Zero-Shot NER for Indic Languages
por: Pattnayak, Priyaranjan, et al.
Publicado: (2025)
por: Pattnayak, Priyaranjan, et al.
Publicado: (2025)
Cross-Lingual IPA Contrastive Learning for Zero-Shot NER
por: Sohn, Jimin, et al.
Publicado: (2025)
por: Sohn, Jimin, et al.
Publicado: (2025)
WAXAL: A Large-Scale Multilingual African Language Speech Corpus
por: Diack, Abdoulaye, et al.
Publicado: (2026)
por: Diack, Abdoulaye, et al.
Publicado: (2026)
Surprisal and Metaphor Novelty Judgments: Moderate Correlations and Divergent Scaling Effects Revealed by Corpus-Based and Synthetic Datasets
por: Momen, Omar, et al.
Publicado: (2026)
por: Momen, Omar, et al.
Publicado: (2026)
CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation
por: Ziegler, Ingo, et al.
Publicado: (2024)
por: Ziegler, Ingo, et al.
Publicado: (2024)
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
por: Chen, Jiangjie, et al.
Publicado: (2025)
por: Chen, Jiangjie, et al.
Publicado: (2025)
Building a Large Japanese Web Corpus for Large Language Models
por: Okazaki, Naoaki, et al.
Publicado: (2024)
por: Okazaki, Naoaki, et al.
Publicado: (2024)
Supervised Fine-Tuning or In-Context Learning? Evaluating LLMs for Clinical NER
por: Baroian, Andrei
Publicado: (2025)
por: Baroian, Andrei
Publicado: (2025)
GerPS-Compare: Comparing NER methods for legal norm analysis
por: Bachinger, Sarah T., et al.
Publicado: (2024)
por: Bachinger, Sarah T., et al.
Publicado: (2024)
Wiki-TabNER: Integrating Named Entity Recognition into Wikipedia Tables
por: Koleva, Aneta, et al.
Publicado: (2024)
por: Koleva, Aneta, et al.
Publicado: (2024)
Ejemplares similares
-
Accent Placement Models for Rigvedic Sanskrit Text
por: P, Akhil Rajeev, et al.
Publicado: (2025) -
Chandomitra: Towards Generating Structured Sanskrit Poetry from Natural Language Inputs
por: Jagadeeshan, Manoj Balaji, et al.
Publicado: (2025) -
WikiNER-fr-gold: A Gold-Standard NER Corpus
por: Cao, Danrun, et al.
Publicado: (2024) -
Automating SPARQL Query Translations between DBpedia and Wikidata
por: Bartels, Malte Christian, et al.
Publicado: (2025) -
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
por: Dekoninck, Jasper, et al.
Publicado: (2025)