Matina: A Large-Scale 73B Token Persian Text Corpus
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hosseinbeigi, Sara Bourbour, Taherinezhad, Fatemeh, Faili, Heshaam, Baghbani, Hamed, Nadi, Fatemeh, Amiri, Mostafa |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration
par: Kalahroodi, Mohammad Javad Ranjbar, et autres
Publié: (2026)
par: Kalahroodi, Mohammad Javad Ranjbar, et autres
Publié: (2026)
Persian Typographical Error Type Detection Using Deep Neural Networks on Algorithmically-Generated Misspellings
par: Dehghani, Mohammad, et autres
Publié: (2023)
par: Dehghani, Mohammad, et autres
Publié: (2023)
SearchInstruct: Enhancing Domain Adaptation via Retrieval-Based Instruction Dataset Creation
par: Barati, Iman, et autres
Publié: (2025)
par: Barati, Iman, et autres
Publié: (2025)
SchemaGraphSQL: Efficient Schema Linking with Pathfinding Graph Algorithms for Text-to-SQL on Large-Scale Databases
par: Safdarian, AmirHossein, et autres
Publié: (2025)
par: Safdarian, AmirHossein, et autres
Publié: (2025)
PerSHOP -- A Persian dataset for shopping dialogue systems modeling
par: Mahmoudi, Keyvan, et autres
Publié: (2024)
par: Mahmoudi, Keyvan, et autres
Publié: (2024)
Mismatching-Aware Unsupervised Translation Quality Estimation For Low-Resource Languages
par: Azadi, Fatemeh, et autres
Publié: (2022)
par: Azadi, Fatemeh, et autres
Publié: (2022)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
par: Jamali, Naghmeh, et autres
Publié: (2025)
par: Jamali, Naghmeh, et autres
Publié: (2025)
Advancing Retrieval-Augmented Generation for Persian: Development of Language Models, Comprehensive Benchmarks, and Best Practices for Optimization
par: Hosseinbeigi, Sara Bourbour, et autres
Publié: (2025)
par: Hosseinbeigi, Sara Bourbour, et autres
Publié: (2025)
Improving the quality of Persian clinical text with a novel spelling correction system
par: Dashti, Seyed Mohammad Sadegh, et autres
Publié: (2024)
par: Dashti, Seyed Mohammad Sadegh, et autres
Publié: (2024)
Enhancing Few-Shot Transfer Learning with Optimized Multi-Task Prompt Tuning through Modular Prompt Composition
par: Pouramini, Ahmad, et autres
Publié: (2024)
par: Pouramini, Ahmad, et autres
Publié: (2024)
CrossPT: Exploring Cross-Task Transferability through Multi-Task Prompt Tuning
par: Pouramini, Ahmad, et autres
Publié: (2025)
par: Pouramini, Ahmad, et autres
Publié: (2025)
PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark
par: Kalahroodi, Mohammad Javad Ranjbar, et autres
Publié: (2026)
par: Kalahroodi, Mohammad Javad Ranjbar, et autres
Publié: (2026)
Bayesian Network Fusion of Large Language Models for Sentiment Analysis
par: Amirzadeh, Rasoul, et autres
Publié: (2025)
par: Amirzadeh, Rasoul, et autres
Publié: (2025)
PESTS: Persian_English Cross Lingual Corpus for Semantic Textual Similarity
par: Abdous, Mohammad, et autres
Publié: (2023)
par: Abdous, Mohammad, et autres
Publié: (2023)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
par: Lu, Zhiyuan, et autres
Publié: (2026)
par: Lu, Zhiyuan, et autres
Publié: (2026)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
par: Wang, Zengzhi, et autres
Publié: (2023)
par: Wang, Zengzhi, et autres
Publié: (2023)
Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies
par: Taherinezhad, Fatemeh, et autres
Publié: (2025)
par: Taherinezhad, Fatemeh, et autres
Publié: (2025)
StackRAG Agent: Improving Developer Answers with Retrieval-Augmented Generation
par: Abrahamyan, Davit, et autres
Publié: (2024)
par: Abrahamyan, Davit, et autres
Publié: (2024)
ToMMeR -- Efficient Entity Mention Detection from Large Language Models
par: Morand, Victor, et autres
Publié: (2025)
par: Morand, Victor, et autres
Publié: (2025)
GraphER: A Structure-aware Text-to-Graph Model for Entity and Relation Extraction
par: Zaratiana, Urchade, et autres
Publié: (2024)
par: Zaratiana, Urchade, et autres
Publié: (2024)
An Autoregressive Text-to-Graph Framework for Joint Entity and Relation Extraction
par: Zaratiana, Urchade, et autres
Publié: (2024)
par: Zaratiana, Urchade, et autres
Publié: (2024)
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
par: Dekoninck, Jasper, et autres
Publié: (2025)
par: Dekoninck, Jasper, et autres
Publié: (2025)
BanglaNirTox: A Large-scale Parallel Corpus for Explainable AI in Bengali Text Detoxification
par: Mohsin, Ayesha Afroza, et autres
Publié: (2025)
par: Mohsin, Ayesha Afroza, et autres
Publié: (2025)
LlamaRec-LKG-RAG: A Single-Pass, Learnable Knowledge Graph-RAG Framework for LLM-Based Ranking
par: Azizi, Vahid, et autres
Publié: (2025)
par: Azizi, Vahid, et autres
Publié: (2025)
BaiJia: A Large-Scale Role-Playing Agent Corpus of Chinese Historical Characters
par: Bai, Ting, et autres
Publié: (2024)
par: Bai, Ting, et autres
Publié: (2024)
PersianMind: A Cross-Lingual Persian-English Large Language Model
par: Rostami, Pedram, et autres
Publié: (2024)
par: Rostami, Pedram, et autres
Publié: (2024)
Persian-Phi: Efficient Cross-Lingual Adaptation of Compact LLMs via Curriculum Learning
par: Akhlaghi, Amir Mohammad, et autres
Publié: (2025)
par: Akhlaghi, Amir Mohammad, et autres
Publié: (2025)
Lotus at SemEval-2025 Task 11: RoBERTa with Llama-3 Generated Explanations for Multi-Label Emotion Classification
par: Ranjbar, Niloofar, et autres
Publié: (2025)
par: Ranjbar, Niloofar, et autres
Publié: (2025)
Fractal Patterns May Illuminate the Success of Next-Token Prediction
par: Alabdulmohsin, Ibrahim, et autres
Publié: (2024)
par: Alabdulmohsin, Ibrahim, et autres
Publié: (2024)
Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation
par: P, Akhil Rajeev, et autres
Publié: (2026)
par: P, Akhil Rajeev, et autres
Publié: (2026)
Rezwan: Leveraging Large Language Models for Comprehensive Hadith Text Processing: A 1.2M Corpus Development
par: Asgari-Bidhendi, Majid, et autres
Publié: (2025)
par: Asgari-Bidhendi, Majid, et autres
Publié: (2025)
NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus
par: Silva, Enzo S. N., et autres
Publié: (2026)
par: Silva, Enzo S. N., et autres
Publié: (2026)
Reverse Probing: Supervised Token-level Uncertainty Quantification for Large Language Models in Clinical Text
par: Xiao, Bushi, et autres
Publié: (2026)
par: Xiao, Bushi, et autres
Publié: (2026)
Building a Large Japanese Web Corpus for Large Language Models
par: Okazaki, Naoaki, et autres
Publié: (2024)
par: Okazaki, Naoaki, et autres
Publié: (2024)
Sharif-MGTD at SemEval-2024 Task 8: A Transformer-Based Approach to Detect Machine Generated Text
par: Ebrahimi, Seyedeh Fatemeh, et autres
Publié: (2024)
par: Ebrahimi, Seyedeh Fatemeh, et autres
Publié: (2024)
Text Generation Beyond Discrete Token Sampling
par: Zhuang, Yufan, et autres
Publié: (2025)
par: Zhuang, Yufan, et autres
Publié: (2025)
Large Scale Generative AI Text Applied to Sports and Music
par: Baughman, Aaron, et autres
Publié: (2024)
par: Baughman, Aaron, et autres
Publié: (2024)
LLMCARE: early detection of cognitive impairment via transformer models enhanced by LLM-generated synthetic data
par: Zolnour, Ali, et autres
Publié: (2025)
par: Zolnour, Ali, et autres
Publié: (2025)
WAXAL: A Large-Scale Multilingual African Language Speech Corpus
par: Diack, Abdoulaye, et autres
Publié: (2026)
par: Diack, Abdoulaye, et autres
Publié: (2026)
Generation, Evaluation, and Explanation of Novelists' Styles with Single-Token Prompts
par: Rezaei, Mosab, et autres
Publié: (2025)
par: Rezaei, Mosab, et autres
Publié: (2025)
Documents similaires
-
PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration
par: Kalahroodi, Mohammad Javad Ranjbar, et autres
Publié: (2026) -
Persian Typographical Error Type Detection Using Deep Neural Networks on Algorithmically-Generated Misspellings
par: Dehghani, Mohammad, et autres
Publié: (2023) -
SearchInstruct: Enhancing Domain Adaptation via Retrieval-Based Instruction Dataset Creation
par: Barati, Iman, et autres
Publié: (2025) -
SchemaGraphSQL: Efficient Schema Linking with Pathfinding Graph Algorithms for Text-to-SQL on Large-Scale Databases
par: Safdarian, AmirHossein, et autres
Publié: (2025) -
PerSHOP -- A Persian dataset for shopping dialogue systems modeling
par: Mahmoudi, Keyvan, et autres
Publié: (2024)