MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
Fuente:
arXiv
Saved in:
| Main Authors: | Yadav, Sumit, Yadav, Raju Kumar, Maskey, Utsav, Kashyap, Gautam Siddharth, Gautam, Ganesh, Naseem, Usman |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering
by: Maskey, Utsav, et al.
Published: (2025)
by: Maskey, Utsav, et al.
Published: (2025)
AlignCultura: Towards Culturally Aligned Large Language Models?
by: Kashyap, Gautam Siddharth, et al.
Published: (2026)
by: Kashyap, Gautam Siddharth, et al.
Published: (2026)
Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities
by: Maskey, Utsav, et al.
Published: (2025)
by: Maskey, Utsav, et al.
Published: (2025)
When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified
by: Kashyap, Gautam Siddharth, et al.
Published: (2026)
by: Kashyap, Gautam Siddharth, et al.
Published: (2026)
We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)
Too Helpful, Too Harmless, Too Honest or Just Right?
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)
Should LLM Safety Be More Than Refusing Harmful Instructions?
by: Maskey, Utsav, et al.
Published: (2025)
by: Maskey, Utsav, et al.
Published: (2025)
Steering Over-refusals Towards Safety in Retrieval Augmented Generation
by: Maskey, Utsav, et al.
Published: (2025)
by: Maskey, Utsav, et al.
Published: (2025)
Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs
by: Maskey, Utsav, et al.
Published: (2026)
by: Maskey, Utsav, et al.
Published: (2026)
Can Large Language Models Make Everyone Happy?
by: Naseem, Usman, et al.
Published: (2026)
by: Naseem, Usman, et al.
Published: (2026)
Do Large Language Models Reflect Demographic Pluralism in Safety?
by: Naseem, Usman, et al.
Published: (2026)
by: Naseem, Usman, et al.
Published: (2026)
Are Aligned Large Language Models Still Misaligned?
by: Naseem, Usman, et al.
Published: (2026)
by: Naseem, Usman, et al.
Published: (2026)
Are Large Language Models Economically Viable for Industry Deployment?
by: Mohammad, Abdullah, et al.
Published: (2026)
by: Mohammad, Abdullah, et al.
Published: (2026)
SentiMaithili: A Benchmark Dataset for Sentiment and Reason Generation for the Low-Resource Maithili Language
by: Ranjan, Rahul, et al.
Published: (2025)
by: Ranjan, Rahul, et al.
Published: (2025)
They Said Memes Were Harmless-We Found the Ones That Hurt: Decoding Jokes, Symbols, and Cultural References
by: Tripathi, Sahil, et al.
Published: (2026)
by: Tripathi, Sahil, et al.
Published: (2026)
MS-HuBERT: Mitigating Pre-training and Inference Mismatch in Masked Language Modelling methods for learning Speech Representations
by: Yadav, Hemant, et al.
Published: (2024)
by: Yadav, Hemant, et al.
Published: (2024)
Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes
by: Kashyap, Gautam Siddharth, et al.
Published: (2026)
by: Kashyap, Gautam Siddharth, et al.
Published: (2026)
Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions
by: Naseem, Usman
Published: (2026)
by: Naseem, Usman
Published: (2026)
Do Clinical Question Answering Systems Really Need Specialised Medical Fine Tuning?
by: Ray, Sushant Kumar, et al.
Published: (2026)
by: Ray, Sushant Kumar, et al.
Published: (2026)
From Text to Transformation: A Comprehensive Review of Large Language Models' Versatility
by: Kaur, Pravneet, et al.
Published: (2024)
by: Kaur, Pravneet, et al.
Published: (2024)
How Can Multimodal Remote Sensing Datasets Transform Classification via SpatialNet-ViT?
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)
ChildGuard: A Specialized Dataset for Combatting Child-Targeted Hate Speech
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)
Truth, Trust, and Trouble: Medical AI on the Edge
by: Azeez, Mohammad Anas, et al.
Published: (2025)
by: Azeez, Mohammad Anas, et al.
Published: (2025)
Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
by: Joshi, Raviraj, et al.
Published: (2024)
by: Joshi, Raviraj, et al.
Published: (2024)
LLMs on a Budget? Say HOLA
by: Siddiqui, Zohaib Hasan, et al.
Published: (2025)
by: Siddiqui, Zohaib Hasan, et al.
Published: (2025)
Can Argus Judge Them All? Comparing VLMs Across Domains
by: Joshi, Harsh, et al.
Published: (2025)
by: Joshi, Harsh, et al.
Published: (2025)
Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack
by: Ren, Juan, et al.
Published: (2025)
by: Ren, Juan, et al.
Published: (2025)
Do Large Language Models Speak All Languages Equally? A Comparative Study in Low-Resource Settings
by: Hasan, Md. Arid, et al.
Published: (2024)
by: Hasan, Md. Arid, et al.
Published: (2024)
DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models
by: Ren, Kaixuan, et al.
Published: (2025)
by: Ren, Kaixuan, et al.
Published: (2025)
MAGIC-Enhanced Keyword Prompting for Zero-Shot Audio Captioning with CLIP Models
by: Govindarajan, Vijay, et al.
Published: (2025)
by: Govindarajan, Vijay, et al.
Published: (2025)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
by: Zhang, Ying, et al.
Published: (2024)
by: Zhang, Ying, et al.
Published: (2024)
ColBERT-Zero: To Pre-train Or Not To Pre-train ColBERT models
by: Chaffin, Antoine, et al.
Published: (2026)
by: Chaffin, Antoine, et al.
Published: (2026)
EDA Corpus: A Large Language Model Dataset for Enhanced Interaction with OpenROAD
by: Wu, Bing-Yue, et al.
Published: (2024)
by: Wu, Bing-Yue, et al.
Published: (2024)
FaBERT: Pre-training BERT on Persian Blogs
by: Masumi, Mostafa, et al.
Published: (2024)
by: Masumi, Mostafa, et al.
Published: (2024)
Language Portability Strategies for Open-domain Dialogue with Pre-trained Language Models from High to Low Resource Languages
by: Njifenjou, Ahmed, et al.
Published: (2024)
by: Njifenjou, Ahmed, et al.
Published: (2024)
Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups
by: Veldanda, Gautam
Published: (2026)
by: Veldanda, Gautam
Published: (2026)
Towards Open Foundation Language Model and Corpus for Macedonian: A Low-Resource Language
by: Krsteski, Stefan, et al.
Published: (2025)
by: Krsteski, Stefan, et al.
Published: (2025)
Better to Ask in English: Evaluation of Large Language Models on English, Low-resource and Cross-Lingual Settings
by: Dey, Krishno, et al.
Published: (2024)
by: Dey, Krishno, et al.
Published: (2024)
PersoBench: Benchmarking Personalized Response Generation in Large Language Models
by: Afzoon, Saleh, et al.
Published: (2024)
by: Afzoon, Saleh, et al.
Published: (2024)
Flick: Few Labels Text Classification using K-Aware Intermediate Learning in Multi-Task Low-Resource Languages
by: Almutairi, Ali, et al.
Published: (2025)
by: Almutairi, Ali, et al.
Published: (2025)
Similar Items
-
SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering
by: Maskey, Utsav, et al.
Published: (2025) -
AlignCultura: Towards Culturally Aligned Large Language Models?
by: Kashyap, Gautam Siddharth, et al.
Published: (2026) -
Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities
by: Maskey, Utsav, et al.
Published: (2025) -
When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified
by: Kashyap, Gautam Siddharth, et al.
Published: (2026) -
We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong
by: Kashyap, Gautam Siddharth, et al.
Published: (2025)