Training BERT Models to Carry Over a Coding System Developed on One Corpus to Another
Fuente:
arXiv
Saved in:
| Main Authors: | Galambos, Dalma, Zsámboki, Pál |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Event-Arguments Extraction Corpus and Modeling using BERT for Arabic
by: Aljabari, Alaa, et al.
Published: (2024)
by: Aljabari, Alaa, et al.
Published: (2024)
NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus
by: Silva, Enzo S. N., et al.
Published: (2026)
by: Silva, Enzo S. N., et al.
Published: (2026)
llm-jp-modernbert: A ModernBERT Model Trained on a Large-Scale Japanese Corpus with Long Context Length
by: Sugiura, Issa, et al.
Published: (2025)
by: Sugiura, Issa, et al.
Published: (2025)
MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
by: Yadav, Sumit, et al.
Published: (2025)
by: Yadav, Sumit, et al.
Published: (2025)
MahaParaphrase: A Marathi Paraphrase Detection Corpus and BERT-based Models
by: Jadhav, Suramya, et al.
Published: (2025)
by: Jadhav, Suramya, et al.
Published: (2025)
Large Language Models Often Say One Thing and Do Another
by: Xu, Ruoxi, et al.
Published: (2025)
by: Xu, Ruoxi, et al.
Published: (2025)
Biomedical Entity Linking for Dutch: Fine-tuning a Self-alignment BERT Model on an Automatically Generated Wikipedia Corpus
by: Hartendorp, Fons, et al.
Published: (2024)
by: Hartendorp, Fons, et al.
Published: (2024)
Comparative Study of Pre-Trained BERT and Large Language Models for Code-Mixed Named Entity Recognition
by: Shirke, Mayur, et al.
Published: (2025)
by: Shirke, Mayur, et al.
Published: (2025)
A Novel Corpus of Annotated Medical Imaging Reports and Information Extraction Results Using BERT-based Language Models
by: Park, Namu, et al.
Published: (2024)
by: Park, Namu, et al.
Published: (2024)
Symmetric Dot-Product Attention for Efficient Training of BERT Language Models
by: Courtois, Martin, et al.
Published: (2024)
by: Courtois, Martin, et al.
Published: (2024)
Mixed-Distil-BERT: Code-mixed Language Modeling for Bangla, English, and Hindi
by: Raihan, Md Nishat, et al.
Published: (2023)
by: Raihan, Md Nishat, et al.
Published: (2023)
UniBERT: Adversarial Training for Language-Universal Representations
by: Avram, Andrei-Marius, et al.
Published: (2025)
by: Avram, Andrei-Marius, et al.
Published: (2025)
Developing an English-Efik Corpus and Machine Translation System for Digitization Inclusion
by: Edet, Offiong Bassey, et al.
Published: (2026)
by: Edet, Offiong Bassey, et al.
Published: (2026)
One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
by: Fein, Daniel, et al.
Published: (2026)
by: Fein, Daniel, et al.
Published: (2026)
Research on Violent Text Detection System Based on BERT-fasttext Model
by: Yang, Yongsheng, et al.
Published: (2024)
by: Yang, Yongsheng, et al.
Published: (2024)
QiBERT -- Classifying Online Conversations Messages with BERT as a Feature
by: Ferreira-Saraiva, Bruno D., et al.
Published: (2024)
by: Ferreira-Saraiva, Bruno D., et al.
Published: (2024)
RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models
by: Niu, Cheng, et al.
Published: (2023)
by: Niu, Cheng, et al.
Published: (2023)
FaBERT: Pre-training BERT on Persian Blogs
by: Masumi, Mostafa, et al.
Published: (2024)
by: Masumi, Mostafa, et al.
Published: (2024)
NusaBERT: Teaching IndoBERT to be Multilingual and Multicultural
by: Wongso, Wilson, et al.
Published: (2024)
by: Wongso, Wilson, et al.
Published: (2024)
One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
by: Jia, Qi, et al.
Published: (2025)
by: Jia, Qi, et al.
Published: (2025)
PGB: One-Shot Pruning for BERT via Weight Grouping and Permutation
by: Lim, Hyemin, et al.
Published: (2025)
by: Lim, Hyemin, et al.
Published: (2025)
KliniskVestBERT: BERT Model Specialised to Norwegian Clinical Texts
by: Autenried, Christian, et al.
Published: (2026)
by: Autenried, Christian, et al.
Published: (2026)
NESTLE: a No-Code Tool for Statistical Analysis of Legal Corpus
by: Cho, Kyoungyeon, et al.
Published: (2023)
by: Cho, Kyoungyeon, et al.
Published: (2023)
Toward Understanding BERT-Like Pre-Training for DNA Foundation Models
by: Liang, Chaoqi, et al.
Published: (2023)
by: Liang, Chaoqi, et al.
Published: (2023)
Developing an Open Conversational Speech Corpus for the Isan Language
by: Na-Thalang, Adisai, et al.
Published: (2025)
by: Na-Thalang, Adisai, et al.
Published: (2025)
TabiBERT: A Large-Scale ModernBERT Foundation Model and A Unified Benchmark for Turkish
by: Türker, Melikşah, et al.
Published: (2025)
by: Türker, Melikşah, et al.
Published: (2025)
NeoDictaBERT: Pushing the Frontier of BERT models for Hebrew
by: Shmidman, Shaltiel, et al.
Published: (2025)
by: Shmidman, Shaltiel, et al.
Published: (2025)
Breaking MLPerf Training: A Case Study on Optimizing BERT
by: Kim, Yongdeok, et al.
Published: (2024)
by: Kim, Yongdeok, et al.
Published: (2024)
Say One Thing, Do Another? Diagnosing Reasoning-Execution Gaps in VLM-Powered Mobile-Use Agents
by: Dong, Lingzhong, et al.
Published: (2025)
by: Dong, Lingzhong, et al.
Published: (2025)
LLMSniffer: Detecting LLM-Generated Code via GraphCodeBERT and Supervised Contrastive Learning
by: Dihan, Mahir Labib, et al.
Published: (2026)
by: Dihan, Mahir Labib, et al.
Published: (2026)
SwissBERT: The Multilingual Language Model for Switzerland
by: Vamvas, Jannis, et al.
Published: (2023)
by: Vamvas, Jannis, et al.
Published: (2023)
KuBERT: Central Kurdish BERT Model and Its Application for Sentiment Analysis
by: Awlla, Kozhin muhealddin, et al.
Published: (2025)
by: Awlla, Kozhin muhealddin, et al.
Published: (2025)
Pre-training technique to localize medical BERT and enhance biomedical BERT
by: Wada, Shoya, et al.
Published: (2020)
by: Wada, Shoya, et al.
Published: (2020)
Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training
by: Langlais, Pierre-Carl, et al.
Published: (2025)
by: Langlais, Pierre-Carl, et al.
Published: (2025)
Yet Another Watermark for Large Language Models
by: Bao, Siyuan, et al.
Published: (2025)
by: Bao, Siyuan, et al.
Published: (2025)
YABLoCo: Yet Another Benchmark for Long Context Code Generation
by: Valeev, Aidar, et al.
Published: (2025)
by: Valeev, Aidar, et al.
Published: (2025)
Extending Translate-Train for ColBERT-X to African Language CLIR
by: Yang, Eugene, et al.
Published: (2024)
by: Yang, Eugene, et al.
Published: (2024)
NeoBERT: A Next-Generation BERT
by: Breton, Lola Le, et al.
Published: (2025)
by: Breton, Lola Le, et al.
Published: (2025)
Empowering Interdisciplinary Research with BERT-Based Models: An Approach Through SciBERT-CNN with Topic Modeling
by: Likhareva, Darya, et al.
Published: (2024)
by: Likhareva, Darya, et al.
Published: (2024)
Determinants of Training Corpus Size for Clinical Text Classification
by: Chaturvedi, Jaya, et al.
Published: (2026)
by: Chaturvedi, Jaya, et al.
Published: (2026)
Similar Items
-
Event-Arguments Extraction Corpus and Modeling using BERT for Arabic
by: Aljabari, Alaa, et al.
Published: (2024) -
NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus
by: Silva, Enzo S. N., et al.
Published: (2026) -
llm-jp-modernbert: A ModernBERT Model Trained on a Large-Scale Japanese Corpus with Long Context Length
by: Sugiura, Issa, et al.
Published: (2025) -
MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
by: Yadav, Sumit, et al.
Published: (2025) -
MahaParaphrase: A Marathi Paraphrase Detection Corpus and BERT-based Models
by: Jadhav, Suramya, et al.
Published: (2025)