PrahokBART: A Pre-trained Sequence-to-Sequence Model for Khmer Natural Language Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kaing, Hour, Dabre, Raj, Song, Haiyue, Tran, Van-Hien, Tanaka, Hideki, Utiyama, Masao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Alignment Hurts: Decoupling Representational Spaces in Multilingual Models
par: Elshabrawy, Ahmed, et autres
Publié: (2025)
par: Elshabrawy, Ahmed, et autres
Publié: (2025)
Structured Document Translation via Format Reinforcement Learning
par: Song, Haiyue, et autres
Publié: (2025)
par: Song, Haiyue, et autres
Publié: (2025)
IteRABRe: Iterative Recovery-Aided Block Reduction
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2025)
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2025)
OptiMer: Optimal Distribution Vector Merging Is Better than Data Mixing for Continual Pre-Training
par: Song, Haiyue, et autres
Publié: (2026)
par: Song, Haiyue, et autres
Publié: (2026)
Connecting Ideas in 'Lower-Resource' Scenarios: NLP for National Varieties, Creoles and Other Low-resource Scenarios
par: Joshi, Aditya, et autres
Publié: (2024)
par: Joshi, Aditya, et autres
Publié: (2024)
TikZero: Zero-Shot Text-Guided Graphics Program Synthesis
par: Belouadi, Jonas, et autres
Publié: (2025)
par: Belouadi, Jonas, et autres
Publié: (2025)
Minimum Bayes Risk Decoding for Error Span Detection in Reference-Free Automatic Machine Translation Evaluation
par: Lyu, Boxuan, et autres
Publié: (2025)
par: Lyu, Boxuan, et autres
Publié: (2025)
On Eliciting Syntax from Language Models via Hashing
par: Wang, Yiran, et autres
Publié: (2024)
par: Wang, Yiran, et autres
Publié: (2024)
Sequence-to-Sequence Spanish Pre-trained Language Models
par: Araujo, Vladimir, et autres
Publié: (2023)
par: Araujo, Vladimir, et autres
Publié: (2023)
Comprehensive Evaluation on Lexical Normalization: Boundary-Aware Approaches for Unsegmented Languages
par: Higashiyama, Shohei, et autres
Publié: (2025)
par: Higashiyama, Shohei, et autres
Publié: (2025)
Improving Language Transfer Capability of Decoder-only Architecture in Multilingual Neural Machine Translation
par: Qu, Zhi, et autres
Publié: (2024)
par: Qu, Zhi, et autres
Publié: (2024)
Towards Cultural Bridge by Bahnaric-Vietnamese Translation Using Transfer Learning of Sequence-To-Sequence Pre-training Language Model
par: Dat, Phan Tran Minh, et autres
Publié: (2025)
par: Dat, Phan Tran Minh, et autres
Publié: (2025)
Pralekha: Cross-Lingual Document Alignment for Indic Languages
par: Suryanarayanan, Sanjay, et autres
Publié: (2024)
par: Suryanarayanan, Sanjay, et autres
Publié: (2024)
Registering Source Tokens to Target Language Spaces in Multilingual Neural Machine Translation
par: Qu, Zhi, et autres
Publié: (2025)
par: Qu, Zhi, et autres
Publié: (2025)
Centroid-Based Efficient Minimum Bayes Risk Decoding
par: Deguchi, Hiroyuki, et autres
Publié: (2024)
par: Deguchi, Hiroyuki, et autres
Publié: (2024)
CADEL: A Corpus of Administrative Web Documents for Japanese Entity Linking
par: Higashiyama, Shohei, et autres
Publié: (2026)
par: Higashiyama, Shohei, et autres
Publié: (2026)
Top-b: Entropic Regulation of Relative Probability Bands in Autoregressive Language Processes
par: Halder, Deepon, et autres
Publié: (2026)
par: Halder, Deepon, et autres
Publié: (2026)
Pretraining Language Models Using Translationese
par: Doshi, Meet, et autres
Publié: (2024)
par: Doshi, Meet, et autres
Publié: (2024)
Repeated Sequences Reveal Gaps between Large Language Models and Natural Language
par: Tanaka-Ishii, Kumiko
Publié: (2026)
par: Tanaka-Ishii, Kumiko
Publié: (2026)
Are Language Models Agnostic to Linguistically Grounded Perturbations? A Case Study of Indic Languages
par: Ghosh, Poulami, et autres
Publié: (2024)
par: Ghosh, Poulami, et autres
Publié: (2024)
To be Continuous, or to be Discrete, Those are Bits of Questions
par: Wang, Yiran, et autres
Publié: (2024)
par: Wang, Yiran, et autres
Publié: (2024)
Chinese Sequence Labeling with Semi-Supervised Boundary-Aware Language Model Pre-training
par: Zhang, Longhui, et autres
Publié: (2024)
par: Zhang, Longhui, et autres
Publié: (2024)
Improving Transfer Learning for Sequence Labeling Tasks by Adapting Pre-trained Neural Language Models
par: Dukić, David
Publié: (2025)
par: Dukić, David
Publié: (2025)
Exploiting Pre-trained Encoder-Decoder Transformers for Sequence-to-Sequence Constituent Parsing
par: Fernández-González, Daniel, et autres
Publié: (2026)
par: Fernández-González, Daniel, et autres
Publié: (2026)
Natural Language Processing for Dialects of a Language: A Survey
par: Joshi, Aditya, et autres
Publié: (2024)
par: Joshi, Aditya, et autres
Publié: (2024)
Language-free Experience at Expo 2025 Osaka
par: Paul, Michael, et autres
Publié: (2026)
par: Paul, Michael, et autres
Publié: (2026)
Development of Cognitive Intelligence in Pre-trained Language Models
par: Shah, Raj Sanjay, et autres
Publié: (2024)
par: Shah, Raj Sanjay, et autres
Publié: (2024)
Analysing The Impact of Sequence Composition on Language Model Pre-Training
par: Zhao, Yu, et autres
Publié: (2024)
par: Zhao, Yu, et autres
Publié: (2024)
ATD-Trans: A Geographically Grounded Japanese-English Travelogue Translation Dataset
par: Higashiyama, Shohei, et autres
Publié: (2026)
par: Higashiyama, Shohei, et autres
Publié: (2026)
How effective is Multi-source pivoting for Translation of Low Resource Indian Languages?
par: Gaikwad, Pranav, et autres
Publié: (2024)
par: Gaikwad, Pranav, et autres
Publié: (2024)
Scripts Through Time: A Survey of the Evolving Role of Transliteration in NLP
par: Jayakumar, Thanmay, et autres
Publié: (2026)
par: Jayakumar, Thanmay, et autres
Publié: (2026)
IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian Languages
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2024)
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2024)
Mark My Words: A Robust Multilingual Model for Punctuation in Text and Speech Transcripts
par: Pulipaka, Sidharth, et autres
Publié: (2025)
par: Pulipaka, Sidharth, et autres
Publié: (2025)
IndicRAGSuite: Large-Scale Datasets and a Benchmark for Indian Language RAG Systems
par: Prasanjith, Pasunuti, et autres
Publié: (2025)
par: Prasanjith, Pasunuti, et autres
Publié: (2025)
Khmer Spellchecking: A Holistic Approach
par: Kong, Marry, et autres
Publié: (2025)
par: Kong, Marry, et autres
Publié: (2025)
Towards Explainable Khmer Polarity Classification
par: Kong, Marry, et autres
Publié: (2025)
par: Kong, Marry, et autres
Publié: (2025)
CycleDistill: Bootstrapping Machine Translation using LLMs with Cyclical Distillation
par: Halder, Deepon, et autres
Publié: (2025)
par: Halder, Deepon, et autres
Publié: (2025)
Contextualized Sequence Likelihood: Enhanced Confidence Scores for Natural Language Generation
par: Lin, Zhen, et autres
Publié: (2024)
par: Lin, Zhen, et autres
Publié: (2024)
An Empirical Study of In-context Learning in LLMs for Machine Translation
par: Chitale, Pranjal A., et autres
Publié: (2024)
par: Chitale, Pranjal A., et autres
Publié: (2024)
A Better LLM Evaluator for Text Generation: The Impact of Prompt Output Sequencing and Optimization
par: Chu, KuanChao, et autres
Publié: (2024)
par: Chu, KuanChao, et autres
Publié: (2024)
Documents similaires
-
When Alignment Hurts: Decoupling Representational Spaces in Multilingual Models
par: Elshabrawy, Ahmed, et autres
Publié: (2025) -
Structured Document Translation via Format Reinforcement Learning
par: Song, Haiyue, et autres
Publié: (2025) -
IteRABRe: Iterative Recovery-Aided Block Reduction
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2025) -
OptiMer: Optimal Distribution Vector Merging Is Better than Data Mixing for Continual Pre-Training
par: Song, Haiyue, et autres
Publié: (2026) -
Connecting Ideas in 'Lower-Resource' Scenarios: NLP for National Varieties, Creoles and Other Low-resource Scenarios
par: Joshi, Aditya, et autres
Publié: (2024)