Modelling the Morphology of Verbal Paradigms: A Case Study in the Tokenization of Turkish and Hebrew
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Samo, Giuseppe, Merlo, Paola |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Comparing Natural and Synthetic Structured Data: A Study of the Passive Verb Alternation in French and Italian
par: Samo, Giuseppe, et autres
Publié: (2026)
par: Samo, Giuseppe, et autres
Publié: (2026)
Datasets for Verb Alternations across Languages: BLM Templates and Data Augmentation Strategies
par: Samo, Giuseppe, et autres
Publié: (2026)
par: Samo, Giuseppe, et autres
Publié: (2026)
Blackbird Language Matrices: A Framework to Investigate the Linguistic Competence of Language Models
par: Merlo, Paola, et autres
Publié: (2026)
par: Merlo, Paola, et autres
Publié: (2026)
Exploring Italian sentence embeddings properties through multi-tasking
par: Nastase, Vivi, et autres
Publié: (2024)
par: Nastase, Vivi, et autres
Publié: (2024)
Exploring syntactic information in sentence embeddings through multilingual subject-verb agreement
par: Nastase, Vivi, et autres
Publié: (2024)
par: Nastase, Vivi, et autres
Publié: (2024)
MRL Parsing Without Tears: The Case of Hebrew
par: Shmidman, Shaltiel, et autres
Publié: (2024)
par: Shmidman, Shaltiel, et autres
Publié: (2024)
Tokenization Strategies for Low-Resource Agglutinative Languages in Word2Vec: Case Study on Turkish and Finnish
par: Hu, Jinfan Frank
Publié: (2025)
par: Hu, Jinfan Frank
Publié: (2025)
Analogical Structure, Minimal Contextual Cues and Contrastive Distractors: Input Design for Sample-Efficient Linguistic Rule Induction
par: Jiang, Chunyang, et autres
Publié: (2025)
par: Jiang, Chunyang, et autres
Publié: (2025)
HeceTokenizer: A Syllable-Based Tokenization Approach for Turkish Retrieval
par: Gulgonul, Senol
Publié: (2026)
par: Gulgonul, Senol
Publié: (2026)
Paradigm Completion for Derivational Morphology
par: Cotterell, Ryan, et autres
Publié: (2017)
par: Cotterell, Ryan, et autres
Publié: (2017)
Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text
par: Greenfeld, Refael Shaked, et autres
Publié: (2026)
par: Greenfeld, Refael Shaked, et autres
Publié: (2026)
D-Nikud: Enhancing Hebrew Diacritization with LSTM and Pretrained Models
par: Rosenthal, Adi, et autres
Publié: (2024)
par: Rosenthal, Adi, et autres
Publié: (2024)
Benchmarking Procedural Language Understanding for Low-Resource Languages: A Case Study on Turkish
par: Uzunoglu, Arda, et autres
Publié: (2023)
par: Uzunoglu, Arda, et autres
Publié: (2023)
HEBATRON: A Hebrew-Specialized Open-Weight Mixture-of-Experts Language Model
par: Kayzer, Noam, et autres
Publié: (2026)
par: Kayzer, Noam, et autres
Publié: (2026)
Building Patient Journeys in Hebrew: A Language Model for Clinical Timeline Extraction
par: Hashiloni, Kai Golan, et autres
Publié: (2025)
par: Hashiloni, Kai Golan, et autres
Publié: (2025)
MenakBERT -- Hebrew Diacriticizer
par: Cohen, Ido, et autres
Publié: (2024)
par: Cohen, Ido, et autres
Publié: (2024)
Hebrew Diacritics Restoration using Visual Representation
par: Elboher, Yair, et autres
Publié: (2025)
par: Elboher, Yair, et autres
Publié: (2025)
Tracking linguistic information in transformer-based sentence embeddings through targeted sparsification
par: Nastase, Vivi, et autres
Publié: (2024)
par: Nastase, Vivi, et autres
Publié: (2024)
Are there identifiable structural parts in the sentence embedding whole?
par: Nastase, Vivi, et autres
Publié: (2024)
par: Nastase, Vivi, et autres
Publié: (2024)
Testing the assumptions about the geometry of sentence embedding spaces: the cosine measure need not apply
par: Nastase, Vivi, et autres
Publié: (2025)
par: Nastase, Vivi, et autres
Publié: (2025)
Knesset-DictaBERT: A Hebrew Language Model for Parliamentary Proceedings
par: Goldin, Gili, et autres
Publié: (2024)
par: Goldin, Gili, et autres
Publié: (2024)
Do Pretrained Contextual Language Models Distinguish between Hebrew Homograph Analyses?
par: Shmidman, Avi, et autres
Publié: (2024)
par: Shmidman, Avi, et autres
Publié: (2024)
JudgeMeNot: Personalizing Large Language Models to Emulate Judicial Reasoning in Hebrew
par: Razumenko, Itay, et autres
Publié: (2026)
par: Razumenko, Itay, et autres
Publié: (2026)
Tokens with Meaning: A Hybrid Tokenization Approach for Turkish
par: Bayram, M. Ali, et autres
Publié: (2025)
par: Bayram, M. Ali, et autres
Publié: (2025)
Evaluating the Quality of Benchmark Datasets for Low-Resource Languages: A Case Study on Turkish
par: Cengiz, Ayşe Aysu, et autres
Publié: (2025)
par: Cengiz, Ayşe Aysu, et autres
Publié: (2025)
Unsupervised Morphological Tree Tokenizer
par: Zhu, Qingyang, et autres
Publié: (2024)
par: Zhu, Qingyang, et autres
Publié: (2024)
Evaluating Morphological Alignment of Tokenizers in 70 Languages
par: Arnett, Catherine, et autres
Publié: (2025)
par: Arnett, Catherine, et autres
Publié: (2025)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
par: Roth, Amit, et autres
Publié: (2024)
par: Roth, Amit, et autres
Publié: (2024)
Intertextual Parallel Detection in Biblical Hebrew: A Transformer-Based Benchmark
par: Smiley, David M.
Publié: (2025)
par: Smiley, David M.
Publié: (2025)
Cross-Lingual Learning vs. Low-Resource Fine-Tuning: A Case Study with Fact-Checking in Turkish
par: Cekinel, Recep Firat, et autres
Publié: (2024)
par: Cekinel, Recep Firat, et autres
Publié: (2024)
Can a Neural Model Guide Fieldwork? A Case Study on Morphological Data Collection
par: Mahmudi, Aso, et autres
Publié: (2024)
par: Mahmudi, Aso, et autres
Publié: (2024)
NeoDictaBERT: Pushing the Frontier of BERT models for Hebrew
par: Shmidman, Shaltiel, et autres
Publié: (2025)
par: Shmidman, Shaltiel, et autres
Publié: (2025)
Turkish Delights: a Dataset on Turkish Euphemisms
par: Biyik, Hasan Can, et autres
Publié: (2024)
par: Biyik, Hasan Can, et autres
Publié: (2024)
Morphologically-Informed Tokenizers for Languages with Non-Concatenative Morphology: A case study of Yoloxóchtil Mixtec ASR
par: Crawford, Chris
Publié: (2025)
par: Crawford, Chris
Publié: (2025)
MorphTok: Morphologically Grounded Tokenization for Indian Languages
par: Brahma, Maharaj, et autres
Publié: (2025)
par: Brahma, Maharaj, et autres
Publié: (2025)
In-Context Learning on a Budget: A Case Study in Token Classification
par: Berger, Uri, et autres
Publié: (2024)
par: Berger, Uri, et autres
Publié: (2024)
Tokenization and Morphological Fidelity in Uralic NLP: A Cross-Lingual Evaluation
par: Xu, Nuo, et autres
Publié: (2026)
par: Xu, Nuo, et autres
Publié: (2026)
Optimal Turkish Subword Strategies at Scale: Systematic Evaluation of Data, Vocabulary, Morphology Interplay
par: Altinok, Duygu
Publié: (2026)
par: Altinok, Duygu
Publié: (2026)
Dicta-LM 3.0: Advancing The Frontier of Hebrew Sovereign LLMs
par: Shmidman, Shaltiel, et autres
Publié: (2026)
par: Shmidman, Shaltiel, et autres
Publié: (2026)
HebID: Detecting Social Identities in Hebrew-language Political Text
par: Mor-Lan, Guy, et autres
Publié: (2025)
par: Mor-Lan, Guy, et autres
Publié: (2025)
Documents similaires
-
Comparing Natural and Synthetic Structured Data: A Study of the Passive Verb Alternation in French and Italian
par: Samo, Giuseppe, et autres
Publié: (2026) -
Datasets for Verb Alternations across Languages: BLM Templates and Data Augmentation Strategies
par: Samo, Giuseppe, et autres
Publié: (2026) -
Blackbird Language Matrices: A Framework to Investigate the Linguistic Competence of Language Models
par: Merlo, Paola, et autres
Publié: (2026) -
Exploring Italian sentence embeddings properties through multi-tasking
par: Nastase, Vivi, et autres
Publié: (2024) -
Exploring syntactic information in sentence embeddings through multilingual subject-verb agreement
par: Nastase, Vivi, et autres
Publié: (2024)