ByteSpan: Information-Driven Subword Tokenisation
Fuente:
arXiv
Salvato in:
| Autori principali: | Goriely, Zébulon, Salhan, Suchir, Lesci, Pietro, Cheng, Julius, Buttery, Paula |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
What is the Best Sequence Length for BABYLM?
di: Salhan, Suchir, et al.
Pubblicazione: (2025)
di: Salhan, Suchir, et al.
Pubblicazione: (2025)
Less is More: Pre-Training Cross-Lingual Small-Scale Language Models with Cognitively-Plausible Curriculum Learning Strategies
di: Salhan, Suchir, et al.
Pubblicazione: (2024)
di: Salhan, Suchir, et al.
Pubblicazione: (2024)
IPA-CHILDES & G2P+: Feature-Rich Resources for Cross-Lingual Phonology and Phonemic Language Modeling
di: Goriely, Zébulon, et al.
Pubblicazione: (2025)
di: Goriely, Zébulon, et al.
Pubblicazione: (2025)
BabyLM's First Words: Word Segmentation as a Phonological Probing Task
di: Goriely, Zébulon, et al.
Pubblicazione: (2025)
di: Goriely, Zébulon, et al.
Pubblicazione: (2025)
BLiSS 1.0: Evaluating Bilingual Learner Competence in Second Language Small Language Models
di: Gao, Yuan, et al.
Pubblicazione: (2025)
di: Gao, Yuan, et al.
Pubblicazione: (2025)
Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling
di: Ganescu, Bianca-Mihaela, et al.
Pubblicazione: (2025)
di: Ganescu, Bianca-Mihaela, et al.
Pubblicazione: (2025)
Mitigating Frequency Bias and Anisotropy in Language Model Pre-Training with Syntactic Smoothing
di: Martinez, Richard Diehl, et al.
Pubblicazione: (2024)
di: Martinez, Richard Diehl, et al.
Pubblicazione: (2024)
From Babble to Words: Pre-Training Language Models on Continuous Streams of Phonemes
di: Goriely, Zébulon, et al.
Pubblicazione: (2024)
di: Goriely, Zébulon, et al.
Pubblicazione: (2024)
Pico: A Modular Framework for Hypothesis-Driven Small Language Model Research
di: Martinez, Richard Diehl, et al.
Pubblicazione: (2025)
di: Martinez, Richard Diehl, et al.
Pubblicazione: (2025)
Meta-Pretraining for Zero-Shot Cross-Lingual Named Entity Recognition in Low-Resource Philippine Languages
di: Africa, David Demitri, et al.
Pubblicazione: (2025)
di: Africa, David Demitri, et al.
Pubblicazione: (2025)
Tending Towards Stability: Convergence Challenges in Small Language Models
di: Martinez, Richard Diehl, et al.
Pubblicazione: (2024)
di: Martinez, Richard Diehl, et al.
Pubblicazione: (2024)
Causal Estimation of Tokenisation Bias
di: Lesci, Pietro, et al.
Pubblicazione: (2025)
di: Lesci, Pietro, et al.
Pubblicazione: (2025)
The Distribution of Phoneme Frequencies across the World's Languages: Macroscopic and Microscopic Information-Theoretic Models
di: Martín, Fermín Moscoso del Prado, et al.
Pubblicazione: (2026)
di: Martín, Fermín Moscoso del Prado, et al.
Pubblicazione: (2026)
A Computational Operationalisation of Competing Maturational Theories of Syntactic Development via Statistical Grammar Induction
di: Marcheva, Mila, et al.
Pubblicazione: (2026)
di: Marcheva, Mila, et al.
Pubblicazione: (2026)
Teacher Demonstrations in a BabyLM's Zone of Proximal Development for Contingent Multi-Turn Interaction
di: Salhan, Suchir, et al.
Pubblicazione: (2025)
di: Salhan, Suchir, et al.
Pubblicazione: (2025)
Modelling the Diachronic Emergence of Phoneme Frequency Distributions
di: Martín, Fermín Moscoso del Prado, et al.
Pubblicazione: (2026)
di: Martín, Fermín Moscoso del Prado, et al.
Pubblicazione: (2026)
Stochasticity in Tokenisation Improves Robustness
di: Steger, Sophie, et al.
Pubblicazione: (2026)
di: Steger, Sophie, et al.
Pubblicazione: (2026)
Tokenisation is NP-Complete
di: Whittington, Philip, et al.
Pubblicazione: (2024)
di: Whittington, Philip, et al.
Pubblicazione: (2024)
Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation
di: Gigant, Théo, et al.
Pubblicazione: (2026)
di: Gigant, Théo, et al.
Pubblicazione: (2026)
Tokenisation via Convex Relaxations
di: Tempus, Jan, et al.
Pubblicazione: (2026)
di: Tempus, Jan, et al.
Pubblicazione: (2026)
AnchorAL: Computationally Efficient Active Learning for Large and Imbalanced Datasets
di: Lesci, Pietro, et al.
Pubblicazione: (2024)
di: Lesci, Pietro, et al.
Pubblicazione: (2024)
Tokenisation over Bounded Alphabets is Hard
di: Kastreva, Violeta, et al.
Pubblicazione: (2025)
di: Kastreva, Violeta, et al.
Pubblicazione: (2025)
Bias Dynamics in BabyLMs: Towards a Compute-Efficient Sandbox for Democratising Pre-Training Debiasing
di: Trhlik, Filip, et al.
Pubblicazione: (2026)
di: Trhlik, Filip, et al.
Pubblicazione: (2026)
Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge
di: Batsuren, Khuyagbaatar, et al.
Pubblicazione: (2024)
di: Batsuren, Khuyagbaatar, et al.
Pubblicazione: (2024)
Distributional Properties of Subword Regularization
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
Lexically Grounded Subword Segmentation
di: Libovický, Jindřich, et al.
Pubblicazione: (2024)
di: Libovický, Jindřich, et al.
Pubblicazione: (2024)
SubRegWeigh: Effective and Efficient Annotation Weighing with Subword Regularization
di: Tsuji, Kohei, et al.
Pubblicazione: (2024)
di: Tsuji, Kohei, et al.
Pubblicazione: (2024)
BabyLM Turns 4 and Goes Multilingual: Call for Papers for the 2026 BabyLM Workshop
di: Choshen, Leshem, et al.
Pubblicazione: (2026)
di: Choshen, Leshem, et al.
Pubblicazione: (2026)
What Language is This? Ask Your Tokenizer
di: Meister, Clara, et al.
Pubblicazione: (2026)
di: Meister, Clara, et al.
Pubblicazione: (2026)
Subword Tokenization Strategies for Kurdish Word Embeddings
di: Salehi, Ali, et al.
Pubblicazione: (2025)
di: Salehi, Ali, et al.
Pubblicazione: (2025)
Subword models struggle with word learning, but surprisal hides it
di: Bunzeck, Bastian, et al.
Pubblicazione: (2025)
di: Bunzeck, Bastian, et al.
Pubblicazione: (2025)
The Learning Dynamics of Subword Segmentation for Morphologically Diverse Languages
di: Meyer, Francois, et al.
Pubblicazione: (2025)
di: Meyer, Francois, et al.
Pubblicazione: (2025)
Morphological Typology in BPE Subword Productivity and Language Modeling
di: Parra, Iñigo
Pubblicazione: (2024)
di: Parra, Iñigo
Pubblicazione: (2024)
What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?
di: Bhatia, Gagan, et al.
Pubblicazione: (2026)
di: Bhatia, Gagan, et al.
Pubblicazione: (2026)
Entropy-Driven Pre-Tokenization for Byte-Pair Encoding
di: Hu, Yifan, et al.
Pubblicazione: (2025)
di: Hu, Yifan, et al.
Pubblicazione: (2025)
Learning Mutually Informed Representations for Characters and Subwords
di: Wang, Yilin, et al.
Pubblicazione: (2023)
di: Wang, Yilin, et al.
Pubblicazione: (2023)
StochasTok: Improving Fine-Grained Subword Understanding in LLMs
di: Sims, Anya, et al.
Pubblicazione: (2025)
di: Sims, Anya, et al.
Pubblicazione: (2025)
Stolen Subwords: Importance of Vocabularies for Machine Translation Model Stealing
di: Zouhar, Vilém
Pubblicazione: (2024)
di: Zouhar, Vilém
Pubblicazione: (2024)
Tokenization Falling Short: On Subword Robustness in Large Language Models
di: Chai, Yekun, et al.
Pubblicazione: (2024)
di: Chai, Yekun, et al.
Pubblicazione: (2024)
Learning Dynamics of Meta-Learning in Small Model Pretraining
di: Africa, David Demitri, et al.
Pubblicazione: (2025)
di: Africa, David Demitri, et al.
Pubblicazione: (2025)
Documenti analoghi
-
What is the Best Sequence Length for BABYLM?
di: Salhan, Suchir, et al.
Pubblicazione: (2025) -
Less is More: Pre-Training Cross-Lingual Small-Scale Language Models with Cognitively-Plausible Curriculum Learning Strategies
di: Salhan, Suchir, et al.
Pubblicazione: (2024) -
IPA-CHILDES & G2P+: Feature-Rich Resources for Cross-Lingual Phonology and Phonemic Language Modeling
di: Goriely, Zébulon, et al.
Pubblicazione: (2025) -
BabyLM's First Words: Word Segmentation as a Phonological Probing Task
di: Goriely, Zébulon, et al.
Pubblicazione: (2025) -
BLiSS 1.0: Evaluating Bilingual Learner Competence in Second Language Small Language Models
di: Gao, Yuan, et al.
Pubblicazione: (2025)