SubRegWeigh: Effective and Efficient Annotation Weighing with Subword Regularization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tsuji, Kohei, Hiraoka, Tatsuya, Cheng, Yuchang, Iwakura, Tomoya |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Investigating Neurons and Heads in Transformer-based LLMs for Typographical Errors
par: Tsuji, Kohei, et autres
Publié: (2025)
par: Tsuji, Kohei, et autres
Publié: (2025)
Tokenization Preference for Human and Machine Learning Model: An Annotation Study
par: Hiraoka, Tatsuya, et autres
Publié: (2023)
par: Hiraoka, Tatsuya, et autres
Publié: (2023)
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
par: Atuhurra, Jesse, et autres
Publié: (2025)
par: Atuhurra, Jesse, et autres
Publié: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024)
par: Atuhurra, Jesse, et autres
Publié: (2024)
Distributional Properties of Subword Regularization
par: Cognetta, Marco, et autres
Publié: (2024)
par: Cognetta, Marco, et autres
Publié: (2024)
Weighing Obese Timed Languages
par: Asarin, Eugene, et autres
Publié: (2025)
par: Asarin, Eugene, et autres
Publié: (2025)
Repetition Neurons: How Do Language Models Produce Repetitions?
par: Hiraoka, Tatsuya, et autres
Publié: (2024)
par: Hiraoka, Tatsuya, et autres
Publié: (2024)
Knowledge of Pretrained Language Models on Surface Information of Tokens
par: Hiraoka, Tatsuya, et autres
Publié: (2024)
par: Hiraoka, Tatsuya, et autres
Publié: (2024)
Spelling-out is not Straightforward: LLMs' Capability of Tokenization from Token to Characters
par: Hiraoka, Tatsuya, et autres
Publié: (2025)
par: Hiraoka, Tatsuya, et autres
Publié: (2025)
MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models
par: Su, Zhenpeng, et autres
Publié: (2023)
par: Su, Zhenpeng, et autres
Publié: (2023)
Bit-level BPE: Below the byte boundary
par: Moon, Sangwhan, et autres
Publié: (2025)
par: Moon, Sangwhan, et autres
Publié: (2025)
ByteSpan: Information-Driven Subword Tokenisation
par: Goriely, Zébulon, et autres
Publié: (2025)
par: Goriely, Zébulon, et autres
Publié: (2025)
Understanding and Controlling Repetition Neurons and Induction Heads in In-Context Learning
par: Doan, Nhi Hoai, et autres
Publié: (2025)
par: Doan, Nhi Hoai, et autres
Publié: (2025)
Weighing the curvature invariants
par: Dragašević, Jan, et autres
Publié: (2025)
par: Dragašević, Jan, et autres
Publié: (2025)
Weighing In on IP2.
par: Johnson, Doug, et autres
Publié: (1999)
par: Johnson, Doug, et autres
Publié: (1999)
Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge
par: Batsuren, Khuyagbaatar, et autres
Publié: (2024)
par: Batsuren, Khuyagbaatar, et autres
Publié: (2024)
Lexically Grounded Subword Segmentation
par: Libovický, Jindřich, et autres
Publié: (2024)
par: Libovický, Jindřich, et autres
Publié: (2024)
Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP
par: Visser, Ruan, et autres
Publié: (2026)
par: Visser, Ruan, et autres
Publié: (2026)
Subword Tokenization Strategies for Kurdish Word Embeddings
par: Salehi, Ali, et autres
Publié: (2025)
par: Salehi, Ali, et autres
Publié: (2025)
Improving Named Entity Extraction Accuracy using Unlabeled Data and Several Extractors
par: Tomoya Iwakura
Publié: (2009)
par: Tomoya Iwakura
Publié: (2009)
loppe35/PowderDispensing_and_Weighing_Module: PowderDispensing and Weighing Module Initial Release
par: Louie Lucas Bisgaard Nyeland, et autres
Publié: (2025)
par: Louie Lucas Bisgaard Nyeland, et autres
Publié: (2025)
SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization
par: Sun, Yan, et autres
Publié: (2026)
par: Sun, Yan, et autres
Publié: (2026)
An Analysis of BPE Vocabulary Trimming in Neural Machine Translation
par: Cognetta, Marco, et autres
Publié: (2024)
par: Cognetta, Marco, et autres
Publié: (2024)
Morphological Typology in BPE Subword Productivity and Language Modeling
par: Parra, Iñigo
Publié: (2024)
par: Parra, Iñigo
Publié: (2024)
Subword models struggle with word learning, but surprisal hides it
par: Bunzeck, Bastian, et autres
Publié: (2025)
par: Bunzeck, Bastian, et autres
Publié: (2025)
The Learning Dynamics of Subword Segmentation for Morphologically Diverse Languages
par: Meyer, Francois, et autres
Publié: (2025)
par: Meyer, Francois, et autres
Publié: (2025)
The App Squad: SLJ's Advisors Weigh in on Kids' Book Apps
par: Ishizuka, Kathy
Publié: (2011)
par: Ishizuka, Kathy
Publié: (2011)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
par: Liu, Yihong, et autres
Publié: (2023)
par: Liu, Yihong, et autres
Publié: (2023)
Learning Mutually Informed Representations for Characters and Subwords
par: Wang, Yilin, et autres
Publié: (2023)
par: Wang, Yilin, et autres
Publié: (2023)
Stolen Subwords: Importance of Vocabularies for Machine Translation Model Stealing
par: Zouhar, Vilém
Publié: (2024)
par: Zouhar, Vilém
Publié: (2024)
Tokenization Falling Short: On Subword Robustness in Large Language Models
par: Chai, Yekun, et autres
Publié: (2024)
par: Chai, Yekun, et autres
Publié: (2024)
StochasTok: Improving Fine-Grained Subword Understanding in LLMs
par: Sims, Anya, et autres
Publié: (2025)
par: Sims, Anya, et autres
Publié: (2025)
Weighing the mass of LHS 3844 b
par: Hacker, Alejandro, et autres
Publié: (2026)
par: Hacker, Alejandro, et autres
Publié: (2026)
FLIP: Flowability-Informed Powder Weighing
par: Radulov, Nikola, et autres
Publié: (2025)
par: Radulov, Nikola, et autres
Publié: (2025)
Weighing neutrinos with Lyman-$α$ observations
par: Sarkar, Anjan K., et autres
Publié: (2023)
par: Sarkar, Anjan K., et autres
Publié: (2023)
A Systematic Analysis of Subwords and Cross-Lingual Transfer in Multilingual Translation
par: Meyer, Francois, et autres
Publié: (2024)
par: Meyer, Francois, et autres
Publié: (2024)
A Subword Embedding Approach for Variation Detection in Luxembourgish User Comments
par: Lutgen, Anne-Marie, et autres
Publié: (2026)
par: Lutgen, Anne-Marie, et autres
Publié: (2026)
Assessing the Importance of Frequency versus Compositionality for Subword-based Tokenization in NMT
par: Wolleb, Benoist, et autres
Publié: (2023)
par: Wolleb, Benoist, et autres
Publié: (2023)
Token Alignment via Character Matching for Subword Completion
par: Athiwaratkun, Ben, et autres
Publié: (2024)
par: Athiwaratkun, Ben, et autres
Publié: (2024)
TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization
par: Fu, Lucheng, et autres
Publié: (2026)
par: Fu, Lucheng, et autres
Publié: (2026)
Documents similaires
-
Investigating Neurons and Heads in Transformer-based LLMs for Typographical Errors
par: Tsuji, Kohei, et autres
Publié: (2025) -
Tokenization Preference for Human and Machine Learning Model: An Annotation Study
par: Hiraoka, Tatsuya, et autres
Publié: (2023) -
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
par: Atuhurra, Jesse, et autres
Publié: (2025) -
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024) -
Distributional Properties of Subword Regularization
par: Cognetta, Marco, et autres
Publié: (2024)