Bolmo: Byteifying the Next Generation of Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Minixhofer, Benjamin, Murray, Tyler, Limisiewicz, Tomasz, Korhonen, Anna, Zettlemoyer, Luke, Smith, Noah A., Ponti, Edoardo M., Soldaini, Luca, Hofmann, Valentin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Breaking the Curse of Multilinguality with Cross-lingual Expert Language Models
di: Blevins, Terra, et al.
Pubblicazione: (2024)
di: Blevins, Terra, et al.
Pubblicazione: (2024)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024)
Zero-Shot Tokenizer Transfer
di: Minixhofer, Benjamin, et al.
Pubblicazione: (2024)
di: Minixhofer, Benjamin, et al.
Pubblicazione: (2024)
Universal Cross-Tokenizer Distillation via Approximate Likelihood Matching
di: Minixhofer, Benjamin, et al.
Pubblicazione: (2025)
di: Minixhofer, Benjamin, et al.
Pubblicazione: (2025)
MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization
di: Ahia, Orevaoghene, et al.
Pubblicazione: (2024)
di: Ahia, Orevaoghene, et al.
Pubblicazione: (2024)
Scaling Sparse Fine-Tuning to Large Language Models
di: Ansell, Alan, et al.
Pubblicazione: (2024)
di: Ansell, Alan, et al.
Pubblicazione: (2024)
Dual Debiasing: Remove Stereotypes and Keep Factual Gender for Fair Language Modeling and Translation
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2025)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2025)
Demystifying Prompts in Language Models via Perplexity Estimation
di: Gonen, Hila, et al.
Pubblicazione: (2022)
di: Gonen, Hila, et al.
Pubblicazione: (2022)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
Emergent Communication Pretraining for Few-Shot Machine Translation
di: Li, Yaoyiran, et al.
Pubblicazione: (2020)
di: Li, Yaoyiran, et al.
Pubblicazione: (2020)
Does Liking Yellow Imply Driving a School Bus? Semantic Leakage in Language Models
di: Gonen, Hila, et al.
Pubblicazione: (2024)
di: Gonen, Hila, et al.
Pubblicazione: (2024)
Spectral Editing of Activations for Large Language Model Alignment
di: Qiu, Yifu, et al.
Pubblicazione: (2024)
di: Qiu, Yifu, et al.
Pubblicazione: (2024)
Retrofitting Large Language Models with Dynamic Tokenization
di: Feher, Darius, et al.
Pubblicazione: (2024)
di: Feher, Darius, et al.
Pubblicazione: (2024)
Debiasing Algorithm through Model Adaptation
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)
Fast Byte Latent Transformer
di: Kallini, Julie, et al.
Pubblicazione: (2026)
di: Kallini, Julie, et al.
Pubblicazione: (2026)
Compute Optimal Tokenization
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2026)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2026)
Beyond Literal Token Overlap: Token Alignability for Multilinguality
di: Hämmerl, Katharina, et al.
Pubblicazione: (2025)
di: Hämmerl, Katharina, et al.
Pubblicazione: (2025)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
di: Min, Sewon, et al.
Pubblicazione: (2023)
di: Min, Sewon, et al.
Pubblicazione: (2023)
Evaluating Copyright Takedown Methods for Language Models
di: Wei, Boyi, et al.
Pubblicazione: (2024)
di: Wei, Boyi, et al.
Pubblicazione: (2024)
Bigram Subnetworks: Mapping to Next Tokens in Transformer Language Models
di: Chang, Tyler A., et al.
Pubblicazione: (2025)
di: Chang, Tyler A., et al.
Pubblicazione: (2025)
Self-Improving World Modelling with Latent Actions
di: Qiu, Yifu, et al.
Pubblicazione: (2026)
di: Qiu, Yifu, et al.
Pubblicazione: (2026)
Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
Quantifying Language Disparities in Multilingual Large Language Models
di: Hu, Songbo, et al.
Pubblicazione: (2025)
di: Hu, Songbo, et al.
Pubblicazione: (2025)
Fine-tuning Large Language Models with Sequential Instructions
di: Hu, Hanxu, et al.
Pubblicazione: (2024)
di: Hu, Hanxu, et al.
Pubblicazione: (2024)
Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation
di: Miranda, Lester James V., et al.
Pubblicazione: (2026)
di: Miranda, Lester James V., et al.
Pubblicazione: (2026)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2024)
di: Hu, Yushi, et al.
Pubblicazione: (2024)
Comparing Hallucination Detection Metrics for Multilingual Generation
di: Kang, Haoqiang, et al.
Pubblicazione: (2024)
di: Kang, Haoqiang, et al.
Pubblicazione: (2024)
Cross-Lingual and Cross-Cultural Variation in Image Descriptions
di: Berger, Uri, et al.
Pubblicazione: (2024)
di: Berger, Uri, et al.
Pubblicazione: (2024)
MUSE: Machine Unlearning Six-Way Evaluation for Language Models
di: Shi, Weijia, et al.
Pubblicazione: (2024)
di: Shi, Weijia, et al.
Pubblicazione: (2024)
Analyzing and Adapting Large Language Models for Few-Shot Multilingual NLU: Are We There Yet?
di: Razumovskaia, Evgeniia, et al.
Pubblicazione: (2024)
di: Razumovskaia, Evgeniia, et al.
Pubblicazione: (2024)
Cultural Learning-Based Culture Adaptation of Language Models
di: Liu, Chen Cecilia, et al.
Pubblicazione: (2025)
di: Liu, Chen Cecilia, et al.
Pubblicazione: (2025)
Teaching Models to Understand (but not Generate) High-risk Data
di: Wang, Ryan, et al.
Pubblicazione: (2025)
di: Wang, Ryan, et al.
Pubblicazione: (2025)
SuperBPE: Space Travel for Language Models
di: Liu, Alisa, et al.
Pubblicazione: (2025)
di: Liu, Alisa, et al.
Pubblicazione: (2025)
Micro Language Models Enable Instant Responses
di: Cheng, Wen, et al.
Pubblicazione: (2026)
di: Cheng, Wen, et al.
Pubblicazione: (2026)
Generative Adapter: Contextualizing Language Models in Parameters with A Single Forward Pass
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
On Bilingual Lexicon Induction with Large Language Models
di: Li, Yaoyiran, et al.
Pubblicazione: (2023)
di: Li, Yaoyiran, et al.
Pubblicazione: (2023)
Paloma: A Benchmark for Evaluating Language Model Fit
di: Magnusson, Ian, et al.
Pubblicazione: (2023)
di: Magnusson, Ian, et al.
Pubblicazione: (2023)
Mathfish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula
di: Lucy, Li, et al.
Pubblicazione: (2024)
di: Lucy, Li, et al.
Pubblicazione: (2024)
FlexOlmo: Open Language Models for Flexible Data Use
di: Shi, Weijia, et al.
Pubblicazione: (2025)
di: Shi, Weijia, et al.
Pubblicazione: (2025)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Breaking the Curse of Multilinguality with Cross-lingual Expert Language Models
di: Blevins, Terra, et al.
Pubblicazione: (2024) -
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024) -
Zero-Shot Tokenizer Transfer
di: Minixhofer, Benjamin, et al.
Pubblicazione: (2024) -
Universal Cross-Tokenizer Distillation via Approximate Likelihood Matching
di: Minixhofer, Benjamin, et al.
Pubblicazione: (2025) -
MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization
di: Ahia, Orevaoghene, et al.
Pubblicazione: (2024)