Fast Byte Latent Transformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Kallini, Julie, Pagnoni, Artidoro, Limisiewicz, Tomasz, Ghosh, Gargi, Zettlemoyer, Luke, Potts, Christopher, Han, Xiaochuang, Iyer, Srinivasan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024)
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
di: Kallini, Julie, et al.
Pubblicazione: (2024)
di: Kallini, Julie, et al.
Pubblicazione: (2024)
Latent Speech-Text Transformer
di: Lu, Yen-Ju, et al.
Pubblicazione: (2025)
di: Lu, Yen-Ju, et al.
Pubblicazione: (2025)
Compute Optimal Tokenization
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2026)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2026)
Mission: Impossible Language Models
di: Kallini, Julie, et al.
Pubblicazione: (2024)
di: Kallini, Julie, et al.
Pubblicazione: (2024)
Byte Latent Transformer: Patches Scale Better Than Tokens
di: Pagnoni, Artidoro, et al.
Pubblicazione: (2024)
di: Pagnoni, Artidoro, et al.
Pubblicazione: (2024)
Debiasing Algorithm through Model Adaptation
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)
MoMa: Efficient Early-Fusion Pre-training with Mixture of Modality-Aware Experts
di: Lin, Xi Victoria, et al.
Pubblicazione: (2024)
di: Lin, Xi Victoria, et al.
Pubblicazione: (2024)
LMFusion: Adapting Pretrained Language Models for Multimodal Generation
di: Shi, Weijia, et al.
Pubblicazione: (2024)
di: Shi, Weijia, et al.
Pubblicazione: (2024)
Predicting vs. Acting: A Trade-off Between World Modeling & Agent Modeling
di: Li, Margaret, et al.
Pubblicazione: (2024)
di: Li, Margaret, et al.
Pubblicazione: (2024)
Text Quality-Based Pruning for Efficient Training of Language Models
di: Sharma, Vasu, et al.
Pubblicazione: (2024)
di: Sharma, Vasu, et al.
Pubblicazione: (2024)
(Mis)Fitting: A Survey of Scaling Laws
di: Li, Margaret, et al.
Pubblicazione: (2025)
di: Li, Margaret, et al.
Pubblicazione: (2025)
Language models as tools for investigating the distinction between possible and impossible natural languages
di: Kallini, Julie, et al.
Pubblicazione: (2025)
di: Kallini, Julie, et al.
Pubblicazione: (2025)
Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
Better Alignment with Instruction Back-and-Forth Translation
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
Dual Debiasing: Remove Stereotypes and Keep Factual Gender for Fair Language Modeling and Translation
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2025)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2025)
Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models
di: Neitemeier, Pit, et al.
Pubblicazione: (2025)
di: Neitemeier, Pit, et al.
Pubblicazione: (2025)
Fine-Tuning and Prompt Optimization: Two Great Steps that Work Better Together
di: Soylu, Dilara, et al.
Pubblicazione: (2024)
di: Soylu, Dilara, et al.
Pubblicazione: (2024)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
di: Min, Sewon, et al.
Pubblicazione: (2023)
di: Min, Sewon, et al.
Pubblicazione: (2023)
Reliable, Adaptable, and Attributable Language Models with Retrieval
di: Asai, Akari, et al.
Pubblicazione: (2024)
di: Asai, Akari, et al.
Pubblicazione: (2024)
NEAT: Concept driven Neuron Attribution in LLMs
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
Generative Adapter: Contextualizing Language Models in Parameters with A Single Forward Pass
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
Memory Layers at Scale
di: Berges, Vincent-Pierre, et al.
Pubblicazione: (2024)
di: Berges, Vincent-Pierre, et al.
Pubblicazione: (2024)
Synthetic Data for any Differentiable Target
di: Thrush, Tristan, et al.
Pubblicazione: (2026)
di: Thrush, Tristan, et al.
Pubblicazione: (2026)
Reasoning with Latent Thoughts: On the Power of Looped Transformers
di: Saunshi, Nikunj, et al.
Pubblicazione: (2025)
di: Saunshi, Nikunj, et al.
Pubblicazione: (2025)
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
Latent Concept Disentanglement in Transformer-based Language Models
di: Hong, Guan Zhe, et al.
Pubblicazione: (2025)
di: Hong, Guan Zhe, et al.
Pubblicazione: (2025)
Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
di: Lu, Wenquan, et al.
Pubblicazione: (2025)
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
di: Slagle, Kevin
Pubblicazione: (2024)
di: Slagle, Kevin
Pubblicazione: (2024)
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors
di: Huang, Jing, et al.
Pubblicazione: (2025)
di: Huang, Jing, et al.
Pubblicazione: (2025)
Steering LLMs for Formal Theorem Proving
di: Kirtania, Shashank, et al.
Pubblicazione: (2025)
di: Kirtania, Shashank, et al.
Pubblicazione: (2025)
s1: Simple test-time scaling
di: Muennighoff, Niklas, et al.
Pubblicazione: (2025)
di: Muennighoff, Niklas, et al.
Pubblicazione: (2025)
From Bytes to Borsch: Fine-Tuning Gemma and Mistral for the Ukrainian Language Representation
di: Kiulian, Artur, et al.
Pubblicazione: (2024)
di: Kiulian, Artur, et al.
Pubblicazione: (2024)
Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
Continual Learning via Sparse Memory Finetuning
di: Lin, Jessy, et al.
Pubblicazione: (2025)
di: Lin, Jessy, et al.
Pubblicazione: (2025)
Block Transformer: Global-to-Local Language Modeling for Fast Inference
di: Ho, Namgyu, et al.
Pubblicazione: (2024)
di: Ho, Namgyu, et al.
Pubblicazione: (2024)
ReFT: Representation Finetuning for Language Models
di: Wu, Zhengxuan, et al.
Pubblicazione: (2024)
di: Wu, Zhengxuan, et al.
Pubblicazione: (2024)
State Stream Transformer (SST) : Emergent Metacognitive Behaviours Through Latent State Persistence
di: Aviss, Thea
Pubblicazione: (2025)
di: Aviss, Thea
Pubblicazione: (2025)
HyperSteer: Activation Steering at Scale with Hypernetworks
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
di: Sun, Jiuding, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024) -
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
di: Kallini, Julie, et al.
Pubblicazione: (2024) -
Latent Speech-Text Transformer
di: Lu, Yen-Ju, et al.
Pubblicazione: (2025) -
Compute Optimal Tokenization
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2026) -
Mission: Impossible Language Models
di: Kallini, Julie, et al.
Pubblicazione: (2024)