ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Chunyuan, Lokegaonkar, Sanket, Lockard, Colin, Fetahu, Besnik, Zalmout, Nasser, Li, Xian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Train a Unified Multimodal Data Quality Classifier with Synthetic Data
par: Wang, Weizhi, et autres
Publié: (2025)
par: Wang, Weizhi, et autres
Publié: (2025)
DocTalk: Scalable Graph-based Dialogue Synthesis for Enhancing LLM Conversational Capabilities
par: Lee, Jing Yang, et autres
Publié: (2025)
par: Lee, Jing Yang, et autres
Publié: (2025)
MambaByte: Token-free Selective State Space Model
par: Wang, Junxiong, et autres
Publié: (2024)
par: Wang, Junxiong, et autres
Publié: (2024)
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
par: Slagle, Kevin
Publié: (2024)
par: Slagle, Kevin
Publié: (2024)
Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles
par: Phan, Buu, et autres
Publié: (2024)
par: Phan, Buu, et autres
Publié: (2024)
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
par: Kallini, Julie, et autres
Publié: (2024)
par: Kallini, Julie, et autres
Publié: (2024)
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
par: Zhuang, Yuchen, et autres
Publié: (2025)
par: Zhuang, Yuchen, et autres
Publié: (2025)
Language Models over Canonical Byte-Pair Encodings
par: Vieira, Tim, et autres
Publié: (2025)
par: Vieira, Tim, et autres
Publié: (2025)
Byte-token Enhanced Language Models for Temporal Point Processes Analysis
par: Kong, Quyu, et autres
Publié: (2025)
par: Kong, Quyu, et autres
Publié: (2025)
Sampling from Your Language Model One Byte at a Time
par: Hayase, Jonathan, et autres
Publié: (2025)
par: Hayase, Jonathan, et autres
Publié: (2025)
Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models
par: Shravan, Rohan
Publié: (2026)
par: Shravan, Rohan
Publié: (2026)
GPUTOK: GPU Accelerated Byte Level BPE Tokenization
par: Kadamba, Venu Gopal, et autres
Publié: (2026)
par: Kadamba, Venu Gopal, et autres
Publié: (2026)
Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
par: Foroutan, Negar, et autres
Publié: (2025)
par: Foroutan, Negar, et autres
Publié: (2025)
Fast Byte Latent Transformer
par: Kallini, Julie, et autres
Publié: (2026)
par: Kallini, Julie, et autres
Publié: (2026)
Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models
par: Zheng, Lin, et autres
Publié: (2026)
par: Zheng, Lin, et autres
Publié: (2026)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
par: Limisiewicz, Tomasz, et autres
Publié: (2024)
par: Limisiewicz, Tomasz, et autres
Publié: (2024)
Spherical Steering: Geometry-Aware Activation Rotation for Language Models
par: You, Zejia, et autres
Publié: (2026)
par: You, Zejia, et autres
Publié: (2026)
Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling
par: Egli, Eric, et autres
Publié: (2025)
par: Egli, Eric, et autres
Publié: (2025)
Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models
par: Neitemeier, Pit, et autres
Publié: (2025)
par: Neitemeier, Pit, et autres
Publié: (2025)
Specialising and Analysing Instruction-Tuned and Byte-Level Language Models for Organic Reaction Prediction
par: Pang, Jiayun, et autres
Publié: (2024)
par: Pang, Jiayun, et autres
Publié: (2024)
Language Models are Symbolic Learners in Arithmetic
par: Deng, Chunyuan, et autres
Publié: (2024)
par: Deng, Chunyuan, et autres
Publié: (2024)
From Bytes to Borsch: Fine-Tuning Gemma and Mistral for the Ukrainian Language Representation
par: Kiulian, Artur, et autres
Publié: (2024)
par: Kiulian, Artur, et autres
Publié: (2024)
ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning
par: Liu, Yongkang, et autres
Publié: (2026)
par: Liu, Yongkang, et autres
Publié: (2026)
HoloByte: Continuous Hyperspherical Distillation for Tokenizer-Free Modeling
par: Khasia, Vladimer
Publié: (2026)
par: Khasia, Vladimer
Publié: (2026)
ByteGen: A Tokenizer-Free Generative Model for Orderbook Events in Byte Space
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
par: Lan, Guangchen, et autres
Publié: (2026)
par: Lan, Guangchen, et autres
Publié: (2026)
Controllable Decontextualization of Yes/No Question and Answers into Factual Statements
par: Mo, Lingbo, et autres
Publié: (2024)
par: Mo, Lingbo, et autres
Publié: (2024)
From Bytes to Biases: Investigating the Cultural Self-Perception of Large Language Models
par: Messner, Wolfgang, et autres
Publié: (2023)
par: Messner, Wolfgang, et autres
Publié: (2023)
Beyond Language Models: Byte Models are Digital World Simulators
par: Wu, Shangda, et autres
Publié: (2024)
par: Wu, Shangda, et autres
Publié: (2024)
The Efficiency Gap in Byte Modeling
par: Lee, Celine, et autres
Publié: (2026)
par: Lee, Celine, et autres
Publié: (2026)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
par: Zhu, Mingcheng, et autres
Publié: (2026)
par: Zhu, Mingcheng, et autres
Publié: (2026)
Identifying High Consideration E-Commerce Search Queries
par: Chen, Zhiyu, et autres
Publié: (2024)
par: Chen, Zhiyu, et autres
Publié: (2024)
ProgGen: Generating Named Entity Recognition Datasets Step-by-step with Self-Reflexive Large Language Models
par: Heng, Yuzhao, et autres
Publié: (2024)
par: Heng, Yuzhao, et autres
Publié: (2024)
Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
par: Li, Xintong, et autres
Publié: (2026)
par: Li, Xintong, et autres
Publié: (2026)
MambaNetBurst: Direct Byte-level Network Traffic Classification without Tokenization or Pretraining
par: Kulatilleke, Gayan K., et autres
Publié: (2026)
par: Kulatilleke, Gayan K., et autres
Publié: (2026)
Topic Modeling in Marathi
par: Shinde, Sanket, et autres
Publié: (2025)
par: Shinde, Sanket, et autres
Publié: (2025)
zip2zip: Inference-Time Adaptive Tokenization via Online Compression
par: Geng, Saibo, et autres
Publié: (2025)
par: Geng, Saibo, et autres
Publié: (2025)
Distilling Token-Trained Models into Byte-Level Models
par: Bao, Zishuo, et autres
Publié: (2026)
par: Bao, Zishuo, et autres
Publié: (2026)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
par: Mao, Yu, et autres
Publié: (2025)
par: Mao, Yu, et autres
Publié: (2025)
Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models
par: Deng, Difan, et autres
Publié: (2026)
par: Deng, Difan, et autres
Publié: (2026)
Documents similaires
-
Train a Unified Multimodal Data Quality Classifier with Synthetic Data
par: Wang, Weizhi, et autres
Publié: (2025) -
DocTalk: Scalable Graph-based Dialogue Synthesis for Enhancing LLM Conversational Capabilities
par: Lee, Jing Yang, et autres
Publié: (2025) -
MambaByte: Token-free Selective State Space Model
par: Wang, Junxiong, et autres
Publié: (2024) -
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
par: Slagle, Kevin
Publié: (2024) -
Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles
par: Phan, Buu, et autres
Publié: (2024)