Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Lin, Bashlovkina, Vasilisa, Dozat, Timothy, Garrette, Dan, Rimell, Laura, Maynez, Joshua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
di: Shao, Chenze, et al.
Pubblicazione: (2024)
di: Shao, Chenze, et al.
Pubblicazione: (2024)
Auto-Patching: Enhancing Multi-Hop Reasoning in Language Models
di: Jan, Aviv, et al.
Pubblicazione: (2025)
di: Jan, Aviv, et al.
Pubblicazione: (2025)
CausalEvolve: Towards Open-Ended Discovery with Causal Scratchpad
di: Chen, Yongqiang, et al.
Pubblicazione: (2026)
di: Chen, Yongqiang, et al.
Pubblicazione: (2026)
Attractor Patch Networks: Reducing Catastrophic Forgetting with Routed Low-Rank Patch Experts
di: Shashank
Pubblicazione: (2026)
di: Shashank
Pubblicazione: (2026)
Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles
di: Phan, Buu, et al.
Pubblicazione: (2024)
di: Phan, Buu, et al.
Pubblicazione: (2024)
Dissecting Persona-Driven Reasoning in Language Models via Activation Patching
di: Poonia, Ansh, et al.
Pubblicazione: (2025)
di: Poonia, Ansh, et al.
Pubblicazione: (2025)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
di: Zhang, Fred, et al.
Pubblicazione: (2023)
di: Zhang, Fred, et al.
Pubblicazione: (2023)
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
di: Liu, Xinyang, et al.
Pubblicazione: (2023)
di: Liu, Xinyang, et al.
Pubblicazione: (2023)
ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
di: Deng, Chunyuan, et al.
Pubblicazione: (2026)
di: Deng, Chunyuan, et al.
Pubblicazione: (2026)
Language Models over Canonical Byte-Pair Encodings
di: Vieira, Tim, et al.
Pubblicazione: (2025)
di: Vieira, Tim, et al.
Pubblicazione: (2025)
Neuron Patching: Semantic-based Neuron-level Language Model Repair for Code Generation
di: Gu, Jian, et al.
Pubblicazione: (2023)
di: Gu, Jian, et al.
Pubblicazione: (2023)
PortLLM: Personalizing Evolving Large Language Models with Training-Free and Portable Model Patches
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2024)
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2024)
Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation
di: Dasgupta, Sayantan, et al.
Pubblicazione: (2026)
di: Dasgupta, Sayantan, et al.
Pubblicazione: (2026)
Discovering Decoupled Functional Modules in Large Language Models
di: Yu, Yanke, et al.
Pubblicazione: (2026)
di: Yu, Yanke, et al.
Pubblicazione: (2026)
Hierarchical Autoregressive Transformers: Combining Byte- and Word-Level Processing for Robust, Adaptable Language Models
di: Neitemeier, Pit, et al.
Pubblicazione: (2025)
di: Neitemeier, Pit, et al.
Pubblicazione: (2025)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
Specialising and Analysing Instruction-Tuned and Byte-Level Language Models for Organic Reaction Prediction
di: Pang, Jiayun, et al.
Pubblicazione: (2024)
di: Pang, Jiayun, et al.
Pubblicazione: (2024)
Byte-token Enhanced Language Models for Temporal Point Processes Analysis
di: Kong, Quyu, et al.
Pubblicazione: (2025)
di: Kong, Quyu, et al.
Pubblicazione: (2025)
Measuring the Depth of LLM Unlearning via Activation Patching
di: Lee, Jaeung, et al.
Pubblicazione: (2026)
di: Lee, Jaeung, et al.
Pubblicazione: (2026)
Forecasting Time Series with LLMs via Patch-Based Prompting and Decomposition
di: Bumb, Mayank, et al.
Pubblicazione: (2025)
di: Bumb, Mayank, et al.
Pubblicazione: (2025)
Sampling from Your Language Model One Byte at a Time
di: Hayase, Jonathan, et al.
Pubblicazione: (2025)
di: Hayase, Jonathan, et al.
Pubblicazione: (2025)
DEPT: Decoupled Embeddings for Pre-training Language Models
di: Iacob, Alex, et al.
Pubblicazione: (2024)
di: Iacob, Alex, et al.
Pubblicazione: (2024)
Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models
di: Vendrell, Victor Conchello, et al.
Pubblicazione: (2026)
di: Vendrell, Victor Conchello, et al.
Pubblicazione: (2026)
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
di: Slagle, Kevin
Pubblicazione: (2024)
di: Slagle, Kevin
Pubblicazione: (2024)
MambaByte: Token-free Selective State Space Model
di: Wang, Junxiong, et al.
Pubblicazione: (2024)
di: Wang, Junxiong, et al.
Pubblicazione: (2024)
HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
di: Guo, Haiyang, et al.
Pubblicazione: (2025)
di: Guo, Haiyang, et al.
Pubblicazione: (2025)
Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models
di: Shravan, Rohan
Pubblicazione: (2026)
di: Shravan, Rohan
Pubblicazione: (2026)
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
di: Kallini, Julie, et al.
Pubblicazione: (2024)
di: Kallini, Julie, et al.
Pubblicazione: (2024)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024)
Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling
di: Egli, Eric, et al.
Pubblicazione: (2025)
di: Egli, Eric, et al.
Pubblicazione: (2025)
GPUTOK: GPU Accelerated Byte Level BPE Tokenization
di: Kadamba, Venu Gopal, et al.
Pubblicazione: (2026)
di: Kadamba, Venu Gopal, et al.
Pubblicazione: (2026)
Byte Latent Transformer: Patches Scale Better Than Tokens
di: Pagnoni, Artidoro, et al.
Pubblicazione: (2024)
di: Pagnoni, Artidoro, et al.
Pubblicazione: (2024)
Scaling Law for Language Models Training Considering Batch Size
di: Shuai, Xian, et al.
Pubblicazione: (2024)
di: Shuai, Xian, et al.
Pubblicazione: (2024)
Critical Data Size of Language Models from a Grokking Perspective
di: Zhu, Xuekai, et al.
Pubblicazione: (2024)
di: Zhu, Xuekai, et al.
Pubblicazione: (2024)
Leviathan: Decoupling Input and Output Representations in Language Models
di: Batley, Reza T., et al.
Pubblicazione: (2026)
di: Batley, Reza T., et al.
Pubblicazione: (2026)
Patch Ranking: Efficient CLIP by Learning to Rank Local Patches
di: Wu, Cheng-En, et al.
Pubblicazione: (2024)
di: Wu, Cheng-En, et al.
Pubblicazione: (2024)
Proxy Compression for Language Modeling
di: Zheng, Lin, et al.
Pubblicazione: (2026)
di: Zheng, Lin, et al.
Pubblicazione: (2026)
Accelerating Vision Transformers with Adaptive Patch Sizes
di: Choudhury, Rohan, et al.
Pubblicazione: (2025)
di: Choudhury, Rohan, et al.
Pubblicazione: (2025)
Neuron-Level Knowledge Attribution in Large Language Models
di: Yu, Zeping, et al.
Pubblicazione: (2023)
di: Yu, Zeping, et al.
Pubblicazione: (2023)
Fast Byte Latent Transformer
di: Kallini, Julie, et al.
Pubblicazione: (2026)
di: Kallini, Julie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
di: Shao, Chenze, et al.
Pubblicazione: (2024) -
Auto-Patching: Enhancing Multi-Hop Reasoning in Language Models
di: Jan, Aviv, et al.
Pubblicazione: (2025) -
CausalEvolve: Towards Open-Ended Discovery with Causal Scratchpad
di: Chen, Yongqiang, et al.
Pubblicazione: (2026) -
Attractor Patch Networks: Reducing Catastrophic Forgetting with Routed Low-Rank Patch Experts
di: Shashank
Pubblicazione: (2026) -
Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles
di: Phan, Buu, et al.
Pubblicazione: (2024)