Beyond Language Models: Byte Models are Digital World Simulators
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Shangda, Tan, Xu, Wang, Zili, Wang, Rui, Li, Xiaobing, Sun, Maosong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MelodyT5: A Unified Score-to-Score Transformer for Symbolic Music Processing
di: Wu, Shangda, et al.
Pubblicazione: (2024)
di: Wu, Shangda, et al.
Pubblicazione: (2024)
ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
di: Deng, Chunyuan, et al.
Pubblicazione: (2026)
di: Deng, Chunyuan, et al.
Pubblicazione: (2026)
The Efficiency Gap in Byte Modeling
di: Lee, Celine, et al.
Pubblicazione: (2026)
di: Lee, Celine, et al.
Pubblicazione: (2026)
PANTHER: Generative Pretraining Beyond Language for Sequential User Behavior Modeling
di: Li, Guilin, et al.
Pubblicazione: (2025)
di: Li, Guilin, et al.
Pubblicazione: (2025)
Robust and Scalable Model Editing for Large Language Models
di: Chen, Yingfa, et al.
Pubblicazione: (2024)
di: Chen, Yingfa, et al.
Pubblicazione: (2024)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
di: Li, Jianling, et al.
Pubblicazione: (2025)
di: Li, Jianling, et al.
Pubblicazione: (2025)
Pruning and Malicious Injection: A Retraining-Free Backdoor Attack on Transformer Models
di: Zhao, Taibiao, et al.
Pubblicazione: (2025)
di: Zhao, Taibiao, et al.
Pubblicazione: (2025)
A Closer Look into Mixture-of-Experts in Large Language Models
di: Lo, Ka Man, et al.
Pubblicazione: (2024)
di: Lo, Ka Man, et al.
Pubblicazione: (2024)
Exponential Concentration in Stochastic Approximation
di: Law, Kody, et al.
Pubblicazione: (2022)
di: Law, Kody, et al.
Pubblicazione: (2022)
Diffusion Language Models are Super Data Learners
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
World Models with Hints of Large Language Models for Goal Achieving
di: Liu, Zeyuan, et al.
Pubblicazione: (2024)
di: Liu, Zeyuan, et al.
Pubblicazione: (2024)
Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
di: Xie, Wei, et al.
Pubblicazione: (2024)
di: Xie, Wei, et al.
Pubblicazione: (2024)
Beyond Euclidean Proximity: Repairing Latent World Models with Horizon-Matched Trajectory Reachability Metrics
di: Li, Liangyu, et al.
Pubblicazione: (2026)
di: Li, Liangyu, et al.
Pubblicazione: (2026)
MambaByte: Token-free Selective State Space Model
di: Wang, Junxiong, et al.
Pubblicazione: (2024)
di: Wang, Junxiong, et al.
Pubblicazione: (2024)
Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models
di: Zhang, Zhilong, et al.
Pubblicazione: (2026)
di: Zhang, Zhilong, et al.
Pubblicazione: (2026)
Byte-token Enhanced Language Models for Temporal Point Processes Analysis
di: Kong, Quyu, et al.
Pubblicazione: (2025)
di: Kong, Quyu, et al.
Pubblicazione: (2025)
Latent Geometry Beyond Search: Amortizing Planning in World Models
di: Nguyen, Hoang, et al.
Pubblicazione: (2026)
di: Nguyen, Hoang, et al.
Pubblicazione: (2026)
Closing the Loop: Learning to Generate Writing Feedback via Language Model Simulated Student Revisions
di: Nair, Inderjeet, et al.
Pubblicazione: (2024)
di: Nair, Inderjeet, et al.
Pubblicazione: (2024)
AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models
di: Lu, Chengxuan, et al.
Pubblicazione: (2026)
di: Lu, Chengxuan, et al.
Pubblicazione: (2026)
Multi-view Fake News Detection Model Based on Dynamic Hypergraph
di: Ye, Rongping, et al.
Pubblicazione: (2024)
di: Ye, Rongping, et al.
Pubblicazione: (2024)
Digital Player: Evaluating Large Language Models based Human-like Agent in Games
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
CEQuest: Benchmarking Large Language Models for Construction Estimation
di: Wu, Yanzhao, et al.
Pubblicazione: (2025)
di: Wu, Yanzhao, et al.
Pubblicazione: (2025)
Exploring Perceptual Limitation of Multimodal Large Language Models
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
GraphSB: Boosting Imbalanced Node Classification on Graphs through Structural Balance
di: Zhu, Chaofan, et al.
Pubblicazione: (2025)
di: Zhu, Chaofan, et al.
Pubblicazione: (2025)
Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles
di: Phan, Buu, et al.
Pubblicazione: (2024)
di: Phan, Buu, et al.
Pubblicazione: (2024)
Exploring Tokenization Methods for Multitrack Sheet Music Generation
di: Wang, Yashan, et al.
Pubblicazione: (2024)
di: Wang, Yashan, et al.
Pubblicazione: (2024)
Language Models over Canonical Byte-Pair Encodings
di: Vieira, Tim, et al.
Pubblicazione: (2025)
di: Vieira, Tim, et al.
Pubblicazione: (2025)
Beyond State Consistency: Behavior Consistency in Text-Based World Models
di: Huang, Youling, et al.
Pubblicazione: (2026)
di: Huang, Youling, et al.
Pubblicazione: (2026)
World Model-Enabled Causal Digital Twins for Semantic Communications in Physical AI Systems
di: Wang, Lingyi, et al.
Pubblicazione: (2026)
di: Wang, Lingyi, et al.
Pubblicazione: (2026)
HoloByte: Continuous Hyperspherical Distillation for Tokenizer-Free Modeling
di: Khasia, Vladimer
Pubblicazione: (2026)
di: Khasia, Vladimer
Pubblicazione: (2026)
Beyond Accuracy: On the Effects of Fine-tuning Towards Vision-Language Model's Prediction Rationality
di: Wang, Qitong, et al.
Pubblicazione: (2024)
di: Wang, Qitong, et al.
Pubblicazione: (2024)
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
di: Slagle, Kevin
Pubblicazione: (2024)
di: Slagle, Kevin
Pubblicazione: (2024)
Understanding the Natural Language of DNA using Encoder-Decoder Foundation Models with Byte-level Precision
di: Malusare, Aditya, et al.
Pubblicazione: (2023)
di: Malusare, Aditya, et al.
Pubblicazione: (2023)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
di: Zhao, Weilin, et al.
Pubblicazione: (2025)
di: Zhao, Weilin, et al.
Pubblicazione: (2025)
Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models
di: Zheng, Lin, et al.
Pubblicazione: (2026)
di: Zheng, Lin, et al.
Pubblicazione: (2026)
Out-of-Distribution Graph Models Merging
di: Wang, Yidi, et al.
Pubblicazione: (2025)
di: Wang, Yidi, et al.
Pubblicazione: (2025)
NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms
di: Wang, Yashan, et al.
Pubblicazione: (2025)
di: Wang, Yashan, et al.
Pubblicazione: (2025)
Fast Distributed Inference Serving for Large Language Models
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
TWIN-GPT: Digital Twins for Clinical Trials via Large Language Model
di: Wang, Yue, et al.
Pubblicazione: (2024)
di: Wang, Yue, et al.
Pubblicazione: (2024)
Policy and World Modeling Co-Training for Language Agents
di: Lu, Ning, et al.
Pubblicazione: (2026)
di: Lu, Ning, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MelodyT5: A Unified Score-to-Score Transformer for Symbolic Music Processing
di: Wu, Shangda, et al.
Pubblicazione: (2024) -
ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
di: Deng, Chunyuan, et al.
Pubblicazione: (2026) -
The Efficiency Gap in Byte Modeling
di: Lee, Celine, et al.
Pubblicazione: (2026) -
PANTHER: Generative Pretraining Beyond Language for Sequential User Behavior Modeling
di: Li, Guilin, et al.
Pubblicazione: (2025) -
Robust and Scalable Model Editing for Large Language Models
di: Chen, Yingfa, et al.
Pubblicazione: (2024)