Beyond Next Token Prediction: Patch-Level Training for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shao, Chenze, Meng, Fandong, Zhou, Jie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Continuous Autoregressive Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
Language Generation with Strictly Proper Scoring Rules
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
A Law of Next-Token Prediction in Large Language Models
von: He, Hangfeng, et al.
Veröffentlicht: (2024)
von: He, Hangfeng, et al.
Veröffentlicht: (2024)
On Prompt-Driven Safeguarding for Large Language Models
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
von: Kim, Minseo, et al.
Veröffentlicht: (2025)
von: Kim, Minseo, et al.
Veröffentlicht: (2025)
A Dual-Space Framework for General Knowledge Distillation of Large Language Models
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
General learned delegation by clones
von: Li, Darren, et al.
Veröffentlicht: (2026)
von: Li, Darren, et al.
Veröffentlicht: (2026)
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
von: Yang, Zhen, et al.
Veröffentlicht: (2023)
von: Yang, Zhen, et al.
Veröffentlicht: (2023)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
Cautious Next Token Prediction
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
Scalable Token-Level Hallucination Detection in Large Language Models
von: Min, Rui, et al.
Veröffentlicht: (2026)
von: Min, Rui, et al.
Veröffentlicht: (2026)
Token-Efficient Leverage Learning in Large Language Models
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
von: Choo, Jinho, et al.
Veröffentlicht: (2026)
von: Choo, Jinho, et al.
Veröffentlicht: (2026)
PortLLM: Personalizing Evolving Large Language Models with Training-Free and Portable Model Patches
von: Khan, Rana Muhammad Shahroz, et al.
Veröffentlicht: (2024)
von: Khan, Rana Muhammad Shahroz, et al.
Veröffentlicht: (2024)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
von: Jia, Sheng, et al.
Veröffentlicht: (2025)
von: Jia, Sheng, et al.
Veröffentlicht: (2025)
HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling
von: Zhou, Chulun, et al.
Veröffentlicht: (2025)
von: Zhou, Chulun, et al.
Veröffentlicht: (2025)
Large Language Models Struggle in Token-Level Clinical Named Entity Recognition
von: Lu, Qiuhao, et al.
Veröffentlicht: (2024)
von: Lu, Qiuhao, et al.
Veröffentlicht: (2024)
DP-Fusion: Token-Level Differentially Private Inference for Large Language Models
von: Thareja, Rushil, et al.
Veröffentlicht: (2025)
von: Thareja, Rushil, et al.
Veröffentlicht: (2025)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
von: Zhang, Tunyu, et al.
Veröffentlicht: (2025)
von: Zhang, Tunyu, et al.
Veröffentlicht: (2025)
T-REG: Preference Optimization with Token-Level Reward Regularization
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification
von: Fadeeva, Ekaterina, et al.
Veröffentlicht: (2024)
von: Fadeeva, Ekaterina, et al.
Veröffentlicht: (2024)
Training Large Language Models to Predict Clinical Events
von: Turtel, Benjamin, et al.
Veröffentlicht: (2026)
von: Turtel, Benjamin, et al.
Veröffentlicht: (2026)
AgentMove: A Large Language Model based Agentic Framework for Zero-shot Next Location Prediction
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
Dynamics of Spontaneous Topic Changes in Next Token Prediction with Self-Attention
von: Jia, Mumin, et al.
Veröffentlicht: (2025)
von: Jia, Mumin, et al.
Veröffentlicht: (2025)
Counterfactual Token Generation in Large Language Models
von: Chatzi, Ivi, et al.
Veröffentlicht: (2024)
von: Chatzi, Ivi, et al.
Veröffentlicht: (2024)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
A Causal World Model Underlying Next Token Prediction: Exploring GPT in a Controlled Environment
von: Rohekar, Raanan Y., et al.
Veröffentlicht: (2024)
von: Rohekar, Raanan Y., et al.
Veröffentlicht: (2024)
Mechanics of Next Token Prediction with Self-Attention
von: Li, Yingcong, et al.
Veröffentlicht: (2024)
von: Li, Yingcong, et al.
Veröffentlicht: (2024)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
Compositional Steering of Large Language Models with Steering Tokens
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026)
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026)
Probabilistic Token Alignment for Large Language Model Fusion
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
Think before you speak: Training Language Models With Pause Tokens
von: Goyal, Sachin, et al.
Veröffentlicht: (2023)
von: Goyal, Sachin, et al.
Veröffentlicht: (2023)
Ladder: A Model-Agnostic Framework Boosting LLM-based Machine Translation to the Next Level
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2024)
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2024)
Pointer-Guided Pre-Training: Infusing Large Language Models with Paragraph-Level Contextual Awareness
von: Hillebrand, Lars, et al.
Veröffentlicht: (2024)
von: Hillebrand, Lars, et al.
Veröffentlicht: (2024)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
von: Zhang, Songming, et al.
Veröffentlicht: (2025)
von: Zhang, Songming, et al.
Veröffentlicht: (2025)
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
von: Mao, Liyuan, et al.
Veröffentlicht: (2026)
von: Mao, Liyuan, et al.
Veröffentlicht: (2026)
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding
von: Zhang, Zhongjian, et al.
Veröffentlicht: (2026)
von: Zhang, Zhongjian, et al.
Veröffentlicht: (2026)
RewardAnything: Generalizable Principle-Following Reward Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
Evaluation of Large Language Models via Coupled Token Generation
von: Benz, Nina Corvelo, et al.
Veröffentlicht: (2025)
von: Benz, Nina Corvelo, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Continuous Autoregressive Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2025) -
Language Generation with Strictly Proper Scoring Rules
von: Shao, Chenze, et al.
Veröffentlicht: (2024) -
A Law of Next-Token Prediction in Large Language Models
von: He, Hangfeng, et al.
Veröffentlicht: (2024) -
On Prompt-Driven Safeguarding for Large Language Models
von: Zheng, Chujie, et al.
Veröffentlicht: (2024) -
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
von: Kim, Minseo, et al.
Veröffentlicht: (2025)