Gespeichert in:
| 1. Verfasser: | Rozental, Alon |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2601.21768 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models
von: Levy, Mosh, et al.
Veröffentlicht: (2024)
von: Levy, Mosh, et al.
Veröffentlicht: (2024)
Probabilistic Token Alignment for Large Language Model Fusion
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
Certain but not Probable? Differentiating Certainty from Probability in LLM Token Outputs for Probabilistic Scenarios
von: Toney-Wails, Autumn, et al.
Veröffentlicht: (2025)
von: Toney-Wails, Autumn, et al.
Veröffentlicht: (2025)
DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
von: Huang, Yuxiang, et al.
Veröffentlicht: (2026)
von: Huang, Yuxiang, et al.
Veröffentlicht: (2026)
One Token Is Enough: Improving Diffusion Language Models with a Sink Token
von: Zhang, Zihou, et al.
Veröffentlicht: (2026)
von: Zhang, Zihou, et al.
Veröffentlicht: (2026)
SmartTrim: Adaptive Tokens and Attention Pruning for Efficient Vision-Language Models
von: Wang, Zekun, et al.
Veröffentlicht: (2023)
von: Wang, Zekun, et al.
Veröffentlicht: (2023)
Attention Sinks in Diffusion Language Models
von: Rulli, Maximo Eduardo, et al.
Veröffentlicht: (2025)
von: Rulli, Maximo Eduardo, et al.
Veröffentlicht: (2025)
Impact of Preference Noise on the Alignment Performance of Generative Language Models
von: Gao, Yang, et al.
Veröffentlicht: (2024)
von: Gao, Yang, et al.
Veröffentlicht: (2024)
Probabilistic Lexical Manifold Construction in Large Language Models via Hierarchical Vector Field Interpolation
von: Pendleton, Clive, et al.
Veröffentlicht: (2025)
von: Pendleton, Clive, et al.
Veröffentlicht: (2025)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
von: Guo, Yansong, et al.
Veröffentlicht: (2026)
von: Guo, Yansong, et al.
Veröffentlicht: (2026)
Multi-Token Attention
von: Golovneva, Olga, et al.
Veröffentlicht: (2025)
von: Golovneva, Olga, et al.
Veröffentlicht: (2025)
DiffuMask: Diffusion Language Model for Token-level Prompt Pruning
von: Zheng, Caleb, et al.
Veröffentlicht: (2026)
von: Zheng, Caleb, et al.
Veröffentlicht: (2026)
SparseD: Sparse Attention for Diffusion Language Models
von: Wang, Zeqing, et al.
Veröffentlicht: (2025)
von: Wang, Zeqing, et al.
Veröffentlicht: (2025)
Multimodal Latent Language Modeling with Next-Token Diffusion
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
Differentially Private Next-Token Prediction of Large Language Models
von: Flemings, James, et al.
Veröffentlicht: (2024)
von: Flemings, James, et al.
Veröffentlicht: (2024)
H-Net++: Hierarchical Dynamic Chunking for Tokenizer-Free Language Modelling in Morphologically-Rich Languages
von: Zakershahrak, Mehrdad, et al.
Veröffentlicht: (2025)
von: Zakershahrak, Mehrdad, et al.
Veröffentlicht: (2025)
Attention-Based Sampler for Diffusion Language Models
von: Zhou, Yuyan, et al.
Veröffentlicht: (2026)
von: Zhou, Yuyan, et al.
Veröffentlicht: (2026)
Rethinking Token Prediction: Tree-Structured Diffusion Language Model
von: Wu, Zihao, et al.
Veröffentlicht: (2026)
von: Wu, Zihao, et al.
Veröffentlicht: (2026)
Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language Models
von: Yao, Lin
Veröffentlicht: (2026)
von: Yao, Lin
Veröffentlicht: (2026)
Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Large Language Models
von: Yao, Lin
Veröffentlicht: (2026)
von: Yao, Lin
Veröffentlicht: (2026)
MBTSAD: Mitigating Backdoors in Language Models Based on Token Splitting and Attention Distillation
von: Ding, Yidong, et al.
Veröffentlicht: (2025)
von: Ding, Yidong, et al.
Veröffentlicht: (2025)
Adaptive Targeted Dynamic Chunking for Tokenization-Free Hierarchical Model
von: Dang, Thang, et al.
Veröffentlicht: (2026)
von: Dang, Thang, et al.
Veröffentlicht: (2026)
CobwebTM: Probabilistic Concept Formation for Lifelong and Hierarchical Topic Modeling
von: Singaravadivelan, Karthik, et al.
Veröffentlicht: (2026)
von: Singaravadivelan, Karthik, et al.
Veröffentlicht: (2026)
PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model
von: Arif, Kazi Hasan Ibn, et al.
Veröffentlicht: (2025)
von: Arif, Kazi Hasan Ibn, et al.
Veröffentlicht: (2025)
Problematic Tokens: Tokenizer Bias in Large Language Models
von: Yang, Jin, et al.
Veröffentlicht: (2024)
von: Yang, Jin, et al.
Veröffentlicht: (2024)
Token Perturbation Guidance for Diffusion Models
von: Rajabi, Javad, et al.
Veröffentlicht: (2025)
von: Rajabi, Javad, et al.
Veröffentlicht: (2025)
Just on Time: Token-Level Early Stopping for Diffusion Language Models
von: Kohut, Zahar, et al.
Veröffentlicht: (2026)
von: Kohut, Zahar, et al.
Veröffentlicht: (2026)
Beyond Hard Masks: Progressive Token Evolution for Diffusion Language Models
von: Zhong, Linhao, et al.
Veröffentlicht: (2026)
von: Zhong, Linhao, et al.
Veröffentlicht: (2026)
HIGHT: Hierarchical Graph Tokenization for Molecule-Language Alignment
von: Chen, Yongqiang, et al.
Veröffentlicht: (2024)
von: Chen, Yongqiang, et al.
Veröffentlicht: (2024)
EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models
von: Cheong, Minsoo, et al.
Veröffentlicht: (2026)
von: Cheong, Minsoo, et al.
Veröffentlicht: (2026)
Scaling Optimal LR Across Token Horizons
von: Bjorck, Johan, et al.
Veröffentlicht: (2024)
von: Bjorck, Johan, et al.
Veröffentlicht: (2024)
Rethinking Tokenization: Crafting Better Tokenizers for Large Language Models
von: Yang, Jinbiao
Veröffentlicht: (2024)
von: Yang, Jinbiao
Veröffentlicht: (2024)
DP-Fusion: Token-Level Differentially Private Inference for Large Language Models
von: Thareja, Rushil, et al.
Veröffentlicht: (2025)
von: Thareja, Rushil, et al.
Veröffentlicht: (2025)
The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models
von: Sun, Bohang, et al.
Veröffentlicht: (2026)
von: Sun, Bohang, et al.
Veröffentlicht: (2026)
Express Your Doubts -- Probabilistic World Modeling Should not be Based on Token logprobs
von: Wagner, Eitan, et al.
Veröffentlicht: (2025)
von: Wagner, Eitan, et al.
Veröffentlicht: (2025)
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
von: Sun, Bowen, et al.
Veröffentlicht: (2025)
von: Sun, Bowen, et al.
Veröffentlicht: (2025)
Unifying Linear-Time Attention via Latent Probabilistic Modelling
von: Dolga, Rares, et al.
Veröffentlicht: (2024)
von: Dolga, Rares, et al.
Veröffentlicht: (2024)
Improving Self Consistency in LLMs through Probabilistic Tokenization
von: Sathe, Ashutosh, et al.
Veröffentlicht: (2024)
von: Sathe, Ashutosh, et al.
Veröffentlicht: (2024)
A Hierarchical Probabilistic Framework for Incremental Knowledge Tracing in Classroom Settings
von: Gao, Xinyi, et al.
Veröffentlicht: (2025)
von: Gao, Xinyi, et al.
Veröffentlicht: (2025)
Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuning
von: Ye, Ziang, et al.
Veröffentlicht: (2024)
von: Ye, Ziang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models
von: Levy, Mosh, et al.
Veröffentlicht: (2024) -
Probabilistic Token Alignment for Large Language Model Fusion
von: Zeng, Runjia, et al.
Veröffentlicht: (2025) -
Certain but not Probable? Differentiating Certainty from Probability in LLM Token Outputs for Probabilistic Scenarios
von: Toney-Wails, Autumn, et al.
Veröffentlicht: (2025) -
DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
von: Huang, Yuxiang, et al.
Veröffentlicht: (2026) -
One Token Is Enough: Improving Diffusion Language Models with a Sink Token
von: Zhang, Zihou, et al.
Veröffentlicht: (2026)