Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Miao, Tongyuan, Huang, Gary, Han, Kai Jun, Jiang, Annie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Provable Length Generalization in Sequence Prediction via Spectral Filtering
par: Marsden, Annie, et autres
Publié: (2024)
par: Marsden, Annie, et autres
Publié: (2024)
Improving Context-Aware Preference Modeling for Language Models
par: Pitis, Silviu, et autres
Publié: (2024)
par: Pitis, Silviu, et autres
Publié: (2024)
An Empirical Study on Context Length for Open-Domain Dialog Generation
par: Shen, Xinyi, et autres
Publié: (2024)
par: Shen, Xinyi, et autres
Publié: (2024)
Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
par: Chen, Ziyu, et autres
Publié: (2025)
par: Chen, Ziyu, et autres
Publié: (2025)
Stable Adaptive Thinking via Advantage Shaping and Length-Aware Gradient Regulation
par: Xu, Zihang, et autres
Publié: (2026)
par: Xu, Zihang, et autres
Publié: (2026)
Sink-Aware Pruning for Diffusion Language Models
par: Myrzakhan, Aidar, et autres
Publié: (2026)
par: Myrzakhan, Aidar, et autres
Publié: (2026)
On the Expressiveness and Length Generalization of Selective State-Space Models on Regular Languages
par: Terzić, Aleksandar, et autres
Publié: (2024)
par: Terzić, Aleksandar, et autres
Publié: (2024)
Length-MAX Tokenizer for Language Models
par: Dong, Dong, et autres
Publié: (2025)
par: Dong, Dong, et autres
Publié: (2025)
Plan, Verify and Fill: A Structured Parallel Decoding Approach for Diffusion Language Models
par: Li, Miao, et autres
Publié: (2026)
par: Li, Miao, et autres
Publié: (2026)
Revisiting Uncertainty Quantification Evaluation in Language Models: Spurious Interactions with Response Length Bias Results
par: Santilli, Andrea, et autres
Publié: (2025)
par: Santilli, Andrea, et autres
Publié: (2025)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
par: Ye, Jiacheng, et autres
Publié: (2024)
par: Ye, Jiacheng, et autres
Publié: (2024)
Fortify the Shortest Stave in Attention: Enhancing Context Awareness of Large Language Models for Effective Tool Use
par: Chen, Yuhan, et autres
Publié: (2023)
par: Chen, Yuhan, et autres
Publié: (2023)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
par: Tejaswi, Atula, et autres
Publié: (2026)
par: Tejaswi, Atula, et autres
Publié: (2026)
Large Language Models are Miscalibrated In-Context Learners
par: Li, Chengzu, et autres
Publié: (2023)
par: Li, Chengzu, et autres
Publié: (2023)
PAT: Pruning-Aware Tuning for Large Language Models
par: Liu, Yijiang, et autres
Publié: (2024)
par: Liu, Yijiang, et autres
Publié: (2024)
On the Optimal Reasoning Length for RL-Trained Language Models
par: Nohara, Daisuke, et autres
Publié: (2026)
par: Nohara, Daisuke, et autres
Publié: (2026)
The Role of Diversity in In-Context Learning for Large Language Models
par: Xiao, Wenyang, et autres
Publié: (2025)
par: Xiao, Wenyang, et autres
Publié: (2025)
Reducing the Scope of Language Models
par: Yunis, David, et autres
Publié: (2024)
par: Yunis, David, et autres
Publié: (2024)
Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements
par: Zhao, Guangxiang, et autres
Publié: (2025)
par: Zhao, Guangxiang, et autres
Publié: (2025)
Confidence Regularized Masked Language Modeling using Text Length
par: Ji, Seunghyun, et autres
Publié: (2025)
par: Ji, Seunghyun, et autres
Publié: (2025)
Active Layer-Contrastive Decoding Reduces Hallucination in Large Language Model Generation
par: Zhang, Hongxiang, et autres
Publié: (2025)
par: Zhang, Hongxiang, et autres
Publié: (2025)
Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models
par: Leng, Jiaqi, et autres
Publié: (2025)
par: Leng, Jiaqi, et autres
Publié: (2025)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
par: Ding, Fei, et autres
Publié: (2026)
par: Ding, Fei, et autres
Publié: (2026)
Revisiting In-Context Learning with Long Context Language Models
par: Baek, Jinheon, et autres
Publié: (2024)
par: Baek, Jinheon, et autres
Publié: (2024)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
par: Monsefi, Amin Karimi, et autres
Publié: (2026)
par: Monsefi, Amin Karimi, et autres
Publié: (2026)
In-Context Environments Induce Evaluation-Awareness in Language Models
par: Chaudhary, Maheep
Publié: (2026)
par: Chaudhary, Maheep
Publié: (2026)
Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation
par: Chen, Daiwei, et autres
Publié: (2026)
par: Chen, Daiwei, et autres
Publié: (2026)
Calibrating Language Models with Adaptive Temperature Scaling
par: Xie, Johnathan, et autres
Publié: (2024)
par: Xie, Johnathan, et autres
Publié: (2024)
Can an LLM Induce a Graph? Investigating Memory Drift and Context Length
par: Yousuf, Raquib Bin, et autres
Publié: (2025)
par: Yousuf, Raquib Bin, et autres
Publié: (2025)
Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes
par: Ding, Fangyu, et autres
Publié: (2026)
par: Ding, Fangyu, et autres
Publié: (2026)
The Role of Sparsity for Length Generalization in Transformers
par: Golowich, Noah, et autres
Publié: (2025)
par: Golowich, Noah, et autres
Publié: (2025)
Softplus Attention with Re-weighting Boosts Length Extrapolation in Large Language Models
par: Gao, Bo, et autres
Publié: (2025)
par: Gao, Bo, et autres
Publié: (2025)
Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization
par: Samragh, Mohammad, et autres
Publié: (2024)
par: Samragh, Mohammad, et autres
Publié: (2024)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
par: Mo, Yichuan, et autres
Publié: (2026)
par: Mo, Yichuan, et autres
Publié: (2026)
Large Visual-Language Models Are Also Good Classifiers: A Study of In-Context Multimodal Fake News Detection
par: Jiang, Ye, et autres
Publié: (2024)
par: Jiang, Ye, et autres
Publié: (2024)
Improving Large Language Models with Concept-Aware Fine-Tuning
par: Chen, Michael K., et autres
Publié: (2025)
par: Chen, Michael K., et autres
Publié: (2025)
Multiscale Byte Language Models -- A Hierarchical Architecture for Causal Million-Length Sequence Modeling
par: Egli, Eric, et autres
Publié: (2025)
par: Egli, Eric, et autres
Publié: (2025)
RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models
par: Huang, Jie, et autres
Publié: (2023)
par: Huang, Jie, et autres
Publié: (2023)
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
par: Zhang, Qizheng, et autres
Publié: (2025)
par: Zhang, Qizheng, et autres
Publié: (2025)
Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
par: Zheng, Haoyang, et autres
Publié: (2025)
par: Zheng, Haoyang, et autres
Publié: (2025)
Documents similaires
-
Provable Length Generalization in Sequence Prediction via Spectral Filtering
par: Marsden, Annie, et autres
Publié: (2024) -
Improving Context-Aware Preference Modeling for Language Models
par: Pitis, Silviu, et autres
Publié: (2024) -
An Empirical Study on Context Length for Open-Domain Dialog Generation
par: Shen, Xinyi, et autres
Publié: (2024) -
Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
par: Chen, Ziyu, et autres
Publié: (2025) -
Stable Adaptive Thinking via Advantage Shaping and Length-Aware Gradient Regulation
par: Xu, Zihang, et autres
Publié: (2026)