Large Language Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Nie, Shen, Zhu, Fengqi, You, Zebin, Zhang, Xiaolu, Ou, Jingyang, Hu, Jun, Zhou, Jun, Lin, Yankai, Wen, Ji-Rong, Li, Chongxuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
di: You, Zebin, et al.
Pubblicazione: (2025)
di: You, Zebin, et al.
Pubblicazione: (2025)
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
Effective and Efficient Masked Image Generation Models
di: You, Zebin, et al.
Pubblicazione: (2025)
di: You, Zebin, et al.
Pubblicazione: (2025)
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
di: You, Zebin, et al.
Pubblicazione: (2026)
di: You, Zebin, et al.
Pubblicazione: (2026)
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
di: Ou, Jingyang, et al.
Pubblicazione: (2024)
di: Ou, Jingyang, et al.
Pubblicazione: (2024)
DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents
di: Zhao, Jiahao, et al.
Pubblicazione: (2026)
di: Zhao, Jiahao, et al.
Pubblicazione: (2026)
Scaling up Masked Diffusion Models on Text
di: Nie, Shen, et al.
Pubblicazione: (2024)
di: Nie, Shen, et al.
Pubblicazione: (2024)
DeepCritic: Deliberate Critique with Large Language Models
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
Masked Diffusion Models as Energy Minimization
di: Chen, Sitong, et al.
Pubblicazione: (2025)
di: Chen, Sitong, et al.
Pubblicazione: (2025)
Deterministic Differentiable Structured Pruning for Large Language Models
di: Huang, Weiyu, et al.
Pubblicazione: (2026)
di: Huang, Weiyu, et al.
Pubblicazione: (2026)
Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations
di: Xue, Kaiwen, et al.
Pubblicazione: (2024)
di: Xue, Kaiwen, et al.
Pubblicazione: (2024)
Distilling Rule-based Knowledge into Large Language Models
di: Yang, Wenkai, et al.
Pubblicazione: (2023)
di: Yang, Wenkai, et al.
Pubblicazione: (2023)
UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models
di: He, Guangxin, et al.
Pubblicazione: (2025)
di: He, Guangxin, et al.
Pubblicazione: (2025)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
di: Zhu, Fengqi, et al.
Pubblicazione: (2025)
Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective
di: Ou, Jingyang, et al.
Pubblicazione: (2025)
di: Ou, Jingyang, et al.
Pubblicazione: (2025)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
di: Li, Jia-Nan, et al.
Pubblicazione: (2025)
di: Li, Jia-Nan, et al.
Pubblicazione: (2025)
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
di: Bie, Tiwei, et al.
Pubblicazione: (2025)
di: Bie, Tiwei, et al.
Pubblicazione: (2025)
CogAtom: From Cognitive Atoms to Olympiad-level Mathematical Reasoning in Large Language Models
di: Chen, Zhuofan, et al.
Pubblicazione: (2025)
di: Chen, Zhuofan, et al.
Pubblicazione: (2025)
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
di: Huang, Weiyu, et al.
Pubblicazione: (2025)
di: Huang, Weiyu, et al.
Pubblicazione: (2025)
ICLEval: Evaluating In-Context Learning Ability of Large Language Models
di: Chen, Wentong, et al.
Pubblicazione: (2024)
di: Chen, Wentong, et al.
Pubblicazione: (2024)
How do Large Language Models Understand Relevance? A Mechanistic Interpretability Perspective
di: Liu, Qi, et al.
Pubblicazione: (2025)
di: Liu, Qi, et al.
Pubblicazione: (2025)
On Mesa-Optimization in Autoregressively Trained Transformers: Emergence and Capability
di: Zheng, Chenyu, et al.
Pubblicazione: (2024)
di: Zheng, Chenyu, et al.
Pubblicazione: (2024)
Variational Reasoning for Language Models
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
LCQ: Low-Rank Codebook based Quantization for Large Language Models
di: Cai, Wen-Pu, et al.
Pubblicazione: (2024)
di: Cai, Wen-Pu, et al.
Pubblicazione: (2024)
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing
di: Liu, Yudong, et al.
Pubblicazione: (2025)
di: Liu, Yudong, et al.
Pubblicazione: (2025)
Large Language Model-based Human-Agent Collaboration for Complex Task Solving
di: Feng, Xueyang, et al.
Pubblicazione: (2024)
di: Feng, Xueyang, et al.
Pubblicazione: (2024)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
LLaDA-Rec: Discrete Diffusion for Parallel Semantic ID Generation in Generative Recommendation
di: Shi, Teng, et al.
Pubblicazione: (2025)
di: Shi, Teng, et al.
Pubblicazione: (2025)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
di: Ji, Xiaotong, et al.
Pubblicazione: (2025)
di: Ji, Xiaotong, et al.
Pubblicazione: (2025)
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
di: Ye, Mengyu, et al.
Pubblicazione: (2026)
di: Ye, Mengyu, et al.
Pubblicazione: (2026)
Exploring Context Window of Large Language Models via Decomposed Positional Vectors
di: Dong, Zican, et al.
Pubblicazione: (2024)
di: Dong, Zican, et al.
Pubblicazione: (2024)
Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference
di: Song, Yuxuan, et al.
Pubblicazione: (2025)
di: Song, Yuxuan, et al.
Pubblicazione: (2025)
Unraveling Arithmetic in Large Language Models: The Role of Algebraic Structures
di: Chang, Fu-Chieh, et al.
Pubblicazione: (2024)
di: Chang, Fu-Chieh, et al.
Pubblicazione: (2024)
Large Language Models as Computable Approximations to Solomonoff Induction
di: Wan, Jun, et al.
Pubblicazione: (2025)
di: Wan, Jun, et al.
Pubblicazione: (2025)
Are Images Indistinguishable to Humans Also Indistinguishable to Classifiers?
di: You, Zebin, et al.
Pubblicazione: (2024)
di: You, Zebin, et al.
Pubblicazione: (2024)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
di: Zhang, Jingyang, et al.
Pubblicazione: (2024)
di: Zhang, Jingyang, et al.
Pubblicazione: (2024)
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
di: Feng, Xidong, et al.
Pubblicazione: (2023)
di: Feng, Xidong, et al.
Pubblicazione: (2023)
DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models
di: Zhou, Xueyu, et al.
Pubblicazione: (2026)
di: Zhou, Xueyu, et al.
Pubblicazione: (2026)
Lossless Acceleration of Large Language Model via Adaptive N-gram Parallel Decoding
di: Ou, Jie, et al.
Pubblicazione: (2024)
di: Ou, Jie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
di: You, Zebin, et al.
Pubblicazione: (2025) -
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
di: Zhu, Fengqi, et al.
Pubblicazione: (2025) -
Effective and Efficient Masked Image Generation Models
di: You, Zebin, et al.
Pubblicazione: (2025) -
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
di: You, Zebin, et al.
Pubblicazione: (2026) -
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
di: Ou, Jingyang, et al.
Pubblicazione: (2024)