Saved in:
| Main Authors: | He, Guangxin, Nie, Shen, Zhu, Fengqi, Zhao, Yuankang, Bai, Tianyi, Yan, Ran, Fu, Jie, Li, Chongxuan, Yuan, Binhang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2510.10481 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
by: Zhu, Fengqi, et al.
Published: (2025)
by: Zhu, Fengqi, et al.
Published: (2025)
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
by: You, Zebin, et al.
Published: (2026)
by: You, Zebin, et al.
Published: (2026)
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
by: You, Zebin, et al.
Published: (2025)
by: You, Zebin, et al.
Published: (2025)
TAH-QUANT: Effective Activation Quantization in Pipeline Parallelism over Slow Network
by: He, Guangxin, et al.
Published: (2025)
by: He, Guangxin, et al.
Published: (2025)
LLaDA-Rec: Discrete Diffusion for Parallel Semantic ID Generation in Generative Recommendation
by: Shi, Teng, et al.
Published: (2025)
by: Shi, Teng, et al.
Published: (2025)
Scaling up Masked Diffusion Models on Text
by: Nie, Shen, et al.
Published: (2024)
by: Nie, Shen, et al.
Published: (2024)
TQA-Bench: Evaluating LLMs for Multi-Table Question Answering with Scalable Context and Symbolic Extension
by: Qiu, Zipeng, et al.
Published: (2024)
by: Qiu, Zipeng, et al.
Published: (2024)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
by: Yan, Ran, et al.
Published: (2024)
by: Yan, Ran, et al.
Published: (2024)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
by: Bai, Tianyi, et al.
Published: (2025)
by: Bai, Tianyi, et al.
Published: (2025)
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
by: Ou, Jingyang, et al.
Published: (2024)
by: Ou, Jingyang, et al.
Published: (2024)
Large Language Diffusion Models
by: Nie, Shen, et al.
Published: (2025)
by: Nie, Shen, et al.
Published: (2025)
Data Engineering for Scaling Language Models to 128K Context
by: Fu, Yao, et al.
Published: (2024)
by: Fu, Yao, et al.
Published: (2024)
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
by: Liu, Xiaoran, et al.
Published: (2025)
by: Liu, Xiaoran, et al.
Published: (2025)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
by: Zhu, Fengqi, et al.
Published: (2025)
by: Zhu, Fengqi, et al.
Published: (2025)
Scaling Granite Code Models to 128K Context
by: Stallone, Matt, et al.
Published: (2024)
by: Stallone, Matt, et al.
Published: (2024)
Improving Precipitation Nowcasting via Multiphysical Parameter Fusion in Radar Echo Extrapolation
by: Ye, Yuankang
Published: (2026)
by: Ye, Yuankang
Published: (2026)
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
by: Zhao, Min, et al.
Published: (2025)
by: Zhao, Min, et al.
Published: (2025)
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
by: Bie, Tiwei, et al.
Published: (2025)
by: Bie, Tiwei, et al.
Published: (2025)
Zero-Indexing Internet Search Augmented Generation for Large Language Models
by: He, Guangxin, et al.
Published: (2024)
by: He, Guangxin, et al.
Published: (2024)
Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification
by: Xu, Xu, et al.
Published: (2025)
by: Xu, Xu, et al.
Published: (2025)
DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents
by: Zhao, Jiahao, et al.
Published: (2026)
by: Zhao, Jiahao, et al.
Published: (2026)
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
by: Jiang, Youhe, et al.
Published: (2025)
by: Jiang, Youhe, et al.
Published: (2025)
ByteScale: Efficient Scaling of LLM Training with a 2048K Context Length on More Than 12,000 GPUs
by: Ge, Hao, et al.
Published: (2025)
by: Ge, Hao, et al.
Published: (2025)
DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs
by: Yu, Longxuan, et al.
Published: (2026)
by: Yu, Longxuan, et al.
Published: (2026)
Real-time Identity Defenses against Malicious Personalization of Diffusion Models
by: Guo, Hanzhong, et al.
Published: (2024)
by: Guo, Hanzhong, et al.
Published: (2024)
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
by: Liang, Yan, et al.
Published: (2026)
by: Liang, Yan, et al.
Published: (2026)
From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models
by: Xu, Chejian, et al.
Published: (2025)
by: Xu, Chejian, et al.
Published: (2025)
The Blessing of Randomness: SDE Beats ODE in General Diffusion-based Image Editing
by: Nie, Shen, et al.
Published: (2023)
by: Nie, Shen, et al.
Published: (2023)
Balancing Interpretability and Flexibility in Modeling Diagnostic Trajectories with an Embedded Neural Hawkes Process Model
by: Zhao, Yuankang, et al.
Published: (2025)
by: Zhao, Yuankang, et al.
Published: (2025)
Optimizing Length Compression in Large Reasoning Models
by: Cheng, Zhengxiang, et al.
Published: (2025)
by: Cheng, Zhengxiang, et al.
Published: (2025)
VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL
by: Hu, Zengjie, et al.
Published: (2025)
by: Hu, Zengjie, et al.
Published: (2025)
Masked Diffusion Models as Energy Minimization
by: Chen, Sitong, et al.
Published: (2025)
by: Chen, Sitong, et al.
Published: (2025)
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
by: Wang, Zhaowei, et al.
Published: (2026)
by: Wang, Zhaowei, et al.
Published: (2026)
Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations
by: Xue, Kaiwen, et al.
Published: (2024)
by: Xue, Kaiwen, et al.
Published: (2024)
Schedule-Level Shared-Prefix Reuse for LLM RL Training
by: Li, Pengbo, et al.
Published: (2026)
by: Li, Pengbo, et al.
Published: (2026)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
by: Jiang, Youhe, et al.
Published: (2023)
by: Jiang, Youhe, et al.
Published: (2023)
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
by: Lin, Haobo, et al.
Published: (2026)
by: Lin, Haobo, et al.
Published: (2026)
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
by: Fu, Wei, et al.
Published: (2025)
by: Fu, Wei, et al.
Published: (2025)
Review of Large-Scale Simulation Optimization
by: Fan, Weiwei, et al.
Published: (2024)
by: Fan, Weiwei, et al.
Published: (2024)
LLaRA: Large Language-Recommendation Assistant
by: Liao, Jiayi, et al.
Published: (2023)
by: Liao, Jiayi, et al.
Published: (2023)
Similar Items
-
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
by: Zhu, Fengqi, et al.
Published: (2025) -
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
by: You, Zebin, et al.
Published: (2026) -
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
by: You, Zebin, et al.
Published: (2025) -
TAH-QUANT: Effective Activation Quantization in Pipeline Parallelism over Slow Network
by: He, Guangxin, et al.
Published: (2025) -
LLaDA-Rec: Discrete Diffusion for Parallel Semantic ID Generation in Generative Recommendation
by: Shi, Teng, et al.
Published: (2025)