Causal Autoregressive Diffusion Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Ruan, Junhao, Li, Bei, Yin, Yongjing, Huang, Pengcheng, Chen, Xin, Wang, Jingang, Cai, Xunliang, Xiao, Tong, Zhu, JingBo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
por: Ruan, Junhao, et al.
Publicado: (2026)
por: Ruan, Junhao, et al.
Publicado: (2026)
BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories
por: Ouyang, Yuxuan, et al.
Publicado: (2026)
por: Ouyang, Yuxuan, et al.
Publicado: (2026)
Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
por: Mu, Yongyu, et al.
Publicado: (2026)
por: Mu, Yongyu, et al.
Publicado: (2026)
Forgetting Curve: A Reliable Method for Evaluating Memorization Capability for Long-context Models
por: Liu, Xinyu, et al.
Publicado: (2024)
por: Liu, Xinyu, et al.
Publicado: (2024)
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
por: Fan, Yuchun, et al.
Publicado: (2026)
por: Fan, Yuchun, et al.
Publicado: (2026)
SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement
por: Ge, Yuan, et al.
Publicado: (2025)
por: Ge, Yuan, et al.
Publicado: (2025)
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
por: Yuan, Danlong, et al.
Publicado: (2024)
por: Yuan, Danlong, et al.
Publicado: (2024)
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
por: Liu, Xinyu, et al.
Publicado: (2025)
por: Liu, Xinyu, et al.
Publicado: (2025)
Translate-and-Revise: Boosting Large Language Models for Constrained Translation
por: Huang, Pengcheng, et al.
Publicado: (2024)
por: Huang, Pengcheng, et al.
Publicado: (2024)
Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning
por: Li, Bei, et al.
Publicado: (2024)
por: Li, Bei, et al.
Publicado: (2024)
Libra: Assessing and Improving Reward Model by Learning to Think
por: Zhou, Meng, et al.
Publicado: (2025)
por: Zhou, Meng, et al.
Publicado: (2025)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
por: Shao, Ruichen, et al.
Publicado: (2025)
por: Shao, Ruichen, et al.
Publicado: (2025)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
por: Liu, Jiahao, et al.
Publicado: (2024)
por: Liu, Jiahao, et al.
Publicado: (2024)
SpanNorm: Reconciling Training Stability and Performance in Deep Transformers
por: Wang, Chao, et al.
Publicado: (2026)
por: Wang, Chao, et al.
Publicado: (2026)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
por: Diao, Muxi, et al.
Publicado: (2024)
por: Diao, Muxi, et al.
Publicado: (2024)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
por: Fan, Yuchun, et al.
Publicado: (2025)
por: Fan, Yuchun, et al.
Publicado: (2025)
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
por: Wu, Pengfei, et al.
Publicado: (2024)
por: Wu, Pengfei, et al.
Publicado: (2024)
Semformer: Transformer Language Models with Semantic Planning
por: Yin, Yongjing, et al.
Publicado: (2024)
por: Yin, Yongjing, et al.
Publicado: (2024)
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
por: Lee, Sanwoo, et al.
Publicado: (2025)
por: Lee, Sanwoo, et al.
Publicado: (2025)
TIM: Teaching Large Language Models to Translate with Comparison
por: Zeng, Jiali, et al.
Publicado: (2023)
por: Zeng, Jiali, et al.
Publicado: (2023)
Position IDs Matter: An Enhanced Position Layout for Efficient Context Compression in Large Language Models
por: Zhao, Runsong, et al.
Publicado: (2024)
por: Zhao, Runsong, et al.
Publicado: (2024)
AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?
por: Lin, Liang, et al.
Publicado: (2026)
por: Lin, Liang, et al.
Publicado: (2026)
Improving Machine Translation with Large Language Models: A Preliminary Study with Cooperative Decoding
por: Zeng, Jiali, et al.
Publicado: (2023)
por: Zeng, Jiali, et al.
Publicado: (2023)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
por: Wang, Lanrui, et al.
Publicado: (2025)
por: Wang, Lanrui, et al.
Publicado: (2025)
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
por: Liu, Shiyu, et al.
Publicado: (2026)
por: Liu, Shiyu, et al.
Publicado: (2026)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
por: Li, Pengxiang, et al.
Publicado: (2026)
por: Li, Pengxiang, et al.
Publicado: (2026)
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
por: Xu, Zhihao, et al.
Publicado: (2026)
por: Xu, Zhihao, et al.
Publicado: (2026)
Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models
por: Fan, Yuchun, et al.
Publicado: (2025)
por: Fan, Yuchun, et al.
Publicado: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
por: Bai, Yang, et al.
Publicado: (2026)
por: Bai, Yang, et al.
Publicado: (2026)
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
por: Sun, Bowen, et al.
Publicado: (2025)
por: Sun, Bowen, et al.
Publicado: (2025)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
por: Tang, Hongyin, et al.
Publicado: (2024)
por: Tang, Hongyin, et al.
Publicado: (2024)
FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training
por: Xu, Liangyu, et al.
Publicado: (2025)
por: Xu, Liangyu, et al.
Publicado: (2025)
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
Large-Scale Diverse Synthesis for Mid-Training
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
NDP: Next Distribution Prediction as a More Broad Target
por: Ruan, Junhao, et al.
Publicado: (2024)
por: Ruan, Junhao, et al.
Publicado: (2024)
Differences in Text Generated by Diffusion and Autoregressive Language Models
por: Zhang, Zeyang, et al.
Publicado: (2026)
por: Zhang, Zeyang, et al.
Publicado: (2026)
Revisiting Knowledge Distillation for Autoregressive Language Models
por: Zhong, Qihuang, et al.
Publicado: (2024)
por: Zhong, Qihuang, et al.
Publicado: (2024)
KRAIL: A Knowledge-Driven Framework for Base Human Reliability Analysis Integrating IDHEAS and Large Language Models
por: Xiao, Xingyu, et al.
Publicado: (2024)
por: Xiao, Xingyu, et al.
Publicado: (2024)
SMCLM: Semantically Meaningful Causal Language Modeling for Autoregressive Paraphrase Generation
por: Perełkiewicz, Michał, et al.
Publicado: (2025)
por: Perełkiewicz, Michał, et al.
Publicado: (2025)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
por: Li, Xin, et al.
Publicado: (2025)
por: Li, Xin, et al.
Publicado: (2025)
Ejemplares similares
-
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
por: Ruan, Junhao, et al.
Publicado: (2026) -
BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories
por: Ouyang, Yuxuan, et al.
Publicado: (2026) -
Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
por: Mu, Yongyu, et al.
Publicado: (2026) -
Forgetting Curve: A Reliable Method for Evaluating Memorization Capability for Long-context Models
por: Liu, Xinyu, et al.
Publicado: (2024) -
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
por: Fan, Yuchun, et al.
Publicado: (2026)