WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Aiwei, He, Minghua, Zeng, Shaoxun, Zhang, Sijun, Zhang, Linhao, Wu, Chuhan, Jia, Wei, Liu, Yuan, Zhou, Xiao, Zhou, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
por: Pan, Leyi, et al.
Publicado: (2025)
por: Pan, Leyi, et al.
Publicado: (2025)
On the Robustness of Document-Level Relation Extraction Models to Entity Name Variations
por: Meng, Shiao, et al.
Publicado: (2024)
por: Meng, Shiao, et al.
Publicado: (2024)
An Unforgeable Publicly Verifiable Watermark for Large Language Models
por: Liu, Aiwei, et al.
Publicado: (2023)
por: Liu, Aiwei, et al.
Publicado: (2023)
A Survey of Text Watermarking in the Era of Large Language Models
por: Liu, Aiwei, et al.
Publicado: (2023)
por: Liu, Aiwei, et al.
Publicado: (2023)
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
por: Pan, Leyi, et al.
Publicado: (2025)
por: Pan, Leyi, et al.
Publicado: (2025)
Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt Distillation
por: Liu, Aiwei, et al.
Publicado: (2024)
por: Liu, Aiwei, et al.
Publicado: (2024)
Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?
por: Pan, Leyi, et al.
Publicado: (2025)
por: Pan, Leyi, et al.
Publicado: (2025)
A Semantic Invariant Robust Watermark for Large Language Models
por: Liu, Aiwei, et al.
Publicado: (2023)
por: Liu, Aiwei, et al.
Publicado: (2023)
WaterSeeker: Pioneering Efficient Detection of Watermarked Segments in Large Documents
por: Pan, Leyi, et al.
Publicado: (2024)
por: Pan, Leyi, et al.
Publicado: (2024)
A Survey on Parallel Text Generation: From Parallel Decoding to Diffusion Language Models
por: Zhang, Lingzhe, et al.
Publicado: (2025)
por: Zhang, Lingzhe, et al.
Publicado: (2025)
Can Watermarked LLMs be Identified by Users via Crafted Prompts?
por: Liu, Aiwei, et al.
Publicado: (2024)
por: Liu, Aiwei, et al.
Publicado: (2024)
TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated Weights
por: Liu, Aiwei, et al.
Publicado: (2024)
por: Liu, Aiwei, et al.
Publicado: (2024)
MicroRemed: Benchmarking LLMs in Microservices Remediation
por: Zhang, Lingzhe, et al.
Publicado: (2025)
por: Zhang, Lingzhe, et al.
Publicado: (2025)
MarkDiffusion: An Open-Source Toolkit for Generative Watermarking of Latent Diffusion Models
por: Pan, Leyi, et al.
Publicado: (2025)
por: Pan, Leyi, et al.
Publicado: (2025)
MarkLLM: An Open-Source Toolkit for LLM Watermarking
por: Pan, Leyi, et al.
Publicado: (2024)
por: Pan, Leyi, et al.
Publicado: (2024)
Math Natural Language Inference: this should be easy!
por: de Paiva, Valeria, et al.
Publicado: (2025)
por: de Paiva, Valeria, et al.
Publicado: (2025)
ChatCite: LLM Agent with Human Workflow Guidance for Comparative Literature Summary
por: Li, Yutong, et al.
Publicado: (2024)
por: Li, Yutong, et al.
Publicado: (2024)
Parametric Social Identity Injection and Diversification in Public Opinion Simulation
por: Wang, Hexi, et al.
Publicado: (2026)
por: Wang, Hexi, et al.
Publicado: (2026)
Evaluating Pixel Language Models on Non-Standardized Languages
por: Muñoz-Ortiz, Alberto, et al.
Publicado: (2024)
por: Muñoz-Ortiz, Alberto, et al.
Publicado: (2024)
Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation
por: Bayram, M. Ali, et al.
Publicado: (2024)
por: Bayram, M. Ali, et al.
Publicado: (2024)
Prompt Engineering and the Effectiveness of Large Language Models in Enhancing Human Productivity
por: Anam, Rizal Khoirul
Publicado: (2025)
por: Anam, Rizal Khoirul
Publicado: (2025)
Fast Quiet-STaR: Thinking Without Thought Tokens
por: Huang, Wei, et al.
Publicado: (2025)
por: Huang, Wei, et al.
Publicado: (2025)
Optimizing What We Trust: Reliability-Guided QUBO Selection of Multi-Agent Weak Framing Signals for Arabic Sentiment Prediction
por: Alkhalifa, Rabab
Publicado: (2026)
por: Alkhalifa, Rabab
Publicado: (2026)
Train-Attention: Meta-Learning Where to Focus in Continual Knowledge Learning
por: Seo, Yeongbin, et al.
Publicado: (2024)
por: Seo, Yeongbin, et al.
Publicado: (2024)
Prior-based Noisy Text Data Filtering: Fast and Strong Alternative For Perplexity
por: Seo, Yeongbin, et al.
Publicado: (2025)
por: Seo, Yeongbin, et al.
Publicado: (2025)
Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining
por: Mitchell, Rupert, et al.
Publicado: (2025)
por: Mitchell, Rupert, et al.
Publicado: (2025)
An Iterative Optimizing Framework for Radiology Report Summarization with ChatGPT
por: Ma, Chong, et al.
Publicado: (2023)
por: Ma, Chong, et al.
Publicado: (2023)
Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models
por: Lee, Yejin, et al.
Publicado: (2026)
por: Lee, Yejin, et al.
Publicado: (2026)
ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Models
por: Miliani, Martina, et al.
Publicado: (2025)
por: Miliani, Martina, et al.
Publicado: (2025)
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
por: Wang, Zhilin, et al.
Publicado: (2026)
por: Wang, Zhilin, et al.
Publicado: (2026)
NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context
por: Yao, Ben, et al.
Publicado: (2025)
por: Yao, Ben, et al.
Publicado: (2025)
The Superalignment of Superhuman Intelligence with Large Language Models
por: Huang, Minlie, et al.
Publicado: (2024)
por: Huang, Minlie, et al.
Publicado: (2024)
GATE: Graph-based Adaptive Tool Evolution Across Diverse Tasks
por: Luo, Jianwen, et al.
Publicado: (2025)
por: Luo, Jianwen, et al.
Publicado: (2025)
Empowering Tabular Data Preparation with Language Models: Why and How?
por: Chen, Mengshi, et al.
Publicado: (2025)
por: Chen, Mengshi, et al.
Publicado: (2025)
Towards Effective and Efficient Continual Pre-training of Large Language Models
por: Chen, Jie, et al.
Publicado: (2024)
por: Chen, Jie, et al.
Publicado: (2024)
Making Every Head Count: Sparse Attention Without the Speed-Performance Trade-off
por: Zhao, Mingkuan, et al.
Publicado: (2025)
por: Zhao, Mingkuan, et al.
Publicado: (2025)
A Survey on Natural Language Counterfactual Generation
por: Wang, Yongjie, et al.
Publicado: (2024)
por: Wang, Yongjie, et al.
Publicado: (2024)
Examining Linguistic Shifts in Academic Writing Before and After the Launch of ChatGPT: A Study on Preprint Papers
por: Bao, Tong, et al.
Publicado: (2025)
por: Bao, Tong, et al.
Publicado: (2025)
$FastDoc$: Domain-Specific Fast Continual Pre-training Technique using Document-Level Metadata and Taxonomy
por: Nandy, Abhilash, et al.
Publicado: (2023)
por: Nandy, Abhilash, et al.
Publicado: (2023)
Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense
por: Zhang, Zhehao, et al.
Publicado: (2025)
por: Zhang, Zhehao, et al.
Publicado: (2025)
Ejemplares similares
-
d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
por: Pan, Leyi, et al.
Publicado: (2025) -
On the Robustness of Document-Level Relation Extraction Models to Entity Name Variations
por: Meng, Shiao, et al.
Publicado: (2024) -
An Unforgeable Publicly Verifiable Watermark for Large Language Models
por: Liu, Aiwei, et al.
Publicado: (2023) -
A Survey of Text Watermarking in the Era of Large Language Models
por: Liu, Aiwei, et al.
Publicado: (2023) -
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
por: Pan, Leyi, et al.
Publicado: (2025)