Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Fred Zhangzhi, Fox, Alexis, Zhang, Anru R., Tong, Alexander |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone
par: Singh, Vaibhav, et autres
Publié: (2025)
par: Singh, Vaibhav, et autres
Publié: (2025)
Evaluating Generalization and Representation Stability in Small LMs via Prompting, Fine-Tuning and Out-of-Distribution Prompts
par: Raja, Rahul, et autres
Publié: (2025)
par: Raja, Rahul, et autres
Publié: (2025)
Don't Retrain, Just Reuse: Recovering Dual-Target Molecules from Single-Target Diffusion Models
par: Zeng, Qingyuan, et autres
Publié: (2026)
par: Zeng, Qingyuan, et autres
Publié: (2026)
Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
par: Kachaev, Nikita, et autres
Publié: (2025)
par: Kachaev, Nikita, et autres
Publié: (2025)
Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation
par: Chen, Daiwei, et autres
Publié: (2026)
par: Chen, Daiwei, et autres
Publié: (2026)
Coupling Models for One-Step Discrete Generation
par: Peng, Fred Zhangzhi, et autres
Publié: (2026)
par: Peng, Fred Zhangzhi, et autres
Publié: (2026)
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
par: Damani, Mehul, et autres
Publié: (2025)
par: Damani, Mehul, et autres
Publié: (2025)
Path Planning for Masked Diffusion Model Sampling
par: Peng, Fred Zhangzhi, et autres
Publié: (2025)
par: Peng, Fred Zhangzhi, et autres
Publié: (2025)
Forecasting Application Counts in Talent Acquisition Platforms: Harnessing Multimodal Signals using LMs
par: Kabir, Md Ahsanul, et autres
Publié: (2024)
par: Kabir, Md Ahsanul, et autres
Publié: (2024)
When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs
par: Jeong, Soyeong, et autres
Publié: (2025)
par: Jeong, Soyeong, et autres
Publié: (2025)
Addressing the Ecological Fallacy in Larger LMs with Human Context
par: Soni, Nikita, et autres
Publié: (2026)
par: Soni, Nikita, et autres
Publié: (2026)
OpenScholar: Synthesizing Scientific Literature with Retrieval-augmented LMs
par: Asai, Akari, et autres
Publié: (2024)
par: Asai, Akari, et autres
Publié: (2024)
Safety Alignment of LMs via Non-cooperative Games
par: Paulus, Anselm, et autres
Publié: (2025)
par: Paulus, Anselm, et autres
Publié: (2025)
Dodo: Dynamic Contextual Compression for Decoder-only LMs
par: Qin, Guanghui, et autres
Publié: (2023)
par: Qin, Guanghui, et autres
Publié: (2023)
Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds
par: Zhang, Jiefu, et autres
Publié: (2026)
par: Zhang, Jiefu, et autres
Publié: (2026)
ImProver 2: Iteratively Self-Improving LMs for Neurosymbolic Proof Optimization
par: Ahuja, Riyaz, et autres
Publié: (2026)
par: Ahuja, Riyaz, et autres
Publié: (2026)
$\textbf{PLUM}$: Improving Code LMs with Execution-Guided On-Policy Preference Learning Driven By Synthetic Test Cases
par: Zhang, Dylan, et autres
Publié: (2024)
par: Zhang, Dylan, et autres
Publié: (2024)
Don't Start from Scratch: Behavioral Refinement via Interpolant-based Policy Diffusion
par: Chen, Kaiqi, et autres
Publié: (2024)
par: Chen, Kaiqi, et autres
Publié: (2024)
SentinelLMs: Encrypted Input Adaptation and Fine-tuning of Language Models for Private and Secure Inference
par: Mishra, Abhijit, et autres
Publié: (2023)
par: Mishra, Abhijit, et autres
Publié: (2023)
NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness
par: Singhal, Manav, et autres
Publié: (2024)
par: Singhal, Manav, et autres
Publié: (2024)
Steering Masked Discrete Diffusion Models via Discrete Denoising Posterior Prediction
par: Rector-Brooks, Jarrid, et autres
Publié: (2024)
par: Rector-Brooks, Jarrid, et autres
Publié: (2024)
Don't Judge by the Look: Towards Motion Coherent Video Representation
par: Zhang, Yitian, et autres
Publié: (2024)
par: Zhang, Yitian, et autres
Publié: (2024)
Entropy-Aligned Decoding of LMs for Better Writing and Reasoning
par: Ahmed, Kareem, et autres
Publié: (2026)
par: Ahmed, Kareem, et autres
Publié: (2026)
Planner Aware Path Learning in Diffusion Language Models Training
par: Peng, Fred Zhangzhi, et autres
Publié: (2025)
par: Peng, Fred Zhangzhi, et autres
Publié: (2025)
Interpretable-by-Design Transformers via Architectural Stream Independence
par: Kerce, Clayton, et autres
Publié: (2026)
par: Kerce, Clayton, et autres
Publié: (2026)
Transformers Don't In-Context Learn Least Squares Regression
par: Hill, Joshua, et autres
Publié: (2025)
par: Hill, Joshua, et autres
Publié: (2025)
Don't Play Favorites: Minority Guidance for Diffusion Models
par: Um, Soobin, et autres
Publié: (2023)
par: Um, Soobin, et autres
Publié: (2023)
Enabling Approximate Joint Sampling in Diffusion LMs
par: Bansal, Parikshit, et autres
Publié: (2025)
par: Bansal, Parikshit, et autres
Publié: (2025)
Don't be lazy: CompleteP enables compute-efficient deep transformers
par: Dey, Nolan, et autres
Publié: (2025)
par: Dey, Nolan, et autres
Publié: (2025)
Improving Policy Optimization via $\varepsilon$-Retrain
par: Marzari, Luca, et autres
Publié: (2024)
par: Marzari, Luca, et autres
Publié: (2024)
Benchmarking is Broken -- Don't Let AI be its Own Judge
par: Cheng, Zerui, et autres
Publié: (2025)
par: Cheng, Zerui, et autres
Publié: (2025)
Don't Forget It! Conditional Sparse Autoencoder Clamping Works for Unlearning
par: Khoriaty, Matthew, et autres
Publié: (2025)
par: Khoriaty, Matthew, et autres
Publié: (2025)
Do's and Don'ts: Learning Desirable Skills with Instruction Videos
par: Kim, Hyunseung, et autres
Publié: (2024)
par: Kim, Hyunseung, et autres
Publié: (2024)
Don't Waste Your Time: Early Stopping Cross-Validation
par: Bergman, Edward, et autres
Publié: (2024)
par: Bergman, Edward, et autres
Publié: (2024)
Don't Trust: Verify -- Grounding LLM Quantitative Reasoning with Autoformalization
par: Zhou, Jin Peng, et autres
Publié: (2024)
par: Zhou, Jin Peng, et autres
Publié: (2024)
xAI-Drop: Don't Use What You Cannot Explain
par: De Luca, Vincenzo Marco, et autres
Publié: (2024)
par: De Luca, Vincenzo Marco, et autres
Publié: (2024)
Don't Lag, RAG: Training-Free Adversarial Detection Using RAG
par: Kazoom, Roie, et autres
Publié: (2025)
par: Kazoom, Roie, et autres
Publié: (2025)
Position: Don't Use the CLT in LLM Evals With Fewer Than a Few Hundred Datapoints
par: Bowyer, Sam, et autres
Publié: (2025)
par: Bowyer, Sam, et autres
Publié: (2025)
Linear Transformers as VAR Models: Aligning Autoregressive Attention Mechanisms with Autoregressive Forecasting
par: Lu, Jiecheng, et autres
Publié: (2025)
par: Lu, Jiecheng, et autres
Publié: (2025)
Reasoning Models Don't Always Say What They Think
par: Chen, Yanda, et autres
Publié: (2025)
par: Chen, Yanda, et autres
Publié: (2025)
Documents similaires
-
DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone
par: Singh, Vaibhav, et autres
Publié: (2025) -
Evaluating Generalization and Representation Stability in Small LMs via Prompting, Fine-Tuning and Out-of-Distribution Prompts
par: Raja, Rahul, et autres
Publié: (2025) -
Don't Retrain, Just Reuse: Recovering Dual-Target Molecules from Single-Target Diffusion Models
par: Zeng, Qingyuan, et autres
Publié: (2026) -
Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
par: Kachaev, Nikita, et autres
Publié: (2025) -
Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation
par: Chen, Daiwei, et autres
Publié: (2026)