Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
Fuente:
arXiv
Guardado en:
| Autores principales: | Zekri, Oussama, Boullé, Nicolas |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generalized Discrete Diffusion from Snapshots
por: Zekri, Oussama, et al.
Publicado: (2026)
por: Zekri, Oussama, et al.
Publicado: (2026)
Large Language Models as Markov Chains
por: Zekri, Oussama, et al.
Publicado: (2024)
por: Zekri, Oussama, et al.
Publicado: (2024)
Can LLMs predict the convergence of Stochastic Gradient Descent?
por: Zekri, Oussama, et al.
Publicado: (2024)
por: Zekri, Oussama, et al.
Publicado: (2024)
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024)
por: Lang, Hao, et al.
Publicado: (2024)
Parameter-Efficient Fine-Tuning with Discrete Fourier Transform
por: Gao, Ziqi, et al.
Publicado: (2024)
por: Gao, Ziqi, et al.
Publicado: (2024)
Simple Policy Gradients for Reasoning with Diffusion Language Models
por: Zhan, Anthony
Publicado: (2025)
por: Zhan, Anthony
Publicado: (2025)
Hallucination Detection in LLMs: Fast and Memory-Efficient Fine-Tuned Models
por: Arteaga, Gabriel Y., et al.
Publicado: (2024)
por: Arteaga, Gabriel Y., et al.
Publicado: (2024)
AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air
por: Yang, Shiyi, et al.
Publicado: (2025)
por: Yang, Shiyi, et al.
Publicado: (2025)
ClusterUCB: Efficient Gradient-Based Data Selection for Targeted Fine-Tuning of LLMs
por: Wang, Zige, et al.
Publicado: (2025)
por: Wang, Zige, et al.
Publicado: (2025)
Model Editing by Standard Fine-Tuning
por: Gangadhar, Govind, et al.
Publicado: (2024)
por: Gangadhar, Govind, et al.
Publicado: (2024)
Directional Gradient Projection for Robust Fine-Tuning of Foundation Models
por: Huang, Chengyue, et al.
Publicado: (2025)
por: Huang, Chengyue, et al.
Publicado: (2025)
Parameter-Efficient Fine-Tuning for Foundation Models
por: Zhang, Dan, et al.
Publicado: (2025)
por: Zhang, Dan, et al.
Publicado: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
por: Fu, Yuqian, et al.
Publicado: (2025)
por: Fu, Yuqian, et al.
Publicado: (2025)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
por: Heuillet, Maxime, et al.
Publicado: (2025)
por: Heuillet, Maxime, et al.
Publicado: (2025)
Boosting Large Language Models with Mask Fine-Tuning
por: Zhang, Mingyuan, et al.
Publicado: (2025)
por: Zhang, Mingyuan, et al.
Publicado: (2025)
Scaling Sparse Fine-Tuning to Large Language Models
por: Ansell, Alan, et al.
Publicado: (2024)
por: Ansell, Alan, et al.
Publicado: (2024)
Fine-Tuning Improves Information Conveyance in Language Models
por: Cheng, Yuwei, et al.
Publicado: (2026)
por: Cheng, Yuwei, et al.
Publicado: (2026)
In-Context Fine-Tuning for Time-Series Foundation Models
por: Das, Abhimanyu, et al.
Publicado: (2024)
por: Das, Abhimanyu, et al.
Publicado: (2024)
Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models
por: Gautam, Tanmay, et al.
Publicado: (2024)
por: Gautam, Tanmay, et al.
Publicado: (2024)
Proximal Supervised Fine-Tuning
por: Zhu, Wenhong, et al.
Publicado: (2025)
por: Zhu, Wenhong, et al.
Publicado: (2025)
Non-Markovian Discrete Diffusion with Causal Language Models
por: Zhang, Yangtian, et al.
Publicado: (2025)
por: Zhang, Yangtian, et al.
Publicado: (2025)
Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards
por: Pandey, Punya Syon, et al.
Publicado: (2025)
por: Pandey, Punya Syon, et al.
Publicado: (2025)
ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models
por: Singhal, Raghav, et al.
Publicado: (2025)
por: Singhal, Raghav, et al.
Publicado: (2025)
Improving Large Language Models with Concept-Aware Fine-Tuning
por: Chen, Michael K., et al.
Publicado: (2025)
por: Chen, Michael K., et al.
Publicado: (2025)
Crafting Efficient Fine-Tuning Strategies for Large Language Models
por: Oliver, Michael, et al.
Publicado: (2024)
por: Oliver, Michael, et al.
Publicado: (2024)
Unintended Memorization of Sensitive Information in Fine-Tuned Language Models
por: Szep, Marton, et al.
Publicado: (2026)
por: Szep, Marton, et al.
Publicado: (2026)
G-Loss: Graph-Guided Fine-Tuning of Language Models
por: Sharma, Aditya, et al.
Publicado: (2026)
por: Sharma, Aditya, et al.
Publicado: (2026)
Generalized Interpolating Discrete Diffusion
por: von Rütte, Dimitri, et al.
Publicado: (2025)
por: von Rütte, Dimitri, et al.
Publicado: (2025)
GRAD: Generative Retrieval-Aligned Demonstration Sampler for Efficient Few-Shot Reasoning
por: Gabouj, Oussama, et al.
Publicado: (2025)
por: Gabouj, Oussama, et al.
Publicado: (2025)
Order-Independence Without Fine Tuning
por: McIlroy-Young, Reid, et al.
Publicado: (2024)
por: McIlroy-Young, Reid, et al.
Publicado: (2024)
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior
por: Doyle, Cooper
Publicado: (2025)
por: Doyle, Cooper
Publicado: (2025)
Neural Parameter Search for Slimmer Fine-Tuned Models and Better Transfer
por: Du, Guodong, et al.
Publicado: (2025)
por: Du, Guodong, et al.
Publicado: (2025)
Parameter-Efficient Fine-Tuning in Large Models: A Survey of Methodologies
por: Wang, Luping, et al.
Publicado: (2024)
por: Wang, Luping, et al.
Publicado: (2024)
Fine-Tuning a Time Series Foundation Model with Wasserstein Loss
por: Chernov, Andrei
Publicado: (2024)
por: Chernov, Andrei
Publicado: (2024)
DARE the Extreme: Revisiting Delta-Parameter Pruning For Fine-Tuned Models
por: Deng, Wenlong, et al.
Publicado: (2024)
por: Deng, Wenlong, et al.
Publicado: (2024)
Mafin: Enhancing Black-Box Embeddings with Model Augmented Fine-Tuning
por: Zhang, Mingtian, et al.
Publicado: (2024)
por: Zhang, Mingtian, et al.
Publicado: (2024)
Continuous Diffusion Scales Competitively with Discrete Diffusion for Language
por: Yang, Zhihan, et al.
Publicado: (2026)
por: Yang, Zhihan, et al.
Publicado: (2026)
PoliTune: Analyzing the Impact of Data Selection and Fine-Tuning on Economic and Political Biases in Large Language Models
por: Agiza, Ahmed, et al.
Publicado: (2024)
por: Agiza, Ahmed, et al.
Publicado: (2024)
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
por: Yuan, Huizhuo, et al.
Publicado: (2024)
por: Yuan, Huizhuo, et al.
Publicado: (2024)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
por: Chen, Zixiang, et al.
Publicado: (2024)
por: Chen, Zixiang, et al.
Publicado: (2024)
Ejemplares similares
-
Generalized Discrete Diffusion from Snapshots
por: Zekri, Oussama, et al.
Publicado: (2026) -
Large Language Models as Markov Chains
por: Zekri, Oussama, et al.
Publicado: (2024) -
Can LLMs predict the convergence of Stochastic Gradient Descent?
por: Zekri, Oussama, et al.
Publicado: (2024) -
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024) -
Parameter-Efficient Fine-Tuning with Discrete Fourier Transform
por: Gao, Ziqi, et al.
Publicado: (2024)