Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zekri, Oussama, Boullé, Nicolas |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Generalized Discrete Diffusion from Snapshots
von: Zekri, Oussama, et al.
Veröffentlicht: (2026)
von: Zekri, Oussama, et al.
Veröffentlicht: (2026)
Large Language Models as Markov Chains
von: Zekri, Oussama, et al.
Veröffentlicht: (2024)
von: Zekri, Oussama, et al.
Veröffentlicht: (2024)
Can LLMs predict the convergence of Stochastic Gradient Descent?
von: Zekri, Oussama, et al.
Veröffentlicht: (2024)
von: Zekri, Oussama, et al.
Veröffentlicht: (2024)
Fine-Tuning Language Models with Reward Learning on Policy
von: Lang, Hao, et al.
Veröffentlicht: (2024)
von: Lang, Hao, et al.
Veröffentlicht: (2024)
Parameter-Efficient Fine-Tuning with Discrete Fourier Transform
von: Gao, Ziqi, et al.
Veröffentlicht: (2024)
von: Gao, Ziqi, et al.
Veröffentlicht: (2024)
Simple Policy Gradients for Reasoning with Diffusion Language Models
von: Zhan, Anthony
Veröffentlicht: (2025)
von: Zhan, Anthony
Veröffentlicht: (2025)
Hallucination Detection in LLMs: Fast and Memory-Efficient Fine-Tuned Models
von: Arteaga, Gabriel Y., et al.
Veröffentlicht: (2024)
von: Arteaga, Gabriel Y., et al.
Veröffentlicht: (2024)
AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air
von: Yang, Shiyi, et al.
Veröffentlicht: (2025)
von: Yang, Shiyi, et al.
Veröffentlicht: (2025)
ClusterUCB: Efficient Gradient-Based Data Selection for Targeted Fine-Tuning of LLMs
von: Wang, Zige, et al.
Veröffentlicht: (2025)
von: Wang, Zige, et al.
Veröffentlicht: (2025)
Model Editing by Standard Fine-Tuning
von: Gangadhar, Govind, et al.
Veröffentlicht: (2024)
von: Gangadhar, Govind, et al.
Veröffentlicht: (2024)
Directional Gradient Projection for Robust Fine-Tuning of Foundation Models
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
Parameter-Efficient Fine-Tuning for Foundation Models
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025)
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025)
Boosting Large Language Models with Mask Fine-Tuning
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
Scaling Sparse Fine-Tuning to Large Language Models
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
Fine-Tuning Improves Information Conveyance in Language Models
von: Cheng, Yuwei, et al.
Veröffentlicht: (2026)
von: Cheng, Yuwei, et al.
Veröffentlicht: (2026)
In-Context Fine-Tuning for Time-Series Foundation Models
von: Das, Abhimanyu, et al.
Veröffentlicht: (2024)
von: Das, Abhimanyu, et al.
Veröffentlicht: (2024)
Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models
von: Gautam, Tanmay, et al.
Veröffentlicht: (2024)
von: Gautam, Tanmay, et al.
Veröffentlicht: (2024)
Proximal Supervised Fine-Tuning
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
Non-Markovian Discrete Diffusion with Causal Language Models
von: Zhang, Yangtian, et al.
Veröffentlicht: (2025)
von: Zhang, Yangtian, et al.
Veröffentlicht: (2025)
Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards
von: Pandey, Punya Syon, et al.
Veröffentlicht: (2025)
von: Pandey, Punya Syon, et al.
Veröffentlicht: (2025)
ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models
von: Singhal, Raghav, et al.
Veröffentlicht: (2025)
von: Singhal, Raghav, et al.
Veröffentlicht: (2025)
Improving Large Language Models with Concept-Aware Fine-Tuning
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
Crafting Efficient Fine-Tuning Strategies for Large Language Models
von: Oliver, Michael, et al.
Veröffentlicht: (2024)
von: Oliver, Michael, et al.
Veröffentlicht: (2024)
Unintended Memorization of Sensitive Information in Fine-Tuned Language Models
von: Szep, Marton, et al.
Veröffentlicht: (2026)
von: Szep, Marton, et al.
Veröffentlicht: (2026)
G-Loss: Graph-Guided Fine-Tuning of Language Models
von: Sharma, Aditya, et al.
Veröffentlicht: (2026)
von: Sharma, Aditya, et al.
Veröffentlicht: (2026)
Generalized Interpolating Discrete Diffusion
von: von Rütte, Dimitri, et al.
Veröffentlicht: (2025)
von: von Rütte, Dimitri, et al.
Veröffentlicht: (2025)
GRAD: Generative Retrieval-Aligned Demonstration Sampler for Efficient Few-Shot Reasoning
von: Gabouj, Oussama, et al.
Veröffentlicht: (2025)
von: Gabouj, Oussama, et al.
Veröffentlicht: (2025)
Order-Independence Without Fine Tuning
von: McIlroy-Young, Reid, et al.
Veröffentlicht: (2024)
von: McIlroy-Young, Reid, et al.
Veröffentlicht: (2024)
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior
von: Doyle, Cooper
Veröffentlicht: (2025)
von: Doyle, Cooper
Veröffentlicht: (2025)
Neural Parameter Search for Slimmer Fine-Tuned Models and Better Transfer
von: Du, Guodong, et al.
Veröffentlicht: (2025)
von: Du, Guodong, et al.
Veröffentlicht: (2025)
Parameter-Efficient Fine-Tuning in Large Models: A Survey of Methodologies
von: Wang, Luping, et al.
Veröffentlicht: (2024)
von: Wang, Luping, et al.
Veröffentlicht: (2024)
Fine-Tuning a Time Series Foundation Model with Wasserstein Loss
von: Chernov, Andrei
Veröffentlicht: (2024)
von: Chernov, Andrei
Veröffentlicht: (2024)
DARE the Extreme: Revisiting Delta-Parameter Pruning For Fine-Tuned Models
von: Deng, Wenlong, et al.
Veröffentlicht: (2024)
von: Deng, Wenlong, et al.
Veröffentlicht: (2024)
Mafin: Enhancing Black-Box Embeddings with Model Augmented Fine-Tuning
von: Zhang, Mingtian, et al.
Veröffentlicht: (2024)
von: Zhang, Mingtian, et al.
Veröffentlicht: (2024)
Continuous Diffusion Scales Competitively with Discrete Diffusion for Language
von: Yang, Zhihan, et al.
Veröffentlicht: (2026)
von: Yang, Zhihan, et al.
Veröffentlicht: (2026)
PoliTune: Analyzing the Impact of Data Selection and Fine-Tuning on Economic and Political Biases in Large Language Models
von: Agiza, Ahmed, et al.
Veröffentlicht: (2024)
von: Agiza, Ahmed, et al.
Veröffentlicht: (2024)
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024)
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
von: Chen, Zixiang, et al.
Veröffentlicht: (2024)
von: Chen, Zixiang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Generalized Discrete Diffusion from Snapshots
von: Zekri, Oussama, et al.
Veröffentlicht: (2026) -
Large Language Models as Markov Chains
von: Zekri, Oussama, et al.
Veröffentlicht: (2024) -
Can LLMs predict the convergence of Stochastic Gradient Descent?
von: Zekri, Oussama, et al.
Veröffentlicht: (2024) -
Fine-Tuning Language Models with Reward Learning on Policy
von: Lang, Hao, et al.
Veröffentlicht: (2024) -
Parameter-Efficient Fine-Tuning with Discrete Fourier Transform
von: Gao, Ziqi, et al.
Veröffentlicht: (2024)