SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yibo, Chen, Qing-Guo, Xu, Zhao, Luo, Weihua, Zhang, Kaifu, Zhang, Lijun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
di: Wang, Yibo, et al.
Pubblicazione: (2026)
di: Wang, Yibo, et al.
Pubblicazione: (2026)
Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees
di: Chen, Sijia, et al.
Pubblicazione: (2024)
di: Chen, Sijia, et al.
Pubblicazione: (2024)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
Building Decision Making Models Through Language Model Regime
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
di: Chen, Zixiang, et al.
Pubblicazione: (2024)
di: Chen, Zixiang, et al.
Pubblicazione: (2024)
MDP3: A Training-free Approach for List-wise Frame Selection in Video-LLMs
di: Sun, Hui, et al.
Pubblicazione: (2025)
di: Sun, Hui, et al.
Pubblicazione: (2025)
IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning
di: Liao, Wenjie, et al.
Pubblicazione: (2026)
di: Liao, Wenjie, et al.
Pubblicazione: (2026)
Self-Generative Adversarial Fine-Tuning for Large Language Models
di: Wu, Shiguang, et al.
Pubblicazione: (2026)
di: Wu, Shiguang, et al.
Pubblicazione: (2026)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
di: Li, Ziniu, et al.
Pubblicazione: (2024)
di: Li, Ziniu, et al.
Pubblicazione: (2024)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
di: Wang, Shumin, et al.
Pubblicazione: (2026)
di: Wang, Shumin, et al.
Pubblicazione: (2026)
Parrot: Multilingual Visual Instruction Tuning
di: Sun, Hai-Long, et al.
Pubblicazione: (2024)
di: Sun, Hai-Long, et al.
Pubblicazione: (2024)
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
Improving Large Language Models with Concept-Aware Fine-Tuning
di: Chen, Michael K., et al.
Pubblicazione: (2025)
di: Chen, Michael K., et al.
Pubblicazione: (2025)
Boosting Large Language Models with Mask Fine-Tuning
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
Resource-Efficient Federated Fine-Tuning Large Language Models for Heterogeneous Data
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
Sensitivity-LoRA: Low-Load Sensitivity-Based Fine-Tuning for Large Language Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Sparse Gradient Compression for Fine-Tuning Large Language Models
di: Yang, David H., et al.
Pubblicazione: (2025)
di: Yang, David H., et al.
Pubblicazione: (2025)
SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language Models
di: Lu, Xudong, et al.
Pubblicazione: (2024)
di: Lu, Xudong, et al.
Pubblicazione: (2024)
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
di: Duan, Lunhao, et al.
Pubblicazione: (2024)
di: Duan, Lunhao, et al.
Pubblicazione: (2024)
SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2026)
Differentially Private Subspace Fine-Tuning for Large Language Models
di: Zheng, Lele, et al.
Pubblicazione: (2026)
di: Zheng, Lele, et al.
Pubblicazione: (2026)
Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models
di: Zhang, Longteng, et al.
Pubblicazione: (2026)
di: Zhang, Longteng, et al.
Pubblicazione: (2026)
QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models
di: Zhou, Jiajun, et al.
Pubblicazione: (2025)
di: Zhou, Jiajun, et al.
Pubblicazione: (2025)
Communication-Efficient and Tensorized Federated Fine-Tuning of Large Language Models
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2024)
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2024)
SecP-Tuning: Efficient Privacy-Preserving Prompt Tuning for Large Language Models via MPC
di: Luo, Jinglong, et al.
Pubblicazione: (2025)
di: Luo, Jinglong, et al.
Pubblicazione: (2025)
ReNCE: Learning to Reason by Noise Contrastive Estimation
di: Zhang, Wenzheng, et al.
Pubblicazione: (2026)
di: Zhang, Wenzheng, et al.
Pubblicazione: (2026)
CLEFT: Language-Image Contrastive Learning with Efficient Large Language Model and Prompt Fine-Tuning
di: Du, Yuexi, et al.
Pubblicazione: (2024)
di: Du, Yuexi, et al.
Pubblicazione: (2024)
Decentralized Low-Rank Fine-Tuning of Large Language Models
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2025)
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2025)
Diversity in Large Language Models under Supervised Fine-Tuning
di: Klypa, Roman, et al.
Pubblicazione: (2026)
di: Klypa, Roman, et al.
Pubblicazione: (2026)
Wings: Learning Multimodal LLMs without Text-only Forgetting
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2024)
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2024)
On the connection between Noise-Contrastive Estimation and Contrastive Divergence
di: Olmin, Amanda, et al.
Pubblicazione: (2024)
di: Olmin, Amanda, et al.
Pubblicazione: (2024)
Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey
di: Han, Zeyu, et al.
Pubblicazione: (2024)
di: Han, Zeyu, et al.
Pubblicazione: (2024)
Data Augmentation of Contrastive Learning is Estimating Positive-incentive Noise
di: Zhang, Hongyuan, et al.
Pubblicazione: (2024)
di: Zhang, Hongyuan, et al.
Pubblicazione: (2024)
BackPlay: Head-Only Look-Back Self-Correction for Diffusion Language Models
di: Liu, Liming, et al.
Pubblicazione: (2026)
di: Liu, Liming, et al.
Pubblicazione: (2026)
A Dual Large Language Models Architecture with Herald Guided Prompts for Parallel Fine Grained Traffic Signal Control
di: Guo, Qing, et al.
Pubblicazione: (2025)
di: Guo, Qing, et al.
Pubblicazione: (2025)
Revisiting Projection-Free Online Learning with Time-Varying Constraints
di: Wang, Yibo, et al.
Pubblicazione: (2025)
di: Wang, Yibo, et al.
Pubblicazione: (2025)
Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique
di: Zhang, Zhehan, et al.
Pubblicazione: (2026)
di: Zhang, Zhehan, et al.
Pubblicazione: (2026)
Fine-Tuning Large Language Models for Stock Return Prediction Using Newsflow
di: Guo, Tian, et al.
Pubblicazione: (2024)
di: Guo, Tian, et al.
Pubblicazione: (2024)
Linearization Explains Fine-Tuning in Large Language Models
di: Afzal, Zahra Rahimi, et al.
Pubblicazione: (2026)
di: Afzal, Zahra Rahimi, et al.
Pubblicazione: (2026)
Dissecting Fine-Tuning Unlearning in Large Language Models
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
di: Wang, Yibo, et al.
Pubblicazione: (2026) -
Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees
di: Chen, Sijia, et al.
Pubblicazione: (2024) -
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
di: Lu, Shiyin, et al.
Pubblicazione: (2024) -
Building Decision Making Models Through Language Model Regime
di: Zhang, Yu, et al.
Pubblicazione: (2024) -
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
di: Chen, Zixiang, et al.
Pubblicazione: (2024)