Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yibo, Sun, Hai-Long, Chen, Qing-Guo, Xu, Zhao, Luo, Weihua, Zhang, Kaifu, Zhang, Lijun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
par: Wang, Yibo, et autres
Publié: (2025)
par: Wang, Yibo, et autres
Publié: (2025)
Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
MDP3: A Training-free Approach for List-wise Frame Selection in Video-LLMs
par: Sun, Hui, et autres
Publié: (2025)
par: Sun, Hui, et autres
Publié: (2025)
Parrot: Multilingual Visual Instruction Tuning
par: Sun, Hai-Long, et autres
Publié: (2024)
par: Sun, Hai-Long, et autres
Publié: (2024)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
par: Li, Wu, et autres
Publié: (2026)
par: Li, Wu, et autres
Publié: (2026)
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
par: Fu, Minghao, et autres
Publié: (2025)
par: Fu, Minghao, et autres
Publié: (2025)
CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
par: Fu, Minghao, et autres
Publié: (2025)
par: Fu, Minghao, et autres
Publié: (2025)
TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
par: Fu, Minghao, et autres
Publié: (2025)
par: Fu, Minghao, et autres
Publié: (2025)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
par: Dai, Ziqi, et autres
Publié: (2025)
par: Dai, Ziqi, et autres
Publié: (2025)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
par: Yang, Wenhao, et autres
Publié: (2025)
par: Yang, Wenhao, et autres
Publié: (2025)
Effective Action and Gravitational Pair Production in (A)dS Spacetime
par: Zhou, Yu, et autres
Publié: (2024)
par: Zhou, Yu, et autres
Publié: (2024)
Towards Better Understanding of Cybercrime: The Role of Fine-Tuned LLMs in Translation
par: Valeros, Veronica, et autres
Publié: (2024)
par: Valeros, Veronica, et autres
Publié: (2024)
Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
par: Kong, Aobo, et autres
Publié: (2024)
par: Kong, Aobo, et autres
Publié: (2024)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
par: Lu, Shiyin, et autres
Publié: (2024)
par: Lu, Shiyin, et autres
Publié: (2024)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
par: Guo, Song, et autres
Publié: (2024)
par: Guo, Song, et autres
Publié: (2024)
Wings: Learning Multimodal LLMs without Text-only Forgetting
par: Zhang, Yi-Kai, et autres
Publié: (2024)
par: Zhang, Yi-Kai, et autres
Publié: (2024)
Challenging Multilingual LLMs: A New Taxonomy and Benchmark for Unraveling Hallucination in Translation
par: Wu, Xinwei, et autres
Publié: (2025)
par: Wu, Xinwei, et autres
Publié: (2025)
Marco-ASR: A Principled and Metric-Driven Framework for Fine-Tuning Large-Scale ASR Models for Domain Adaptation
par: Ni, Xuanfan, et autres
Publié: (2025)
par: Ni, Xuanfan, et autres
Publié: (2025)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
par: Cui, Tianyu, et autres
Publié: (2025)
par: Cui, Tianyu, et autres
Publié: (2025)
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
Building Decision Making Models Through Language Model Regime
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
Multimodal Tabular Reasoning with Privileged Structured Information
par: Jiang, Jun-Peng, et autres
Publié: (2025)
par: Jiang, Jun-Peng, et autres
Publié: (2025)
Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs
par: Wu, Xinwei, et autres
Publié: (2026)
par: Wu, Xinwei, et autres
Publié: (2026)
Two Intermediate Translations Are Better Than One: Fine-tuning LLMs for Document-level Translation Refinement
par: Dong, Yichen, et autres
Publié: (2025)
par: Dong, Yichen, et autres
Publié: (2025)
Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs
par: Zhang, Kairun, et autres
Publié: (2025)
par: Zhang, Kairun, et autres
Publié: (2025)
Two Heads Are Better Than One: Averaging along Fine-Tuning to Improve Targeted Transferability
par: Zeng, Hui, et autres
Publié: (2024)
par: Zeng, Hui, et autres
Publié: (2024)
Omni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview images
par: Hu, JiaKui, et autres
Publié: (2025)
par: Hu, JiaKui, et autres
Publié: (2025)
Two Is Better Than One: Aligned Representation Pairs for Anomaly Detection
par: Ryser, Alain, et autres
Publié: (2024)
par: Ryser, Alain, et autres
Publié: (2024)
Dialogue is Better Than Monologue: Instructing Medical LLMs via Strategical Conversations
par: Liu, Zijie, et autres
Publié: (2025)
par: Liu, Zijie, et autres
Publié: (2025)
A State-Transition Framework for Efficient LLM Reasoning
par: Zhang, Liang, et autres
Publié: (2026)
par: Zhang, Liang, et autres
Publié: (2026)
Spin-Triplet Pairing in Heavy Nuclei is Stable Against Deformation
par: Palkanoglou, G., et autres
Publié: (2024)
par: Palkanoglou, G., et autres
Publié: (2024)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
par: Yang, Wenhao, et autres
Publié: (2026)
par: Yang, Wenhao, et autres
Publié: (2026)
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
par: Duan, Lunhao, et autres
Publié: (2024)
par: Duan, Lunhao, et autres
Publié: (2024)
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
par: Zhao, Yu, et autres
Publié: (2024)
par: Zhao, Yu, et autres
Publié: (2024)
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
par: Yuan, Huizhuo, et autres
Publié: (2024)
par: Yuan, Huizhuo, et autres
Publié: (2024)
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
par: He, Junwen, et autres
Publié: (2024)
par: He, Junwen, et autres
Publié: (2024)
Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teaching
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
Span-level Emotion-Cause-Category Triplet Extraction with Instruction Tuning LLMs and Data Augmentation
par: Li, Xiangju, et autres
Publié: (2025)
par: Li, Xiangju, et autres
Publié: (2025)
Documents similaires
-
SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
par: Wang, Yibo, et autres
Publié: (2025) -
Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees
par: Chen, Sijia, et autres
Publié: (2024) -
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
par: Wang, Yibo, et autres
Publié: (2026) -
MDP3: A Training-free Approach for List-wise Frame Selection in Video-LLMs
par: Sun, Hui, et autres
Publié: (2025) -
Parrot: Multilingual Visual Instruction Tuning
par: Sun, Hai-Long, et autres
Publié: (2024)