DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Kaixuan, Chai, Jiajun, Li, Sicheng, Fu, Yuqian, Zhu, Yuanheng, Zhao, Dongbin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
von: Fu, Yuqian, et al.
Veröffentlicht: (2026)
von: Fu, Yuqian, et al.
Veröffentlicht: (2026)
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
von: Zhu, Yuanyang, et al.
Veröffentlicht: (2024)
von: Zhu, Yuanyang, et al.
Veröffentlicht: (2024)
DipSVD: Dual-importance Protected SVD for Efficient LLM Compression
von: Ding, Xuan, et al.
Veröffentlicht: (2025)
von: Ding, Xuan, et al.
Veröffentlicht: (2025)
Alignment Dynamics in LLM Fine-Tuning
von: Huang, Yuhan, et al.
Veröffentlicht: (2026)
von: Huang, Yuhan, et al.
Veröffentlicht: (2026)
MergeIT: From Selection to Merging for Efficient Instruction Tuning
von: Cai, Hongyi, et al.
Veröffentlicht: (2025)
von: Cai, Hongyi, et al.
Veröffentlicht: (2025)
Goal-Conditioned Supervised Learning for LLM Fine-Tuning
von: Li, Shijun, et al.
Veröffentlicht: (2026)
von: Li, Shijun, et al.
Veröffentlicht: (2026)
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
von: Chen, Haoxian, et al.
Veröffentlicht: (2024)
von: Chen, Haoxian, et al.
Veröffentlicht: (2024)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
von: Li, Qizheng, et al.
Veröffentlicht: (2026)
von: Li, Qizheng, et al.
Veröffentlicht: (2026)
AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air
von: Yang, Shiyi, et al.
Veröffentlicht: (2025)
von: Yang, Shiyi, et al.
Veröffentlicht: (2025)
Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning
von: Liu, Siyuan, et al.
Veröffentlicht: (2026)
von: Liu, Siyuan, et al.
Veröffentlicht: (2026)
Implicit Federated In-context Learning For Task-Specific LLM Fine-Tuning
von: Li, Dongcheng, et al.
Veröffentlicht: (2025)
von: Li, Dongcheng, et al.
Veröffentlicht: (2025)
Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning
von: Zheng, Han, et al.
Veröffentlicht: (2026)
von: Zheng, Han, et al.
Veröffentlicht: (2026)
Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies
von: Schweighofer, Kajetan, et al.
Veröffentlicht: (2026)
von: Schweighofer, Kajetan, et al.
Veröffentlicht: (2026)
LENSLLM: Unveiling Fine-Tuning Dynamics for LLM Selection
von: Zeng, Xinyue, et al.
Veröffentlicht: (2025)
von: Zeng, Xinyue, et al.
Veröffentlicht: (2025)
Prune 'n Predict: Optimizing LLM Decision-making with Conformal Prediction
von: Vishwakarma, Harit, et al.
Veröffentlicht: (2024)
von: Vishwakarma, Harit, et al.
Veröffentlicht: (2024)
A Hierarchical Deep Reinforcement Learning Framework for 6-DOF UCAV Air-to-Air Combat
von: Chai, Jiajun, et al.
Veröffentlicht: (2022)
von: Chai, Jiajun, et al.
Veröffentlicht: (2022)
Rank Also Matters: Hierarchical Configuration for Mixture of Adapter Experts in LLM Fine-Tuning
von: Cong, Peizhuang, et al.
Veröffentlicht: (2025)
von: Cong, Peizhuang, et al.
Veröffentlicht: (2025)
LEAD: Iterative Data Selection for Efficient LLM Instruction Tuning
von: Lin, Xiaotian, et al.
Veröffentlicht: (2025)
von: Lin, Xiaotian, et al.
Veröffentlicht: (2025)
SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning
von: Hossain, Saad, et al.
Veröffentlicht: (2025)
von: Hossain, Saad, et al.
Veröffentlicht: (2025)
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
Representation Without Reward: A JEPA Audit for LLM Fine-Tuning
von: Sengupta, Biswa
Veröffentlicht: (2026)
von: Sengupta, Biswa
Veröffentlicht: (2026)
Adaptive Ensembles of Fine-Tuned Transformers for LLM-Generated Text Detection
von: Lai, Zhixin, et al.
Veröffentlicht: (2024)
von: Lai, Zhixin, et al.
Veröffentlicht: (2024)
OAT-Rephrase: Optimization-Aware Training Data Rephrasing for Zeroth-Order LLM Fine-Tuning
von: Long, Jikai, et al.
Veröffentlicht: (2025)
von: Long, Jikai, et al.
Veröffentlicht: (2025)
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
von: Li, Xiaomin, et al.
Veröffentlicht: (2024)
von: Li, Xiaomin, et al.
Veröffentlicht: (2024)
Mitigating Non-IID Drift in Zeroth-Order Federated LLM Fine-Tuning with Transferable Sparsity
von: Ran, Yide, et al.
Veröffentlicht: (2025)
von: Ran, Yide, et al.
Veröffentlicht: (2025)
Parameter Efficiency Is Not Memory Efficiency: Rethinking Fine-Tuning for On-Device LLM Adaptation
von: Tenison, Irene, et al.
Veröffentlicht: (2026)
von: Tenison, Irene, et al.
Veröffentlicht: (2026)
MoFO: Momentum-Filtered Optimizer for Mitigating Forgetting in LLM Fine-Tuning
von: Chen, Yupeng, et al.
Veröffentlicht: (2024)
von: Chen, Yupeng, et al.
Veröffentlicht: (2024)
Understanding the Performance and Estimating the Cost of LLM Fine-Tuning
von: Xia, Yuchen, et al.
Veröffentlicht: (2024)
von: Xia, Yuchen, et al.
Veröffentlicht: (2024)
RL Fine-Tuning Heals OOD Forgetting in SFT
von: Jin, Hangzhan, et al.
Veröffentlicht: (2025)
von: Jin, Hangzhan, et al.
Veröffentlicht: (2025)
RL Is Neither a Panacea Nor a Mirage: Understanding Supervised vs. Reinforcement Learning Fine-Tuning for LLMs
von: Jin, Hangzhan, et al.
Veröffentlicht: (2025)
von: Jin, Hangzhan, et al.
Veröffentlicht: (2025)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
von: Ju, Yiming, et al.
Veröffentlicht: (2024)
von: Ju, Yiming, et al.
Veröffentlicht: (2024)
Tuning LLM Judge Design Decisions for 1/1000 of the Cost
von: Salinas, David, et al.
Veröffentlicht: (2025)
von: Salinas, David, et al.
Veröffentlicht: (2025)
MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning
von: Zhu, Sicheng, et al.
Veröffentlicht: (2026)
von: Zhu, Sicheng, et al.
Veröffentlicht: (2026)
Wireless Federated Multi-Task LLM Fine-Tuning via Sparse-and-Orthogonal LoRA
von: Yang, Nuocheng, et al.
Veröffentlicht: (2026)
von: Yang, Nuocheng, et al.
Veröffentlicht: (2026)
Robust and Efficient Zeroth-Order LLM Fine-Tuning via Adaptive Bayesian Subspace Optimizer
von: Feng, Jian, et al.
Veröffentlicht: (2026)
von: Feng, Jian, et al.
Veröffentlicht: (2026)
Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning
von: Qiu, Xin, et al.
Veröffentlicht: (2025)
von: Qiu, Xin, et al.
Veröffentlicht: (2025)
Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning
von: Liu, Yong, et al.
Veröffentlicht: (2024)
von: Liu, Yong, et al.
Veröffentlicht: (2024)
MSSR: Memory-Aware Adaptive Replay for Continual LLM Fine-Tuning
von: Lu, Yiyang, et al.
Veröffentlicht: (2026)
von: Lu, Yiyang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
von: Fu, Yuqian, et al.
Veröffentlicht: (2025) -
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025) -
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
von: Fu, Yuqian, et al.
Veröffentlicht: (2026) -
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
von: Zhu, Yuanyang, et al.
Veröffentlicht: (2024) -
DipSVD: Dual-importance Protected SVD for Efficient LLM Compression
von: Ding, Xuan, et al.
Veröffentlicht: (2025)