Unlocking Large Language Model's Planning Capabilities with Maximum Diversity Fine-tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Wenjun, Chen, Changyu, Varakantham, Pradeep |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
por: Ge, Zichang, et al.
Publicado: (2025)
por: Ge, Zichang, et al.
Publicado: (2025)
Enhancing the Hierarchical Environment Design via Generative Trajectory Modeling
por: Li, Dexun, et al.
Publicado: (2023)
por: Li, Dexun, et al.
Publicado: (2023)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
por: Lu, Yuxiao, et al.
Publicado: (2024)
por: Lu, Yuxiao, et al.
Publicado: (2024)
Efficient Unsupervised Environment Design through Hierarchical Policy Representation Learning
por: Li, Dexun, et al.
Publicado: (2026)
por: Li, Dexun, et al.
Publicado: (2026)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
por: Chen, Pin-Yu, et al.
Publicado: (2025)
por: Chen, Pin-Yu, et al.
Publicado: (2025)
Offline Safe Policy Optimization From Heterogeneous Feedback
por: Gong, Ze, et al.
Publicado: (2025)
por: Gong, Ze, et al.
Publicado: (2025)
Optimizing Ride-Pooling Operations with Extended Pickup and Drop-Off Flexibility
por: Jiang, Hao, et al.
Publicado: (2025)
por: Jiang, Hao, et al.
Publicado: (2025)
UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations
por: Hoang, Huy, et al.
Publicado: (2024)
por: Hoang, Huy, et al.
Publicado: (2024)
Offline Safe Reinforcement Learning Using Trajectory Classification
por: Gong, Ze, et al.
Publicado: (2024)
por: Gong, Ze, et al.
Publicado: (2024)
On Minimizing Adversarial Counterfactual Error in Adversarial RL
por: Belaire, Roman, et al.
Publicado: (2024)
por: Belaire, Roman, et al.
Publicado: (2024)
SPRINQL: Sub-optimal Demonstrations driven Offline Imitation Learning
por: Hoang, Huy, et al.
Publicado: (2024)
por: Hoang, Huy, et al.
Publicado: (2024)
Preserving the Privacy of Reward Functions in MDPs through Deception
por: Chirra, Shashank Reddy, et al.
Publicado: (2024)
por: Chirra, Shashank Reddy, et al.
Publicado: (2024)
Safety through feedback in Constrained RL
por: Chirra, Shashank Reddy, et al.
Publicado: (2024)
por: Chirra, Shashank Reddy, et al.
Publicado: (2024)
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
por: Lu, Yuxiao, et al.
Publicado: (2023)
por: Lu, Yuxiao, et al.
Publicado: (2023)
Imitate the Good and Avoid the Bad: An Incremental Approach to Safe Reinforcement Learning
por: Hoang, Huy, et al.
Publicado: (2023)
por: Hoang, Huy, et al.
Publicado: (2023)
Automatic LLM Red Teaming
por: Belaire, Roman, et al.
Publicado: (2025)
por: Belaire, Roman, et al.
Publicado: (2025)
EduQate: Generating Adaptive Curricula through RMABs in Education Settings
por: Tio, Sidney, et al.
Publicado: (2024)
por: Tio, Sidney, et al.
Publicado: (2024)
Semi-supervised Fine-tuning for Large Language Models
por: Luo, Junyu, et al.
Publicado: (2024)
por: Luo, Junyu, et al.
Publicado: (2024)
Imitating Cost-Constrained Behaviors in Reinforcement Learning
por: Shao, Qian, et al.
Publicado: (2024)
por: Shao, Qian, et al.
Publicado: (2024)
Privacy-preserving Fine-tuning of Large Language Models through Flatness
por: Chen, Tiejin, et al.
Publicado: (2024)
por: Chen, Tiejin, et al.
Publicado: (2024)
Refine Large Language Model Fine-tuning via Instruction Vector
por: Jiang, Gangwei, et al.
Publicado: (2024)
por: Jiang, Gangwei, et al.
Publicado: (2024)
Revisiting the Travel Planning Capabilities of Large Language Models
por: Zhang, Bo-Wen, et al.
Publicado: (2026)
por: Zhang, Bo-Wen, et al.
Publicado: (2026)
Unlocking Reasoning Capability on Machine Translation in Large Language Models
por: Rajaee, Sara, et al.
Publicado: (2026)
por: Rajaee, Sara, et al.
Publicado: (2026)
On Discovering Algorithms for Adversarial Imitation Learning
por: Chirra, Shashank Reddy, et al.
Publicado: (2025)
por: Chirra, Shashank Reddy, et al.
Publicado: (2025)
Privacy in Fine-tuning Large Language Models: Attacks, Defenses, and Future Directions
por: Du, Hao, et al.
Publicado: (2024)
por: Du, Hao, et al.
Publicado: (2024)
Regret-Based Defense in Adversarial Reinforcement Learning
por: Belaire, Roman, et al.
Publicado: (2023)
por: Belaire, Roman, et al.
Publicado: (2023)
Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
por: Hoang, Huy, et al.
Publicado: (2025)
por: Hoang, Huy, et al.
Publicado: (2025)
Federated Fine-tuning of Large Language Models under Heterogeneous Tasks and Client Resources
por: Bai, Jiamu, et al.
Publicado: (2024)
por: Bai, Jiamu, et al.
Publicado: (2024)
KnowTuning: Knowledge-aware Fine-tuning for Large Language Models
por: Lyu, Yougang, et al.
Publicado: (2024)
por: Lyu, Yougang, et al.
Publicado: (2024)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
por: Li, Ziniu, et al.
Publicado: (2024)
por: Li, Ziniu, et al.
Publicado: (2024)
Fine-tuning Large Language Model for Automated Algorithm Design
por: Liu, Fei, et al.
Publicado: (2025)
por: Liu, Fei, et al.
Publicado: (2025)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
por: Wang, Yibo, et al.
Publicado: (2025)
por: Wang, Yibo, et al.
Publicado: (2025)
Cooperative Strategic Planning Enhances Reasoning Capabilities in Large Language Models
por: Wang, Danqing, et al.
Publicado: (2024)
por: Wang, Danqing, et al.
Publicado: (2024)
Are Large Brainwave Foundation Models Capable Yet? Insights from Fine-tuning
por: Lee, Na, et al.
Publicado: (2025)
por: Lee, Na, et al.
Publicado: (2025)
Demystifying Instruction Mixing for Fine-tuning Large Language Models
por: Wang, Renxi, et al.
Publicado: (2023)
por: Wang, Renxi, et al.
Publicado: (2023)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
por: Zhu, Lianghui, et al.
Publicado: (2023)
por: Zhu, Lianghui, et al.
Publicado: (2023)
Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation
por: Bellaouar, Slimane, et al.
Publicado: (2025)
por: Bellaouar, Slimane, et al.
Publicado: (2025)
Compositional Subspace Representation Fine-tuning for Adaptive Large Language Models
por: Zhou, Andy
Publicado: (2025)
por: Zhou, Andy
Publicado: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
por: Song, Weixi, et al.
Publicado: (2023)
por: Song, Weixi, et al.
Publicado: (2023)
MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
por: Tong, Xin, et al.
Publicado: (2025)
por: Tong, Xin, et al.
Publicado: (2025)
Ejemplares similares
-
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
por: Ge, Zichang, et al.
Publicado: (2025) -
Enhancing the Hierarchical Environment Design via Generative Trajectory Modeling
por: Li, Dexun, et al.
Publicado: (2023) -
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
por: Lu, Yuxiao, et al.
Publicado: (2024) -
Efficient Unsupervised Environment Design through Hierarchical Policy Representation Learning
por: Li, Dexun, et al.
Publicado: (2026) -
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
por: Chen, Pin-Yu, et al.
Publicado: (2025)