How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Teng, Li, Mingxiao, Yuan, Yige, Zhu, Huaisheng, Cui, Chao, Honavar, Vasant G |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
MolBind: Multimodal Alignment of Language, Molecules, and Proteins
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
3M-Diffusion: Latent Multi-Modal Diffusion for Language-Guided Molecular Structure Generation
di: Zhu, Huaisheng, et al.
Pubblicazione: (2024)
di: Zhu, Huaisheng, et al.
Pubblicazione: (2024)
On a Connection Between Imitation Learning and RLHF
di: Xiao, Teng, et al.
Pubblicazione: (2025)
di: Xiao, Teng, et al.
Pubblicazione: (2025)
SimPER: A Minimalist Approach to Preference Alignment without Hyperparameters
di: Xiao, Teng, et al.
Pubblicazione: (2025)
di: Xiao, Teng, et al.
Pubblicazione: (2025)
GeomCLIP: Contrastive Geometry-Text Pre-training for Molecules
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models
di: Ren, Weijieying, et al.
Pubblicazione: (2025)
di: Ren, Weijieying, et al.
Pubblicazione: (2025)
Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning
di: Dalvi, Abhishek, et al.
Pubblicazione: (2026)
di: Dalvi, Abhishek, et al.
Pubblicazione: (2026)
Simple Denoising Diffusion Language Models
di: Zhu, Huaisheng, et al.
Pubblicazione: (2025)
di: Zhu, Huaisheng, et al.
Pubblicazione: (2025)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
di: Xiao, Teng, et al.
Pubblicazione: (2026)
di: Xiao, Teng, et al.
Pubblicazione: (2026)
EsaCL: Efficient Continual Learning of Sparse Models
di: Ren, Weijieying, et al.
Pubblicazione: (2024)
di: Ren, Weijieying, et al.
Pubblicazione: (2024)
The Path of Self-Evolving Large Language Models: Achieving Data-Efficient Learning via Intrinsic Feedback
di: Zhang, Hangfan, et al.
Pubblicazione: (2025)
di: Zhang, Hangfan, et al.
Pubblicazione: (2025)
Hyperdimensional Representation Learning for Node Classification and Link Prediction
di: Dalvi, Abhishek, et al.
Pubblicazione: (2024)
di: Dalvi, Abhishek, et al.
Pubblicazione: (2024)
From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment
di: Xie, Bin, et al.
Pubblicazione: (2025)
di: Xie, Bin, et al.
Pubblicazione: (2025)
Inference-time Alignment in Continuous Space
di: Yuan, Yige, et al.
Pubblicazione: (2025)
di: Yuan, Yige, et al.
Pubblicazione: (2025)
UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language Models
di: Xue, Boyang, et al.
Pubblicazione: (2024)
di: Xue, Boyang, et al.
Pubblicazione: (2024)
Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment
di: Guo, Geyang, et al.
Pubblicazione: (2023)
di: Guo, Geyang, et al.
Pubblicazione: (2023)
ULMA: Unified Language Model Alignment with Human Demonstration and Point-wise Preference
di: Cai, Tianchi, et al.
Pubblicazione: (2023)
di: Cai, Tianchi, et al.
Pubblicazione: (2023)
C-HDNet: Hyperdimensional Computing for Causal Effect Estimation from Observational Data Under Network Interference
di: Dalvi, Abhishek, et al.
Pubblicazione: (2025)
di: Dalvi, Abhishek, et al.
Pubblicazione: (2025)
Skin-R1: Toward Trustworthy Clinical Reasoning for Dermatological Diagnosis
di: Liu, Zehao, et al.
Pubblicazione: (2025)
di: Liu, Zehao, et al.
Pubblicazione: (2025)
Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models
di: Liu, Yi, et al.
Pubblicazione: (2025)
di: Liu, Yi, et al.
Pubblicazione: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
Programmatic Imitation Learning from Unlabeled and Noisy Demonstrations
di: Xin, Jimmy, et al.
Pubblicazione: (2023)
di: Xin, Jimmy, et al.
Pubblicazione: (2023)
Teaching Language Models to Self-Improve through Interactive Demonstrations
di: Yu, Xiao, et al.
Pubblicazione: (2023)
di: Yu, Xiao, et al.
Pubblicazione: (2023)
Deep Learning within Tabular Data: Foundations, Challenges, Advances and Future Directions
di: Ren, Weijieying, et al.
Pubblicazione: (2025)
di: Ren, Weijieying, et al.
Pubblicazione: (2025)
Self-Training Large Language Models for Tool-Use Without Demonstrations
di: Luo, Ne, et al.
Pubblicazione: (2025)
di: Luo, Ne, et al.
Pubblicazione: (2025)
Language Model Distillation: A Temporal Difference Imitation Learning Perspective
di: Yu, Zishun, et al.
Pubblicazione: (2025)
di: Yu, Zishun, et al.
Pubblicazione: (2025)
Unveiling Imitation Learning: Exploring the Impact of Data Falsity to Large Language Model
di: Cho, Hyunsoo
Pubblicazione: (2024)
di: Cho, Hyunsoo
Pubblicazione: (2024)
How to Leverage Diverse Demonstrations in Offline Imitation Learning
di: Yue, Sheng, et al.
Pubblicazione: (2024)
di: Yue, Sheng, et al.
Pubblicazione: (2024)
Hybrid Alignment Training for Large Language Models
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
RIDE: Enhancing Large Language Model Alignment through Restyled In-Context Learning Demonstration Exemplars
di: Hua, Yuncheng, et al.
Pubblicazione: (2025)
di: Hua, Yuncheng, et al.
Pubblicazione: (2025)
Fact-Level Confidence Calibration and Self-Correction
di: Yuan, Yige, et al.
Pubblicazione: (2024)
di: Yuan, Yige, et al.
Pubblicazione: (2024)
Self-Pluralising Culture Alignment for Large Language Models
di: Xu, Shaoyang, et al.
Pubblicazione: (2024)
di: Xu, Shaoyang, et al.
Pubblicazione: (2024)
A Survey on Efficient Large Language Model Training: From Data-centric Perspectives
di: Luo, Junyu, et al.
Pubblicazione: (2025)
di: Luo, Junyu, et al.
Pubblicazione: (2025)
Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning
di: Liu, Zehao, et al.
Pubblicazione: (2026)
di: Liu, Zehao, et al.
Pubblicazione: (2026)
Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models
di: He, Wei, et al.
Pubblicazione: (2024)
di: He, Wei, et al.
Pubblicazione: (2024)
Personality Alignment of Large Language Models
di: Zhu, Minjun, et al.
Pubblicazione: (2024)
di: Zhu, Minjun, et al.
Pubblicazione: (2024)
Do Influence Functions Work on Large Language Models?
di: Li, Zhe, et al.
Pubblicazione: (2024)
di: Li, Zhe, et al.
Pubblicazione: (2024)
DRUM: Learning Demonstration Retriever for Large MUlti-modal Models
di: Yi-Ge, Ellen, et al.
Pubblicazione: (2024)
di: Yi-Ge, Ellen, et al.
Pubblicazione: (2024)
Noise Contrastive Alignment of Language Models with Explicit Rewards
di: Chen, Huayu, et al.
Pubblicazione: (2024)
di: Chen, Huayu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
di: Xiao, Teng, et al.
Pubblicazione: (2024) -
MolBind: Multimodal Alignment of Language, Molecules, and Proteins
di: Xiao, Teng, et al.
Pubblicazione: (2024) -
3M-Diffusion: Latent Multi-Modal Diffusion for Language-Guided Molecular Structure Generation
di: Zhu, Huaisheng, et al.
Pubblicazione: (2024) -
On a Connection Between Imitation Learning and RLHF
di: Xiao, Teng, et al.
Pubblicazione: (2025) -
SimPER: A Minimalist Approach to Preference Alignment without Hyperparameters
di: Xiao, Teng, et al.
Pubblicazione: (2025)