Selective Self-to-Supervised Fine-Tuning for Generalization in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Gupta, Sonam, Nandwani, Yatin, Yehudai, Asaf, Khandelwal, Dinesh, Raghu, Dinesh, Joshi, Sachindra |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Selective Self-Rehearsal: A Fine-Tuning Approach to Improve Generalization in Large Language Models
di: Gupta, Sonam, et al.
Pubblicazione: (2024)
di: Gupta, Sonam, et al.
Pubblicazione: (2024)
Systematic Knowledge Injection into Large Language Models via Diverse Augmentation for Domain-Specific RAG
di: Bhushan, Kushagra, et al.
Pubblicazione: (2025)
di: Bhushan, Kushagra, et al.
Pubblicazione: (2025)
Few shot chain-of-thought driven reasoning to prompt LLMs for open ended medical question answering
di: Nachane, Saeel Sandeep, et al.
Pubblicazione: (2024)
di: Nachane, Saeel Sandeep, et al.
Pubblicazione: (2024)
BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback
di: Pandey, Gaurav, et al.
Pubblicazione: (2024)
di: Pandey, Gaurav, et al.
Pubblicazione: (2024)
ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues
di: Khandelwal, Dinesh, et al.
Pubblicazione: (2026)
di: Khandelwal, Dinesh, et al.
Pubblicazione: (2026)
Mediocrity is the key for LLM as a Judge Anchor Selection
di: Don-Yehiya, Shachar, et al.
Pubblicazione: (2026)
di: Don-Yehiya, Shachar, et al.
Pubblicazione: (2026)
When LLMs are Unfit Use FastFit: Fast and Effective Text Classification with Many Classes
di: Yehudai, Asaf, et al.
Pubblicazione: (2024)
di: Yehudai, Asaf, et al.
Pubblicazione: (2024)
Cyber for AI at SemEval-2025 Task 4: Forgotten but Not Lost: The Balancing Act of Selective Unlearning in Large Language Models
di: P, Dinesh Srivasthav, et al.
Pubblicazione: (2025)
di: P, Dinesh Srivasthav, et al.
Pubblicazione: (2025)
Efficient Response Generation Strategy Selection for Fine-Tuning Large Language Models Through Self-Aligned Perplexity
di: Ren, Xuan, et al.
Pubblicazione: (2025)
di: Ren, Xuan, et al.
Pubblicazione: (2025)
A Nurse is Blue and Elephant is Rugby: Cross Domain Alignment in Large Language Models Reveal Human-like Patterns
di: Yehudai, Asaf, et al.
Pubblicazione: (2024)
di: Yehudai, Asaf, et al.
Pubblicazione: (2024)
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
di: Yehudai, Asaf, et al.
Pubblicazione: (2026)
di: Yehudai, Asaf, et al.
Pubblicazione: (2026)
When Fine-Tuning Fails: Lessons from MS MARCO Passage Ranking
di: Pande, Manu, et al.
Pubblicazione: (2025)
di: Pande, Manu, et al.
Pubblicazione: (2025)
Injecting New Knowledge into Large Language Models via Supervised Fine-Tuning
di: Mecklenburg, Nick, et al.
Pubblicazione: (2024)
di: Mecklenburg, Nick, et al.
Pubblicazione: (2024)
Rethinking Data Selection for Supervised Fine-Tuning
di: Shen, Ming
Pubblicazione: (2024)
di: Shen, Ming
Pubblicazione: (2024)
Synergizing In-context Learning with Hints for End-to-end Task-oriented Dialog Systems
di: Saley, Vishal Vivek, et al.
Pubblicazione: (2024)
di: Saley, Vishal Vivek, et al.
Pubblicazione: (2024)
CoCoA: Confidence and Context-Aware Adaptive Decoding for Resolving Knowledge Conflicts in Large Language Models
di: Khandelwal, Anant, et al.
Pubblicazione: (2025)
di: Khandelwal, Anant, et al.
Pubblicazione: (2025)
Applying Intrinsic Debiasing on Downstream Tasks: Challenges and Considerations for Machine Translation
di: Iluz, Bar, et al.
Pubblicazione: (2024)
di: Iluz, Bar, et al.
Pubblicazione: (2024)
Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents
di: Yehudai, Asaf, et al.
Pubblicazione: (2026)
di: Yehudai, Asaf, et al.
Pubblicazione: (2026)
IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages
di: Singh, Harman, et al.
Pubblicazione: (2024)
di: Singh, Harman, et al.
Pubblicazione: (2024)
See, Think, Learn: A Self-Taught Multimodal Reasoner
di: Sharma, Sourabh, et al.
Pubblicazione: (2025)
di: Sharma, Sourabh, et al.
Pubblicazione: (2025)
Unveiling the Generalization Power of Fine-Tuned Large Language Models
di: Yang, Haoran, et al.
Pubblicazione: (2024)
di: Yang, Haoran, et al.
Pubblicazione: (2024)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
di: Ding, Fei, et al.
Pubblicazione: (2025)
di: Ding, Fei, et al.
Pubblicazione: (2025)
Fill in the Blank: Exploring and Enhancing LLM Capabilities for Backward Reasoning in Math Word Problems
di: Deb, Aniruddha, et al.
Pubblicazione: (2023)
di: Deb, Aniruddha, et al.
Pubblicazione: (2023)
Systematic Diagnosis of Brittle Reasoning in Large Language Models
di: Parupudi, V. S. Raghu
Pubblicazione: (2025)
di: Parupudi, V. S. Raghu
Pubblicazione: (2025)
Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models
di: Fan, Yuchen, et al.
Pubblicazione: (2024)
di: Fan, Yuchen, et al.
Pubblicazione: (2024)
SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
di: Chen, Yijie, et al.
Pubblicazione: (2026)
di: Chen, Yijie, et al.
Pubblicazione: (2026)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
di: Ruan, Zhiwen, et al.
Pubblicazione: (2025)
di: Ruan, Zhiwen, et al.
Pubblicazione: (2025)
Will it Merge? On The Causes of Model Mergeability
di: Rahamim, Adir, et al.
Pubblicazione: (2026)
di: Rahamim, Adir, et al.
Pubblicazione: (2026)
MediTOD: An English Dialogue Dataset for Medical History Taking with Comprehensive Annotations
di: Saley, Vishal Vivek, et al.
Pubblicazione: (2024)
di: Saley, Vishal Vivek, et al.
Pubblicazione: (2024)
Improving Narrative Classification and Explanation via Fine Tuned Language Models
di: Tyagi, Rishit, et al.
Pubblicazione: (2025)
di: Tyagi, Rishit, et al.
Pubblicazione: (2025)
Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization
di: Uzan, Omri, et al.
Pubblicazione: (2025)
di: Uzan, Omri, et al.
Pubblicazione: (2025)
Supervised In-Context Fine-Tuning for Generative Sequence Labeling
di: Dukić, David, et al.
Pubblicazione: (2025)
di: Dukić, David, et al.
Pubblicazione: (2025)
HFT: Half Fine-Tuning for Large Language Models
di: Hui, Tingfeng, et al.
Pubblicazione: (2024)
di: Hui, Tingfeng, et al.
Pubblicazione: (2024)
Long-Short Chain-of-Thought Mixture Supervised Fine-Tuning Eliciting Efficient Reasoning in Large Language Models
di: Yu, Bin, et al.
Pubblicazione: (2025)
di: Yu, Bin, et al.
Pubblicazione: (2025)
Enhancing Non-English Capabilities of English-Centric Large Language Models through Deep Supervision Fine-Tuning
di: Huo, Wenshuai, et al.
Pubblicazione: (2025)
di: Huo, Wenshuai, et al.
Pubblicazione: (2025)
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
di: Xue, Chao, et al.
Pubblicazione: (2026)
di: Xue, Chao, et al.
Pubblicazione: (2026)
WildIFEval: Instruction Following in the Wild
di: Lior, Gili, et al.
Pubblicazione: (2025)
di: Lior, Gili, et al.
Pubblicazione: (2025)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
di: Pang, Jinlong, et al.
Pubblicazione: (2025)
di: Pang, Jinlong, et al.
Pubblicazione: (2025)
Enabling On-Device Large Language Model Personalization with Self-Supervised Data Selection and Synthesis
di: Qin, Ruiyang, et al.
Pubblicazione: (2023)
di: Qin, Ruiyang, et al.
Pubblicazione: (2023)
Memorization in Fine-Tuned Large Language Models
di: Savine, Danil
Pubblicazione: (2025)
di: Savine, Danil
Pubblicazione: (2025)
Documenti analoghi
-
Selective Self-Rehearsal: A Fine-Tuning Approach to Improve Generalization in Large Language Models
di: Gupta, Sonam, et al.
Pubblicazione: (2024) -
Systematic Knowledge Injection into Large Language Models via Diverse Augmentation for Domain-Specific RAG
di: Bhushan, Kushagra, et al.
Pubblicazione: (2025) -
Few shot chain-of-thought driven reasoning to prompt LLMs for open ended medical question answering
di: Nachane, Saeel Sandeep, et al.
Pubblicazione: (2024) -
BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback
di: Pandey, Gaurav, et al.
Pubblicazione: (2024) -
ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues
di: Khandelwal, Dinesh, et al.
Pubblicazione: (2026)