Risk-Averse Finetuning of Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chaudhary, Sapana, Dinesha, Ujwal, Kalathil, Dileep, Shakkottai, Srinivas |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
von: Bobbili, Sarat Chandra, et al.
Veröffentlicht: (2025)
von: Bobbili, Sarat Chandra, et al.
Veröffentlicht: (2025)
Federated Ensemble-Directed Offline Reinforcement Learning
von: Rengarajan, Desik, et al.
Veröffentlicht: (2023)
von: Rengarajan, Desik, et al.
Veröffentlicht: (2023)
Offline Learning and Forgetting for Reasoning with Large Language Models
von: Ni, Tianwei, et al.
Veröffentlicht: (2025)
von: Ni, Tianwei, et al.
Veröffentlicht: (2025)
Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
von: Sanders, Kate, et al.
Veröffentlicht: (2026)
von: Sanders, Kate, et al.
Veröffentlicht: (2026)
Large Language Models to Diffusion Finetuning
von: Cetin, Edoardo, et al.
Veröffentlicht: (2025)
von: Cetin, Edoardo, et al.
Veröffentlicht: (2025)
Structured Reinforcement Learning for Media Streaming at the Wireless Edge
von: Bura, Archana, et al.
Veröffentlicht: (2024)
von: Bura, Archana, et al.
Veröffentlicht: (2024)
LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models
von: Stengel-Eskin, Elias, et al.
Veröffentlicht: (2024)
von: Stengel-Eskin, Elias, et al.
Veröffentlicht: (2024)
Finetuning Generative Large Language Models with Discrimination Instructions for Knowledge Graph Completion
von: Liu, Yang, et al.
Veröffentlicht: (2024)
von: Liu, Yang, et al.
Veröffentlicht: (2024)
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
von: Kunde, Vishnu Teja, et al.
Veröffentlicht: (2026)
von: Kunde, Vishnu Teja, et al.
Veröffentlicht: (2026)
Zero-Shot Classification of Crisis Tweets Using Instruction-Finetuned Large Language Models
von: McDaniel, Emma, et al.
Veröffentlicht: (2024)
von: McDaniel, Emma, et al.
Veröffentlicht: (2024)
AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents
von: Yang, Ke, et al.
Veröffentlicht: (2024)
von: Yang, Ke, et al.
Veröffentlicht: (2024)
Transfer Learning of Tabular Data by Finetuning Large Language Models
von: Rabbani, Shourav B., et al.
Veröffentlicht: (2025)
von: Rabbani, Shourav B., et al.
Veröffentlicht: (2025)
Whisper Finetuning on Nepali Language
von: Rijal, Sanjay, et al.
Veröffentlicht: (2024)
von: Rijal, Sanjay, et al.
Veröffentlicht: (2024)
LMFlow: An Extensible Toolkit for Finetuning and Inference of Large Foundation Models
von: Diao, Shizhe, et al.
Veröffentlicht: (2023)
von: Diao, Shizhe, et al.
Veröffentlicht: (2023)
Large Language Models as Planning Domain Generators
von: Oswald, James, et al.
Veröffentlicht: (2024)
von: Oswald, James, et al.
Veröffentlicht: (2024)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
von: Tejaswi, Atula, et al.
Veröffentlicht: (2026)
von: Tejaswi, Atula, et al.
Veröffentlicht: (2026)
Differentially Private Zeroth-Order Methods for Scalable Large Language Model Finetuning
von: Liu, Z, et al.
Veröffentlicht: (2024)
von: Liu, Z, et al.
Veröffentlicht: (2024)
Crossing Linguistic Horizons: Finetuning and Comprehensive Evaluation of Vietnamese Large Language Models
von: Truong, Sang T., et al.
Veröffentlicht: (2024)
von: Truong, Sang T., et al.
Veröffentlicht: (2024)
An Experimental Design Framework for Label-Efficient Supervised Finetuning of Large Language Models
von: Bhatt, Gantavya, et al.
Veröffentlicht: (2024)
von: Bhatt, Gantavya, et al.
Veröffentlicht: (2024)
Mind the Gap! Choice Independence in Using Multilingual LLMs for Persuasive Co-Writing Tasks in Different Languages
von: Biswas, Shreyan, et al.
Veröffentlicht: (2025)
von: Biswas, Shreyan, et al.
Veröffentlicht: (2025)
VeriCoT: Neuro-symbolic Chain-of-Thought Validation via Logical Consistency Checks
von: Feng, Yu, et al.
Veröffentlicht: (2025)
von: Feng, Yu, et al.
Veröffentlicht: (2025)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
von: Zhang, Junjie, et al.
Veröffentlicht: (2025)
von: Zhang, Junjie, et al.
Veröffentlicht: (2025)
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
von: Liu, Xinyue, et al.
Veröffentlicht: (2026)
von: Liu, Xinyue, et al.
Veröffentlicht: (2026)
Vanishing Gradients in Reinforcement Finetuning of Language Models
von: Razin, Noam, et al.
Veröffentlicht: (2023)
von: Razin, Noam, et al.
Veröffentlicht: (2023)
ReFT: Representation Finetuning for Language Models
von: Wu, Zhengxuan, et al.
Veröffentlicht: (2024)
von: Wu, Zhengxuan, et al.
Veröffentlicht: (2024)
Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model
von: Liang, Jing, et al.
Veröffentlicht: (2025)
von: Liang, Jing, et al.
Veröffentlicht: (2025)
CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
von: Zhang, Andi, et al.
Veröffentlicht: (2024)
von: Zhang, Andi, et al.
Veröffentlicht: (2024)
Delta Activations: A Representation for Finetuned Large Language Models
von: Xu, Zhiqiu, et al.
Veröffentlicht: (2025)
von: Xu, Zhiqiu, et al.
Veröffentlicht: (2025)
Risks of Cultural Erasure in Large Language Models
von: Qadri, Rida, et al.
Veröffentlicht: (2025)
von: Qadri, Rida, et al.
Veröffentlicht: (2025)
Small or Large? Zero-Shot or Finetuned? Guiding Language Model Choice for Specialized Applications in Healthcare
von: Gondara, Lovedeep, et al.
Veröffentlicht: (2025)
von: Gondara, Lovedeep, et al.
Veröffentlicht: (2025)
Pedagogical Alignment of Large Language Models
von: Sonkar, Shashank, et al.
Veröffentlicht: (2024)
von: Sonkar, Shashank, et al.
Veröffentlicht: (2024)
On Instruction-Finetuning Neural Machine Translation Models
von: Raunak, Vikas, et al.
Veröffentlicht: (2024)
von: Raunak, Vikas, et al.
Veröffentlicht: (2024)
A Tutorial on the Pretrain-Finetune Paradigm for Natural Language Processing
von: Wang, Yu, et al.
Veröffentlicht: (2024)
von: Wang, Yu, et al.
Veröffentlicht: (2024)
Language-Agnostic Suicidal Risk Detection Using Large Language Models
von: Kim, June-Woo, et al.
Veröffentlicht: (2025)
von: Kim, June-Woo, et al.
Veröffentlicht: (2025)
Finetuning Large Language Models for Automated Depression Screening in Nigerian Pidgin English: GENSCORE Pilot Study
von: Olufadewa, Isaac Iyinoluwa, et al.
Veröffentlicht: (2025)
von: Olufadewa, Isaac Iyinoluwa, et al.
Veröffentlicht: (2025)
Unfamiliar Finetuning Examples Control How Language Models Hallucinate
von: Kang, Katie, et al.
Veröffentlicht: (2024)
von: Kang, Katie, et al.
Veröffentlicht: (2024)
Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time
von: Yang, Wang, et al.
Veröffentlicht: (2025)
von: Yang, Wang, et al.
Veröffentlicht: (2025)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
von: Yang, Fan
Veröffentlicht: (2025)
von: Yang, Fan
Veröffentlicht: (2025)
Large Language Model Capabilities in Perioperative Risk Prediction and Prognostication
von: Chung, Philip, et al.
Veröffentlicht: (2024)
von: Chung, Philip, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
von: Bobbili, Sarat Chandra, et al.
Veröffentlicht: (2025) -
Federated Ensemble-Directed Offline Reinforcement Learning
von: Rengarajan, Desik, et al.
Veröffentlicht: (2023) -
Offline Learning and Forgetting for Reasoning with Large Language Models
von: Ni, Tianwei, et al.
Veröffentlicht: (2025) -
Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
von: Sanders, Kate, et al.
Veröffentlicht: (2026) -
Large Language Models to Diffusion Finetuning
von: Cetin, Edoardo, et al.
Veröffentlicht: (2025)