Rethinking harmless refusals when fine-tuning foundation models
Fuente:
arXiv
Guardado en:
| Autores principales: | Pop, Florin, Rosenblatt, Judd, de Lucena, Diogo Schwerz, Vaiana, Michael |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Momentum Point-Perplexity Mechanics in Large Language Models
por: Tomaz, Lorenzo, et al.
Publicado: (2025)
por: Tomaz, Lorenzo, et al.
Publicado: (2025)
Learning Self-Interpretation from Interpretability Artifacts: Training Lightweight Adapters on Vector-Label Pairs
por: Pepper, Keenan, et al.
Publicado: (2026)
por: Pepper, Keenan, et al.
Publicado: (2026)
Endogenous Resistance to Activation Steering in Language Models
por: McKenzie, Alex, et al.
Publicado: (2026)
por: McKenzie, Alex, et al.
Publicado: (2026)
Towards Safe and Honest AI Agents with Neural Self-Other Overlap
por: Carauleanu, Marc, et al.
Publicado: (2024)
por: Carauleanu, Marc, et al.
Publicado: (2024)
Unexpected Benefits of Self-Modeling in Neural Systems
por: Premakumar, Vickram N., et al.
Publicado: (2024)
por: Premakumar, Vickram N., et al.
Publicado: (2024)
Large Language Models Report Subjective Experience Under Self-Referential Processing
por: Berg, Cameron, et al.
Publicado: (2025)
por: Berg, Cameron, et al.
Publicado: (2025)
Uncertainty quantification in fine-tuned LLMs using LoRA ensembles
por: Balabanov, Oleksandr, et al.
Publicado: (2024)
por: Balabanov, Oleksandr, et al.
Publicado: (2024)
Improving embedding with contrastive fine-tuning on small datasets with expert-augmented scores
por: Lu, Jun, et al.
Publicado: (2024)
por: Lu, Jun, et al.
Publicado: (2024)
Investigating the performance of Retrieval-Augmented Generation and fine-tuning for the development of AI-driven knowledge-based systems
por: Lakatos, Robert, et al.
Publicado: (2024)
por: Lakatos, Robert, et al.
Publicado: (2024)
The language of time: a language model perspective on time-series foundation models
por: Xie, Yi, et al.
Publicado: (2025)
por: Xie, Yi, et al.
Publicado: (2025)
A decoder-only foundation model for time-series forecasting
por: Das, Abhimanyu, et al.
Publicado: (2023)
por: Das, Abhimanyu, et al.
Publicado: (2023)
What explains the success of cross-modal fine-tuning with ORCA?
por: García-de-Herreros, Paloma, et al.
Publicado: (2024)
por: García-de-Herreros, Paloma, et al.
Publicado: (2024)
A multimodal and temporal foundation model for virtual patient representations at healthcare system scale
por: Zhang, Andrew, et al.
Publicado: (2026)
por: Zhang, Andrew, et al.
Publicado: (2026)
CLewR: Curriculum Learning with Restarts for Machine Translation Preference Learning
por: Dragomir, Alexandra, et al.
Publicado: (2026)
por: Dragomir, Alexandra, et al.
Publicado: (2026)
GL-Fusion: Rethinking the Combination of Graph Neural Network and Large Language model
por: Yang, Haotong, et al.
Publicado: (2024)
por: Yang, Haotong, et al.
Publicado: (2024)
Zero-knowledge LLM hallucination detection and mitigation through fine-grained cross-model consistency
por: Goel, Aman, et al.
Publicado: (2025)
por: Goel, Aman, et al.
Publicado: (2025)
Mechanistic Fine-tuning for In-context Learning
por: Cho, Hakaze, et al.
Publicado: (2025)
por: Cho, Hakaze, et al.
Publicado: (2025)
Exploring Memorization in Fine-tuned Language Models
por: Zeng, Shenglai, et al.
Publicado: (2023)
por: Zeng, Shenglai, et al.
Publicado: (2023)
Instruction-tuned Language Models are Better Knowledge Learners
por: Jiang, Zhengbao, et al.
Publicado: (2024)
por: Jiang, Zhengbao, et al.
Publicado: (2024)
Information Guided Regularization for Fine-tuning Language Models
por: Sharma, Mandar, et al.
Publicado: (2024)
por: Sharma, Mandar, et al.
Publicado: (2024)
Outlier-weighed Layerwise Sampling for LLM Fine-tuning
por: Li, Pengxiang, et al.
Publicado: (2024)
por: Li, Pengxiang, et al.
Publicado: (2024)
Rethinking GSPO: The Perplexity-Entropy Equivalence
por: Liu, Chi
Publicado: (2025)
por: Liu, Chi
Publicado: (2025)
REFRAG: Rethinking RAG based Decoding
por: Lin, Xiaoqiang, et al.
Publicado: (2025)
por: Lin, Xiaoqiang, et al.
Publicado: (2025)
Efficient Model Development through Fine-tuning Transfer
por: Lin, Pin-Jie, et al.
Publicado: (2025)
por: Lin, Pin-Jie, et al.
Publicado: (2025)
Physics-informed fine-tuning of foundation models for partial differential equations
por: Medvedev, Vlad, et al.
Publicado: (2026)
por: Medvedev, Vlad, et al.
Publicado: (2026)
Parameter Efficient Fine-tuning via Explained Variance Adaptation
por: Paischer, Fabian, et al.
Publicado: (2024)
por: Paischer, Fabian, et al.
Publicado: (2024)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
por: Yu, Zhang Ze, et al.
Publicado: (2023)
por: Yu, Zhang Ze, et al.
Publicado: (2023)
Efficient End-to-end Language Model Fine-tuning on Graphs
por: Xue, Rui, et al.
Publicado: (2023)
por: Xue, Rui, et al.
Publicado: (2023)
Rethinking Interpretability in the Era of Large Language Models
por: Singh, Chandan, et al.
Publicado: (2024)
por: Singh, Chandan, et al.
Publicado: (2024)
Rethinking Entropy Regularization in Large Reasoning Models
por: Jiang, Yuxian, et al.
Publicado: (2025)
por: Jiang, Yuxian, et al.
Publicado: (2025)
Multi-Target Cross-Lingual Summarization: a novel task and a language-neutral approach
por: Pernes, Diogo, et al.
Publicado: (2024)
por: Pernes, Diogo, et al.
Publicado: (2024)
Large Language Models can Strategically Deceive their Users when Put Under Pressure
por: Scheurer, Jérémy, et al.
Publicado: (2023)
por: Scheurer, Jérémy, et al.
Publicado: (2023)
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
por: Jan, Essa, et al.
Publicado: (2024)
por: Jan, Essa, et al.
Publicado: (2024)
Random Masking Finds Winning Tickets for Parameter Efficient Fine-tuning
por: Xu, Jing, et al.
Publicado: (2024)
por: Xu, Jing, et al.
Publicado: (2024)
The Importance of Online Data: Understanding Preference Fine-tuning via Coverage
por: Song, Yuda, et al.
Publicado: (2024)
por: Song, Yuda, et al.
Publicado: (2024)
Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
por: Zou, Jiaru, et al.
Publicado: (2025)
por: Zou, Jiaru, et al.
Publicado: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
por: Song, Weixi, et al.
Publicado: (2023)
por: Song, Weixi, et al.
Publicado: (2023)
Fine-tuning Multi-hop Question Answering with Hierarchical Graph Network
por: Xiong, Guanming
Publicado: (2020)
por: Xiong, Guanming
Publicado: (2020)
APE: Selective Fine-tuning with Acceptance Criteria for Language Model Adaptation
por: Marín, Javier
Publicado: (2025)
por: Marín, Javier
Publicado: (2025)
Rethinking the Role of Proxy Rewards in Language Model Alignment
por: Kim, Sungdong, et al.
Publicado: (2024)
por: Kim, Sungdong, et al.
Publicado: (2024)
Ejemplares similares
-
Momentum Point-Perplexity Mechanics in Large Language Models
por: Tomaz, Lorenzo, et al.
Publicado: (2025) -
Learning Self-Interpretation from Interpretability Artifacts: Training Lightweight Adapters on Vector-Label Pairs
por: Pepper, Keenan, et al.
Publicado: (2026) -
Endogenous Resistance to Activation Steering in Language Models
por: McKenzie, Alex, et al.
Publicado: (2026) -
Towards Safe and Honest AI Agents with Neural Self-Other Overlap
por: Carauleanu, Marc, et al.
Publicado: (2024) -
Unexpected Benefits of Self-Modeling in Neural Systems
por: Premakumar, Vickram N., et al.
Publicado: (2024)