Enregistré dans:
| Auteurs principaux: | Zhong, Ziqian, Raghunathan, Aditi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2508.00161 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
par: Zhong, Ziqian, et autres
Publié: (2025)
par: Zhong, Ziqian, et autres
Publié: (2025)
Base Models Look Human To AI Detectors
par: Xu, Yixuan Even, et autres
Publié: (2026)
par: Xu, Yixuan Even, et autres
Publié: (2026)
Jailbreaking in the Haystack
par: Shah, Rishi Rajesh, et autres
Publié: (2025)
par: Shah, Rishi Rajesh, et autres
Publié: (2025)
Understanding Finetuning for Factual Knowledge Extraction
par: Ghosal, Gaurav, et autres
Publié: (2024)
par: Ghosal, Gaurav, et autres
Publié: (2024)
Self-Trained Verification for Training- and Test-Time Self-Improvement
par: Wu, Chen Henry, et autres
Publié: (2026)
par: Wu, Chen Henry, et autres
Publié: (2026)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
par: Kotha, Suhas, et autres
Publié: (2023)
par: Kotha, Suhas, et autres
Publié: (2023)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
par: Kim, Taeyoun, et autres
Publié: (2024)
par: Kim, Taeyoun, et autres
Publié: (2024)
Mitigating Bias in RAG: Controlling the Embedder
par: Kim, Taeyoun, et autres
Publié: (2025)
par: Kim, Taeyoun, et autres
Publié: (2025)
Mode-Conditioning Unlocks Superior Test-Time Scaling
par: Wu, Chen Henry, et autres
Publié: (2025)
par: Wu, Chen Henry, et autres
Publié: (2025)
Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance
par: Goyal, Sachin, et autres
Publié: (2024)
par: Goyal, Sachin, et autres
Publié: (2024)
Complexity-aware fine-tuning
par: Goncharov, Andrey, et autres
Publié: (2025)
par: Goncharov, Andrey, et autres
Publié: (2025)
Uncertainty quantification in fine-tuned LLMs using LoRA ensembles
par: Balabanov, Oleksandr, et autres
Publié: (2024)
par: Balabanov, Oleksandr, et autres
Publié: (2024)
Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting
par: Watts, Ishaan, et autres
Publié: (2026)
par: Watts, Ishaan, et autres
Publié: (2026)
Repetition Improves Language Model Embeddings
par: Springer, Jacob Mitchell, et autres
Publié: (2024)
par: Springer, Jacob Mitchell, et autres
Publié: (2024)
Roll the dice & look before you leap: Going beyond the creative limits of next-token prediction
par: Nagarajan, Vaishnavh, et autres
Publié: (2025)
par: Nagarajan, Vaishnavh, et autres
Publié: (2025)
Replaying pre-training data improves fine-tuning
par: Kotha, Suhas, et autres
Publié: (2026)
par: Kotha, Suhas, et autres
Publié: (2026)
Algorithmic Capabilities of Random Transformers
par: Zhong, Ziqian, et autres
Publié: (2024)
par: Zhong, Ziqian, et autres
Publié: (2024)
You can remove GPT2's LayerNorm by fine-tuning
par: Heimersheim, Stefan
Publié: (2024)
par: Heimersheim, Stefan
Publié: (2024)
LayerNorm: A key component in parameter-efficient fine-tuning
par: ValizadehAslani, Taha, et autres
Publié: (2024)
par: ValizadehAslani, Taha, et autres
Publié: (2024)
T-MARS: Improving Visual Representations by Circumventing Text Feature Learning
par: Maini, Pratyush, et autres
Publié: (2023)
par: Maini, Pratyush, et autres
Publié: (2023)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
par: Zhou, Huichi, et autres
Publié: (2025)
par: Zhou, Huichi, et autres
Publié: (2025)
The representation landscape of few-shot learning and fine-tuning in large language models
par: Doimo, Diego, et autres
Publié: (2024)
par: Doimo, Diego, et autres
Publié: (2024)
The more polypersonal the better -- a short look on space geometry of fine-tuned layers
par: Kudriashov, Sergei, et autres
Publié: (2025)
par: Kudriashov, Sergei, et autres
Publié: (2025)
Deep literature reviews: an application of fine-tuned language models to migration research
par: Iacus, Stefano M., et autres
Publié: (2025)
par: Iacus, Stefano M., et autres
Publié: (2025)
Rethinking harmless refusals when fine-tuning foundation models
par: Pop, Florin, et autres
Publié: (2024)
par: Pop, Florin, et autres
Publié: (2024)
Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?
par: Zhong, Ziqian, et autres
Publié: (2026)
par: Zhong, Ziqian, et autres
Publié: (2026)
RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantization
par: Huang, Xijie, et autres
Publié: (2024)
par: Huang, Xijie, et autres
Publié: (2024)
Does fine-tuning GPT-3 with the OpenAI API leak personally-identifiable information?
par: Sun, Albert Yu, et autres
Publié: (2023)
par: Sun, Albert Yu, et autres
Publié: (2023)
Multi-task retriever fine-tuning for domain-specific and efficient RAG
par: Béchard, Patrice, et autres
Publié: (2025)
par: Béchard, Patrice, et autres
Publié: (2025)
Scaling Laws for Precision
par: Kumar, Tanishq, et autres
Publié: (2024)
par: Kumar, Tanishq, et autres
Publié: (2024)
Topic Modeling with Fine-tuning LLMs and Bag of Sentences
par: Schneider, Johannes
Publié: (2024)
par: Schneider, Johannes
Publié: (2024)
Improving embedding with contrastive fine-tuning on small datasets with expert-augmented scores
par: Lu, Jun, et autres
Publié: (2024)
par: Lu, Jun, et autres
Publié: (2024)
Multilingual Amnesia: On the Transferability of Unlearning in Multilingual LLMs
par: Farashah, Alireza Dehghanpour, et autres
Publié: (2026)
par: Farashah, Alireza Dehghanpour, et autres
Publié: (2026)
Early Data Exposure Improves Robustness to Subsequent Fine-Tuning
par: Feng, Lawrence, et autres
Publié: (2026)
par: Feng, Lawrence, et autres
Publié: (2026)
Hodoscope: Unsupervised Monitoring for AI Misbehaviors
par: Zhong, Ziqian, et autres
Publié: (2026)
par: Zhong, Ziqian, et autres
Publié: (2026)
What explains the success of cross-modal fine-tuning with ORCA?
par: García-de-Herreros, Paloma, et autres
Publié: (2024)
par: García-de-Herreros, Paloma, et autres
Publié: (2024)
Dissecting Adversarial Robustness of Multimodal LM Agents
par: Wu, Chen Henry, et autres
Publié: (2024)
par: Wu, Chen Henry, et autres
Publié: (2024)
Towards Safer Pretraining: Analyzing and Filtering Harmful Content in Webscale datasets for Responsible LLMs
par: Mendu, Sai Krishna, et autres
Publié: (2025)
par: Mendu, Sai Krishna, et autres
Publié: (2025)
Robust and Efficient Fine-tuning of LLMs with Bayesian Reparameterization of Low-Rank Adaptation
par: Sengupta, Ayan, et autres
Publié: (2024)
par: Sengupta, Ayan, et autres
Publié: (2024)
Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs
par: Hejabi, Parsa, et autres
Publié: (2025)
par: Hejabi, Parsa, et autres
Publié: (2025)
Documents similaires
-
ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
par: Zhong, Ziqian, et autres
Publié: (2025) -
Base Models Look Human To AI Detectors
par: Xu, Yixuan Even, et autres
Publié: (2026) -
Jailbreaking in the Haystack
par: Shah, Rishi Rajesh, et autres
Publié: (2025) -
Understanding Finetuning for Factual Knowledge Extraction
par: Ghosal, Gaurav, et autres
Publié: (2024) -
Self-Trained Verification for Training- and Test-Time Self-Improvement
par: Wu, Chen Henry, et autres
Publié: (2026)