Correcting Large Language Model Behavior via Influence Function
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Han, Zhang, Zhuo, Zhang, Yi, Zhai, Yuanzhao, Peng, Hanyang, Lei, Yu, Yu, Yue, Wang, Hui, Liang, Bin, Gui, Lin, Xu, Ruifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
COPR: Continual Learning Human Preference through Optimal Policy Regularization
par: Zhang, Han, et autres
Publié: (2023)
par: Zhang, Han, et autres
Publié: (2023)
COPR: Continual Human Preference Learning via Optimal Policy Regularization
par: Zhang, Han, et autres
Publié: (2024)
par: Zhang, Han, et autres
Publié: (2024)
Online Self-Preferring Language Models
par: Zhai, Yuanzhao, et autres
Publié: (2024)
par: Zhai, Yuanzhao, et autres
Publié: (2024)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
par: Zhai, Yuanzhao, et autres
Publié: (2023)
par: Zhai, Yuanzhao, et autres
Publié: (2023)
Mitigating Biases of Large Language Models in Stance Detection with Counterfactual Augmented Calibration
par: Li, Ang, et autres
Publié: (2024)
par: Li, Ang, et autres
Publié: (2024)
Improving Natural Language Understanding for LLMs via Large-Scale Instruction Synthesis
par: Yuan, Lin, et autres
Publié: (2025)
par: Yuan, Lin, et autres
Publié: (2025)
Scalable Multi-Stage Influence Function for Large Language Models via Eigenvalue-Corrected Kronecker-Factored Parameterization
par: Bao, Yuntai, et autres
Publié: (2025)
par: Bao, Yuntai, et autres
Publié: (2025)
SecP-Tuning: Efficient Privacy-Preserving Prompt Tuning for Large Language Models via MPC
par: Luo, Jinglong, et autres
Publié: (2025)
par: Luo, Jinglong, et autres
Publié: (2025)
Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Multi-modal Stance Detection: New Datasets and Model
par: Liang, Bin, et autres
Publié: (2024)
par: Liang, Bin, et autres
Publié: (2024)
Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Context parroting: A simple but tough-to-beat baseline for foundation models in scientific machine learning
par: Zhang, Yuanzhao, et autres
Publié: (2025)
par: Zhang, Yuanzhao, et autres
Publié: (2025)
Zero-shot forecasting of chaotic systems
par: Zhang, Yuanzhao, et autres
Publié: (2024)
par: Zhang, Yuanzhao, et autres
Publié: (2024)
Intent Representation Learning with Large Language Model for Recommendation
par: Wang, Yu, et autres
Publié: (2025)
par: Wang, Yu, et autres
Publié: (2025)
HalluRNN: Mitigating Hallucinations via Recurrent Cross-Layer Reasoning in Large Vision-Language Models
par: Yu, Le, et autres
Publié: (2025)
par: Yu, Le, et autres
Publié: (2025)
Behavioral Fingerprinting of Large Language Models
par: Pei, Zehua, et autres
Publié: (2025)
par: Pei, Zehua, et autres
Publié: (2025)
Simple Convergence Proof of Adam From a Sign-like Descent Perspective
par: Peng, Hanyang, et autres
Publié: (2025)
par: Peng, Hanyang, et autres
Publié: (2025)
VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling
par: Li, Weiqi, et autres
Publié: (2025)
par: Li, Weiqi, et autres
Publié: (2025)
Effects of MDA‐19 on Zebrafish Larval Behavior: Perspectives From Neurodevelopment, Oxidative Stress, and Metabolomics
par: Boyang Xu, et autres
Publié: (2024)
par: Boyang Xu, et autres
Publié: (2024)
Tempological Control of Network Dynamics
par: Zhang, Yuanzhao, et autres
Publié: (2025)
par: Zhang, Yuanzhao, et autres
Publié: (2025)
Universal Hypothesis of Autocorrelation Function from Krylov Complexity
par: Zhang, Ren, et autres
Publié: (2023)
par: Zhang, Ren, et autres
Publié: (2023)
SecFormer: Fast and Accurate Privacy-Preserving Inference for Transformer Models via SMPC
par: Luo, Jinglong, et autres
Publié: (2024)
par: Luo, Jinglong, et autres
Publié: (2024)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
par: Zhang, Han, et autres
Publié: (2025)
par: Zhang, Han, et autres
Publié: (2025)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
LLMAtKGE: Large Language Models as Explainable Attackers against Knowledge Graph Embeddings
par: Li, Ting, et autres
Publié: (2025)
par: Li, Ting, et autres
Publié: (2025)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
par: Zhang, YiFan, et autres
Publié: (2024)
par: Zhang, YiFan, et autres
Publié: (2024)
Accelerating Automatic Program Repair with Dual Retrieval-Augmented Fine-Tuning and Patch Generation on Large Language Models
par: Guo, Hanyang, et autres
Publié: (2025)
par: Guo, Hanyang, et autres
Publié: (2025)
Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models
par: Yu, Longxuan, et autres
Publié: (2026)
par: Yu, Longxuan, et autres
Publié: (2026)
ARL2: Aligning Retrievers for Black-box Large Language Models via Self-guided Adaptive Relevance Labeling
par: Zhang, Lingxi, et autres
Publié: (2024)
par: Zhang, Lingxi, et autres
Publié: (2024)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
par: Yu, Haiyang, et autres
Publié: (2025)
par: Yu, Haiyang, et autres
Publié: (2025)
Shaping the Anthropocene: Understanding and Evaluating Human Impact on the Global Ecosystem
par: Yuanzhao Ding
Publié: (2025)
par: Yuanzhao Ding
Publié: (2025)
SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam
par: Peng, Hanyang, et autres
Publié: (2025)
par: Peng, Hanyang, et autres
Publié: (2025)
Leveraging Large Language Models for Solving Rare MIP Challenges
par: Wang, Teng, et autres
Publié: (2024)
par: Wang, Teng, et autres
Publié: (2024)
Information Shapes Koopman Representation
par: Cheng, Xiaoyuan, et autres
Publié: (2025)
par: Cheng, Xiaoyuan, et autres
Publié: (2025)
A Concise Primer on Solid-State Quantum Emitters
par: Yu, Shicheng, et autres
Publié: (2025)
par: Yu, Shicheng, et autres
Publié: (2025)
EventRL: Enhancing Event Extraction with Outcome Supervision for Large Language Models
par: Gao, Jun, et autres
Publié: (2024)
par: Gao, Jun, et autres
Publié: (2024)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
par: Weng, Xingxing, et autres
Publié: (2026)
par: Weng, Xingxing, et autres
Publié: (2026)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
par: Xu, Ancheng, et autres
Publié: (2024)
par: Xu, Ancheng, et autres
Publié: (2024)
NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?
par: Peng, Jierui, et autres
Publié: (2025)
par: Peng, Jierui, et autres
Publié: (2025)
3D Large‐Scale Subwavelength‐Resolution Sound Sheet Tomography Based on an Active and Programmable Circular Meta‐Array
par: Qiu‐De Zhang, et autres
Publié: (2026)
par: Qiu‐De Zhang, et autres
Publié: (2026)
Documents similaires
-
COPR: Continual Learning Human Preference through Optimal Policy Regularization
par: Zhang, Han, et autres
Publié: (2023) -
COPR: Continual Human Preference Learning via Optimal Policy Regularization
par: Zhang, Han, et autres
Publié: (2024) -
Online Self-Preferring Language Models
par: Zhai, Yuanzhao, et autres
Publié: (2024) -
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
par: Zhai, Yuanzhao, et autres
Publié: (2023) -
Mitigating Biases of Large Language Models in Stance Detection with Counterfactual Augmented Calibration
par: Li, Ang, et autres
Publié: (2024)