Correcting Large Language Model Behavior via Influence Function
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Han, Zhang, Zhuo, Zhang, Yi, Zhai, Yuanzhao, Peng, Hanyang, Lei, Yu, Yu, Yue, Wang, Hui, Liang, Bin, Gui, Lin, Xu, Ruifeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
COPR: Continual Learning Human Preference through Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2023)
por: Zhang, Han, et al.
Publicado: (2023)
COPR: Continual Human Preference Learning via Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2024)
por: Zhang, Han, et al.
Publicado: (2024)
Online Self-Preferring Language Models
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
por: Zhai, Yuanzhao, et al.
Publicado: (2023)
por: Zhai, Yuanzhao, et al.
Publicado: (2023)
Mitigating Biases of Large Language Models in Stance Detection with Counterfactual Augmented Calibration
por: Li, Ang, et al.
Publicado: (2024)
por: Li, Ang, et al.
Publicado: (2024)
Improving Natural Language Understanding for LLMs via Large-Scale Instruction Synthesis
por: Yuan, Lin, et al.
Publicado: (2025)
por: Yuan, Lin, et al.
Publicado: (2025)
Scalable Multi-Stage Influence Function for Large Language Models via Eigenvalue-Corrected Kronecker-Factored Parameterization
por: Bao, Yuntai, et al.
Publicado: (2025)
por: Bao, Yuntai, et al.
Publicado: (2025)
SecP-Tuning: Efficient Privacy-Preserving Prompt Tuning for Large Language Models via MPC
por: Luo, Jinglong, et al.
Publicado: (2025)
por: Luo, Jinglong, et al.
Publicado: (2025)
Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
Multi-modal Stance Detection: New Datasets and Model
por: Liang, Bin, et al.
Publicado: (2024)
por: Liang, Bin, et al.
Publicado: (2024)
Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
Context parroting: A simple but tough-to-beat baseline for foundation models in scientific machine learning
por: Zhang, Yuanzhao, et al.
Publicado: (2025)
por: Zhang, Yuanzhao, et al.
Publicado: (2025)
Zero-shot forecasting of chaotic systems
por: Zhang, Yuanzhao, et al.
Publicado: (2024)
por: Zhang, Yuanzhao, et al.
Publicado: (2024)
Intent Representation Learning with Large Language Model for Recommendation
por: Wang, Yu, et al.
Publicado: (2025)
por: Wang, Yu, et al.
Publicado: (2025)
HalluRNN: Mitigating Hallucinations via Recurrent Cross-Layer Reasoning in Large Vision-Language Models
por: Yu, Le, et al.
Publicado: (2025)
por: Yu, Le, et al.
Publicado: (2025)
Behavioral Fingerprinting of Large Language Models
por: Pei, Zehua, et al.
Publicado: (2025)
por: Pei, Zehua, et al.
Publicado: (2025)
Simple Convergence Proof of Adam From a Sign-like Descent Perspective
por: Peng, Hanyang, et al.
Publicado: (2025)
por: Peng, Hanyang, et al.
Publicado: (2025)
VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling
por: Li, Weiqi, et al.
Publicado: (2025)
por: Li, Weiqi, et al.
Publicado: (2025)
Effects of MDA‐19 on Zebrafish Larval Behavior: Perspectives From Neurodevelopment, Oxidative Stress, and Metabolomics
por: Boyang Xu, et al.
Publicado: (2024)
por: Boyang Xu, et al.
Publicado: (2024)
Tempological Control of Network Dynamics
por: Zhang, Yuanzhao, et al.
Publicado: (2025)
por: Zhang, Yuanzhao, et al.
Publicado: (2025)
SecFormer: Fast and Accurate Privacy-Preserving Inference for Transformer Models via SMPC
por: Luo, Jinglong, et al.
Publicado: (2024)
por: Luo, Jinglong, et al.
Publicado: (2024)
Universal Hypothesis of Autocorrelation Function from Krylov Complexity
por: Zhang, Ren, et al.
Publicado: (2023)
por: Zhang, Ren, et al.
Publicado: (2023)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
por: Zhang, Han, et al.
Publicado: (2025)
por: Zhang, Han, et al.
Publicado: (2025)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
por: Lin, Bingqian, et al.
Publicado: (2024)
por: Lin, Bingqian, et al.
Publicado: (2024)
LLMAtKGE: Large Language Models as Explainable Attackers against Knowledge Graph Embeddings
por: Li, Ting, et al.
Publicado: (2025)
por: Li, Ting, et al.
Publicado: (2025)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
por: Zhang, YiFan, et al.
Publicado: (2024)
por: Zhang, YiFan, et al.
Publicado: (2024)
Accelerating Automatic Program Repair with Dual Retrieval-Augmented Fine-Tuning and Patch Generation on Large Language Models
por: Guo, Hanyang, et al.
Publicado: (2025)
por: Guo, Hanyang, et al.
Publicado: (2025)
Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models
por: Yu, Longxuan, et al.
Publicado: (2026)
por: Yu, Longxuan, et al.
Publicado: (2026)
ARL2: Aligning Retrievers for Black-box Large Language Models via Self-guided Adaptive Relevance Labeling
por: Zhang, Lingxi, et al.
Publicado: (2024)
por: Zhang, Lingxi, et al.
Publicado: (2024)
Shaping the Anthropocene: Understanding and Evaluating Human Impact on the Global Ecosystem
por: Yuanzhao Ding
Publicado: (2025)
por: Yuanzhao Ding
Publicado: (2025)
SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam
por: Peng, Hanyang, et al.
Publicado: (2025)
por: Peng, Hanyang, et al.
Publicado: (2025)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
Leveraging Large Language Models for Solving Rare MIP Challenges
por: Wang, Teng, et al.
Publicado: (2024)
por: Wang, Teng, et al.
Publicado: (2024)
Information Shapes Koopman Representation
por: Cheng, Xiaoyuan, et al.
Publicado: (2025)
por: Cheng, Xiaoyuan, et al.
Publicado: (2025)
A Concise Primer on Solid-State Quantum Emitters
por: Yu, Shicheng, et al.
Publicado: (2025)
por: Yu, Shicheng, et al.
Publicado: (2025)
EventRL: Enhancing Event Extraction with Outcome Supervision for Large Language Models
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
por: Weng, Xingxing, et al.
Publicado: (2026)
por: Weng, Xingxing, et al.
Publicado: (2026)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
por: Xu, Ancheng, et al.
Publicado: (2024)
por: Xu, Ancheng, et al.
Publicado: (2024)
NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?
por: Peng, Jierui, et al.
Publicado: (2025)
por: Peng, Jierui, et al.
Publicado: (2025)
3D Large‐Scale Subwavelength‐Resolution Sound Sheet Tomography Based on an Active and Programmable Circular Meta‐Array
por: Qiu‐De Zhang, et al.
Publicado: (2026)
por: Qiu‐De Zhang, et al.
Publicado: (2026)
Ejemplares similares
-
COPR: Continual Learning Human Preference through Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2023) -
COPR: Continual Human Preference Learning via Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2024) -
Online Self-Preferring Language Models
por: Zhai, Yuanzhao, et al.
Publicado: (2024) -
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
por: Zhai, Yuanzhao, et al.
Publicado: (2023) -
Mitigating Biases of Large Language Models in Stance Detection with Counterfactual Augmented Calibration
por: Li, Ang, et al.
Publicado: (2024)