Aligning Large Language Models with Human Preferences through Representation Engineering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Wenhao, Wang, Xiaohua, Wu, Muling, Li, Tianlong, Lv, Changze, Ling, Zixuan, Zhu, Jianhao, Zhang, Cenyuan, Zheng, Xiaoqing, Huang, Xuanjing |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Advancing Parameter Efficiency in Fine-tuning via Representation Editing
par: Wu, Muling, et autres
Publié: (2024)
par: Wu, Muling, et autres
Publié: (2024)
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
par: Zhu, JianHao, et autres
Publié: (2024)
par: Zhu, JianHao, et autres
Publié: (2024)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
par: Li, Tianlong, et autres
Publié: (2024)
par: Li, Tianlong, et autres
Publié: (2024)
SpikeCLIP: A Contrastive Language-Image Pretrained Spiking Neural Network
par: Lv, Changze, et autres
Publié: (2023)
par: Lv, Changze, et autres
Publié: (2023)
UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation
par: Li, Tianlong, et autres
Publié: (2023)
par: Li, Tianlong, et autres
Publié: (2023)
SpikeBERT: A Language Spikformer Learned from BERT with Knowledge Distillation
par: Lv, Changze, et autres
Publié: (2023)
par: Lv, Changze, et autres
Publié: (2023)
Enhancing the Capability and Robustness of Large Language Models through Reinforcement Learning-Driven Query Refinement
par: Wang, Xiaohua, et autres
Publié: (2024)
par: Wang, Xiaohua, et autres
Publié: (2024)
Decoding Continuous Character-based Language from Non-invasive Brain Recordings
par: Zhang, Cenyuan, et autres
Publié: (2024)
par: Zhang, Cenyuan, et autres
Publié: (2024)
Improving Continual Pre-training Through Seamless Data Packing
par: Yin, Ruicheng, et autres
Publié: (2025)
par: Yin, Ruicheng, et autres
Publié: (2025)
Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning
par: Wu, Muling, et autres
Publié: (2025)
par: Wu, Muling, et autres
Publié: (2025)
Tell Me What You Don't Know: Enhancing Refusal Capabilities of Role-Playing Agents via Representation Space Analysis and Editing
par: Liu, Wenhao, et autres
Publié: (2024)
par: Liu, Wenhao, et autres
Publié: (2024)
Enhancing Model Privacy in Federated Learning with Random Masking and Quantization
par: Xu, Zhibo, et autres
Publié: (2025)
par: Xu, Zhibo, et autres
Publié: (2025)
Layer-Specific Scaling of Positional Encodings for Superior Long-Context Modeling
par: Wang, Zhenghua, et autres
Publié: (2025)
par: Wang, Zhenghua, et autres
Publié: (2025)
Explainable Synthetic Image Detection through Diffusion Timestep Ensembling
par: Wu, Yixin, et autres
Publié: (2025)
par: Wu, Yixin, et autres
Publié: (2025)
Benchmark^2: Systematic Evaluation of LLM Benchmarks
par: Qian, Qi, et autres
Publié: (2026)
par: Qian, Qi, et autres
Publié: (2026)
Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation
par: Lv, Changze, et autres
Publié: (2026)
par: Lv, Changze, et autres
Publié: (2026)
Towards Biologically Plausible Computing: A Comprehensive Comparison
par: Lv, Changze, et autres
Publié: (2024)
par: Lv, Changze, et autres
Publié: (2024)
Spiking Convolutional Neural Networks for Text Classification
par: Lv, Changze, et autres
Publié: (2024)
par: Lv, Changze, et autres
Publié: (2024)
VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck
par: Zhang, Feiran, et autres
Publié: (2026)
par: Zhang, Feiran, et autres
Publié: (2026)
Beyond Single Labels: Improving Conversational Recommendation through LLM-Powered Data Augmentation
par: Xu, Haozhe, et autres
Publié: (2025)
par: Xu, Haozhe, et autres
Publié: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
par: Xia, Han, et autres
Publié: (2024)
par: Xia, Han, et autres
Publié: (2024)
CSSG: Measuring Code Similarity with Semantic Graphs
par: Lu, Yiyang, et autres
Publié: (2026)
par: Lu, Yiyang, et autres
Publié: (2026)
Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations
par: Zhu, Jian-Qiao, et autres
Publié: (2025)
par: Zhu, Jian-Qiao, et autres
Publié: (2025)
Searching for Best Practices in Retrieval-Augmented Generation
par: Wang, Xiaohua, et autres
Publié: (2024)
par: Wang, Xiaohua, et autres
Publié: (2024)
TripTailor: A Real-World Benchmark for Personalized Travel Planning
par: Shen, Yuanzhe, et autres
Publié: (2025)
par: Shen, Yuanzhe, et autres
Publié: (2025)
Aligning Large Language Model Behavior with Human Citation Preferences
par: Ando, Kenichiro, et autres
Publié: (2026)
par: Ando, Kenichiro, et autres
Publié: (2026)
Aligning Large Language Models with Searcher Preferences
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
MetaAlign: Align Large Language Models with Diverse Preferences during Inference Time
par: Zhang, Mozhi, et autres
Publié: (2024)
par: Zhang, Mozhi, et autres
Publié: (2024)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
par: Xu, Ningyu, et autres
Publié: (2026)
par: Xu, Ningyu, et autres
Publié: (2026)
Advancing Spiking Neural Networks for Sequential Modeling with Central Pattern Generators
par: Lv, Changze, et autres
Publié: (2024)
par: Lv, Changze, et autres
Publié: (2024)
Efficient and Effective Time-Series Forecasting with Spiking Neural Networks
par: Lv, Changze, et autres
Publié: (2024)
par: Lv, Changze, et autres
Publié: (2024)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
par: Liu, Yinhong, et autres
Publié: (2024)
par: Liu, Yinhong, et autres
Publié: (2024)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
par: Dou, Shihan, et autres
Publié: (2024)
par: Dou, Shihan, et autres
Publié: (2024)
On the Tip of the Tongue: Analyzing Conceptual Representation in Large Language Models with Reverse-Dictionary Probe
par: Xu, Ningyu, et autres
Publié: (2024)
par: Xu, Ningyu, et autres
Publié: (2024)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
par: Zhou, Han, et autres
Publié: (2024)
par: Zhou, Han, et autres
Publié: (2024)
Aligning Language Models with Human Preferences via a Bayesian Approach
par: Wang, Jiashuo, et autres
Publié: (2023)
par: Wang, Jiashuo, et autres
Publié: (2023)
Aligning Large Language Models with Implicit Preferences from User-Generated Content
par: Tan, Zhaoxuan, et autres
Publié: (2025)
par: Tan, Zhaoxuan, et autres
Publié: (2025)
Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets
par: Feng, Duanyu, et autres
Publié: (2024)
par: Feng, Duanyu, et autres
Publié: (2024)
Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes
par: Gong, Zhuocheng, et autres
Publié: (2025)
par: Gong, Zhuocheng, et autres
Publié: (2025)
Documents similaires
-
Advancing Parameter Efficiency in Fine-tuning via Representation Editing
par: Wu, Muling, et autres
Publié: (2024) -
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
par: Zhu, JianHao, et autres
Publié: (2024) -
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
par: Li, Tianlong, et autres
Publié: (2024) -
SpikeCLIP: A Contrastive Language-Image Pretrained Spiking Neural Network
par: Lv, Changze, et autres
Publié: (2023) -
UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation
par: Li, Tianlong, et autres
Publié: (2023)