Aligning Large Language Models with Representation Editing: A Control Perspective
Fuente:
arXiv
Guardado en:
| Autores principales: | Kong, Lingkai, Wang, Haorui, Mu, Wenhao, Du, Yuanqi, Zhuang, Yuchen, Zhou, Yifei, Song, Yue, Zhang, Rongzhi, Wang, Kai, Zhang, Chao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MUBen: Benchmarking the Uncertainty of Molecular Representation Models
por: Li, Yinghao, et al.
Publicado: (2023)
por: Li, Yinghao, et al.
Publicado: (2023)
TPD: Enhancing Student Language Model Reasoning via Principle Discovery and Guidance
por: Wang, Haorui, et al.
Publicado: (2024)
por: Wang, Haorui, et al.
Publicado: (2024)
Two Birds with One Stone: Enhancing Uncertainty Quantification and Interpretability with Graph Functional Neural Process
por: Kong, Lingkai, et al.
Publicado: (2025)
por: Kong, Lingkai, et al.
Publicado: (2025)
Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing
por: Zhang, Rongzhi, et al.
Publicado: (2025)
por: Zhang, Rongzhi, et al.
Publicado: (2025)
LLM-Augmented Chemical Synthesis and Design Decision Programs
por: Wang, Haorui, et al.
Publicado: (2025)
por: Wang, Haorui, et al.
Publicado: (2025)
Efficient Evolutionary Search Over Chemical Space with Large Language Models
por: Wang, Haorui, et al.
Publicado: (2024)
por: Wang, Haorui, et al.
Publicado: (2024)
Diffusion Models as Constrained Samplers for Optimization with Unknown Constraints
por: Kong, Lingkai, et al.
Publicado: (2024)
por: Kong, Lingkai, et al.
Publicado: (2024)
DF2: Distribution-Free Decision-Focused Learning
por: Kong, Lingkai, et al.
Publicado: (2023)
por: Kong, Lingkai, et al.
Publicado: (2023)
Assessing Logical Puzzle Solving in Large Language Models: Insights from a Minesweeper Case Study
por: Li, Yinghao, et al.
Publicado: (2023)
por: Li, Yinghao, et al.
Publicado: (2023)
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
por: Zhang, Rongzhi, et al.
Publicado: (2024)
por: Zhang, Rongzhi, et al.
Publicado: (2024)
Aligning Large Language Models and Geometric Deep Models for Protein Representation
por: Shu, Dong, et al.
Publicado: (2024)
por: Shu, Dong, et al.
Publicado: (2024)
Aligning Large Language Models with Human Preferences through Representation Engineering
por: Liu, Wenhao, et al.
Publicado: (2023)
por: Liu, Wenhao, et al.
Publicado: (2023)
ARL2: Aligning Retrievers for Black-box Large Language Models via Self-guided Adaptive Relevance Labeling
por: Zhang, Lingxi, et al.
Publicado: (2024)
por: Zhang, Lingxi, et al.
Publicado: (2024)
Diffusion-DFL: Decision-focused Diffusion Models for Stochastic Optimization
por: Zhao, Zihao, et al.
Publicado: (2025)
por: Zhao, Zihao, et al.
Publicado: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
por: Zhang, Qingru, et al.
Publicado: (2025)
por: Zhang, Qingru, et al.
Publicado: (2025)
ProgGen: Generating Named Entity Recognition Datasets Step-by-step with Self-Reflexive Large Language Models
por: Heng, Yuzhao, et al.
Publicado: (2024)
por: Heng, Yuzhao, et al.
Publicado: (2024)
MatLLMSearch: Crystal Structure Discovery with Evolution-Guided Large Language Models
por: Gan, Jingru, et al.
Publicado: (2025)
por: Gan, Jingru, et al.
Publicado: (2025)
Disentangling Knowledge Representations for Large Language Model Editing
por: Zhang, Mengqi, et al.
Publicado: (2025)
por: Zhang, Mengqi, et al.
Publicado: (2025)
Quantitative Convergences of Lie Group Momentum Optimizers
por: Kong, Lingkai, et al.
Publicado: (2024)
por: Kong, Lingkai, et al.
Publicado: (2024)
Convergence of Kinetic Langevin Monte Carlo on Lie groups
por: Kong, Lingkai, et al.
Publicado: (2024)
por: Kong, Lingkai, et al.
Publicado: (2024)
Affective Computing in the Era of Large Language Models: A Survey from the NLP Perspective
por: Zhang, Yiqun, et al.
Publicado: (2024)
por: Zhang, Yiqun, et al.
Publicado: (2024)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
por: Li, Tianlong, et al.
Publicado: (2024)
por: Li, Tianlong, et al.
Publicado: (2024)
BBox-Adapter: Lightweight Adapting for Black-Box Large Language Models
por: Sun, Haotian, et al.
Publicado: (2024)
por: Sun, Haotian, et al.
Publicado: (2024)
Aligning Large Language Models for Controllable Recommendations
por: Lu, Wensheng, et al.
Publicado: (2024)
por: Lu, Wensheng, et al.
Publicado: (2024)
AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport
por: Kong, Lingkai, et al.
Publicado: (2025)
por: Kong, Lingkai, et al.
Publicado: (2025)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
por: He, Haorui, et al.
Publicado: (2024)
por: He, Haorui, et al.
Publicado: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
por: Wang, Haichuan, et al.
Publicado: (2026)
por: Wang, Haichuan, et al.
Publicado: (2026)
AdaptiveK: Complexity-Driven Sparse Autoencoders for Interpretable Language Model Representations
por: Yao, Yifei, et al.
Publicado: (2025)
por: Yao, Yifei, et al.
Publicado: (2025)
Semantic Representation Attack against Aligned Large Language Models
por: Lian, Jiawei, et al.
Publicado: (2025)
por: Lian, Jiawei, et al.
Publicado: (2025)
MetaAlign: Align Large Language Models with Diverse Preferences during Inference Time
por: Zhang, Mozhi, et al.
Publicado: (2024)
por: Zhang, Mozhi, et al.
Publicado: (2024)
Aligning Large Language Models with Healthcare Stakeholders: A Pathway to Trustworthy AI Integration
por: Ding, Kexin, et al.
Publicado: (2025)
por: Ding, Kexin, et al.
Publicado: (2025)
Learning Graph Structures and Uncertainty for Accurate and Calibrated Time-series Forecasting
por: Kamarthi, Harshavardhan, et al.
Publicado: (2024)
por: Kamarthi, Harshavardhan, et al.
Publicado: (2024)
How LLMs Are Persuaded: A Few Attention Heads, Rerouted
por: Sun, Xiangkun, et al.
Publicado: (2026)
por: Sun, Xiangkun, et al.
Publicado: (2026)
Verifiable Format Control for Large Language Model Generations
por: Wang, Zhaoyang, et al.
Publicado: (2025)
por: Wang, Zhaoyang, et al.
Publicado: (2025)
BMRetriever: Tuning Large Language Models as Better Biomedical Text Retrievers
por: Xu, Ran, et al.
Publicado: (2024)
por: Xu, Ran, et al.
Publicado: (2024)
HiGen: Hierarchy-Aware Sequence Generation for Hierarchical Text Classification
por: Jain, Vidit, et al.
Publicado: (2024)
por: Jain, Vidit, et al.
Publicado: (2024)
Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models
por: Fan, Yuchen, et al.
Publicado: (2024)
por: Fan, Yuchen, et al.
Publicado: (2024)
Trivialized Momentum Facilitates Diffusion Generative Modeling on Lie Groups
por: Zhu, Yuchen, et al.
Publicado: (2024)
por: Zhu, Yuchen, et al.
Publicado: (2024)
Editing Conceptual Knowledge for Large Language Models
por: Wang, Xiaohan, et al.
Publicado: (2024)
por: Wang, Xiaohan, et al.
Publicado: (2024)
Ejemplares similares
-
MUBen: Benchmarking the Uncertainty of Molecular Representation Models
por: Li, Yinghao, et al.
Publicado: (2023) -
TPD: Enhancing Student Language Model Reasoning via Principle Discovery and Guidance
por: Wang, Haorui, et al.
Publicado: (2024) -
Two Birds with One Stone: Enhancing Uncertainty Quantification and Interpretability with Graph Functional Neural Process
por: Kong, Lingkai, et al.
Publicado: (2025) -
Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing
por: Zhang, Rongzhi, et al.
Publicado: (2025) -
LLM-Augmented Chemical Synthesis and Design Decision Programs
por: Wang, Haorui, et al.
Publicado: (2025)