Guardado en:
| Autores principales: | Zhong, Yifan, Ma, Chengdong, Zhang, Xiaoyuan, Yang, Ziran, Chen, Haojun, Zhang, Qingfu, Qi, Siyuan, Yang, Yaodong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2402.02030 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs
por: Zhang, Zhaowei, et al.
Publicado: (2025)
por: Zhang, Zhaowei, et al.
Publicado: (2025)
Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment
por: Wang, Mingzhi, et al.
Publicado: (2024)
por: Wang, Mingzhi, et al.
Publicado: (2024)
Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games
por: Ma, Chengdong, et al.
Publicado: (2023)
por: Ma, Chengdong, et al.
Publicado: (2023)
Dealing with Structure Constraints in Evolutionary Pareto Set Learning
por: Lin, Xi, et al.
Publicado: (2023)
por: Lin, Xi, et al.
Publicado: (2023)
In-Context Editing: Learning Knowledge from Self-Induced Distributions
por: Qi, Siyuan, et al.
Publicado: (2024)
por: Qi, Siyuan, et al.
Publicado: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
por: Ji, Jiaming, et al.
Publicado: (2024)
por: Ji, Jiaming, et al.
Publicado: (2024)
Heterogeneous Value Alignment Evaluation for Large Language Models
por: Zhang, Zhaowei, et al.
Publicado: (2023)
por: Zhang, Zhaowei, et al.
Publicado: (2023)
World Models Should Prioritize the Unification of Physical and Social Dynamics
por: Zhang, Xiaoyuan, et al.
Publicado: (2025)
por: Zhang, Xiaoyuan, et al.
Publicado: (2025)
Efficient Model-agnostic Alignment via Bayesian Persuasion
por: Bai, Fengshuo, et al.
Publicado: (2024)
por: Bai, Fengshuo, et al.
Publicado: (2024)
PANDA: Preference Adaptation for Enhancing Domain-Specific Abilities of LLMs
por: Liu, An, et al.
Publicado: (2024)
por: Liu, An, et al.
Publicado: (2024)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
por: Dai, Josef, et al.
Publicado: (2024)
por: Dai, Josef, et al.
Publicado: (2024)
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
por: Yang, Zhengbang, et al.
Publicado: (2026)
por: Yang, Zhengbang, et al.
Publicado: (2026)
Can LLMs Understand Unvoiced Speech? Exploring EMG-to-Text Conversion with LLMs
por: Mohapatra, Payal, et al.
Publicado: (2025)
por: Mohapatra, Payal, et al.
Publicado: (2025)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
por: Li, Moxin, et al.
Publicado: (2025)
por: Li, Moxin, et al.
Publicado: (2025)
Knowledgeable Preference Alignment for LLMs in Domain-specific Question Answering
por: Zhang, Yichi, et al.
Publicado: (2023)
por: Zhang, Yichi, et al.
Publicado: (2023)
Roadmap on Incentive Compatibility for AI Alignment and Governance in Sociotechnical Systems
por: Zhang, Zhaowei, et al.
Publicado: (2024)
por: Zhang, Zhaowei, et al.
Publicado: (2024)
UMOEA/D: A Multiobjective Evolutionary Algorithm for Uniform Pareto Objectives based on Decomposition
por: Zhang, Xiaoyuan, et al.
Publicado: (2024)
por: Zhang, Xiaoyuan, et al.
Publicado: (2024)
LLMs Know More Than Words: A Genre Study with Syntax, Metaphor & Phonetics
por: Shi, Weiye, et al.
Publicado: (2025)
por: Shi, Weiye, et al.
Publicado: (2025)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
por: Lou, Hantao, et al.
Publicado: (2025)
por: Lou, Hantao, et al.
Publicado: (2025)
Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning
por: Zhang, Zhaowei, et al.
Publicado: (2026)
por: Zhang, Zhaowei, et al.
Publicado: (2026)
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
por: Sun, Shengyin, et al.
Publicado: (2026)
por: Sun, Shengyin, et al.
Publicado: (2026)
Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
por: Sun, Guanglong, et al.
Publicado: (2026)
por: Sun, Guanglong, et al.
Publicado: (2026)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
Evaluating and Aligning CodeLLMs on Human Preference
por: Yang, Jian, et al.
Publicado: (2024)
por: Yang, Jian, et al.
Publicado: (2024)
TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment
por: Li, Chong, et al.
Publicado: (2026)
por: Li, Chong, et al.
Publicado: (2026)
ProgressGym: Alignment with a Millennium of Moral Progress
por: Qiu, Tianyi, et al.
Publicado: (2024)
por: Qiu, Tianyi, et al.
Publicado: (2024)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
por: Bai, Fengshuo, et al.
Publicado: (2024)
por: Bai, Fengshuo, et al.
Publicado: (2024)
PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization
por: Jiang, Han, et al.
Publicado: (2025)
por: Jiang, Han, et al.
Publicado: (2025)
UC-MOA: Utility-Conditioned Multi-Objective Alignment for Distributional Pareto-Optimality
por: Cheng, Zelei, et al.
Publicado: (2025)
por: Cheng, Zelei, et al.
Publicado: (2025)
DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization
por: Zhang, Chao, et al.
Publicado: (2025)
por: Zhang, Chao, et al.
Publicado: (2025)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
por: Yang, Wen, et al.
Publicado: (2025)
por: Yang, Wen, et al.
Publicado: (2025)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
por: Lou, Hantao, et al.
Publicado: (2025)
por: Lou, Hantao, et al.
Publicado: (2025)
Self-supervised Attribute-aware Dynamic Preference Ranking Alignment
por: Yang, Hongyu, et al.
Publicado: (2025)
por: Yang, Hongyu, et al.
Publicado: (2025)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
por: Cheng, Pengyu, et al.
Publicado: (2023)
por: Cheng, Pengyu, et al.
Publicado: (2023)
ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models using Pareto High-quality Data
por: Gu, Haoran, et al.
Publicado: (2025)
por: Gu, Haoran, et al.
Publicado: (2025)
MPO: An Efficient Post-Processing Framework for Mixing Diverse Preference Alignment
por: Wang, Tianze, et al.
Publicado: (2025)
por: Wang, Tianze, et al.
Publicado: (2025)
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
por: Zhao, Mengjie, et al.
Publicado: (2026)
por: Zhao, Mengjie, et al.
Publicado: (2026)
Accelerating Robotic Reinforcement Learning with Agent Guidance
por: Chen, Haojun, et al.
Publicado: (2026)
por: Chen, Haojun, et al.
Publicado: (2026)
PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs
por: Zhao, Tianyu, et al.
Publicado: (2026)
por: Zhao, Tianyu, et al.
Publicado: (2026)
HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs
por: Yang, Dongquan, et al.
Publicado: (2025)
por: Yang, Dongquan, et al.
Publicado: (2025)
Ejemplares similares
-
Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs
por: Zhang, Zhaowei, et al.
Publicado: (2025) -
Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment
por: Wang, Mingzhi, et al.
Publicado: (2024) -
Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games
por: Ma, Chengdong, et al.
Publicado: (2023) -
Dealing with Structure Constraints in Evolutionary Pareto Set Learning
por: Lin, Xi, et al.
Publicado: (2023) -
In-Context Editing: Learning Knowledge from Self-Induced Distributions
por: Qi, Siyuan, et al.
Publicado: (2024)