Aligner: Efficient Alignment by Learning to Correct
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Jiaming, Chen, Boyuan, Lou, Hantao, Hong, Donghai, Zhang, Borong, Pan, Xuehai, Dai, Juntao, Qiu, Tianyi, Yang, Yaodong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
par: Lou, Hantao, et autres
Publié: (2025)
par: Lou, Hantao, et autres
Publié: (2025)
Language Models Resist Alignment: Evidence From Data Compression
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
par: Lou, Hantao, et autres
Publié: (2025)
par: Lou, Hantao, et autres
Publié: (2025)
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
par: Zhou, Jiayi, et autres
Publié: (2024)
par: Zhou, Jiayi, et autres
Publié: (2024)
Mitigating Deceptive Alignment via Self-Monitoring
par: Ji, Jiaming, et autres
Publié: (2025)
par: Ji, Jiaming, et autres
Publié: (2025)
Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark
par: Ji, Jiaming, et autres
Publié: (2023)
par: Ji, Jiaming, et autres
Publié: (2023)
AI Alignment: A Comprehensive Survey
par: Ji, Jiaming, et autres
Publié: (2023)
par: Ji, Jiaming, et autres
Publié: (2023)
Reward Generalization in RLHF: A Topological Perspective
par: Qiu, Tianyi, et autres
Publié: (2024)
par: Qiu, Tianyi, et autres
Publié: (2024)
ProgressGym: Alignment with a Millennium of Moral Progress
par: Qiu, Tianyi, et autres
Publié: (2024)
par: Qiu, Tianyi, et autres
Publié: (2024)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
par: Chen, Jiawei, et autres
Publié: (2026)
par: Chen, Jiawei, et autres
Publié: (2026)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
par: Zhang, Borong, et autres
Publié: (2025)
par: Zhang, Borong, et autres
Publié: (2025)
SafeMT: Multi-turn Safety for Multimodal Language Models
par: Zhu, Han, et autres
Publié: (2025)
par: Zhu, Han, et autres
Publié: (2025)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
par: Bu, Yuyan, et autres
Publié: (2026)
par: Bu, Yuyan, et autres
Publié: (2026)
SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
par: Wang, Lichao, et autres
Publié: (2026)
par: Wang, Lichao, et autres
Publié: (2026)
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
par: Chen, Boyuan, et autres
Publié: (2025)
par: Chen, Boyuan, et autres
Publié: (2025)
Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
par: Fang, Sitong, et autres
Publié: (2025)
par: Fang, Sitong, et autres
Publié: (2025)
Aligners: Decoupling LLMs and Alignment
par: Ngweta, Lilian, et autres
Publié: (2024)
par: Ngweta, Lilian, et autres
Publié: (2024)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
par: Bu, Yuyan, et autres
Publié: (2026)
par: Bu, Yuyan, et autres
Publié: (2026)
NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment
par: Shen, Gerald, et autres
Publié: (2024)
par: Shen, Gerald, et autres
Publié: (2024)
SafeDreamer: Safe Reinforcement Learning with World Models
par: Huang, Weidong, et autres
Publié: (2023)
par: Huang, Weidong, et autres
Publié: (2023)
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
par: Zhou, Jiayi, et autres
Publié: (2025)
par: Zhou, Jiayi, et autres
Publié: (2025)
MetaAligner: Towards Generalizable Multi-Objective Alignment of Language Models
par: Yang, Kailai, et autres
Publié: (2024)
par: Yang, Kailai, et autres
Publié: (2024)
Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation
par: Dai, Juntao, et autres
Publié: (2024)
par: Dai, Juntao, et autres
Publié: (2024)
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
par: Yang, Tianzhuo, et autres
Publié: (2026)
par: Yang, Tianzhuo, et autres
Publié: (2026)
Benchmarking Multi-National Value Alignment for Large Language Models
par: Shi, Weijie, et autres
Publié: (2025)
par: Shi, Weijie, et autres
Publié: (2025)
OntoAligner: A Comprehensive Modular and Robust Python Toolkit for Ontology Alignment
par: Giglou, Hamed Babaei, et autres
Publié: (2025)
par: Giglou, Hamed Babaei, et autres
Publié: (2025)
ArcAligner: Adaptive Recursive Aligner for Compressed Context Embeddings in RAG
par: Li, Jianbo, et autres
Publié: (2026)
par: Li, Jianbo, et autres
Publié: (2026)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
par: Ji, Jiaming, et autres
Publié: (2025)
par: Ji, Jiaming, et autres
Publié: (2025)
Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
P-Aligner: Enabling Pre-Alignment of Language Models via Principled Instruction Synthesis
par: Song, Feifan, et autres
Publié: (2025)
par: Song, Feifan, et autres
Publié: (2025)
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
par: Zhang, Guoxi, et autres
Publié: (2025)
par: Zhang, Guoxi, et autres
Publié: (2025)
Representative Social Choice: From Learning Theory to AI Alignment
par: Qiu, Tianyi
Publié: (2024)
par: Qiu, Tianyi
Publié: (2024)
FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight
par: Zhou, Jiayi, et autres
Publié: (2026)
par: Zhou, Jiayi, et autres
Publié: (2026)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
par: Wen, Pengcheng, et autres
Publié: (2025)
par: Wen, Pengcheng, et autres
Publié: (2025)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
par: Shi, Qinglong, et autres
Publié: (2026)
par: Shi, Qinglong, et autres
Publié: (2026)
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
par: Dai, Juntao, et autres
Publié: (2025)
par: Dai, Juntao, et autres
Publié: (2025)
Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers
par: Tang, Zecheng, et autres
Publié: (2026)
par: Tang, Zecheng, et autres
Publié: (2026)
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
par: Ji, Baibei, et autres
Publié: (2026)
par: Ji, Baibei, et autres
Publié: (2026)
Documents similaires
-
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
par: Lou, Hantao, et autres
Publié: (2025) -
Language Models Resist Alignment: Evidence From Data Compression
par: Ji, Jiaming, et autres
Publié: (2024) -
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
par: Ji, Jiaming, et autres
Publié: (2024) -
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
par: Lou, Hantao, et autres
Publié: (2025) -
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
par: Ji, Jiaming, et autres
Publié: (2024)