Language Models Resist Alignment: Evidence From Data Compression
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ji, Jiaming, Wang, Kaile, Qiu, Tianyi, Chen, Boyuan, Zhou, Jiayi, Li, Changye, Lou, Hantao, Dai, Juntao, Liu, Yunhuai, Yang, Yaodong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
von: Lou, Hantao, et al.
Veröffentlicht: (2025)
von: Lou, Hantao, et al.
Veröffentlicht: (2025)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
von: Lou, Hantao, et al.
Veröffentlicht: (2025)
von: Lou, Hantao, et al.
Veröffentlicht: (2025)
Aligner: Efficient Alignment by Learning to Correct
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
von: Zhou, Jiayi, et al.
Veröffentlicht: (2024)
von: Zhou, Jiayi, et al.
Veröffentlicht: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
Reward Generalization in RLHF: A Topological Perspective
von: Qiu, Tianyi, et al.
Veröffentlicht: (2024)
von: Qiu, Tianyi, et al.
Veröffentlicht: (2024)
SafeLawBench: Towards Safe Alignment of Large Language Models
von: Cao, Chuxue, et al.
Veröffentlicht: (2025)
von: Cao, Chuxue, et al.
Veröffentlicht: (2025)
Mitigating Deceptive Alignment via Self-Monitoring
von: Ji, Jiaming, et al.
Veröffentlicht: (2025)
von: Ji, Jiaming, et al.
Veröffentlicht: (2025)
ProgressGym: Alignment with a Millennium of Moral Progress
von: Qiu, Tianyi, et al.
Veröffentlicht: (2024)
von: Qiu, Tianyi, et al.
Veröffentlicht: (2024)
Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
von: Fang, Sitong, et al.
Veröffentlicht: (2025)
von: Fang, Sitong, et al.
Veröffentlicht: (2025)
SafeMT: Multi-turn Safety for Multimodal Language Models
von: Zhu, Han, et al.
Veröffentlicht: (2025)
von: Zhu, Han, et al.
Veröffentlicht: (2025)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
von: Bu, Yuyan, et al.
Veröffentlicht: (2026)
von: Bu, Yuyan, et al.
Veröffentlicht: (2026)
SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
von: Wang, Lichao, et al.
Veröffentlicht: (2026)
von: Wang, Lichao, et al.
Veröffentlicht: (2026)
Efficient Model-agnostic Alignment via Bayesian Persuasion
von: Bai, Fengshuo, et al.
Veröffentlicht: (2024)
von: Bai, Fengshuo, et al.
Veröffentlicht: (2024)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
von: Wen, Pengcheng, et al.
Veröffentlicht: (2025)
von: Wen, Pengcheng, et al.
Veröffentlicht: (2025)
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
von: Chen, Boyuan, et al.
Veröffentlicht: (2025)
von: Chen, Boyuan, et al.
Veröffentlicht: (2025)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
von: Chen, Jiawei, et al.
Veröffentlicht: (2026)
von: Chen, Jiawei, et al.
Veröffentlicht: (2026)
Benchmarking Multi-National Value Alignment for Large Language Models
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
von: Yang, Tianzhuo, et al.
Veröffentlicht: (2026)
von: Yang, Tianzhuo, et al.
Veröffentlicht: (2026)
FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight
von: Zhou, Jiayi, et al.
Veröffentlicht: (2026)
von: Zhou, Jiayi, et al.
Veröffentlicht: (2026)
Representative Social Choice: From Learning Theory to AI Alignment
von: Qiu, Tianyi
Veröffentlicht: (2024)
von: Qiu, Tianyi
Veröffentlicht: (2024)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
von: Bu, Yuyan, et al.
Veröffentlicht: (2026)
von: Bu, Yuyan, et al.
Veröffentlicht: (2026)
Data-free Weight Compress and Denoise for Large Language Models
von: Peng, Runyu, et al.
Veröffentlicht: (2024)
von: Peng, Runyu, et al.
Veröffentlicht: (2024)
AI Alignment: A Comprehensive Survey
von: Ji, Jiaming, et al.
Veröffentlicht: (2023)
von: Ji, Jiaming, et al.
Veröffentlicht: (2023)
Too Big to Fail: Larger Language Models are Disproportionately Resilient to Induction of Dementia-Related Linguistic Anomalies
von: Li, Changye, et al.
Veröffentlicht: (2024)
von: Li, Changye, et al.
Veröffentlicht: (2024)
Coordinated Semantic Alignment and Evidence Constraints for Retrieval-Augmented Generation with Large Language Models
von: Chen, Xin, et al.
Veröffentlicht: (2026)
von: Chen, Xin, et al.
Veröffentlicht: (2026)
AddrLLM: Address Rewriting via Large Language Model on Nationwide Logistics Data
von: Yang, Qinchen, et al.
Veröffentlicht: (2024)
von: Yang, Qinchen, et al.
Veröffentlicht: (2024)
Bigger But Not Better: Small Neural Language Models Outperform Large Language Models in Detection of Thought Disorder
von: Li, Changye, et al.
Veröffentlicht: (2025)
von: Li, Changye, et al.
Veröffentlicht: (2025)
CCF: A Context Compression Framework for Efficient Long-Sequence Language Modeling
von: Li, Wenhao, et al.
Veröffentlicht: (2025)
von: Li, Wenhao, et al.
Veröffentlicht: (2025)
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment
von: Wang, Mingzhi, et al.
Veröffentlicht: (2024)
von: Wang, Mingzhi, et al.
Veröffentlicht: (2024)
A Survey on Multilingual Large Language Models: Corpora, Alignment, and Bias
von: Xu, Yuemei, et al.
Veröffentlicht: (2024)
von: Xu, Yuemei, et al.
Veröffentlicht: (2024)
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
von: Zhang, Guoxi, et al.
Veröffentlicht: (2025)
von: Zhang, Guoxi, et al.
Veröffentlicht: (2025)
From LLM-anation to LLM-orchestrator: Coordinating Small Models for Data Labeling
von: Lu, Yao, et al.
Veröffentlicht: (2025)
von: Lu, Yao, et al.
Veröffentlicht: (2025)
Reexamining Racial Disparities in Automatic Speech Recognition Performance: The Role of Confounding by Provenance
von: Li, Changye, et al.
Veröffentlicht: (2024)
von: Li, Changye, et al.
Veröffentlicht: (2024)
From Lists to Emojis: How Format Bias Affects Model Alignment
von: Zhang, Xuanchang, et al.
Veröffentlicht: (2024)
von: Zhang, Xuanchang, et al.
Veröffentlicht: (2024)
PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
von: Lu, Keer, et al.
Veröffentlicht: (2025)
von: Lu, Keer, et al.
Veröffentlicht: (2025)
Heterogeneous Value Alignment Evaluation for Large Language Models
von: Zhang, Zhaowei, et al.
Veröffentlicht: (2023)
von: Zhang, Zhaowei, et al.
Veröffentlicht: (2023)
Beware of Calibration Data for Pruning Large Language Models
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
von: Lou, Hantao, et al.
Veröffentlicht: (2025) -
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
von: Lou, Hantao, et al.
Veröffentlicht: (2025) -
Aligner: Efficient Alignment by Learning to Correct
von: Ji, Jiaming, et al.
Veröffentlicht: (2024) -
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
von: Zhou, Jiayi, et al.
Veröffentlicht: (2024) -
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)