Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gao, Yuan, Liu, Zhigang, Yao, Xinyu, Chen, Bo, Zhao, Xiaobing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
WenyanGPT: A Large Language Model for Classical Chinese Tasks
von: Yao, Xinyu, et al.
Veröffentlicht: (2025)
von: Yao, Xinyu, et al.
Veröffentlicht: (2025)
Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
NILE: Internal Consistency Alignment in Large Language Models
von: Hu, Minda, et al.
Veröffentlicht: (2024)
von: Hu, Minda, et al.
Veröffentlicht: (2024)
Improving the Robustness of Large Language Models via Consistency Alignment
von: Zhao, Yukun, et al.
Veröffentlicht: (2024)
von: Zhao, Yukun, et al.
Veröffentlicht: (2024)
Semantic Consistency Regularization with Large Language Models for Semi-supervised Sentiment Analysis
von: Li, Kunrong, et al.
Veröffentlicht: (2025)
von: Li, Kunrong, et al.
Veröffentlicht: (2025)
Ensuring Consistency for In-Image Translation
von: Fu, Chengpeng, et al.
Veröffentlicht: (2024)
von: Fu, Chengpeng, et al.
Veröffentlicht: (2024)
C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models
von: Wu, Ping, et al.
Veröffentlicht: (2025)
von: Wu, Ping, et al.
Veröffentlicht: (2025)
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
von: Gupta, Aman, et al.
Veröffentlicht: (2025)
von: Gupta, Aman, et al.
Veröffentlicht: (2025)
Benchmarking Multi-National Value Alignment for Large Language Models
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
Heterogeneous Value Alignment Evaluation for Large Language Models
von: Zhang, Zhaowei, et al.
Veröffentlicht: (2023)
von: Zhang, Zhaowei, et al.
Veröffentlicht: (2023)
Are Large Language Models Consistent over Value-laden Questions?
von: Moore, Jared, et al.
Veröffentlicht: (2024)
von: Moore, Jared, et al.
Veröffentlicht: (2024)
Dr3: Ask Large Language Models Not to Give Off-Topic Answers in Open Domain Multi-Hop Question Answering
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
Enhancing Cross-Lingual Transfer through Reversible Transliteration: A Huffman-Based Approach for Low-Resource Languages
von: Zhuang, Wenhao, et al.
Veröffentlicht: (2025)
von: Zhuang, Wenhao, et al.
Veröffentlicht: (2025)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
von: Yuan, Hongbang, et al.
Veröffentlicht: (2024)
von: Yuan, Hongbang, et al.
Veröffentlicht: (2024)
InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment
von: Wang, Jianing, et al.
Veröffentlicht: (2024)
von: Wang, Jianing, et al.
Veröffentlicht: (2024)
WeightedKV: Attention Scores Weighted Key-Value Cache Merging for Large Language Models
von: Yuan, Jian, et al.
Veröffentlicht: (2025)
von: Yuan, Jian, et al.
Veröffentlicht: (2025)
Bridging Collaborative Filtering and Large Language Models with Dynamic Alignment, Multimodal Fusion and Evidence-grounded Explanations
von: Ma, Bo, et al.
Veröffentlicht: (2025)
von: Ma, Bo, et al.
Veröffentlicht: (2025)
AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models
von: Zhu, Zihao, et al.
Veröffentlicht: (2025)
von: Zhu, Zihao, et al.
Veröffentlicht: (2025)
Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models
von: Zhang, Peiyi, et al.
Veröffentlicht: (2024)
von: Zhang, Peiyi, et al.
Veröffentlicht: (2024)
Zero-Shot Stance Detection in the Wild: Dynamic Target Generation and Multi-Target Adaptation
von: Li, Aohua, et al.
Veröffentlicht: (2026)
von: Li, Aohua, et al.
Veröffentlicht: (2026)
Towards Context-Invariant Safety Alignment for Large Language Models
von: Wang, Yixu, et al.
Veröffentlicht: (2026)
von: Wang, Yixu, et al.
Veröffentlicht: (2026)
Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict
von: Chen, Guanyu, et al.
Veröffentlicht: (2026)
von: Chen, Guanyu, et al.
Veröffentlicht: (2026)
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
von: Chen, Chen, et al.
Veröffentlicht: (2026)
von: Chen, Chen, et al.
Veröffentlicht: (2026)
ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models
von: Yang, Bo, et al.
Veröffentlicht: (2026)
von: Yang, Bo, et al.
Veröffentlicht: (2026)
Enhancing Time Series Forecasting via Multi-Level Text Alignment with LLMs
von: Zhao, Taibiao, et al.
Veröffentlicht: (2025)
von: Zhao, Taibiao, et al.
Veröffentlicht: (2025)
Enhancing Speech Large Language Models through Reinforced Behavior Alignment
von: Liu, Yansong, et al.
Veröffentlicht: (2025)
von: Liu, Yansong, et al.
Veröffentlicht: (2025)
CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
von: Mo, Haosi, et al.
Veröffentlicht: (2025)
von: Mo, Haosi, et al.
Veröffentlicht: (2025)
VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models
von: Kim, Woojin, et al.
Veröffentlicht: (2026)
von: Kim, Woojin, et al.
Veröffentlicht: (2026)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
von: Wang, Jiahao, et al.
Veröffentlicht: (2025)
von: Wang, Jiahao, et al.
Veröffentlicht: (2025)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
von: Jin, Haoran, et al.
Veröffentlicht: (2025)
von: Jin, Haoran, et al.
Veröffentlicht: (2025)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
von: Zhao, Zilong, et al.
Veröffentlicht: (2024)
von: Zhao, Zilong, et al.
Veröffentlicht: (2024)
Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models
von: Zhang, Binchi, et al.
Veröffentlicht: (2026)
von: Zhang, Binchi, et al.
Veröffentlicht: (2026)
ECKGBench: Benchmarking Large Language Models in E-commerce Leveraging Knowledge Graph
von: Liu, Langming, et al.
Veröffentlicht: (2025)
von: Liu, Langming, et al.
Veröffentlicht: (2025)
ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
von: Chen, Jiawei, et al.
Veröffentlicht: (2025)
von: Chen, Jiawei, et al.
Veröffentlicht: (2025)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
von: Zhao, Fei, et al.
Veröffentlicht: (2024)
von: Zhao, Fei, et al.
Veröffentlicht: (2024)
DDK: Distilling Domain Knowledge for Efficient Large Language Models
von: Liu, Jiaheng, et al.
Veröffentlicht: (2024)
von: Liu, Jiaheng, et al.
Veröffentlicht: (2024)
Alignment for Efficient Tool Calling of Large Language Models
von: Xu, Hongshen, et al.
Veröffentlicht: (2025)
von: Xu, Hongshen, et al.
Veröffentlicht: (2025)
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
von: Huang, Yue, et al.
Veröffentlicht: (2024)
von: Huang, Yue, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
WenyanGPT: A Large Language Model for Classical Chinese Tasks
von: Yao, Xinyu, et al.
Veröffentlicht: (2025) -
Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024) -
NILE: Internal Consistency Alignment in Large Language Models
von: Hu, Minda, et al.
Veröffentlicht: (2024) -
Improving the Robustness of Large Language Models via Consistency Alignment
von: Zhao, Yukun, et al.
Veröffentlicht: (2024) -
Semantic Consistency Regularization with Large Language Models for Semi-supervised Sentiment Analysis
von: Li, Kunrong, et al.
Veröffentlicht: (2025)