Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains
Fuente:
arXiv
Guardado en:
| Autores principales: | Gao, Yuan, Liu, Zhigang, Yao, Xinyu, Chen, Bo, Zhao, Xiaobing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WenyanGPT: A Large Language Model for Classical Chinese Tasks
por: Yao, Xinyu, et al.
Publicado: (2025)
por: Yao, Xinyu, et al.
Publicado: (2025)
Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
por: Xu, Shaoyang, et al.
Publicado: (2024)
por: Xu, Shaoyang, et al.
Publicado: (2024)
NILE: Internal Consistency Alignment in Large Language Models
por: Hu, Minda, et al.
Publicado: (2024)
por: Hu, Minda, et al.
Publicado: (2024)
Improving the Robustness of Large Language Models via Consistency Alignment
por: Zhao, Yukun, et al.
Publicado: (2024)
por: Zhao, Yukun, et al.
Publicado: (2024)
Semantic Consistency Regularization with Large Language Models for Semi-supervised Sentiment Analysis
por: Li, Kunrong, et al.
Publicado: (2025)
por: Li, Kunrong, et al.
Publicado: (2025)
Ensuring Consistency for In-Image Translation
por: Fu, Chengpeng, et al.
Publicado: (2024)
por: Fu, Chengpeng, et al.
Publicado: (2024)
C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models
por: Wu, Ping, et al.
Publicado: (2025)
por: Wu, Ping, et al.
Publicado: (2025)
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
por: Zhang, Xue, et al.
Publicado: (2025)
por: Zhang, Xue, et al.
Publicado: (2025)
VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
por: Gupta, Aman, et al.
Publicado: (2025)
por: Gupta, Aman, et al.
Publicado: (2025)
Benchmarking Multi-National Value Alignment for Large Language Models
por: Shi, Weijie, et al.
Publicado: (2025)
por: Shi, Weijie, et al.
Publicado: (2025)
Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
Heterogeneous Value Alignment Evaluation for Large Language Models
por: Zhang, Zhaowei, et al.
Publicado: (2023)
por: Zhang, Zhaowei, et al.
Publicado: (2023)
Are Large Language Models Consistent over Value-laden Questions?
por: Moore, Jared, et al.
Publicado: (2024)
por: Moore, Jared, et al.
Publicado: (2024)
Dr3: Ask Large Language Models Not to Give Off-Topic Answers in Open Domain Multi-Hop Question Answering
por: Gao, Yuan, et al.
Publicado: (2024)
por: Gao, Yuan, et al.
Publicado: (2024)
Enhancing Cross-Lingual Transfer through Reversible Transliteration: A Huffman-Based Approach for Low-Resource Languages
por: Zhuang, Wenhao, et al.
Publicado: (2025)
por: Zhuang, Wenhao, et al.
Publicado: (2025)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment
por: Wang, Jianing, et al.
Publicado: (2024)
por: Wang, Jianing, et al.
Publicado: (2024)
WeightedKV: Attention Scores Weighted Key-Value Cache Merging for Large Language Models
por: Yuan, Jian, et al.
Publicado: (2025)
por: Yuan, Jian, et al.
Publicado: (2025)
Bridging Collaborative Filtering and Large Language Models with Dynamic Alignment, Multimodal Fusion and Evidence-grounded Explanations
por: Ma, Bo, et al.
Publicado: (2025)
por: Ma, Bo, et al.
Publicado: (2025)
AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models
por: Zhu, Zihao, et al.
Publicado: (2025)
por: Zhu, Zihao, et al.
Publicado: (2025)
Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models
por: Zhang, Peiyi, et al.
Publicado: (2024)
por: Zhang, Peiyi, et al.
Publicado: (2024)
Zero-Shot Stance Detection in the Wild: Dynamic Target Generation and Multi-Target Adaptation
por: Li, Aohua, et al.
Publicado: (2026)
por: Li, Aohua, et al.
Publicado: (2026)
Towards Context-Invariant Safety Alignment for Large Language Models
por: Wang, Yixu, et al.
Publicado: (2026)
por: Wang, Yixu, et al.
Publicado: (2026)
Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict
por: Chen, Guanyu, et al.
Publicado: (2026)
por: Chen, Guanyu, et al.
Publicado: (2026)
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
por: Chen, Chen, et al.
Publicado: (2026)
por: Chen, Chen, et al.
Publicado: (2026)
ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models
por: Yang, Bo, et al.
Publicado: (2026)
por: Yang, Bo, et al.
Publicado: (2026)
Enhancing Time Series Forecasting via Multi-Level Text Alignment with LLMs
por: Zhao, Taibiao, et al.
Publicado: (2025)
por: Zhao, Taibiao, et al.
Publicado: (2025)
Enhancing Speech Large Language Models through Reinforced Behavior Alignment
por: Liu, Yansong, et al.
Publicado: (2025)
por: Liu, Yansong, et al.
Publicado: (2025)
CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
por: Mo, Haosi, et al.
Publicado: (2025)
por: Mo, Haosi, et al.
Publicado: (2025)
VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models
por: Kim, Woojin, et al.
Publicado: (2026)
por: Kim, Woojin, et al.
Publicado: (2026)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
por: Wang, Jiahao, et al.
Publicado: (2025)
por: Wang, Jiahao, et al.
Publicado: (2025)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
por: Jin, Haoran, et al.
Publicado: (2025)
por: Jin, Haoran, et al.
Publicado: (2025)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
por: Zhao, Zilong, et al.
Publicado: (2024)
por: Zhao, Zilong, et al.
Publicado: (2024)
Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models
por: Zhang, Binchi, et al.
Publicado: (2026)
por: Zhang, Binchi, et al.
Publicado: (2026)
ECKGBench: Benchmarking Large Language Models in E-commerce Leveraging Knowledge Graph
por: Liu, Langming, et al.
Publicado: (2025)
por: Liu, Langming, et al.
Publicado: (2025)
ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
por: Chen, Jiawei, et al.
Publicado: (2025)
por: Chen, Jiawei, et al.
Publicado: (2025)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
por: Zhao, Fei, et al.
Publicado: (2024)
por: Zhao, Fei, et al.
Publicado: (2024)
DDK: Distilling Domain Knowledge for Efficient Large Language Models
por: Liu, Jiaheng, et al.
Publicado: (2024)
por: Liu, Jiaheng, et al.
Publicado: (2024)
Alignment for Efficient Tool Calling of Large Language Models
por: Xu, Hongshen, et al.
Publicado: (2025)
por: Xu, Hongshen, et al.
Publicado: (2025)
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
por: Huang, Yue, et al.
Publicado: (2024)
por: Huang, Yue, et al.
Publicado: (2024)
Ejemplares similares
-
WenyanGPT: A Large Language Model for Classical Chinese Tasks
por: Yao, Xinyu, et al.
Publicado: (2025) -
Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
por: Xu, Shaoyang, et al.
Publicado: (2024) -
NILE: Internal Consistency Alignment in Large Language Models
por: Hu, Minda, et al.
Publicado: (2024) -
Improving the Robustness of Large Language Models via Consistency Alignment
por: Zhao, Yukun, et al.
Publicado: (2024) -
Semantic Consistency Regularization with Large Language Models for Semi-supervised Sentiment Analysis
por: Li, Kunrong, et al.
Publicado: (2025)