Dialectical Alignment: Resolving the Tension of 3H and Security Threats of LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Shu, Su, Jiayuan, Jiang, Han, Li, Mengdi, Cheng, Keyuan, Ali, Muhammad Asif, Hu, Lijie, Wang, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MoRAL: MoE Augmented LoRA for LLMs' Lifelong Learning
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
Multi-hop Question Answering under Temporal Knowledge Editing
par: Cheng, Keyuan, et autres
Publié: (2024)
par: Cheng, Keyuan, et autres
Publié: (2024)
COMPKE: Complex Question Answering under Knowledge Editing
par: Cheng, Keyuan, et autres
Publié: (2025)
par: Cheng, Keyuan, et autres
Publié: (2025)
Leveraging Logical Rules in Knowledge Editing: A Cherry on the Top
par: Cheng, Keyuan, et autres
Publié: (2024)
par: Cheng, Keyuan, et autres
Publié: (2024)
MONAL: Model Autophagy Analysis for Modeling Human-AI Interactions
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
Prompt-SAW: Leveraging Relation-Aware Graphs for Textual Prompt Compression
par: Ali, Muhammad Asif, et autres
Publié: (2024)
par: Ali, Muhammad Asif, et autres
Publié: (2024)
Understanding Reasoning in Chain-of-Thought from the Hopfieldian View
par: Hu, Lijie, et autres
Publié: (2024)
par: Hu, Lijie, et autres
Publié: (2024)
Exploring the Personality Traits of LLMs through Latent Features Steering
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
CODEMENV: Benchmarking Large Language Models on Code Migration
par: Cheng, Keyuan, et autres
Publié: (2025)
par: Cheng, Keyuan, et autres
Publié: (2025)
A Hopfieldian View-based Interpretation for Chain-of-Thought Reasoning
par: Hu, Lijie, et autres
Publié: (2024)
par: Hu, Lijie, et autres
Publié: (2024)
Understanding How Value Neurons Shape the Generation of Specified Values in LLMs
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Understanding the Repeat Curse in Large Language Models from a Feature Perspective
par: Yao, Junchi, et autres
Publié: (2025)
par: Yao, Junchi, et autres
Publié: (2025)
Locate-then-edit for Multi-hop Factual Recall under Knowledge Editing
par: Zhang, Zhuoran, et autres
Publié: (2024)
par: Zhang, Zhuoran, et autres
Publié: (2024)
From Multimodal Perception to Strategic Reasoning: A Survey on AI-Generated Game Commentary
par: Zheng, Qirui, et autres
Publié: (2025)
par: Zheng, Qirui, et autres
Publié: (2025)
Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness
par: Yang, Zhipeng, et autres
Publié: (2026)
par: Yang, Zhipeng, et autres
Publié: (2026)
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
par: Yang, Qishun, et autres
Publié: (2026)
par: Yang, Qishun, et autres
Publié: (2026)
Antonym vs Synonym Distinction using InterlaCed Encoder NETworks (ICE-NET)
par: Ali, Muhammad Asif, et autres
Publié: (2024)
par: Ali, Muhammad Asif, et autres
Publié: (2024)
Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency
par: Yang, Shu, et autres
Publié: (2026)
par: Yang, Shu, et autres
Publié: (2026)
A Survey on Agentic Security: Applications, Threats and Defenses
par: Shahriar, Asif, et autres
Publié: (2025)
par: Shahriar, Asif, et autres
Publié: (2025)
The Ethics of Interaction: Mitigating Security Threats in LLMs
par: Kumar, Ashutosh, et autres
Publié: (2024)
par: Kumar, Ashutosh, et autres
Publié: (2024)
Fine-Tuning LLMs for Low-Resource Dialect Translation: The Case of Lebanese
par: Yakhni, Silvana, et autres
Publié: (2025)
par: Yakhni, Silvana, et autres
Publié: (2025)
Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation
par: Li, Tong, et autres
Publié: (2025)
par: Li, Tong, et autres
Publié: (2025)
Xwin-LM: Strong and Scalable Alignment Practice for LLMs
par: Ni, Bolin, et autres
Publié: (2024)
par: Ni, Bolin, et autres
Publié: (2024)
Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
par: Zhou, Wenrui, et autres
Publié: (2025)
par: Zhou, Wenrui, et autres
Publié: (2025)
Fraud-R1 : A Multi-Round Benchmark for Assessing the Robustness of LLM Against Augmented Fraud and Phishing Inducements
par: Yang, Shu, et autres
Publié: (2025)
par: Yang, Shu, et autres
Publié: (2025)
UniMEEC: Towards Unified Multimodal Emotion Recognition and Emotion Cause
par: Hu, Guimin, et autres
Publié: (2024)
par: Hu, Guimin, et autres
Publié: (2024)
ProSec: Fortifying Code LLMs with Proactive Security Alignment
par: Xu, Xiangzhe, et autres
Publié: (2024)
par: Xu, Xiangzhe, et autres
Publié: (2024)
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
par: Beetham, James, et autres
Publié: (2024)
par: Beetham, James, et autres
Publié: (2024)
Analyzing Dialectical Biases in LLMs for Knowledge and Reasoning Benchmarks
par: Pan, Eileen, et autres
Publié: (2025)
par: Pan, Eileen, et autres
Publié: (2025)
Data-Augmentation-Based Dialectal Adaptation for LLMs
par: Faisal, Fahim, et autres
Publié: (2024)
par: Faisal, Fahim, et autres
Publié: (2024)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
par: You, Liangliang, et autres
Publié: (2025)
par: You, Liangliang, et autres
Publié: (2025)
Language, Place, and Social Media: Geographic Dialect Alignment in New Zealand
par: Wong, Sidney
Publié: (2026)
par: Wong, Sidney
Publié: (2026)
MQA-KEAL: Multi-hop Question Answering under Knowledge Editing for Arabic Language
par: Ali, Muhammad Asif, et autres
Publié: (2024)
par: Ali, Muhammad Asif, et autres
Publié: (2024)
DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects
par: Lucas, Jason, et autres
Publié: (2026)
par: Lucas, Jason, et autres
Publié: (2026)
Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
Vuyko Mistral: Adapting LLMs for Low-Resource Dialectal Translation
par: Kyslyi, Roman, et autres
Publié: (2025)
par: Kyslyi, Roman, et autres
Publié: (2025)
The Compositional Architecture of Regret in Large Language Models
par: Cui, Xiangxiang, et autres
Publié: (2025)
par: Cui, Xiangxiang, et autres
Publié: (2025)
Understanding and Mitigating Cross-lingual Privacy Leakage via Language-specific and Universal Privacy Neurons
par: Dong, Wenshuo, et autres
Publié: (2025)
par: Dong, Wenshuo, et autres
Publié: (2025)
Teaching LLMs How to Learn with Contextual Fine-Tuning
par: Choi, Younwoo, et autres
Publié: (2025)
par: Choi, Younwoo, et autres
Publié: (2025)
Dolphin-CN-Dialect: Where Chinese Dialects Matter
par: Meng, Yangyang, et autres
Publié: (2026)
par: Meng, Yangyang, et autres
Publié: (2026)
Documents similaires
-
MoRAL: MoE Augmented LoRA for LLMs' Lifelong Learning
par: Yang, Shu, et autres
Publié: (2024) -
Multi-hop Question Answering under Temporal Knowledge Editing
par: Cheng, Keyuan, et autres
Publié: (2024) -
COMPKE: Complex Question Answering under Knowledge Editing
par: Cheng, Keyuan, et autres
Publié: (2025) -
Leveraging Logical Rules in Knowledge Editing: A Cherry on the Top
par: Cheng, Keyuan, et autres
Publié: (2024) -
MONAL: Model Autophagy Analysis for Modeling Human-AI Interactions
par: Yang, Shu, et autres
Publié: (2024)