Safety Alignment in NLP Tasks: Weakly Aligned Summarization as an In-Context Attack
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Yu, Li, Yufei, Xiao, Wen, Liu, Cong, Dong, Yue |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MACE: A Hybrid LLM Serving System with Colocated SLO-aware Continuous Retraining Alignment
par: Li, Yufei, et autres
Publié: (2025)
par: Li, Yufei, et autres
Publié: (2025)
Cross-Task Defense: Instruction-Tuning LLMs for Content Safety
par: Fu, Yu, et autres
Publié: (2024)
par: Fu, Yu, et autres
Publié: (2024)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs
par: Zhang, Xing, et autres
Publié: (2026)
par: Zhang, Xing, et autres
Publié: (2026)
NLP-ADBench: NLP Anomaly Detection Benchmark
par: Li, Yuangang, et autres
Publié: (2024)
par: Li, Yuangang, et autres
Publié: (2024)
Long Context Alignment with Short Instructions and Synthesized Positions
par: Wu, Wenhao, et autres
Publié: (2024)
par: Wu, Wenhao, et autres
Publié: (2024)
AlignSum: Data Pyramid Hierarchical Fine-tuning for Aligning with Human Summarization Preference
par: Han, Yang, et autres
Publié: (2024)
par: Han, Yang, et autres
Publié: (2024)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
par: Xia, Yinan, et autres
Publié: (2025)
par: Xia, Yinan, et autres
Publié: (2025)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
par: Liu, Chuang, et autres
Publié: (2024)
par: Liu, Chuang, et autres
Publié: (2024)
Improving Weak-to-Strong Generalization with Reliability-Aware Alignment
par: Guo, Yue, et autres
Publié: (2024)
par: Guo, Yue, et autres
Publié: (2024)
Abstractive Text Summarization for Bangla Language Using NLP and Machine Learning Approaches
par: Miazee, Asif Ahammad, et autres
Publié: (2025)
par: Miazee, Asif Ahammad, et autres
Publié: (2025)
STAIR: Improving Safety Alignment with Introspective Reasoning
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
AraFinNLP 2024: The First Arabic Financial NLP Shared Task
par: Malaysha, Sanad, et autres
Publié: (2024)
par: Malaysha, Sanad, et autres
Publié: (2024)
W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search
par: Ding, Zhenyu, et autres
Publié: (2025)
par: Ding, Zhenyu, et autres
Publié: (2025)
IterAlign: Iterative Constitutional Alignment of Large Language Models
par: Chen, Xiusi, et autres
Publié: (2024)
par: Chen, Xiusi, et autres
Publié: (2024)
TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment
par: Li, Chong, et autres
Publié: (2026)
par: Li, Chong, et autres
Publié: (2026)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
par: Zhu, Wenhong, et autres
Publié: (2024)
par: Zhu, Wenhong, et autres
Publié: (2024)
NLP Datasets for Idiom and Figurative Language Tasks
par: Matheny, Blake, et autres
Publié: (2025)
par: Matheny, Blake, et autres
Publié: (2025)
What Matters For Safety Alignment?
par: Li, Xing, et autres
Publié: (2026)
par: Li, Xing, et autres
Publié: (2026)
Aligning NLP Models with Target Population Perspectives using PAIR: Population-Aligned Instance Replication
par: Eckman, Stephanie, et autres
Publié: (2025)
par: Eckman, Stephanie, et autres
Publié: (2025)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
par: Huang, Caishuang, et autres
Publié: (2024)
par: Huang, Caishuang, et autres
Publié: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
Multi-Dimensional Evaluation of Text Summarization with In-Context Learning
par: Jain, Sameer, et autres
Publié: (2023)
par: Jain, Sameer, et autres
Publié: (2023)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
par: Bu, Yuyan, et autres
Publié: (2026)
par: Bu, Yuyan, et autres
Publié: (2026)
Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks
par: Ham, Seokil, et autres
Publié: (2025)
par: Ham, Seokil, et autres
Publié: (2025)
Harnessing the Unseen: The Hidden Influence of Intrinsic Knowledge in Long-Context Language Models
par: Fu, Yu, et autres
Publié: (2025)
par: Fu, Yu, et autres
Publié: (2025)
YaleNLP @ PerAnsSumm 2025: Multi-Perspective Integration via Mixture-of-Agents for Enhanced Healthcare QA Summarization
par: Jang, Dongsuk, et autres
Publié: (2025)
par: Jang, Dongsuk, et autres
Publié: (2025)
Personalized Abstractive Summarization by Tri-agent Generation Pipeline
par: Xiao, Wen, et autres
Publié: (2023)
par: Xiao, Wen, et autres
Publié: (2023)
HERA: Improving Long Document Summarization using Large Language Models with Context Packaging and Reordering
par: Li, Taiji, et autres
Publié: (2025)
par: Li, Taiji, et autres
Publié: (2025)
Annotator-Centric Active Learning for Subjective NLP Tasks
par: van der Meer, Michiel, et autres
Publié: (2024)
par: van der Meer, Michiel, et autres
Publié: (2024)
How Far Can In-Context Alignment Go? Exploring the State of In-Context Alignment
par: Huang, Heyan, et autres
Publié: (2024)
par: Huang, Heyan, et autres
Publié: (2024)
On Context Utilization in Summarization with Large Language Models
par: Ravaut, Mathieu, et autres
Publié: (2023)
par: Ravaut, Mathieu, et autres
Publié: (2023)
Comparative Evaluation of ChatGPT and DeepSeek Across Key NLP Tasks: Strengths, Weaknesses, and Domain-Specific Performance
par: Etaiwi, Wael, et autres
Publié: (2025)
par: Etaiwi, Wael, et autres
Publié: (2025)
Knowledge Planning in Large Language Models for Domain-Aligned Counseling Summarization
par: Srivastava, Aseem, et autres
Publié: (2024)
par: Srivastava, Aseem, et autres
Publié: (2024)
Membership Inference Attacks Against In-Context Learning
par: Wen, Rui, et autres
Publié: (2024)
par: Wen, Rui, et autres
Publié: (2024)
Benchmarking LLMs on the Semantic Overlap Summarization Task
par: Salvador, John, et autres
Publié: (2024)
par: Salvador, John, et autres
Publié: (2024)
Towards Context-Invariant Safety Alignment for Large Language Models
par: Wang, Yixu, et autres
Publié: (2026)
par: Wang, Yixu, et autres
Publié: (2026)
Uncertainty Awareness of Large Language Models Under Code Distribution Shifts: A Benchmark Study
par: Li, Yufei, et autres
Publié: (2024)
par: Li, Yufei, et autres
Publié: (2024)
Documents similaires
-
MACE: A Hybrid LLM Serving System with Colocated SLO-aware Continuous Retraining Alignment
par: Li, Yufei, et autres
Publié: (2025) -
Cross-Task Defense: Instruction-Tuning LLMs for Content Safety
par: Fu, Yu, et autres
Publié: (2024) -
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
par: Li, Hao, et autres
Publié: (2026) -
The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs
par: Zhang, Xing, et autres
Publié: (2026) -
NLP-ADBench: NLP Anomaly Detection Benchmark
par: Li, Yuangang, et autres
Publié: (2024)