Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Soor, Sampriti, Ghosh, Suklav, Sur, Arijit |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Universal Adversarial Suffixes Using Calibrated Gumbel-Softmax Relaxation
par: Soor, Sampriti, et autres
Publié: (2025)
par: Soor, Sampriti, et autres
Publié: (2025)
A Generative Adversarial Approach to Adversarial Attacks Guided by Contrastive Language-Image Pre-trained Model
par: Soor, Sampriti, et autres
Publié: (2025)
par: Soor, Sampriti, et autres
Publié: (2025)
C-LEAD: Contrastive Learning for Enhanced Adversarial Defense
par: Ghosh, Suklav, et autres
Publié: (2025)
par: Ghosh, Suklav, et autres
Publié: (2025)
DGSSM: Diffusion guided state-space models for multimodal salient object detection
par: Ghosh, Suklav, et autres
Publié: (2026)
par: Ghosh, Suklav, et autres
Publié: (2026)
Trans-defense: Transformer-based Denoiser for Adversarial Defense with Spatial-Frequency Domain Representation
par: Pramanick, Alik, et autres
Publié: (2025)
par: Pramanick, Alik, et autres
Publié: (2025)
Learning to Extract Cross-Domain Aspects and Understanding Sentiments Using Large Language Models
par: Ghosh, Karukriti Kaushik, et autres
Publié: (2025)
par: Ghosh, Karukriti Kaushik, et autres
Publié: (2025)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
par: Ball, Sarah, et autres
Publié: (2025)
par: Ball, Sarah, et autres
Publié: (2025)
AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs
par: Liao, Zeyi, et autres
Publié: (2024)
par: Liao, Zeyi, et autres
Publié: (2024)
Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models
par: Bani-Harouni, David, et autres
Publié: (2025)
par: Bani-Harouni, David, et autres
Publié: (2025)
A UNet Model for Accelerated Preprocessing of CRISM Hyperspectral Data for Mineral Identification on Mars
par: Kumari, Priyanka, et autres
Publié: (2025)
par: Kumari, Priyanka, et autres
Publié: (2025)
Suffix-Constrained Greedy Search Algorithms for Causal Language Models
par: Hammal, Ayoub, et autres
Publié: (2026)
par: Hammal, Ayoub, et autres
Publié: (2026)
Thermometer: Towards Universal Calibration for Large Language Models
par: Shen, Maohao, et autres
Publié: (2024)
par: Shen, Maohao, et autres
Publié: (2024)
DPad: Efficient Diffusion Language Models with Suffix Dropout
par: Chen, Xinhua, et autres
Publié: (2025)
par: Chen, Xinhua, et autres
Publié: (2025)
Mitigating Adversarial Attacks in LLMs through Defensive Suffix Generation
par: Kim, Minkyoung, et autres
Publié: (2024)
par: Kim, Minkyoung, et autres
Publié: (2024)
Logical Consistency of Large Language Models in Fact-checking
par: Ghosh, Bishwamittra, et autres
Publié: (2024)
par: Ghosh, Bishwamittra, et autres
Publié: (2024)
Calibrated Self-Rewarding Vision Language Models
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
SANSKRITI: A Comprehensive Benchmark for Evaluating Language Models' Knowledge of Indian Culture
par: Maji, Arijit, et autres
Publié: (2025)
par: Maji, Arijit, et autres
Publié: (2025)
Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
par: Alsadat, Shayan Meshkat, et autres
Publié: (2024)
par: Alsadat, Shayan Meshkat, et autres
Publié: (2024)
Weighted Sum of Segmented Correlation: An Efficient Method for Spectra Matching in Hyperspectral Images
par: Soor, Sampriti, et autres
Publié: (2024)
par: Soor, Sampriti, et autres
Publié: (2024)
Adaptive Content Restriction for Large Language Models via Suffix Optimization
par: Li, Yige, et autres
Publié: (2025)
par: Li, Yige, et autres
Publié: (2025)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
par: Mu, Junjie, et autres
Publié: (2025)
par: Mu, Junjie, et autres
Publié: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
AmpleGCG-Plus: A Strong Generative Model of Adversarial Suffixes to Jailbreak LLMs with Higher Success Rates in Fewer Attempts
par: Kumar, Vishal, et autres
Publié: (2024)
par: Kumar, Vishal, et autres
Publié: (2024)
When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models
par: Park, Jungwon, et autres
Publié: (2026)
par: Park, Jungwon, et autres
Publié: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
par: Deng, Wenlong, et autres
Publié: (2026)
par: Deng, Wenlong, et autres
Publié: (2026)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
par: Ma, Zhengzhao, et autres
Publié: (2026)
par: Ma, Zhengzhao, et autres
Publié: (2026)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
par: Pathmanathan, Pankayaraj, et autres
Publié: (2025)
par: Pathmanathan, Pankayaraj, et autres
Publié: (2025)
Enhancing Reinforcement Learning with Label-Sensitive Reward for Natural Language Understanding
par: Liao, Kuo, et autres
Publié: (2024)
par: Liao, Kuo, et autres
Publié: (2024)
Semantic Stealth: Adversarial Text Attacks on NLP Using Several Methods
par: Dey, Roopkatha, et autres
Publié: (2024)
par: Dey, Roopkatha, et autres
Publié: (2024)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
par: Yu, Zhang Ze, et autres
Publié: (2023)
par: Yu, Zhang Ze, et autres
Publié: (2023)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
par: Hong, Haitao, et autres
Publié: (2025)
par: Hong, Haitao, et autres
Publié: (2025)
ROSA-Tuning: Enhancing Long-Context Modeling via Suffix Matching
par: Zheng, Yunao, et autres
Publié: (2026)
par: Zheng, Yunao, et autres
Publié: (2026)
Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
par: Tang, Haochun, et autres
Publié: (2026)
par: Tang, Haochun, et autres
Publié: (2026)
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
par: Zhang, Feng, et autres
Publié: (2026)
par: Zhang, Feng, et autres
Publié: (2026)
The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration
par: Ghosh, Sudipta, et autres
Publié: (2026)
par: Ghosh, Sudipta, et autres
Publié: (2026)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
par: Hu, Ziyou, et autres
Publié: (2025)
par: Hu, Ziyou, et autres
Publié: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
par: Wang, Zizhao, et autres
Publié: (2025)
par: Wang, Zizhao, et autres
Publié: (2025)
Documents similaires
-
Universal Adversarial Suffixes Using Calibrated Gumbel-Softmax Relaxation
par: Soor, Sampriti, et autres
Publié: (2025) -
A Generative Adversarial Approach to Adversarial Attacks Guided by Contrastive Language-Image Pre-trained Model
par: Soor, Sampriti, et autres
Publié: (2025) -
C-LEAD: Contrastive Learning for Enhanced Adversarial Defense
par: Ghosh, Suklav, et autres
Publié: (2025) -
DGSSM: Diffusion guided state-space models for multimodal salient object detection
par: Ghosh, Suklav, et autres
Publié: (2026) -
Trans-defense: Transformer-based Denoiser for Adversarial Defense with Spatial-Frequency Domain Representation
par: Pramanick, Alik, et autres
Publié: (2025)