RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Xiang, Ma, Xingjun, Lee, Wei-Bin, Wang, Cong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
di: Ding, Jiale, et al.
Pubblicazione: (2025)
di: Ding, Jiale, et al.
Pubblicazione: (2025)
Toward Evaluating Robustness of Reinforcement Learning with Adversarial Policy
di: Zheng, Xiang, et al.
Pubblicazione: (2023)
di: Zheng, Xiang, et al.
Pubblicazione: (2023)
SafeProtein: Red-Teaming Framework and Benchmark for Protein Foundation Models
di: Fan, Jigang, et al.
Pubblicazione: (2025)
di: Fan, Jigang, et al.
Pubblicazione: (2025)
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
di: Huang, Dongchi, et al.
Pubblicazione: (2025)
di: Huang, Dongchi, et al.
Pubblicazione: (2025)
Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models
di: Pan, Xuchen, et al.
Pubblicazione: (2025)
di: Pan, Xuchen, et al.
Pubblicazione: (2025)
PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
di: Yin, Chenlong, et al.
Pubblicazione: (2026)
di: Yin, Chenlong, et al.
Pubblicazione: (2026)
Red-Team Multi-Agent Reinforcement Learning for Emergency Braking Scenario
di: Chen, Yinsong, et al.
Pubblicazione: (2025)
di: Chen, Yinsong, et al.
Pubblicazione: (2025)
Automatic LLM Red Teaming
di: Belaire, Roman, et al.
Pubblicazione: (2025)
di: Belaire, Roman, et al.
Pubblicazione: (2025)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
di: Zhao, Yunhan, et al.
Pubblicazione: (2024)
di: Zhao, Yunhan, et al.
Pubblicazione: (2024)
Geometric Red-Teaming for Robotic Manipulation
di: Goel, Divyam, et al.
Pubblicazione: (2025)
di: Goel, Divyam, et al.
Pubblicazione: (2025)
Leveraging Reinforcement Learning in Red Teaming for Advanced Ransomware Attack Simulations
di: Wang, Cheng, et al.
Pubblicazione: (2024)
di: Wang, Cheng, et al.
Pubblicazione: (2024)
Abstractive Red-Teaming of Language Model Character
di: Rahn, Nate, et al.
Pubblicazione: (2026)
di: Rahn, Nate, et al.
Pubblicazione: (2026)
AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
Embodied Red Teaming for Auditing Robotic Foundation Models
di: Karnik, Sathwik, et al.
Pubblicazione: (2024)
di: Karnik, Sathwik, et al.
Pubblicazione: (2024)
Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
di: Guo, Ruohao, et al.
Pubblicazione: (2025)
di: Guo, Ruohao, et al.
Pubblicazione: (2025)
From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming
di: Sinha, Anusha, et al.
Pubblicazione: (2025)
di: Sinha, Anusha, et al.
Pubblicazione: (2025)
Capability-Based Scaling Trends for LLM-Based Red-Teaming
di: Panfilov, Alexander, et al.
Pubblicazione: (2025)
di: Panfilov, Alexander, et al.
Pubblicazione: (2025)
Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers
di: Kezins, Nikita, et al.
Pubblicazione: (2026)
di: Kezins, Nikita, et al.
Pubblicazione: (2026)
Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning
di: Zheng, Han, et al.
Pubblicazione: (2026)
di: Zheng, Han, et al.
Pubblicazione: (2026)
Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents
di: He, Pengfei, et al.
Pubblicazione: (2026)
di: He, Pengfei, et al.
Pubblicazione: (2026)
Red-Teaming Segment Anything Model
di: Jankowski, Krzysztof, et al.
Pubblicazione: (2024)
di: Jankowski, Krzysztof, et al.
Pubblicazione: (2024)
Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning
di: Beutel, Alex, et al.
Pubblicazione: (2024)
di: Beutel, Alex, et al.
Pubblicazione: (2024)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System
di: Liang, Jiacheng, et al.
Pubblicazione: (2026)
di: Liang, Jiacheng, et al.
Pubblicazione: (2026)
Pokemon Red via Reinforcement Learning
di: Pleines, Marco, et al.
Pubblicazione: (2025)
di: Pleines, Marco, et al.
Pubblicazione: (2025)
Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs
di: Wang, Jingyao, et al.
Pubblicazione: (2025)
di: Wang, Jingyao, et al.
Pubblicazione: (2025)
Red Teaming with Artificial Intelligence-Driven Cyberattacks: A Scoping Review
di: Al-Azzawi, Mays, et al.
Pubblicazione: (2025)
di: Al-Azzawi, Mays, et al.
Pubblicazione: (2025)
Automated Red Teaming with GOAT: the Generative Offensive Agent Tester
di: Pavlova, Maya, et al.
Pubblicazione: (2024)
di: Pavlova, Maya, et al.
Pubblicazione: (2024)
Red-Teaming for Inducing Societal Bias in Large Language Models
di: Luo, Chu Fei, et al.
Pubblicazione: (2024)
di: Luo, Chu Fei, et al.
Pubblicazione: (2024)
ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming
di: Tedeschi, Simone, et al.
Pubblicazione: (2024)
di: Tedeschi, Simone, et al.
Pubblicazione: (2024)
PokeRL: Reinforcement Learning for Pokemon Red
di: Mudireddy, Dheeraj, et al.
Pubblicazione: (2026)
di: Mudireddy, Dheeraj, et al.
Pubblicazione: (2026)
ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning
di: Tan, Xiaofeng, et al.
Pubblicazione: (2026)
di: Tan, Xiaofeng, et al.
Pubblicazione: (2026)
OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents
di: Li, Xinyu, et al.
Pubblicazione: (2026)
di: Li, Xinyu, et al.
Pubblicazione: (2026)
Visual-RFT: Visual Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
LLM-Assisted Red Teaming of Diffusion Models through "Failures Are Fated, But Can Be Faded"
di: Sagar, Som, et al.
Pubblicazione: (2024)
di: Sagar, Som, et al.
Pubblicazione: (2024)
CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies
di: Chen, Keyu, et al.
Pubblicazione: (2026)
di: Chen, Keyu, et al.
Pubblicazione: (2026)
Adaptive Instruction Composition for Automated LLM Red-Teaming
di: Zymet, Jesse, et al.
Pubblicazione: (2026)
di: Zymet, Jesse, et al.
Pubblicazione: (2026)
TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration
di: Li, Chunxiao, et al.
Pubblicazione: (2026)
di: Li, Chunxiao, et al.
Pubblicazione: (2026)
Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
di: Ding, Jiale, et al.
Pubblicazione: (2025) -
Toward Evaluating Robustness of Reinforcement Learning with Adversarial Policy
di: Zheng, Xiang, et al.
Pubblicazione: (2023) -
SafeProtein: Red-Teaming Framework and Benchmark for Protein Foundation Models
di: Fan, Jigang, et al.
Pubblicazione: (2025) -
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
di: Huang, Dongchi, et al.
Pubblicazione: (2025) -
Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models
di: Pan, Xuchen, et al.
Pubblicazione: (2025)