RRTL: Red Teaming Reasoning Large Language Models in Tool Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yifei, Cui, Yu, Zhang, Haibin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Red Teaming Large Language Models for Healthcare
di: Balazadeh, Vahid, et al.
Pubblicazione: (2025)
di: Balazadeh, Vahid, et al.
Pubblicazione: (2025)
Resource Consumption Red-Teaming for Large Vision-Language Models
di: Gao, Haoran, et al.
Pubblicazione: (2025)
di: Gao, Haoran, et al.
Pubblicazione: (2025)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
di: Dang, Quy-Anh, et al.
Pubblicazione: (2026)
di: Dang, Quy-Anh, et al.
Pubblicazione: (2026)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
di: Ding, Jiale, et al.
Pubblicazione: (2025)
di: Ding, Jiale, et al.
Pubblicazione: (2025)
Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
di: Mao, Yanxu, et al.
Pubblicazione: (2026)
di: Mao, Yanxu, et al.
Pubblicazione: (2026)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
di: Wei, Zhang, et al.
Pubblicazione: (2025)
di: Wei, Zhang, et al.
Pubblicazione: (2025)
Red Teaming Visual Language Models
di: Li, Mukai, et al.
Pubblicazione: (2024)
di: Li, Mukai, et al.
Pubblicazione: (2024)
Red-Teaming for Inducing Societal Bias in Large Language Models
di: Luo, Chu Fei, et al.
Pubblicazione: (2024)
di: Luo, Chu Fei, et al.
Pubblicazione: (2024)
Gradient-Based Language Model Red Teaming
di: Wichers, Nevan, et al.
Pubblicazione: (2024)
di: Wichers, Nevan, et al.
Pubblicazione: (2024)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models
di: Wang, Zilong, et al.
Pubblicazione: (2025)
di: Wang, Zilong, et al.
Pubblicazione: (2025)
TOOLCAD: Exploring Tool-Using Large Language Models in Text-to-CAD Generation with Reinforcement Learning
di: Gong, Yifei, et al.
Pubblicazione: (2026)
di: Gong, Yifei, et al.
Pubblicazione: (2026)
TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data Synthesis
di: Wu, Xiaorui, et al.
Pubblicazione: (2025)
di: Wu, Xiaorui, et al.
Pubblicazione: (2025)
Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning
di: Cheng, Qianjia, et al.
Pubblicazione: (2026)
di: Cheng, Qianjia, et al.
Pubblicazione: (2026)
TroubleLLM: Align to Red Team Expert
di: Xu, Zhuoer, et al.
Pubblicazione: (2024)
di: Xu, Zhuoer, et al.
Pubblicazione: (2024)
Enhancing Tool Learning in Large Language Models with Hierarchical Error Checklists
di: Cui, Yue, et al.
Pubblicazione: (2025)
di: Cui, Yue, et al.
Pubblicazione: (2025)
Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models
di: Purpura, Alberto, et al.
Pubblicazione: (2025)
di: Purpura, Alberto, et al.
Pubblicazione: (2025)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
di: Shamsi, Zafir, et al.
Pubblicazione: (2026)
di: Shamsi, Zafir, et al.
Pubblicazione: (2026)
Red Teaming Language Models for Processing Contradictory Dialogues
di: Wen, Xiaofei, et al.
Pubblicazione: (2024)
di: Wen, Xiaofei, et al.
Pubblicazione: (2024)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
CREATOR: Tool Creation for Disentangling Abstract and Concrete Reasoning of Large Language Models
di: Qian, Cheng, et al.
Pubblicazione: (2023)
di: Qian, Cheng, et al.
Pubblicazione: (2023)
Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)
di: Verma, Apurv, et al.
Pubblicazione: (2024)
di: Verma, Apurv, et al.
Pubblicazione: (2024)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
di: Fan, Zhiting, et al.
Pubblicazione: (2025)
di: Fan, Zhiting, et al.
Pubblicazione: (2025)
Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
di: Li, Chenghao, et al.
Pubblicazione: (2025)
di: Li, Chenghao, et al.
Pubblicazione: (2025)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
di: Guo, Zhicheng, et al.
Pubblicazione: (2024)
di: Guo, Zhicheng, et al.
Pubblicazione: (2024)
Chain-of-Knowledge: Integrating Knowledge Reasoning into Large Language Models by Learning from Knowledge Graphs
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
MUR: Momentum Uncertainty guided Reasoning for Large Language Models
di: Yan, Hang, et al.
Pubblicazione: (2025)
di: Yan, Hang, et al.
Pubblicazione: (2025)
MATHSENSEI: A Tool-Augmented Large Language Model for Mathematical Reasoning
di: Das, Debrup, et al.
Pubblicazione: (2024)
di: Das, Debrup, et al.
Pubblicazione: (2024)
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
di: Xu, Qiancheng, et al.
Pubblicazione: (2026)
di: Xu, Qiancheng, et al.
Pubblicazione: (2026)
Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models
di: Van Doren, Madison, et al.
Pubblicazione: (2025)
di: Van Doren, Madison, et al.
Pubblicazione: (2025)
Red Teaming for Large Language Models At Scale: Tackling Hallucinations on Mathematics Tasks
di: Buszydlik, Aleksander, et al.
Pubblicazione: (2023)
di: Buszydlik, Aleksander, et al.
Pubblicazione: (2023)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
di: Yan, Siyu, et al.
Pubblicazione: (2025)
di: Yan, Siyu, et al.
Pubblicazione: (2025)
EmoLLM: Appraisal-Grounded Cognitive-Emotional Co-Reasoning in Large Language Models
di: Zhang, Yifei, et al.
Pubblicazione: (2026)
di: Zhang, Yifei, et al.
Pubblicazione: (2026)
Learning Evolving Tools for Large Language Models
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning
di: Zhang, Shaokun, et al.
Pubblicazione: (2025)
di: Zhang, Shaokun, et al.
Pubblicazione: (2025)
STAR: SocioTechnical Approach to Red Teaming Language Models
di: Weidinger, Laura, et al.
Pubblicazione: (2024)
di: Weidinger, Laura, et al.
Pubblicazione: (2024)
NEAT: Neuron-Based Early Exit for Large Reasoning Models
di: Liu, Kang, et al.
Pubblicazione: (2026)
di: Liu, Kang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Red Teaming Large Language Models for Healthcare
di: Balazadeh, Vahid, et al.
Pubblicazione: (2025) -
Resource Consumption Red-Teaming for Large Vision-Language Models
di: Gao, Haoran, et al.
Pubblicazione: (2025) -
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
di: Dang, Quy-Anh, et al.
Pubblicazione: (2026) -
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
di: Ding, Jiale, et al.
Pubblicazione: (2025) -
Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
di: Mao, Yanxu, et al.
Pubblicazione: (2026)