Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yanbo, Xu, Zixiang, Huang, Yue, Gao, Chujie, Wu, Siyuan, Ye, Jiayi, Chen, Pin-Yu, Chen, Xiuying, Zhang, Xiangliang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models
by: Xu, Zixiang, et al.
Published: (2025)
by: Xu, Zixiang, et al.
Published: (2025)
Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs
by: Huang, Yue, et al.
Published: (2026)
by: Huang, Yue, et al.
Published: (2026)
ProbeLLM: Automating Principled Diagnosis of LLM Failures
by: Huang, Yue, et al.
Published: (2026)
by: Huang, Yue, et al.
Published: (2026)
HonestLLM: Toward an Honest and Helpful Large Language Model
by: Gao, Chujie, et al.
Published: (2024)
by: Gao, Chujie, et al.
Published: (2024)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
by: Ye, Jiayi, et al.
Published: (2024)
by: Ye, Jiayi, et al.
Published: (2024)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
by: Bao, Han, et al.
Published: (2024)
by: Bao, Han, et al.
Published: (2024)
DyFlow: Dynamic Workflow Framework for Agentic Reasoning
by: Wang, Yanbo, et al.
Published: (2025)
by: Wang, Yanbo, et al.
Published: (2025)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
by: Xu, Zixiang, et al.
Published: (2025)
by: Xu, Zixiang, et al.
Published: (2025)
Under the Shadow of Babel: How Language Shapes Reasoning in LLMs
by: Wang, Chenxi, et al.
Published: (2025)
by: Wang, Chenxi, et al.
Published: (2025)
My Favorite Streamer is an LLM: Discovering, Bonding, and Co-Creating in AI VTuber Fandom
by: Ye, Jiayi, et al.
Published: (2025)
by: Ye, Jiayi, et al.
Published: (2025)
Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles
by: Huang, Yue, et al.
Published: (2025)
by: Huang, Yue, et al.
Published: (2025)
DataGen: Unified Synthetic Dataset Generation via Large Language Models
by: Huang, Yue, et al.
Published: (2024)
by: Huang, Yue, et al.
Published: (2024)
Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models
by: Gao, Lang, et al.
Published: (2024)
by: Gao, Lang, et al.
Published: (2024)
Invisible Entropy: Towards Safe and Efficient Low-Entropy LLM Watermarking
by: Gu, Tianle, et al.
Published: (2025)
by: Gu, Tianle, et al.
Published: (2025)
Evaluate Bias without Manual Test Sets: A Concept Representation Perspective for LLMs
by: Gao, Lang, et al.
Published: (2025)
by: Gao, Lang, et al.
Published: (2025)
Write Summary Step-by-Step: A Pilot Study of Stepwise Summarization
by: Chen, Xiuying, et al.
Published: (2024)
by: Chen, Xiuying, et al.
Published: (2024)
Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression
by: Zeng, Lingjie, et al.
Published: (2026)
by: Zeng, Lingjie, et al.
Published: (2026)
An Adaptive Balance Search Based Complementary Heterogeneous Particle Swarm Optimization Architecture
by: Zhang, Zhenxing, et al.
Published: (2024)
by: Zhang, Zhenxing, et al.
Published: (2024)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
by: Wang, Xiangqi, et al.
Published: (2025)
by: Wang, Xiangqi, et al.
Published: (2025)
Adaptive Probe-based Steering for Robust LLM Jailbreaking
by: Chen, Junxi, et al.
Published: (2026)
by: Chen, Junxi, et al.
Published: (2026)
SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
by: Huang, Yue, et al.
Published: (2025)
by: Huang, Yue, et al.
Published: (2025)
Evaluating and Mitigating Bias in AI-Based Medical Text Generation
by: Chen, Xiuying, et al.
Published: (2025)
by: Chen, Xiuying, et al.
Published: (2025)
SenWave: A Fine-Grained Multi-Language Sentiment Analysis Dataset Sourced from COVID-19 Tweets
by: Yang, Qiang, et al.
Published: (2025)
by: Yang, Qiang, et al.
Published: (2025)
DSDFormer: An Innovative Transformer-Mamba Framework for Robust High-Precision Driver Distraction Identification
by: Chen, Junzhou, et al.
Published: (2024)
by: Chen, Junzhou, et al.
Published: (2024)
The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
by: Wei, Rongzhe, et al.
Published: (2025)
by: Wei, Rongzhe, et al.
Published: (2025)
Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization
by: Du, Linfeng, et al.
Published: (2026)
by: Du, Linfeng, et al.
Published: (2026)
No More Distractions: an Adaptive Up-Sampling Algorithm to Reduce Data Artifacts
by: Chen, Han
Published: (2024)
by: Chen, Han
Published: (2024)
An AI Agent for Fully Automated Multi‐Omic Analyses
by: Juexiao Zhou, et al.
Published: (2024)
by: Juexiao Zhou, et al.
Published: (2024)
Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning
by: Zhang, Chi, et al.
Published: (2026)
by: Zhang, Chi, et al.
Published: (2026)
Advanced Framework for Animal Sound Classification With Features Optimization
by: Yang, Qiang, et al.
Published: (2024)
by: Yang, Qiang, et al.
Published: (2024)
Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference
by: Dong, Wenxin, et al.
Published: (2026)
by: Dong, Wenxin, et al.
Published: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
by: Song, Zirui, et al.
Published: (2025)
by: Song, Zirui, et al.
Published: (2025)
Probing a left-right symmetric model from a displaced shower at the CMS muon system
by: Liu, Wei, et al.
Published: (2025)
by: Liu, Wei, et al.
Published: (2025)
Unify Graph Learning with Text: Unleashing LLM Potentials for Session Search
by: Wu, Songhao, et al.
Published: (2025)
by: Wu, Songhao, et al.
Published: (2025)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
by: Dong, Jianshuo, et al.
Published: (2025)
by: Dong, Jianshuo, et al.
Published: (2025)
Flexible and Adaptable Summarization via Expertise Separation
by: Chen, Xiuying, et al.
Published: (2024)
by: Chen, Xiuying, et al.
Published: (2024)
Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark
by: Chen, Xiuying, et al.
Published: (2024)
by: Chen, Xiuying, et al.
Published: (2024)
Adaptively Robust LLM Inference Optimization under Prediction Uncertainty
by: Chen, Zixi, et al.
Published: (2025)
by: Chen, Zixi, et al.
Published: (2025)
The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF
by: Su, Zeli, et al.
Published: (2026)
by: Su, Zeli, et al.
Published: (2026)
QUIDS: Query Intent Description for Exploratory Search via Dual Space Modeling
by: Wang, Yumeng, et al.
Published: (2024)
by: Wang, Yumeng, et al.
Published: (2024)
Similar Items
-
Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models
by: Xu, Zixiang, et al.
Published: (2025) -
Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs
by: Huang, Yue, et al.
Published: (2026) -
ProbeLLM: Automating Principled Diagnosis of LLM Failures
by: Huang, Yue, et al.
Published: (2026) -
HonestLLM: Toward an Honest and Helpful Large Language Model
by: Gao, Chujie, et al.
Published: (2024) -
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
by: Ye, Jiayi, et al.
Published: (2024)