BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Junxiao, Tu, Jinzhe, Liu, Haoran, Wang, Xiaoce, Zheng, Chujie, Zhang, Zhexin, Cui, Shiyao, Chen, Caishun, He, Tiantian, Wang, Hongning, Ong, Yew-Soon, Huang, Minlie |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
by: Yang, Junxiao, et al.
Published: (2025)
by: Yang, Junxiao, et al.
Published: (2025)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
by: Zhang, Zhexin, et al.
Published: (2024)
by: Zhang, Zhexin, et al.
Published: (2024)
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
by: Zhang, Zhexin, et al.
Published: (2025)
by: Zhang, Zhexin, et al.
Published: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
by: Zhang, Zhexin, et al.
Published: (2024)
by: Zhang, Zhexin, et al.
Published: (2024)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
by: Yang, Junxiao, et al.
Published: (2026)
by: Yang, Junxiao, et al.
Published: (2026)
SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions
by: Tu, Jinzhe, et al.
Published: (2026)
by: Tu, Jinzhe, et al.
Published: (2026)
Automated Large-scale CVRP Solver Design via LLM-assisted Flexible MCTS
by: Guo, Tong, et al.
Published: (2026)
by: Guo, Tong, et al.
Published: (2026)
When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity
by: Cui, Shiyao, et al.
Published: (2025)
by: Cui, Shiyao, et al.
Published: (2025)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
by: Zhang, Zhexin, et al.
Published: (2023)
by: Zhang, Zhexin, et al.
Published: (2023)
Where to Move Next: Zero-shot Generalization of LLMs for Next POI Recommendation
by: Feng, Shanshan, et al.
Published: (2024)
by: Feng, Shanshan, et al.
Published: (2024)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
by: Cui, Shiyao, et al.
Published: (2025)
by: Cui, Shiyao, et al.
Published: (2025)
How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
by: Zhang, Zhexin, et al.
Published: (2025)
by: Zhang, Zhexin, et al.
Published: (2025)
Precise-Physics Driven Text-to-3D Generation
by: Xu, Qingshan, et al.
Published: (2024)
by: Xu, Qingshan, et al.
Published: (2024)
Language Model Evolutionary Algorithms for Recommender Systems: Benchmarks and Algorithm Comparisons
by: Liu, Jiao, et al.
Published: (2024)
by: Liu, Jiao, et al.
Published: (2024)
Large Language Models as Evolutionary Optimizers
by: Liu, Shengcai, et al.
Published: (2023)
by: Liu, Shengcai, et al.
Published: (2023)
The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment
by: Zhang, Zhexin, et al.
Published: (2026)
by: Zhang, Zhexin, et al.
Published: (2026)
Jack and Masters of all Trades: One-Pass Learning Sets of Model Sets From Large Pre-Trained Models
by: Choong, Han Xiang, et al.
Published: (2022)
by: Choong, Han Xiang, et al.
Published: (2022)
Prompt Evolution for Generative AI: A Classifier-Guided Approach
by: Wong, Melvin, et al.
Published: (2023)
by: Wong, Melvin, et al.
Published: (2023)
LongSafety: Evaluating Long-Context Safety of Large Language Models
by: Lu, Yida, et al.
Published: (2025)
by: Lu, Yida, et al.
Published: (2025)
ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
by: Wang, Xiaoce, et al.
Published: (2026)
by: Wang, Xiaoce, et al.
Published: (2026)
Co-Learning Bayesian Optimization
by: Guo, Zhendong, et al.
Published: (2025)
by: Guo, Zhendong, et al.
Published: (2025)
Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
by: Wang, Fangjinhua, et al.
Published: (2025)
by: Wang, Fangjinhua, et al.
Published: (2025)
Pushing Rendering Boundaries: Hard Gaussian Splatting
by: Xu, Qingshan, et al.
Published: (2024)
by: Xu, Qingshan, et al.
Published: (2024)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
by: Zhao, Heng, et al.
Published: (2026)
by: Zhao, Heng, et al.
Published: (2026)
JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering
by: Chen, Renmiao, et al.
Published: (2025)
by: Chen, Renmiao, et al.
Published: (2025)
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
by: Zhang, Zhexin, et al.
Published: (2025)
by: Zhang, Zhexin, et al.
Published: (2025)
Hybrid Memetic Search for Electric Vehicle Routing with Time Windows, Simultaneous Pickup-Delivery, and Partial Recharges
by: Zheng, Zubin, et al.
Published: (2024)
by: Zheng, Zubin, et al.
Published: (2024)
Enhancing Adversarial Robustness via Uncertainty-Aware Distributional Adversarial Training
by: Dong, Junhao, et al.
Published: (2024)
by: Dong, Junhao, et al.
Published: (2024)
LLM Agents Make Collective Belief Dynamics Programmable: Challenges and Research Directions
by: He, Xin, et al.
Published: (2026)
by: He, Xin, et al.
Published: (2026)
GRASP: Gradient Realignment via Active Shared Perception for Multi-Agent Collaborative Optimization
by: Zhou, Sihan, et al.
Published: (2026)
by: Zhou, Sihan, et al.
Published: (2026)
Context-Adaptive Graph Neural Networks for Next POI Recommendation
by: Lei, Yu, et al.
Published: (2025)
by: Lei, Yu, et al.
Published: (2025)
Uncertain Multi-Objective Recommendation via Orthogonal Meta-Learning Enhanced Bayesian Optimization
by: Wang, Hongxu, et al.
Published: (2025)
by: Wang, Hongxu, et al.
Published: (2025)
Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning
by: Wen, Jiaxin, et al.
Published: (2024)
by: Wen, Jiaxin, et al.
Published: (2024)
Model Extrapolation Expedites Alignment
by: Zheng, Chujie, et al.
Published: (2024)
by: Zheng, Chujie, et al.
Published: (2024)
EvoSpeak: Large Language Models for Interpretable Genetic Programming-Evolved Heuristics
by: Xu, Meng, et al.
Published: (2025)
by: Xu, Meng, et al.
Published: (2025)
Bayesian Inverse Transfer in Evolutionary Multiobjective Optimization
by: Liu, Jiao, et al.
Published: (2023)
by: Liu, Jiao, et al.
Published: (2023)
Finding Sets of Pareto Sets in Real-World Scenarios -- A Multitask Multiobjective Perspective
by: Liu, Jiao, et al.
Published: (2026)
by: Liu, Jiao, et al.
Published: (2026)
Multi-Task Learning with Multi-Task Optimization
by: Bai, Lu, et al.
Published: (2024)
by: Bai, Lu, et al.
Published: (2024)
Free-Rider and Conflict Aware Collaboration Formation for Cross-Silo Federated Learning
by: Chen, Mengmeng, et al.
Published: (2024)
by: Chen, Mengmeng, et al.
Published: (2024)
Language Model Decoding as Direct Metrics Optimization
by: Ji, Haozhe, et al.
Published: (2023)
by: Ji, Haozhe, et al.
Published: (2023)
Similar Items
-
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
by: Yang, Junxiao, et al.
Published: (2025) -
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
by: Zhang, Zhexin, et al.
Published: (2024) -
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
by: Zhang, Zhexin, et al.
Published: (2025) -
Agent-SafetyBench: Evaluating the Safety of LLM Agents
by: Zhang, Zhexin, et al.
Published: (2024) -
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
by: Yang, Junxiao, et al.
Published: (2026)