Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Zhengyang, Zhang, Yi, Li, Chenxin, Lai, Xin, Lyu, Pengyuan, Guo, Yiduo, Wang, Weinong, Li, Junyi, Ding, Yang, Shen, Huawen, Fang, Zhengyao, Zhou, Xingran, Wu, Liang, Tang, Fei, Fan, Sunqi, Peng, Shangpin, Ruan, Zheng, Zhang, Anran, Wang, Benyou, Zhang, Chengquan, Hu, Han |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PhoneWorld: Scaling Phone-Use Agent Environments
by: Tang, Zhengyang, et al.
Published: (2026)
by: Tang, Zhengyang, et al.
Published: (2026)
Do Phone-Use Agents Respect Your Privacy?
by: Tang, Zhengyang, et al.
Published: (2026)
by: Tang, Zhengyang, et al.
Published: (2026)
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
by: Fang, Zhengyao, et al.
Published: (2026)
by: Fang, Zhengyao, et al.
Published: (2026)
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation
by: Li, Gengluo, et al.
Published: (2026)
by: Li, Gengluo, et al.
Published: (2026)
Recognition-Synergistic Scene Text Editing
by: Fang, Zhengyao, et al.
Published: (2025)
by: Fang, Zhengyao, et al.
Published: (2025)
WeCromCL: Weakly Supervised Cross-Modality Contrastive Learning for Transcription-only Supervised Text Spotting
by: Wu, Jingjing, et al.
Published: (2024)
by: Wu, Jingjing, et al.
Published: (2024)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
by: Peng, Shangpin, et al.
Published: (2025)
by: Peng, Shangpin, et al.
Published: (2025)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
by: Tang, Zhengyang, et al.
Published: (2024)
by: Tang, Zhengyang, et al.
Published: (2024)
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
by: Li, Gengluo, et al.
Published: (2026)
by: Li, Gengluo, et al.
Published: (2026)
Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe
by: Hou, Wenjin, et al.
Published: (2026)
by: Hou, Wenjin, et al.
Published: (2026)
Enhancing RAG with Active Learning on Conversation Records: Reject Incapables and Answer Capables
by: Geng, Xuzhao, et al.
Published: (2025)
by: Geng, Xuzhao, et al.
Published: (2025)
Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding
by: Qiu, Huming, et al.
Published: (2024)
by: Qiu, Huming, et al.
Published: (2024)
Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
by: Bi, Jiaxi, et al.
Published: (2026)
by: Bi, Jiaxi, et al.
Published: (2026)
Towards Unified Multi-granularity Text Detection with Interactive Attention
by: Wan, Xingyu, et al.
Published: (2024)
by: Wan, Xingyu, et al.
Published: (2024)
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
by: Li, Chenxin, et al.
Published: (2026)
by: Li, Chenxin, et al.
Published: (2026)
HunyuanOCR Technical Report
by: Hunyuan Vision Team, et al.
Published: (2025)
by: Hunyuan Vision Team, et al.
Published: (2025)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
by: Chen, Jiahua, et al.
Published: (2026)
by: Chen, Jiahua, et al.
Published: (2026)
Rethinking The Uniformity Metric in Self-Supervised Learning
by: Fang, Xianghong, et al.
Published: (2024)
by: Fang, Xianghong, et al.
Published: (2024)
Optimization Techniques for Unsupervised Complex Table Reasoning via Self-Training Framework
by: Li, Zhenyu, et al.
Published: (2022)
by: Li, Zhenyu, et al.
Published: (2022)
Know Thyself? On the Incapability and Implications of AI Self-Recognition
by: Bai, Xiaoyan, et al.
Published: (2025)
by: Bai, Xiaoyan, et al.
Published: (2025)
Quantum Dueling: an Efficient Solution for Combinatorial Optimization
by: Tang, Letian, et al.
Published: (2023)
by: Tang, Letian, et al.
Published: (2023)
Adaptive Window Selection for Financial Risk Forecasting
by: Li, Yinhuan, et al.
Published: (2026)
by: Li, Yinhuan, et al.
Published: (2026)
Learning from Peers in Reasoning Models
by: Luo, Tongxu, et al.
Published: (2025)
by: Luo, Tongxu, et al.
Published: (2025)
Science is Subjective: Humans Are Incapable of Knowing or Discovering Absolute Truth
by: Aguilera Katayama, Kaoru
Published: (2026)
by: Aguilera Katayama, Kaoru
Published: (2026)
EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models
by: Zhou, Li, et al.
Published: (2025)
by: Zhou, Li, et al.
Published: (2025)
Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models
by: Guo, Qiming, et al.
Published: (2025)
by: Guo, Qiming, et al.
Published: (2025)
Rethinking Transformer-Based Blind-Spot Network for Self-Supervised Image Denoising
by: Li, Junyi, et al.
Published: (2024)
by: Li, Junyi, et al.
Published: (2024)
SedarEval: Automated Evaluation using Self-Adaptive Rubrics
by: Fan, Zhiyuan, et al.
Published: (2025)
by: Fan, Zhiyuan, et al.
Published: (2025)
StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond
by: Lyu, Pengyuan, et al.
Published: (2024)
by: Lyu, Pengyuan, et al.
Published: (2024)
CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents
by: Tang, Yihong, et al.
Published: (2026)
by: Tang, Yihong, et al.
Published: (2026)
InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees
by: Huang, Chenyu, et al.
Published: (2026)
by: Huang, Chenyu, et al.
Published: (2026)
Controlling your Attributes in Voice
by: Li, Xuyuan, et al.
Published: (2025)
by: Li, Xuyuan, et al.
Published: (2025)
ProbRes: Volatility Learning for Probabilistic Time-Series Forecasting
by: Wang, Tingting, et al.
Published: (2026)
by: Wang, Tingting, et al.
Published: (2026)
Characteristic and Prognostic Value of Serum Bone Turnover Markers in Pregnant Women With Pre‐Eclampsia: A Prospective Cohort Study
by: Fan Yu, et al.
Published: (2024)
by: Fan Yu, et al.
Published: (2024)
ORLM: A Customizable Framework in Training Large Models for Automated Optimization Modeling
by: Huang, Chenyu, et al.
Published: (2024)
by: Huang, Chenyu, et al.
Published: (2024)
SafeMo: Linguistically Grounded Unlearning for Trustworthy Text-to-Motion Generation
by: Wang, Yiling, et al.
Published: (2026)
by: Wang, Yiling, et al.
Published: (2026)
Mitigating Object Hallucinations via Sentence-Level Early Intervention
by: Peng, Shangpin, et al.
Published: (2025)
by: Peng, Shangpin, et al.
Published: (2025)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
by: Zhang, Yan, et al.
Published: (2025)
by: Zhang, Yan, et al.
Published: (2025)
BWArea Model: Learning World Model, Inverse Dynamics, and Policy for Controllable Language Generation
by: Jia, Chengxing, et al.
Published: (2024)
by: Jia, Chengxing, et al.
Published: (2024)
Mean-Field Games with Constraints
by: Hu, Anran, et al.
Published: (2025)
by: Hu, Anran, et al.
Published: (2025)
Similar Items
-
PhoneWorld: Scaling Phone-Use Agent Environments
by: Tang, Zhengyang, et al.
Published: (2026) -
Do Phone-Use Agents Respect Your Privacy?
by: Tang, Zhengyang, et al.
Published: (2026) -
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
by: Fang, Zhengyao, et al.
Published: (2026) -
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation
by: Li, Gengluo, et al.
Published: (2026) -
Recognition-Synergistic Scene Text Editing
by: Fang, Zhengyao, et al.
Published: (2025)