Low-Resource Safety Failures Are Action Failures, Not Representation Failures
Fuente:
arXiv
Salvato in:
| Autori principali: | Aziz, Rashad, Hanif, Ikhlasul Akmal, Koto, Fajri |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages
di: Hanif, Ikhlasul Akmal, et al.
Pubblicazione: (2026)
di: Hanif, Ikhlasul Akmal, et al.
Pubblicazione: (2026)
Listen, Correct, and Feed Back: Spoken Pedagogical Feedback Generation
di: Liang, Junhong, et al.
Pubblicazione: (2026)
di: Liang, Junhong, et al.
Pubblicazione: (2026)
Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
Internal Representation, Not Clinical Knowledge: Where Apparent LLM Triage Failures Originate
di: Navarro, David Fraile, et al.
Pubblicazione: (2026)
di: Navarro, David Fraile, et al.
Pubblicazione: (2026)
LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and the Importance of Object-based Representations
di: Xu, Yudong, et al.
Pubblicazione: (2023)
di: Xu, Yudong, et al.
Pubblicazione: (2023)
Vision Language Models are Confused Tourists
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
Holistic Evaluation and Failure Diagnosis of AI Agents
di: Madvil, Netta, et al.
Pubblicazione: (2026)
di: Madvil, Netta, et al.
Pubblicazione: (2026)
Catastrophic Failure of LLM Unlearning via Quantization
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
Dissecting Failure Dynamics in Large Language Model Reasoning
di: Zhu, Wei, et al.
Pubblicazione: (2026)
di: Zhu, Wei, et al.
Pubblicazione: (2026)
On the Failure of Latent State Persistence in Large Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
Failure of contextual invariance in large language models
di: Kumar, Sagar, et al.
Pubblicazione: (2026)
di: Kumar, Sagar, et al.
Pubblicazione: (2026)
Large Language Model Reasoning Failures
di: Song, Peiyang, et al.
Pubblicazione: (2026)
di: Song, Peiyang, et al.
Pubblicazione: (2026)
Control Illusion: The Failure of Instruction Hierarchies in Large Language Models
di: Geng, Yilin, et al.
Pubblicazione: (2025)
di: Geng, Yilin, et al.
Pubblicazione: (2025)
Too Good to be Bad: On the Failure of LLMs to Role-Play Villains
di: Yi, Zihao, et al.
Pubblicazione: (2025)
di: Yi, Zihao, et al.
Pubblicazione: (2025)
From Documents to Database: Failure Modes for Industrial Assets
di: Kabakci-Zorlu, Duygu, et al.
Pubblicazione: (2025)
di: Kabakci-Zorlu, Duygu, et al.
Pubblicazione: (2025)
Cracking the Code: Multi-domain LLM Evaluation on Real-World Professional Exams in Indonesia
di: Koto, Fajri
Pubblicazione: (2024)
di: Koto, Fajri
Pubblicazione: (2024)
An Empirical Study on Failures in Automated Issue Solving
di: Liu, Simiao, et al.
Pubblicazione: (2025)
di: Liu, Simiao, et al.
Pubblicazione: (2025)
The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models
di: Kim, Dueun, et al.
Pubblicazione: (2026)
di: Kim, Dueun, et al.
Pubblicazione: (2026)
Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks
di: Tan, Rongyuan, et al.
Pubblicazione: (2026)
di: Tan, Rongyuan, et al.
Pubblicazione: (2026)
Medal Matters: Probing LLMs' Failure Cases Through Olympic Rankings
di: Choi, Juhwan, et al.
Pubblicazione: (2024)
di: Choi, Juhwan, et al.
Pubblicazione: (2024)
Format Inertia: A Failure Mechanism of LLMs in Medical Pre-Consultation
di: Lim, Seungseop, et al.
Pubblicazione: (2025)
di: Lim, Seungseop, et al.
Pubblicazione: (2025)
Simulating LLM-to-LLM Tutoring for Multilingual Math Feedback
di: Tonga, Junior Cedric, et al.
Pubblicazione: (2025)
di: Tonga, Junior Cedric, et al.
Pubblicazione: (2025)
University of Indonesia at SemEval-2025 Task 11: Evaluating State-of-the-Art Encoders for Multi-Label Emotion Detection
di: Hanif, Ikhlasul Akmal, et al.
Pubblicazione: (2025)
di: Hanif, Ikhlasul Akmal, et al.
Pubblicazione: (2025)
A Surprising Failure? Multimodal LLMs and the NLVR Challenge
di: Wu, Anne, et al.
Pubblicazione: (2024)
di: Wu, Anne, et al.
Pubblicazione: (2024)
Learning from Failures in Multi-Attempt Reinforcement Learning
di: Chung, Stephen, et al.
Pubblicazione: (2025)
di: Chung, Stephen, et al.
Pubblicazione: (2025)
ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models
di: Ashury-Tahan, Shir, et al.
Pubblicazione: (2026)
di: Ashury-Tahan, Shir, et al.
Pubblicazione: (2026)
Cross-Cultural Transfer of Commonsense Reasoning in LLMs: Evidence from the Arab World
di: Almheiri, Saeed, et al.
Pubblicazione: (2025)
di: Almheiri, Saeed, et al.
Pubblicazione: (2025)
When Informal Text Breaks NLI: Tokenization Failure, Distribution Shift, and Targeted Mitigations
di: Aluguvelly, Avinash Goutham
Pubblicazione: (2026)
di: Aluguvelly, Avinash Goutham
Pubblicazione: (2026)
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
di: Ren, Yanwei, et al.
Pubblicazione: (2026)
di: Ren, Yanwei, et al.
Pubblicazione: (2026)
The Slow Drift of Support: Boundary Failures in Multi-Turn Mental Health LLM Dialogues
di: Cheng, Youyou, et al.
Pubblicazione: (2026)
di: Cheng, Youyou, et al.
Pubblicazione: (2026)
Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models
di: Liu, Yi, et al.
Pubblicazione: (2025)
di: Liu, Yi, et al.
Pubblicazione: (2025)
Read Before You Think: Mitigating LLM Comprehension Failures with Step-by-Step Reading
di: Han, Feijiang, et al.
Pubblicazione: (2025)
di: Han, Feijiang, et al.
Pubblicazione: (2025)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
di: Fu, Yuqian, et al.
Pubblicazione: (2026)
di: Fu, Yuqian, et al.
Pubblicazione: (2026)
Knowledge Management for Automobile Failure Analysis Using Graph RAG
di: Ojima, Yuta, et al.
Pubblicazione: (2024)
di: Ojima, Yuta, et al.
Pubblicazione: (2024)
Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
di: Pal, Arka, et al.
Pubblicazione: (2024)
di: Pal, Arka, et al.
Pubblicazione: (2024)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026)
di: Su, Yanghao, et al.
Pubblicazione: (2026)
Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems
di: West, Alva, et al.
Pubblicazione: (2025)
di: West, Alva, et al.
Pubblicazione: (2025)
Can one size fit all?: Measuring Failure in Multi-Document Summarization Domain Transfer
di: DeLucia, Alexandra, et al.
Pubblicazione: (2025)
di: DeLucia, Alexandra, et al.
Pubblicazione: (2025)
Mitigating Coordinate Prediction Bias from Positional Encoding Failures
di: Tao, Xingjian, et al.
Pubblicazione: (2025)
di: Tao, Xingjian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages
di: Hanif, Ikhlasul Akmal, et al.
Pubblicazione: (2026) -
Listen, Correct, and Feed Back: Spoken Pedagogical Feedback Generation
di: Liang, Junhong, et al.
Pubblicazione: (2026) -
Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations
di: Banerjee, Somnath, et al.
Pubblicazione: (2025) -
Internal Representation, Not Clinical Knowledge: Where Apparent LLM Triage Failures Originate
di: Navarro, David Fraile, et al.
Pubblicazione: (2026) -
LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and the Importance of Object-based Representations
di: Xu, Yudong, et al.
Pubblicazione: (2023)