Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling
Fuente:
arXiv
Salvato in:
| Autori principali: | Hajra, Suvadeep, Nandi, Palash, Chakraborty, Tanmoy |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models
di: Nandi, Palash, et al.
Pubblicazione: (2025)
di: Nandi, Palash, et al.
Pubblicazione: (2025)
SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection
di: Joshi, Maithili, et al.
Pubblicazione: (2025)
di: Joshi, Maithili, et al.
Pubblicazione: (2025)
SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes
di: Nandi, Palash, et al.
Pubblicazione: (2024)
di: Nandi, Palash, et al.
Pubblicazione: (2024)
Recent Advances in Hate Speech Moderation: Multimodality and the Role of Large Models
di: Hee, Ming Shan, et al.
Pubblicazione: (2024)
di: Hee, Ming Shan, et al.
Pubblicazione: (2024)
First Finish Search: Efficient Test-Time Scaling in Large Language Models
di: Agarwal, Aradhye, et al.
Pubblicazione: (2025)
di: Agarwal, Aradhye, et al.
Pubblicazione: (2025)
Markovian ODE-guided scoring can assess the quality of offline reasoning traces in language models
di: Nandi, Arghodeep, et al.
Pubblicazione: (2026)
di: Nandi, Arghodeep, et al.
Pubblicazione: (2026)
Information Anxiety in Large Language Models
di: Bajpai, Prasoon, et al.
Pubblicazione: (2024)
di: Bajpai, Prasoon, et al.
Pubblicazione: (2024)
Compression Laws for Large Language Models
di: Sengupta, Ayan, et al.
Pubblicazione: (2025)
di: Sengupta, Ayan, et al.
Pubblicazione: (2025)
Short-Range Dependency Effects on Transformer Instability and a Decomposed Attention Solution
di: Hajra, Suvadeep
Pubblicazione: (2025)
di: Hajra, Suvadeep
Pubblicazione: (2025)
Step-by-Step Unmasking for Parameter-Efficient Fine-tuning of Large Language Models
di: Agarwal, Aradhye, et al.
Pubblicazione: (2024)
di: Agarwal, Aradhye, et al.
Pubblicazione: (2024)
The Art of Scaling Test-Time Compute for Large Language Models
di: Agarwal, Aradhye, et al.
Pubblicazione: (2025)
di: Agarwal, Aradhye, et al.
Pubblicazione: (2025)
Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models
di: Hengle, Amey, et al.
Pubblicazione: (2024)
di: Hengle, Amey, et al.
Pubblicazione: (2024)
Harmonizing Code-mixed Conversations: Personality-assisted Code-mixed Response Generation in Dialogues
di: Kumar, Shivani, et al.
Pubblicazione: (2024)
di: Kumar, Shivani, et al.
Pubblicazione: (2024)
Listening Between the Lines: Decoding Podcast Narratives with Language Modeling
di: Gupta, Shreya, et al.
Pubblicazione: (2025)
di: Gupta, Shreya, et al.
Pubblicazione: (2025)
Temporally Consistent Factuality Probing for Large Language Models
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
Knowledge Planning in Large Language Models for Domain-Aligned Counseling Summarization
di: Srivastava, Aseem, et al.
Pubblicazione: (2024)
di: Srivastava, Aseem, et al.
Pubblicazione: (2024)
FLAME: Self-Supervised Low-Resource Taxonomy Expansion using Large Language Models
di: Mishra, Sahil, et al.
Pubblicazione: (2024)
di: Mishra, Sahil, et al.
Pubblicazione: (2024)
MULTIVERSE: Exposing Large Language Model Alignment Problems in Diverse Worlds
di: Jin, Xiaolong, et al.
Pubblicazione: (2024)
di: Jin, Xiaolong, et al.
Pubblicazione: (2024)
Post-training Large Language Models for Diverse High-Quality Responses
di: Chen, Yilei, et al.
Pubblicazione: (2025)
di: Chen, Yilei, et al.
Pubblicazione: (2025)
From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers
di: Sengupta, Ayan, et al.
Pubblicazione: (2026)
di: Sengupta, Ayan, et al.
Pubblicazione: (2026)
Mechanistic Behavior Editing of Language Models
di: Singh, Joykirat, et al.
Pubblicazione: (2024)
di: Singh, Joykirat, et al.
Pubblicazione: (2024)
Decoding Memes: Benchmarking Narrative Role Classification across Multilingual and Multimodal Models
di: Sharma, Shivam, et al.
Pubblicazione: (2025)
di: Sharma, Shivam, et al.
Pubblicazione: (2025)
Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics
di: Ananthanarayanan, Samhruth, et al.
Pubblicazione: (2026)
di: Ananthanarayanan, Samhruth, et al.
Pubblicazione: (2026)
HIDE and Seek: Detecting Hallucinations in Language Models via Decoupled Representations
di: Chatterjee, Anwoy, et al.
Pubblicazione: (2025)
di: Chatterjee, Anwoy, et al.
Pubblicazione: (2025)
Counterspeech the ultimate shield! Multi-Conditioned Counterspeech Generation through Attributed Prefix Learning
di: Kumar, Aswini, et al.
Pubblicazione: (2025)
di: Kumar, Aswini, et al.
Pubblicazione: (2025)
coTherapist: A Behavior-Aligned Small Language Model to Support Mental Healthcare Experts
di: Adhikary, Prottay Kumar, et al.
Pubblicazione: (2026)
di: Adhikary, Prottay Kumar, et al.
Pubblicazione: (2026)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
$\texttt{LM}^\texttt{2}$: A Simple Society of Language Models Solves Complex Reasoning
di: Juneja, Gurusha, et al.
Pubblicazione: (2024)
di: Juneja, Gurusha, et al.
Pubblicazione: (2024)
Persona-aware Generative Model for Code-mixed Language
di: Sengupta, Ayan, et al.
Pubblicazione: (2023)
di: Sengupta, Ayan, et al.
Pubblicazione: (2023)
Language Models can Exploit Cross-Task In-context Learning for Data-Scarce Novel Tasks
di: Chatterjee, Anwoy, et al.
Pubblicazione: (2024)
di: Chatterjee, Anwoy, et al.
Pubblicazione: (2024)
Long-Tail Crisis in Nearest Neighbor Language Models
di: Nishida, Yuto, et al.
Pubblicazione: (2025)
di: Nishida, Yuto, et al.
Pubblicazione: (2025)
Multilingual Test-Time Scaling via Initial Thought Transfer
di: Bajpai, Prasoon, et al.
Pubblicazione: (2025)
di: Bajpai, Prasoon, et al.
Pubblicazione: (2025)
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
Long-Tail Knowledge in Large Language Models: Taxonomy, Mechanisms, Interventions and Implications
di: Badhe, Sanket, et al.
Pubblicazione: (2026)
di: Badhe, Sanket, et al.
Pubblicazione: (2026)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
POSIX: A Prompt Sensitivity Index For Large Language Models
di: Chatterjee, Anwoy, et al.
Pubblicazione: (2024)
di: Chatterjee, Anwoy, et al.
Pubblicazione: (2024)
Multilingual LLMs Inherently Reward In-Language Time-Sensitive Semantic Alignment for Low-Resource Languages
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
You Only Prune Once: Designing Calibration-Free Model Compression With Policy Learning
di: Sengupta, Ayan, et al.
Pubblicazione: (2025)
di: Sengupta, Ayan, et al.
Pubblicazione: (2025)
Latent Performance Profiling of Large Language Models
di: Chakraborty, Tanmoy, et al.
Pubblicazione: (2026)
di: Chakraborty, Tanmoy, et al.
Pubblicazione: (2026)
TrackList: Tracing Back Query Linguistic Diversity for Head and Tail Knowledge in Open Large Language Models
di: Buhnila, Ioana, et al.
Pubblicazione: (2025)
di: Buhnila, Ioana, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models
di: Nandi, Palash, et al.
Pubblicazione: (2025) -
SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection
di: Joshi, Maithili, et al.
Pubblicazione: (2025) -
SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes
di: Nandi, Palash, et al.
Pubblicazione: (2024) -
Recent Advances in Hate Speech Moderation: Multimodality and the Role of Large Models
di: Hee, Ming Shan, et al.
Pubblicazione: (2024) -
First Finish Search: Efficient Test-Time Scaling in Large Language Models
di: Agarwal, Aradhye, et al.
Pubblicazione: (2025)