Interpreting the Repeated Token Phenomenon in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yona, Itay, Shumailov, Ilia, Hayes, Jamie, Barbero, Federico, Gandelsman, Yossi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stealing User Prompts from Mixture of Experts
di: Yona, Itay, et al.
Pubblicazione: (2024)
di: Yona, Itay, et al.
Pubblicazione: (2024)
In-Context Representation Hijacking
di: Yona, Itay, et al.
Pubblicazione: (2025)
di: Yona, Itay, et al.
Pubblicazione: (2025)
Buffer Overflow in Mixture of Experts
di: Hayes, Jamie, et al.
Pubblicazione: (2024)
di: Hayes, Jamie, et al.
Pubblicazione: (2024)
UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI
di: Shumailov, Ilia, et al.
Pubblicazione: (2024)
di: Shumailov, Ilia, et al.
Pubblicazione: (2024)
Beyond Slow Signs in High-fidelity Model Extraction
di: Foerster, Hanna, et al.
Pubblicazione: (2024)
di: Foerster, Hanna, et al.
Pubblicazione: (2024)
Locking Machine Learning Models into Hardware
di: Clifford, Eleanor, et al.
Pubblicazione: (2024)
di: Clifford, Eleanor, et al.
Pubblicazione: (2024)
Reasoning Introduces New Poisoning Attacks Yet Makes Them More Complicated
di: Foerster, Hanna, et al.
Pubblicazione: (2025)
di: Foerster, Hanna, et al.
Pubblicazione: (2025)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
di: Boreiko, Valentyn, et al.
Pubblicazione: (2024)
di: Boreiko, Valentyn, et al.
Pubblicazione: (2024)
Machine Learning needs Better Randomness Standards: Randomised Smoothing and PRNG-based attacks
di: Dahiya, Pranav, et al.
Pubblicazione: (2023)
di: Dahiya, Pranav, et al.
Pubblicazione: (2023)
Architectural Backdoors for Within-Batch Data Stealing and Model Inference Manipulation
di: Küchler, Nicolas, et al.
Pubblicazione: (2025)
di: Küchler, Nicolas, et al.
Pubblicazione: (2025)
The Curse of Recursion: Training on Generated Data Makes Models Forget
di: Shumailov, Ilia, et al.
Pubblicazione: (2023)
di: Shumailov, Ilia, et al.
Pubblicazione: (2023)
Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots
di: Vero, Mark, et al.
Pubblicazione: (2026)
di: Vero, Mark, et al.
Pubblicazione: (2026)
LLMs Have Rhythm: Fingerprinting Large Language Models Using Inter-Token Times and Network Traffic Analysis
di: Alhazbi, Saeif, et al.
Pubblicazione: (2025)
di: Alhazbi, Saeif, et al.
Pubblicazione: (2025)
Watermarking Needs Input Repetition Masking
di: Khachaturov, David, et al.
Pubblicazione: (2025)
di: Khachaturov, David, et al.
Pubblicazione: (2025)
Cascading Adversarial Bias from Injection to Distillation in Language Models
di: Chaudhari, Harsh, et al.
Pubblicazione: (2025)
di: Chaudhari, Harsh, et al.
Pubblicazione: (2025)
Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
di: Fang, Zheng, et al.
Pubblicazione: (2026)
di: Fang, Zheng, et al.
Pubblicazione: (2026)
Instructional Fingerprinting of Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2024)
di: Xu, Jiashu, et al.
Pubblicazione: (2024)
Large Language Models in Cybersecurity: State-of-the-Art
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
Duwak: Dual Watermarks in Large Language Models
di: Zhu, Chaoyi, et al.
Pubblicazione: (2024)
di: Zhu, Chaoyi, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Models with Symbolic Mathematics
di: Bethany, Emet, et al.
Pubblicazione: (2024)
di: Bethany, Emet, et al.
Pubblicazione: (2024)
Gradients Look Alike: Sensitivity is Often Overestimated in DP-SGD
di: Thudi, Anvith, et al.
Pubblicazione: (2023)
di: Thudi, Anvith, et al.
Pubblicazione: (2023)
The Resurgence of GCG Adversarial Attacks on Large Language Models
di: Tan, Yuting, et al.
Pubblicazione: (2025)
di: Tan, Yuting, et al.
Pubblicazione: (2025)
Machine Unlearning of Pre-trained Large Language Models
di: Yao, Jin, et al.
Pubblicazione: (2024)
di: Yao, Jin, et al.
Pubblicazione: (2024)
On the Role of Attention Heads in Large Language Model Safety
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
EnJa: Ensemble Jailbreak on Large Language Models
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
Unlocking Memorization in Large Language Models with Dynamic Soft Prompting
di: Wang, Zhepeng, et al.
Pubblicazione: (2024)
di: Wang, Zhepeng, et al.
Pubblicazione: (2024)
FIT to Forget: Robust Continual Unlearning for Large Language Models
di: Xu, Xiaoyu, et al.
Pubblicazione: (2026)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2026)
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
di: Liu, Fuqiang, et al.
Pubblicazione: (2024)
di: Liu, Fuqiang, et al.
Pubblicazione: (2024)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
di: Gu, Tianle, et al.
Pubblicazione: (2025)
di: Gu, Tianle, et al.
Pubblicazione: (2025)
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
di: Golchin, Shahriar, et al.
Pubblicazione: (2023)
di: Golchin, Shahriar, et al.
Pubblicazione: (2023)
Detecting Training Data of Large Language Models via Expectation Maximization
di: Kim, Gyuwan, et al.
Pubblicazione: (2024)
di: Kim, Gyuwan, et al.
Pubblicazione: (2024)
SVIP: Towards Verifiable Inference of Open-source Large Language Models
di: Sun, Yifan, et al.
Pubblicazione: (2024)
di: Sun, Yifan, et al.
Pubblicazione: (2024)
PostMark: A Robust Blackbox Watermark for Large Language Models
di: Chang, Yapei, et al.
Pubblicazione: (2024)
di: Chang, Yapei, et al.
Pubblicazione: (2024)
Adversarial Text Purification: A Large Language Model Approach for Defense
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
Obliviate: Efficient Unmemorization for Protecting Intellectual Property in Large Language Models
di: Russinovich, Mark, et al.
Pubblicazione: (2025)
di: Russinovich, Mark, et al.
Pubblicazione: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
di: Sitawarin, Chawin, et al.
Pubblicazione: (2024)
di: Sitawarin, Chawin, et al.
Pubblicazione: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Inexact Unlearning Needs More Careful Evaluations to Avoid a False Sense of Privacy
di: Hayes, Jamie, et al.
Pubblicazione: (2024)
di: Hayes, Jamie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Stealing User Prompts from Mixture of Experts
di: Yona, Itay, et al.
Pubblicazione: (2024) -
In-Context Representation Hijacking
di: Yona, Itay, et al.
Pubblicazione: (2025) -
Buffer Overflow in Mixture of Experts
di: Hayes, Jamie, et al.
Pubblicazione: (2024) -
UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI
di: Shumailov, Ilia, et al.
Pubblicazione: (2024) -
Beyond Slow Signs in High-fidelity Model Extraction
di: Foerster, Hanna, et al.
Pubblicazione: (2024)