GlitchProber: Advancing Effective Detection and Mitigation of Glitch Tokens in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zhibo, Bai, Wuxia, Li, Yuxi, Meng, Mark Huasong, Wang, Kailong, Shi, Ling, Li, Li, Wang, Jun, Wang, Haoyu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Glitch Tokens in Large Language Models: Categorization Taxonomy and Effective Detection
by: Li, Yuxi, et al.
Published: (2024)
by: Li, Yuxi, et al.
Published: (2024)
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
by: Zhang, Zhibo, et al.
Published: (2025)
by: Zhang, Zhibo, et al.
Published: (2025)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
by: Li, Yuxi, et al.
Published: (2024)
by: Li, Yuxi, et al.
Published: (2024)
GlitchMiner: Mining Glitch Tokens in Large Language Models via Gradient-based Discrete Optimization
by: Wu, Zihui, et al.
Published: (2024)
by: Wu, Zihui, et al.
Published: (2024)
A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia
by: Monea, Giovanni, et al.
Published: (2023)
by: Monea, Giovanni, et al.
Published: (2023)
Detecting LLM Fact-conflicting Hallucinations Enhanced by Temporal-logic-based Reasoning
by: Li, Ningke, et al.
Published: (2025)
by: Li, Ningke, et al.
Published: (2025)
Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes
by: Hanqing, Liu, et al.
Published: (2026)
by: Hanqing, Liu, et al.
Published: (2026)
Point of View--Political Glitches
by: Shaw, Robert
Published: (2004)
by: Shaw, Robert
Published: (2004)
TempGlitch: Evaluating Vision-Language Models for Temporal Glitch Detection in Gameplay Videos
by: Yu, Yakun, et al.
Published: (2026)
by: Yu, Yakun, et al.
Published: (2026)
Detecting Manipulated Contents Using Knowledge-Grounded Inference
by: Meng, Mark Huasong, et al.
Published: (2025)
by: Meng, Mark Huasong, et al.
Published: (2025)
Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving
by: Zheng, Xinyi, et al.
Published: (2025)
by: Zheng, Xinyi, et al.
Published: (2025)
Drowzee: Metamorphic Testing for Fact-Conflicting Hallucination Detection in Large Language Models
by: Li, Ningke, et al.
Published: (2024)
by: Li, Ningke, et al.
Published: (2024)
Exposing the Ghost in the Transformer: Abnormal Detection for Large Language Models via Hidden State Forensics
by: Zhou, Shide, et al.
Published: (2025)
by: Zhou, Shide, et al.
Published: (2025)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
by: Li, Haodong, et al.
Published: (2024)
by: Li, Haodong, et al.
Published: (2024)
Detection and Mitigation of Glitches in LISA Data: A Machine Learning Approach
by: Houba, Niklas, et al.
Published: (2024)
by: Houba, Niklas, et al.
Published: (2024)
Evaluating and Mitigating Linguistic Discrimination in Large Language Models
by: Dong, Guoliang, et al.
Published: (2024)
by: Dong, Guoliang, et al.
Published: (2024)
GlitchBench: Can large multimodal models detect video game glitches?
by: Taesiri, Mohammad Reza, et al.
Published: (2023)
by: Taesiri, Mohammad Reza, et al.
Published: (2023)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
by: Xu, Zihao, et al.
Published: (2024)
by: Xu, Zihao, et al.
Published: (2024)
Normal Distribution of Crab Pulsar Glitch Activity from a Glitch Cluster Perspective
by: Zhu, Pei-Xin, et al.
Published: (2025)
by: Zhu, Pei-Xin, et al.
Published: (2025)
Detection and Mitigation of Hallucination in Large Reasoning Models: A Mechanistic Perspective
by: Sun, Zhongxiang, et al.
Published: (2025)
by: Sun, Zhongxiang, et al.
Published: (2025)
Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift
by: Yuan, Shuai, et al.
Published: (2025)
by: Yuan, Shuai, et al.
Published: (2025)
Understanding the Effectiveness of Coverage Criteria for Large Language Models: A Special Angle from Jailbreak Attacks
by: Zhou, Shide, et al.
Published: (2024)
by: Zhou, Shide, et al.
Published: (2024)
Desinformationen als journalistische Glitches
by: von Reischach, Niklas
Published: (2026)
by: von Reischach, Niklas
Published: (2026)
Investigation into Pulsar Glitch Parameters
by: Marcel, Miracle Chibuzor
Published: (2024)
by: Marcel, Miracle Chibuzor
Published: (2024)
Using Deep Convolutional Neural Networks to Detect Rendered Glitches in Video Games
by: Ling, Carlos Garcia, et al.
Published: (2024)
by: Ling, Carlos Garcia, et al.
Published: (2024)
Advancing Text Classification with Large Language Models and Neural Attention Mechanisms
by: Lyu, Ning, et al.
Published: (2025)
by: Lyu, Ning, et al.
Published: (2025)
Exploring Superfluid Angular Momentum Reservoir Effect on Pulsar Glitches and Forecasting Next Glitches of the Crab Pulsar
by: Zhu, Pei-Xin, et al.
Published: (2026)
by: Zhu, Pei-Xin, et al.
Published: (2026)
A Glitch Detection and Removal Method for Three‐Component Seismic Data From Mars Based On Deep Learning
by: Jiangjie Zhang, et al.
Published: (2025)
by: Jiangjie Zhang, et al.
Published: (2025)
Beyond the Scope: Security Testing of Permission Management in Team Workspace
by: Wan, Liuhuo, et al.
Published: (2025)
by: Wan, Liuhuo, et al.
Published: (2025)
Mitigating Gradient Inversion Risks in Language Models via Token Obfuscation
by: Feng, Xinguo, et al.
Published: (2026)
by: Feng, Xinguo, et al.
Published: (2026)
Semantic Glitch: Agency and Artistry in an Autonomous Pixel Cloud
by: Zhang, Qing, et al.
Published: (2025)
by: Zhang, Qing, et al.
Published: (2025)
Glitches in Decision Tree Ensemble Models
by: Chandra, Satyankar, et al.
Published: (2025)
by: Chandra, Satyankar, et al.
Published: (2025)
Glitching pulsars as gravitational wave sources
by: Haskell, Brynmor, et al.
Published: (2023)
by: Haskell, Brynmor, et al.
Published: (2023)
Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
by: He, Haoyu, et al.
Published: (2025)
by: He, Haoyu, et al.
Published: (2025)
Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding
by: Zheng, Muyang, et al.
Published: (2026)
by: Zheng, Muyang, et al.
Published: (2026)
Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing
by: Liu, Tianci, et al.
Published: (2025)
by: Liu, Tianci, et al.
Published: (2025)
A Causal Explainable Guardrails for Large Language Models
by: Chu, Zhixuan, et al.
Published: (2024)
by: Chu, Zhixuan, et al.
Published: (2024)
Null Stream Based Third-generation-ready Glitch Mitigation for Gravitational Wave Measurements
by: Narola, Harsh, et al.
Published: (2024)
by: Narola, Harsh, et al.
Published: (2024)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
by: Wang, Xunguang, et al.
Published: (2025)
by: Wang, Xunguang, et al.
Published: (2025)
Maximum Likelihood Detection of Instrumental Glitches in LISA TDI Data
by: Sauter, Orion, et al.
Published: (2025)
by: Sauter, Orion, et al.
Published: (2025)
Similar Items
-
Glitch Tokens in Large Language Models: Categorization Taxonomy and Effective Detection
by: Li, Yuxi, et al.
Published: (2024) -
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
by: Zhang, Zhibo, et al.
Published: (2025) -
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
by: Li, Yuxi, et al.
Published: (2024) -
GlitchMiner: Mining Glitch Tokens in Large Language Models via Gradient-based Discrete Optimization
by: Wu, Zihui, et al.
Published: (2024) -
A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia
by: Monea, Giovanni, et al.
Published: (2023)