Impact of Non-Standard Unicode Characters on Security and Comprehension in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Daniel, Johan S, Pal, Anand |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unicode Normalization and Grapheme Parsing of Indic Languages
par: Ansary, Nazmuddoha, et autres
Publié: (2023)
par: Ansary, Nazmuddoha, et autres
Publié: (2023)
Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala
par: Rajapakse, Minuri, et autres
Publié: (2026)
par: Rajapakse, Minuri, et autres
Publié: (2026)
CharacterBench: Benchmarking Character Customization of Large Language Models
par: Zhou, Jinfeng, et autres
Publié: (2024)
par: Zhou, Jinfeng, et autres
Publié: (2024)
Leveraging Large Language Models for Active Merchant Non-player Characters
par: Kim, Byungjun, et autres
Publié: (2024)
par: Kim, Byungjun, et autres
Publié: (2024)
Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works
par: Yuan, Xinfeng, et autres
Publié: (2024)
par: Yuan, Xinfeng, et autres
Publié: (2024)
Unveiling Unicode's Unseen Underpinnings in Undermining Authorship Attribution
par: Dilworth, Robert
Publié: (2025)
par: Dilworth, Robert
Publié: (2025)
Large Language Models Lack Understanding of Character Composition of Words
par: Shin, Andrew, et autres
Publié: (2024)
par: Shin, Andrew, et autres
Publié: (2024)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
Temporal Blind Spots in Large Language Models
par: Wallat, Jonas, et autres
Publié: (2024)
par: Wallat, Jonas, et autres
Publié: (2024)
Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness
par: Yang, Zhipeng, et autres
Publié: (2026)
par: Yang, Zhipeng, et autres
Publié: (2026)
Adapting Large Language Models for Character-based Augmentative and Alternative Communication
par: Gaines, Dylan, et autres
Publié: (2025)
par: Gaines, Dylan, et autres
Publié: (2025)
Evaluating Language Model Character Traits
par: Ward, Francis Rhys, et autres
Publié: (2024)
par: Ward, Francis Rhys, et autres
Publié: (2024)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
par: Liu, Shuyi, et autres
Publié: (2025)
par: Liu, Shuyi, et autres
Publié: (2025)
The Impact of Visual Information in Chinese Characters: Evaluating Large Models' Ability to Recognize and Utilize Radicals
par: Wu, Xiaofeng, et autres
Publié: (2024)
par: Wu, Xiaofeng, et autres
Publié: (2024)
Emergent Semantics Beyond Token Embeddings: Transformer LMs with Frozen Visual Unicode Representations
par: Bochkov, A.
Publié: (2025)
par: Bochkov, A.
Publié: (2025)
CharED: Character-wise Ensemble Decoding for Large Language Models
par: Gu, Kevin, et autres
Publié: (2024)
par: Gu, Kevin, et autres
Publié: (2024)
The Empirical Impact of Data Sanitization on Language Models
par: Pal, Anwesan, et autres
Publié: (2024)
par: Pal, Anwesan, et autres
Publié: (2024)
A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine
par: Xiao, Hanguang, et autres
Publié: (2024)
par: Xiao, Hanguang, et autres
Publié: (2024)
A Comprehensive Overview of Large Language Models
par: Naveed, Humza, et autres
Publié: (2023)
par: Naveed, Humza, et autres
Publié: (2023)
Comprehensive Evaluation of Large Language Models for Topic Modeling
par: Doi, Tomoki, et autres
Publié: (2024)
par: Doi, Tomoki, et autres
Publié: (2024)
M-QALM: A Benchmark to Assess Clinical Reading Comprehension and Knowledge Recall in Large Language Models via Question Answering
par: Subramanian, Anand, et autres
Publié: (2024)
par: Subramanian, Anand, et autres
Publié: (2024)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language Models
par: Ahn, Jaewoo, et autres
Publié: (2024)
par: Ahn, Jaewoo, et autres
Publié: (2024)
Decoding Continuous Character-based Language from Non-invasive Brain Recordings
par: Zhang, Cenyuan, et autres
Publié: (2024)
par: Zhang, Cenyuan, et autres
Publié: (2024)
BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
par: Sokol, Anna, et autres
Publié: (2024)
par: Sokol, Anna, et autres
Publié: (2024)
Transcoding Unicode Characters with AVX-512 Instructions
par: Clausecker, Robert, et autres
Publié: (2022)
par: Clausecker, Robert, et autres
Publié: (2022)
Enhancing Embedding Performance through Large Language Model-based Text Enrichment and Rewriting
par: Harris, Nicholas, et autres
Publié: (2024)
par: Harris, Nicholas, et autres
Publié: (2024)
SLANG: New Concept Comprehension of Large Language Models
par: Mei, Lingrui, et autres
Publié: (2024)
par: Mei, Lingrui, et autres
Publié: (2024)
LLMBox: A Comprehensive Library for Large Language Models
par: Tang, Tianyi, et autres
Publié: (2024)
par: Tang, Tianyi, et autres
Publié: (2024)
Large Language Models Hallucination: A Comprehensive Survey
par: Alansari, Aisha, et autres
Publié: (2025)
par: Alansari, Aisha, et autres
Publié: (2025)
Refining Answer Distributions for Improved Large Language Model Reasoning
par: Pal, Soumyasundar, et autres
Publié: (2024)
par: Pal, Soumyasundar, et autres
Publié: (2024)
Large Language Models as Mirrors of Societal Moral Standards
par: Papadopoulou, Evi, et autres
Publié: (2024)
par: Papadopoulou, Evi, et autres
Publié: (2024)
Reproducibility Report: Test-Time Training on Nearest Neighbors for Large Language Models
par: Zhou, Boyang, et autres
Publié: (2025)
par: Zhou, Boyang, et autres
Publié: (2025)
Assessing Factual Music Comprehension in Large Audio Language Models
par: Lin, Daniel Chenyu, et autres
Publié: (2025)
par: Lin, Daniel Chenyu, et autres
Publié: (2025)
AutoTutor meets Large Language Models: A Language Model Tutor with Rich Pedagogy and Guardrails
par: Chowdhury, Sankalan Pal, et autres
Publié: (2024)
par: Chowdhury, Sankalan Pal, et autres
Publié: (2024)
Evaluating Pixel Language Models on Non-Standardized Languages
par: Muñoz-Ortiz, Alberto, et autres
Publié: (2024)
par: Muñoz-Ortiz, Alberto, et autres
Publié: (2024)
Using Large Language Models to Understand Telecom Standards
par: Karapantelakis, Athanasios, et autres
Publié: (2024)
par: Karapantelakis, Athanasios, et autres
Publié: (2024)
How Do Language Models Acquire Character-Level Information?
par: Sato, Soma, et autres
Publié: (2026)
par: Sato, Soma, et autres
Publié: (2026)
Improving Language and Modality Transfer in Translation by Character-level Modeling
par: Tsiamas, Ioannis, et autres
Publié: (2025)
par: Tsiamas, Ioannis, et autres
Publié: (2025)
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
par: Wei, Fangyun, et autres
Publié: (2024)
par: Wei, Fangyun, et autres
Publié: (2024)
Documents similaires
-
Unicode Normalization and Grapheme Parsing of Indic Languages
par: Ansary, Nazmuddoha, et autres
Publié: (2023) -
Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala
par: Rajapakse, Minuri, et autres
Publié: (2026) -
CharacterBench: Benchmarking Character Customization of Large Language Models
par: Zhou, Jinfeng, et autres
Publié: (2024) -
Leveraging Large Language Models for Active Merchant Non-player Characters
par: Kim, Byungjun, et autres
Publié: (2024) -
Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works
par: Yuan, Xinfeng, et autres
Publié: (2024)