Towards Linguistically-Aware and Language-Independent Tokenization for Large Language Models (LLMs)
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Rahman, Abrar, Bowlin, Garry, Mohanty, Binit, McGunigal, Sean |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Toward Cultural Interpretability: A Linguistic Anthropological Framework for Describing and Evaluating Large Language Models (LLMs)
von: Jones, Graham M., et al.
Veröffentlicht: (2024)
von: Jones, Graham M., et al.
Veröffentlicht: (2024)
Linguistic Blind Spots of Large Language Models
von: Cheng, Jiali, et al.
Veröffentlicht: (2025)
von: Cheng, Jiali, et al.
Veröffentlicht: (2025)
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
von: Slagle, Kevin
Veröffentlicht: (2024)
von: Slagle, Kevin
Veröffentlicht: (2024)
The Geometry of Tokens in Internal Representations of Large Language Models
von: Viswanathan, Karthik, et al.
Veröffentlicht: (2025)
von: Viswanathan, Karthik, et al.
Veröffentlicht: (2025)
Radio: Rate-Distortion Optimization for Large Language Model Compression
von: Young, Sean I.
Veröffentlicht: (2025)
von: Young, Sean I.
Veröffentlicht: (2025)
Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models
von: Alqahtani, Sawsan, et al.
Veröffentlicht: (2026)
von: Alqahtani, Sawsan, et al.
Veröffentlicht: (2026)
Independence Tests for Language Models
von: Zhu, Sally, et al.
Veröffentlicht: (2025)
von: Zhu, Sally, et al.
Veröffentlicht: (2025)
Foundations of Large Language Model Compression -- Part 1: Weight Quantization
von: Young, Sean I.
Veröffentlicht: (2024)
von: Young, Sean I.
Veröffentlicht: (2024)
The Illusionist's Prompt: Exposing the Factual Vulnerabilities of Large Language Models with Linguistic Nuances
von: Wang, Yining, et al.
Veröffentlicht: (2025)
von: Wang, Yining, et al.
Veröffentlicht: (2025)
Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
von: He, Haoyu, et al.
Veröffentlicht: (2025)
von: He, Haoyu, et al.
Veröffentlicht: (2025)
Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models
von: Liu, Zefang, et al.
Veröffentlicht: (2025)
von: Liu, Zefang, et al.
Veröffentlicht: (2025)
DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models
von: Gao, Shangqian, et al.
Veröffentlicht: (2024)
von: Gao, Shangqian, et al.
Veröffentlicht: (2024)
Towards Chapter-to-Chapter Context-Aware Literary Translation via Large Language Models
von: Jin, Linghao, et al.
Veröffentlicht: (2024)
von: Jin, Linghao, et al.
Veröffentlicht: (2024)
Capability-Guided Compression: Toward Interpretability-Aware Budget Allocation for Large Language Models
von: Gupta, Rishaank
Veröffentlicht: (2026)
von: Gupta, Rishaank
Veröffentlicht: (2026)
Cascade-Aware Training of Language Models
von: Wang, Congchao, et al.
Veröffentlicht: (2024)
von: Wang, Congchao, et al.
Veröffentlicht: (2024)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
von: Zhu, Mingcheng, et al.
Veröffentlicht: (2026)
von: Zhu, Mingcheng, et al.
Veröffentlicht: (2026)
Toward a Theory of Tokenization in LLMs
von: Rajaraman, Nived, et al.
Veröffentlicht: (2024)
von: Rajaraman, Nived, et al.
Veröffentlicht: (2024)
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
von: Wang, Ruhan, et al.
Veröffentlicht: (2026)
von: Wang, Ruhan, et al.
Veröffentlicht: (2026)
Counterfactual Token Generation in Large Language Models
von: Chatzi, Ivi, et al.
Veröffentlicht: (2024)
von: Chatzi, Ivi, et al.
Veröffentlicht: (2024)
Finetuning Language Models to Emit Linguistic Expressions of Uncertainty
von: Chaudhry, Arslan, et al.
Veröffentlicht: (2024)
von: Chaudhry, Arslan, et al.
Veröffentlicht: (2024)
Beyond Early-Token Bias: Model-Specific and Language-Specific Position Effects in Multilingual LLMs
von: Menschikov, Mikhail, et al.
Veröffentlicht: (2025)
von: Menschikov, Mikhail, et al.
Veröffentlicht: (2025)
Language Modeling with Learned Meta-Tokens
von: Shah, Alok N., et al.
Veröffentlicht: (2025)
von: Shah, Alok N., et al.
Veröffentlicht: (2025)
Parallel Token Prediction for Language Models
von: Draxler, Felix, et al.
Veröffentlicht: (2025)
von: Draxler, Felix, et al.
Veröffentlicht: (2025)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
von: Jain, Neel, et al.
Veröffentlicht: (2024)
von: Jain, Neel, et al.
Veröffentlicht: (2024)
Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling
von: Luo, Xianzhen, et al.
Veröffentlicht: (2024)
von: Luo, Xianzhen, et al.
Veröffentlicht: (2024)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
UPLME: Uncertainty-Aware Probabilistic Language Modelling for Robust Empathy Regression
von: Hasan, Md Rakibul, et al.
Veröffentlicht: (2025)
von: Hasan, Md Rakibul, et al.
Veröffentlicht: (2025)
Token-Efficient Leverage Learning in Large Language Models
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
Compositional Steering of Large Language Models with Steering Tokens
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026)
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026)
Probabilistic Token Alignment for Large Language Model Fusion
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
A Natural Language Processing-Based Classification and Mode-Based Ranking of Musculoskeletal Disorder Risk Factors
von: Jahin, Md Abrar, et al.
Veröffentlicht: (2023)
von: Jahin, Md Abrar, et al.
Veröffentlicht: (2023)
Multilingual Language Models Encode Script Over Linguistic Structure
von: Verma, Aastha A K, et al.
Veröffentlicht: (2026)
von: Verma, Aastha A K, et al.
Veröffentlicht: (2026)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
von: Tran, Toan, et al.
Veröffentlicht: (2025)
von: Tran, Toan, et al.
Veröffentlicht: (2025)
Securing Large Language Models (LLMs) from Prompt Injection Attacks
von: Suri, Omar Farooq Khan, et al.
Veröffentlicht: (2025)
von: Suri, Omar Farooq Khan, et al.
Veröffentlicht: (2025)
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
von: Zhang, Yang, et al.
Veröffentlicht: (2025)
von: Zhang, Yang, et al.
Veröffentlicht: (2025)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
von: Mao, Yu, et al.
Veröffentlicht: (2025)
von: Mao, Yu, et al.
Veröffentlicht: (2025)
Thermometer: Towards Universal Calibration for Large Language Models
von: Shen, Maohao, et al.
Veröffentlicht: (2024)
von: Shen, Maohao, et al.
Veröffentlicht: (2024)
CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models
von: Lee, Donghyun, et al.
Veröffentlicht: (2024)
von: Lee, Donghyun, et al.
Veröffentlicht: (2024)
Large Language Models Lack Temporal Awareness of Medical Knowledge
von: Guan, Zihan, et al.
Veröffentlicht: (2026)
von: Guan, Zihan, et al.
Veröffentlicht: (2026)
Towards Modeling Learner Performance with Large Language Models
von: Neshaei, Seyed Parsa, et al.
Veröffentlicht: (2024)
von: Neshaei, Seyed Parsa, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Toward Cultural Interpretability: A Linguistic Anthropological Framework for Describing and Evaluating Large Language Models (LLMs)
von: Jones, Graham M., et al.
Veröffentlicht: (2024) -
Linguistic Blind Spots of Large Language Models
von: Cheng, Jiali, et al.
Veröffentlicht: (2025) -
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
von: Slagle, Kevin
Veröffentlicht: (2024) -
The Geometry of Tokens in Internal Representations of Large Language Models
von: Viswanathan, Karthik, et al.
Veröffentlicht: (2025) -
Radio: Rate-Distortion Optimization for Large Language Model Compression
von: Young, Sean I.
Veröffentlicht: (2025)