Harmonic Token Projection (HTP): A Vocabulary-Free, Training-Free, Deterministic, and Reversible Embedding Methodology
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Schmitz, Tcharlies |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Modular Linear Tokenization (MLT)
par: Schmitz, Tcharlies
Publié: (2025)
par: Schmitz, Tcharlies
Publié: (2025)
Interchangeable Token Embeddings for Extendable Vocabulary and Alpha-Equivalence
par: Işık, İlker, et autres
Publié: (2024)
par: Işık, İlker, et autres
Publié: (2024)
Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit
par: Goddard, Charles, et autres
Publié: (2025)
par: Goddard, Charles, et autres
Publié: (2025)
Attention with Trained Embeddings Provably Selects Important Tokens
par: Wu, Diyuan, et autres
Publié: (2025)
par: Wu, Diyuan, et autres
Publié: (2025)
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
par: Deiseroth, Björn, et autres
Publié: (2024)
par: Deiseroth, Björn, et autres
Publié: (2024)
Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling
par: Huang, Hongzhi, et autres
Publié: (2025)
par: Huang, Hongzhi, et autres
Publié: (2025)
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
par: Yang, Wang, et autres
Publié: (2026)
par: Yang, Wang, et autres
Publié: (2026)
Memory Tokens: Large Language Models Can Generate Reversible Sentence Embeddings
par: Sastre, Ignacio, et autres
Publié: (2025)
par: Sastre, Ignacio, et autres
Publié: (2025)
Correcting Mean Bias in Text Embeddings: A Refined Renormalization with Training-Free Improvements on MMTEB
par: Ren, Xingyu, et autres
Publié: (2025)
par: Ren, Xingyu, et autres
Publié: (2025)
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
par: Li, Ziyue, et autres
Publié: (2024)
par: Li, Ziyue, et autres
Publié: (2024)
Detecting Token-Level Hallucinations Using Variance Signals: A Reference-Free Approach
par: Kumar, Keshav
Publié: (2025)
par: Kumar, Keshav
Publié: (2025)
Asynchronous Reasoning: Training-Free Interactive Thinking LLMs
par: Yakushev, George, et autres
Publié: (2025)
par: Yakushev, George, et autres
Publié: (2025)
Training-Free Dynamic Upcycling of Expert Language Models
par: Fanì, Eros, et autres
Publié: (2026)
par: Fanì, Eros, et autres
Publié: (2026)
Token Distillation: Attention-aware Input Embeddings For New Tokens
par: Dobler, Konstantin, et autres
Publié: (2025)
par: Dobler, Konstantin, et autres
Publié: (2025)
NAN: A Training-Free Solution to Coefficient Estimation in Model Merging
par: Si, Chongjie, et autres
Publié: (2025)
par: Si, Chongjie, et autres
Publié: (2025)
X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation
par: Sreenivas, Sharath Turuvekere, et autres
Publié: (2026)
par: Sreenivas, Sharath Turuvekere, et autres
Publié: (2026)
Measuring Intrinsic Dimension of Token Embeddings
par: Kataiwa, Takuya, et autres
Publié: (2025)
par: Kataiwa, Takuya, et autres
Publié: (2025)
VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs
par: Amballa, Avinash, et autres
Publié: (2025)
par: Amballa, Avinash, et autres
Publié: (2025)
Trans-Tokenization and Cross-lingual Vocabulary Transfers: Language Adaptation of LLMs for Low-Resource NLP
par: Remy, François, et autres
Publié: (2024)
par: Remy, François, et autres
Publié: (2024)
Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation
par: Chen, Daiwei, et autres
Publié: (2026)
par: Chen, Daiwei, et autres
Publié: (2026)
SeMe: Training-Free Language Model Merging via Semantic Alignment
par: Gu, Jian, et autres
Publié: (2025)
par: Gu, Jian, et autres
Publié: (2025)
LEWIS (LayEr WIse Sparsity) -- A Training Free Guided Model Merging Approach
par: Chopra, Hetarth, et autres
Publié: (2025)
par: Chopra, Hetarth, et autres
Publié: (2025)
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
par: Roger, Alexis, et autres
Publié: (2025)
par: Roger, Alexis, et autres
Publié: (2025)
Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation
par: Li, Zongxia, et autres
Publié: (2025)
par: Li, Zongxia, et autres
Publié: (2025)
First Activations Matter: Training-Free Methods for Dynamic Activation in Large Language Models
par: Ma, Chi, et autres
Publié: (2024)
par: Ma, Chi, et autres
Publié: (2024)
LLMs Are Already Good Tutors: Training-Free Prompt Optimization for Pedagogical Math Tutoring
par: Lee, Unggi, et autres
Publié: (2026)
par: Lee, Unggi, et autres
Publié: (2026)
Training-Free Spectral Fingerprints of Voice Processing in Transformers
par: Noël, Valentin
Publié: (2025)
par: Noël, Valentin
Publié: (2025)
Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size
par: Hayou, Soufiane, et autres
Publié: (2025)
par: Hayou, Soufiane, et autres
Publié: (2025)
Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch
par: Zhang, Ziyang, et autres
Publié: (2025)
par: Zhang, Ziyang, et autres
Publié: (2025)
Reasoning Bias of Next Token Prediction Training
par: Lin, Pengxiao, et autres
Publié: (2025)
par: Lin, Pengxiao, et autres
Publié: (2025)
Token Erasure as a Footprint of Implicit Vocabulary Items in LLMs
par: Feucht, Sheridan, et autres
Publié: (2024)
par: Feucht, Sheridan, et autres
Publié: (2024)
Backward Lens: Projecting Language Model Gradients into the Vocabulary Space
par: Katz, Shahar, et autres
Publié: (2024)
par: Katz, Shahar, et autres
Publié: (2024)
Safe Reinforcement Learning with Free-form Natural Language Constraints and Pre-Trained Language Models
par: Lou, Xingzhou, et autres
Publié: (2024)
par: Lou, Xingzhou, et autres
Publié: (2024)
When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars
par: Higuchi, Rei, et autres
Publié: (2025)
par: Higuchi, Rei, et autres
Publié: (2025)
ZIP-FIT: Embedding-Free Data Selection via Compression-Based Alignment
par: Obbad, Elyas, et autres
Publié: (2024)
par: Obbad, Elyas, et autres
Publié: (2024)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
par: Tang, Hongyin, et autres
Publié: (2024)
par: Tang, Hongyin, et autres
Publié: (2024)
Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings
par: Ding, Xueying, et autres
Publié: (2025)
par: Ding, Xueying, et autres
Publié: (2025)
FoNE: Precise Single-Token Number Embeddings via Fourier Features
par: Zhou, Tianyi, et autres
Publié: (2025)
par: Zhou, Tianyi, et autres
Publié: (2025)
Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization
par: Awadhiya, Kanishk
Publié: (2026)
par: Awadhiya, Kanishk
Publié: (2026)
Is Free Self-Alignment Possible?
par: Adila, Dyah, et autres
Publié: (2024)
par: Adila, Dyah, et autres
Publié: (2024)
Documents similaires
-
Modular Linear Tokenization (MLT)
par: Schmitz, Tcharlies
Publié: (2025) -
Interchangeable Token Embeddings for Extendable Vocabulary and Alpha-Equivalence
par: Işık, İlker, et autres
Publié: (2024) -
Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit
par: Goddard, Charles, et autres
Publié: (2025) -
Attention with Trained Embeddings Provably Selects Important Tokens
par: Wu, Diyuan, et autres
Publié: (2025) -
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
par: Deiseroth, Björn, et autres
Publié: (2024)